🇻🇳 Hai bộ dataset nguồn mở về pháp lý tiếng Việt cực kỳ giá trị vừa xuất hiện trên Hugging Face cho cộng đồng Legal AI Việt Nam

Đây có thể xem là một trong những kho dữ liệu pháp luật Việt Nam lớn và có cấu trúc tốt nhất hiện nay dành cho:

  • RAG • Legal AI • Fine-tune LLM • Semantic Search • Legal Assistant

📚 1. anle-toaan-gov-vn

Dataset án lệ & bản án từ Tòa án Nhân dân Tối cao Việt Nam.

Điểm mạnh:

  • 279k bản án & quyết định • Parse PDF chất lượng cao • Metadata rất sâu • Cấu trúc Document → Section → Paragraph → Sentence • Hỗ trợ semantic retrieval cực tốt

Dataset bao phủ:

  • dân sự • hình sự • kinh doanh thương mại • hôn nhân gia đình • nhiều cấp tòa khác nhau

⚡ Rất phù hợp để build:

  • Legal RAG • AI chatbot pháp luật • Similar case search • Vietnamese legal embeddings

📜 2. phapdien-moj-gov-vn

Kho Bộ Pháp điển điện tử từ Bộ Tư pháp Việt Nam với 65k chủ đề

Điểm cực mạnh:

→ Dữ liệu có hierarchy rất rõ:

  • Chủ đề • Đề mục • Chương • Điều luật

Bao phủ gần như toàn bộ hệ thống pháp luật Việt Nam hiện hành.

Ngoài raw text còn có:

  • ontology • tree structure • metadata • source linking

🧠 Điều đáng giá nhất:

Hai dataset này có thể kết hợp với nhau để build:

  • Legal Knowledge Graph • Vietnamese Legal Copilot • Court reasoning systems • AI legal search engine

Đây là ví dụ rất tốt cho hướng đi:

“Open-source Vietnamese Legal AI Infrastructure”

Nếu đang làm:

  • LegalTech • Vietnamese LLM • RAG systems • AI search • Government AI

…thì đây gần như là dataset bắt buộc phải bookmark.

#TiniX #LegalAI #VietnameseAI #OpenSource

RELATED POSTS
Share the Post: