phapdien-moj-gov-vn
收藏资源简介:
Bộ Pháp Điển Việt Nam 数据集是越南司法部发布的官方法律条文汇编,包含64,464条法律条文(Điều),涵盖42个主题(Chủ đề)和202个科目(Đề mục)。每条条文都包含标准化全文、所属章节、科目和主题信息,以及指向原始法律文件的链接。数据集还提供了越南语-英语双语法律词典,包括42个主题、202个科目和116个法律术语的翻译。该数据集适用于文本分类、文本检索、问答和文本生成等自然语言处理任务。数据集的规模为10K到100K之间,采用CC-BY-4.0许可协议。
The Bộ Pháp Điển Việt Nam dataset is an official compilation of legal provisions released by the Vietnamese Ministry of Justice, containing 64,464 legal articles (Điều) covering 42 topics (Chủ đề) and 202 subjects (Đề mục). Each article includes standardized full text, chapter, subject, and topic information, as well as links to original legal documents. The dataset also provides a Vietnamese-English bilingual legal dictionary, including translations for 42 topics, 202 subjects, and 116 legal terms. It is suitable for natural language processing tasks such as text classification, text retrieval, Q&A, and text generation. The dataset size ranges from 10K to 100K and is licensed under CC-BY-4.0.
数据集概述:Bộ Pháp Điển Việt Nam (phapdien.moj.gov.vn)
该数据集是越南法典(Bộ Pháp Điển) 的条文级(Điều)语料库,由越南司法部发布,为官方编纂的越南法律集合。数据集以条文为单位,提供经过标准化处理的完整法律文本、章节归属、主题与议题信息,以及指向原始法律文本的链接。
核心特性
- 语言:越南语 (
vi) - 许可协议:Creative Commons Attribution 4.0 International (
cc-by-4.0) - 数据规模:
- 条文(Articles):64,464 条
- 议题(Subjects):202 个
- 主题(Topics):42 个
- 总字符数:约 8,997 万字符
- 总词数:约 1,984 万词
- 适用任务:文本分类、文本检索、问答、文本生成
数据结构与层级
越南法典采用三层结构组织数据:
- 主题 (Chủ đề / Topic):共 42 个,如“社会秩序与安全”、“贸易、投资与证券”。
- 议题 (Đề mục / Subject):共 202 个,每个主题下包含若干议题。
- 条文 (Điều / Article):共 64,464 条,是数据集的基本单位。
每个条文都分配了一个稳定的层级锚点(如 Điều 1.1.LQ.1),在整个数据集中具有唯一标识。
数据配置 (Configurations)
数据集提供多种配置,便于不同场景使用:
| 配置名称 | 描述 | 数据文件 |
|---|---|---|
articles |
主表:包含全部 64,464 条法律条文及其元数据。 | articles.parquet |
demucs |
议题元数据表:包含 202 个议题的详细信息(每行一个议题)。 | demucs.parquet |
tree_nodes |
主题/议题树:以树状节点形式存储主题和议题的层级关系。 | tree_nodes.parquet |
ontology_topics |
主题本体表:42 个主题的双语(越南语/英语)信息。 | ontology_topics.parquet |
ontology_demucs |
议题本体表:202 个议题的双语信息,包含其所属主题。 | ontology_demucs.parquet |
ontology_glossary |
法律术语词汇表:116 个法律术语的双语词典。 | ontology_glossary.parquet |
主表 (articles) 字段说明
| 字段名 | 类型 | 描述 |
|---|---|---|
demuc_id |
string | 该条文所属议题的唯一标识符 (UUID)。 |
topic_id |
string | 该议题所属主题的唯一标识符 (UUID)。 |
topic_number |
string | 主题的显示序号(1-45)。 |
topic_title |
string | 主题名称(如“An ninh quốc gia”)。 |
demuc_number |
string | 议题在所属主题中的显示序号。 |
demuc_title |
string | 议题名称。 |
article_anchor |
string | 稳定的层级锚点(例如 01001000...)。 |
article_title |
string | 完整的条文标题,包含“Điều N.M.X.Y”前缀和标题。 |
chapter_title |
string | 条文所属的章节标题,如“Chương I - …”(99.1% 的条目有此信息)。 |
source_note_text |
string | 指向原始法律文本的引用(100% 的条目有此信息)。 |
source_links |
list | source_note_text 中的超链接,通常指向 vbpl.vn。 |
related_note_text |
string | 指向数据集中其他条目的交叉引用(29% 的条目有此信息)。 |
content_text |
string | 标准化后的完整条文正文。 |
content_char_len |
int64 | content_text 的字符数。 |
content_word_count |
int64 | content_text 的词数。 |
source_url |
string | 指向 phapdien.moj.gov.vn 上该条目的直接深度链接。 |
scraped_at |
string | 数据抓取的时间戳 (ISO-8601 UTC)。 |
附加资源:双语本体 (Vietnamese ↔ English Ontology)
数据集附带了一个精心制作的双语法律本体,有助于理解越南法律体系。它包含三个部分:
- 42 个主题 (
ontology_topics):每个主题提供越南语和英语名称、条文数和议题数。 - 202 个议题 (
ontology_demucs):每个议题提供其父级主题、双语名称和条文数。 - 116 个法律术语 (
ontology_glossary):包括法律文件类型、机构、法院等术语的双语对照表,并按类别(如 instrument, court, procedure)组织。




