遇见数据集

luat.aihoidap.010826

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集是一个包含多层次法律文档结构的多配置数据集。它由多个子集组成,分别对应文档、文章、条款和要点等不同粒度的文本单元,以及它们之间的提及和关系信息。具体子集包括:documents(文档)、documents_id(文档标识)、documents_mark(带标记的文档)、documents_property(文档属性,如文档名称、生效状态、发布日期等)、documents_relate(文档间关联关系)、documents_url(文档URL)、articles(文章)、articles_mark(带标记的文章)、article_mention(文章提及)、article_relation(文章关系)、clauses(条款)、clauses_mark(带标记的条款)、clause_mention(条款提及)、clause_relation(条款关系)、points(要点)、points_mark(带标记的要点)、point_mention(要点提及)、point_relation(要点关系)。每个子集仅包含训练集,数据规模从数百到数百万样本不等,总数据量较大。该数据集适用于法律文本分析、文档结构解析、引用关系抽取、法律信息检索等自然语言处理任务。

This dataset is a multi-configuration dataset containing multi-level legal document structures. It consists of multiple subsets corresponding to different granularity text units such as documents, articles, clauses, and points, along with their mention and relation information. The specific subsets include: documents, documents_id, documents_mark, documents_property (e.g., document name, effective status, publication date), documents_relate (inter-document relations), documents_url, articles, articles_mark, article_mention, article_relation, clauses, clauses_mark, clause_mention, clause_relation, points, points_mark, point_mention, point_relation. Each subset contains only a training set, with sample sizes ranging from hundreds to millions, and the total data volume is large. This dataset is suitable for natural language processing tasks such as legal text analysis, document structure parsing, citation relation extraction, and legal information retrieval.

创建时间:
2026-08-29
原始信息汇总

数据集概述:luat.aihoidap.010826

数据集简介

该数据集是一个关于越南法律文档的多层次结构数据集,包含从文档(documents)到条款(articles)、条文(clauses)和要点(points)的层级关系,同时提供文档属性、关联关系以及各层级之间的引用(mention)和关联(relation)信息。数据集共包含18个配置(config),每个配置均提供训练集(train)。

数据集配置详情

核心内容配置

配置名称 说明 主要特征 样本数
documents 文档内容 DocId, DocName, EffectStatusName, DocContent, DocUrl 104,927
documents_id 文档标识 DocId, DocName, EffectStatusName 119,748
documents_mark 标记后的文档内容 DocId, DocName, EffectStatusName, DocContent, DocUrl 36,652
documents_url 文档链接 DocId, DocName, EffectStatusName, DocUrl 104,927
documents_property 文档属性 DocId, DocName, EffectStatusName, DocIdentity, GazetteNumber, GazetteDate, IssueDate, EffectDate, ExpireDate, DocTypeName, OrganName, SignerName, FieldName, CrDateTime 119,748
documents_relate 文档关联 DocId, DocName, EffectStatusName, DocRelateList(含DocId和RelateTypeName) 119,748

条款(Article)层级配置

配置名称 说明 主要特征 样本数
articles 条款内容 DocId, ArticleContent, ArticleId 427,327
articles_mark 标记后的条款内容 DocId, ArticleContent, ArticleId 490,526
article_mention 条款引用 ArticleContent, ArticleId, RefId 298
article_relation 条款关联 ArticleId, ArticleId_origin, DocItemRelateId, DocItemId, ReferenceName 77,160

条文(Clause)层级配置

配置名称 说明 主要特征 样本数
clauses 条文内容 DocId, ArticleId, ClauseContent, Prefix, ClauseId 925,337
clauses_mark 标记后的条文内容 DocId, ArticleId, ClauseContent, Prefix, ClauseId 1,453,338
clause_mention 条文引用 ClauseContent, ClauseId, RefId 7,097
clause_relation 条文关联 ClauseId, ClauseId_origin, DocItemRelateId, DocItemId, ReferenceName 175,586

要点(Point)层级配置

配置名称 说明 主要特征 样本数
points 要点内容 DocId, ArticleId, Prefix, ClauseId, PointContent, PointId 818,094
points_mark 标记后的要点内容 DocId, ArticleId, Prefix, ClauseId, PointContent, PointId 1,283,771
point_mention 要点引用 PointContent, PointId, RefId 6,468
point_relation 要点关联 PointId, PointId_origin, DocItemRelateId, DocItemId, ReferenceName 104,199

数据规模与规格

  • 最大配置:documents_mark(约12.0 GB)和documents(约11.0 GB)
  • 最小配置:article_mention(约1.0 MB)
  • 数据总量:约31.9 GB(所有配置总和)
  • 所有配置均包含统一的train分割,无其他分割

潜在应用场景

  • 越南法律文本的层级结构解析与信息提取
  • 法律文档间的关联关系挖掘与引用分析
  • 文档、条款、条文、要点多粒度文本的检索与分类任务
  • 法律文本的自然语言处理模型训练与评估
搜集汇总
数据集介绍
luat.aihoidap.010826 数据集图片
构建方式
该数据集以越南法律文档为语料基础,构建了从文档、条款、子句到点的四层粒度体系,每层均提供标注与未标注版本,并配有实体提及与关系数据,形成了完整的知识图谱结构。
特点
数据集包含18个子配置,覆盖文档、条款、子句和点四个层级,并提供提及与关系标注,支持细粒度的法律文本分析。数据规模庞大,总计超过千万条记录,其中点级标注达128万条,为法律信息抽取和关系推理提供了丰富资源。
使用方法
使用者可通过HuggingFace datasets库加载特定配置,如'article_relation'用于关系抽取,'clauses'用于子句分类,'documents'用于文档级任务。各配置均提供train分片,便于直接用于训练和评估。
背景与挑战
背景概述
luat.aihoidap.010826数据集由LUAT公司构建,旨在支持越南法律文档的深度自然语言处理研究。该数据集创建于2026年1月8日,其核心研究问题聚焦于法律文本的细粒度信息抽取与语义关系建模,涵盖了从文档、条款、子句到观点点的多层次结构,并提供了实体提及与关系标注。这一资源为法律人工智能领域提供了大规模、结构化的语料基础,推动了法律文本理解、知识图谱构建及智能问答系统的发展,其影响力在职法律科技研究与实际应用中逐渐显现。
当前挑战
该数据集面临的挑战首先体现在法律文本的复杂性上,包括长文本的依赖建模、专业术语的语义消歧以及跨条款逻辑关联的抽取,这些均对现有NLP模型提出严峻考验。构建过程中,数据标注需应对法律文档结构的多层级嵌套及关系类型的多样性,确保标注一致性与准确性极为困难。此外,数据规模庞大(如文档子集超过10GB),对存储、处理及高效访问提出技术挑战。同时,法律文本的时效性与修订状态(如EffectStatusName)要求数据持续更新,以确保模型训练数据的法律准确性和现实适用性。
常用场景
经典使用场景
该数据集以越南法律文件为语料,构建了从文档、条款、子条款到句子的多层级结构,并标注了实体提及与相互引用关系,为法律自然语言处理提供了丰富的资源。其经典使用场景包括法律信息抽取、文档结构解析和实体关系识别。研究者利用该数据集训练模型自动识别法律条文中的引用关系,实现法律知识的自动关联与推理。此外,基于该数据的层级结构,可开展跨文档的法律文本对齐与比较分析,为法律智能检索和问答系统提供基础支持。
衍生相关工作
围绕该数据集,催生了一系列经典研究。研究者基于其结构构建了法律文本的层次化表示学习模型,用于文档分类和相似度计算。引用关系数据则激发了法律引用网络分析工作,用于发现具有影响力的法律条款和关键法规。此外,该数据集还促进了跨语言法律信息检索的研究,成为评估多语言法律NLP系统性能的基准。后续工作还探索了将预训练语言模型应用于法律条文级语义匹配,以及联合抽取实体和关系以构建领域知识图谱,推动了法律人工智能的实践创新。
数据集最近研究
最新研究方向
该数据集聚焦于法律文本的深度语义解析与结构化知识抽取,通过构建篇章、条款、句子及要点等多粒度的关联与提及关系,为法律领域的自然语言处理提供了丰富的基准资源。当前研究热点包括基于该数据集的法律文档自动摘要、法律条款关系抽取及法律智能问答系统,旨在提升法律信息检索的精确度与法律文书的自动化处理能力。其多层级标注结构不仅支持细粒度的法律语义分析,还为法律知识图谱的构建及法规演变追踪等前沿课题提供了坚实的数据基础,对推动法律科技与智能司法的发展具有重要的理论与实际应用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务