遇见数据集

ulysses-camara/ulysses-ner-br

收藏
Hugging Face2022-10-25 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: [] language_creators: [] language: - pt license: [] multilinguality: - monolingual pretty_name: UlyssesNER-br size_categories: - 10K<n<100K source_datasets: [] task_categories: - token-classification task_ids: - named-entity-recognition --- # Dataset Card for UlyssesNER-Br ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage:** [Convenio-Camara-dos-Deputados/ulyssesner-br-propor](https://github.com/Convenio-Camara-dos-Deputados/ulyssesner-br-propor) - **Repository:** [Convenio-Camara-dos-Deputados/ulyssesner-br-propor](https://github.com/Convenio-Camara-dos-Deputados/ulyssesner-br-propor) - **Paper:** [UlyssesNER-Br: a Corpus of Brazilian Legislative Documents for Named Entity Recognition](https://link.springer.com/chapter/10.1007/978-3-030-98305-5_1) - **Leaderboard:** - **Point of Contact:** ### Dataset Summary [More Information Needed] ### Supported Tasks and Leaderboards [More Information Needed] ### Languages Portuguese (Brazil). ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation ### Curation Rationale [More Information Needed] ### Source Data #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ### Annotations #### Annotation process [More Information Needed] #### Who are the annotators? [More Information Needed] ### Personal and Sensitive Information [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information ``` @inproceedings{UlyssesNER-Br, title={UlyssesNER-Br: A Corpus of Brazilian Legislative Documents for Named Entity Recognition}, author={Albuquerque, Hidelberg O. and Costa, Rosimeire and Silvestre, Gabriel and Souza, Ellen and da Silva, Nádia F. F. and Vitório, Douglas and Moriyama, Gyovana and Martins, Lucas and Soezima, Luiza and Nunes, Augusto and Siqueira, Felipe and Tarrega, João P. and Beinotti, Joao V. and Dias, Marcio and Silva, Matheus and Gardini, Miguel and Silva, Vinicius and de Carvalho, André C. P. L. F. and Oliveira, Adriano L. I.}, booktitle={Computational Processing of the Portuguese Language}, year={2022}, publisher={Springer International Publishing}, isbn={978-3-030-98305-5}, doi={https://doi.org/10.1007/978-3-030-98305-5_1} } ``` ### Contributions Thanks to [@augusnunes](https://github.com/augusnunes) for adding this dataset.

注释创建者: [] 语言创建者: [] 语言: - 葡萄牙语(pt) 许可证: [] 多语言类型: - 单语 数据集展示名称: UlyssesNER-br 样本规模类别: - 10000 < 样本量 < 100000 源数据集: [] 任务类别: - 词元分类(token-classification) 任务子任务: - 命名实体识别(named-entity-recognition) --- # UlyssesNER-Br 数据集卡片 ## 目录 - [目录](#table-of-contents) - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持的任务与排行榜](#supported-tasks-and-leaderboards) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [标注](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据集使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集策展人](#dataset-curators) - [许可证信息](#licensing-information) - [引用信息](#citation-information) - [贡献](#contributions) ## 数据集描述 - **主页:** [Convenio-Camara-dos-Deputados/ulyssesner-br-propor](https://github.com/Convenio-Camara-dos-Deputados/ulyssesner-br-propor) - **代码仓库:** [Convenio-Camara-dos-Deputados/ulyssesner-br-propor](https://github.com/Convenio-Camara-dos-Deputados/ulyssesner-br-propor) - **论文:** [UlyssesNER-Br:面向命名实体识别的巴西立法文档语料库](https://link.springer.com/chapter/10.1007/978-3-030-98305-5_1) - **排行榜:** - **联系人:** ### 数据集概述 【需补充更多信息】 ### 支持的任务与排行榜 【需补充更多信息】 ### 语言 巴西葡萄牙语 ## 数据集结构 ### 数据实例 【需补充更多信息】 ### 数据字段 【需补充更多信息】 ### 数据划分 【需补充更多信息】 ## 数据集构建 ### 构建初衷 【需补充更多信息】 ### 源数据 #### 初始数据收集与归一化 【需补充更多信息】 #### 源语言内容的创作者是谁? 【需补充更多信息】 ### 标注 #### 标注流程 【需补充更多信息】 #### 标注人员是谁? 【需补充更多信息】 ### 个人与敏感信息 【需补充更多信息】 ## 数据集使用注意事项 ### 数据集的社会影响 【需补充更多信息】 ### 偏差讨论 【需补充更多信息】 ### 其他已知局限性 【需补充更多信息】 ## 附加信息 ### 数据集策展人 【需补充更多信息】 ### 许可证信息 【需补充更多信息】 ### 引用信息 @inproceedings{UlyssesNER-Br, title={UlyssesNER-Br: A Corpus of Brazilian Legislative Documents for Named Entity Recognition}, author={Albuquerque, Hidelberg O. and Costa, Rosimeire and Silvestre, Gabriel and Souza, Ellen and da Silva, Nádia F. F. and Vitório, Douglas and Moriyama, Gyovana and Martins, Lucas and Soezima, Luiza and Nunes, Augusto and Siqueira, Felipe and Tarrega, João P. and Beinotti, Joao V. and Dias, Marcio and Silva, Matheus and Gardini, Miguel and Silva, Vinicius and de Carvalho, André C. P. L. F. and Oliveira, Adriano L. I.}, booktitle={Computational Processing of the Portuguese Language}, year={2022}, publisher={Springer International Publishing}, isbn={978-3-030-98305-5}, doi={https://doi.org/10.1007/978-3-030-98305-5_1} } ### 贡献 感谢 [@augusnunes](https://github.com/augusnunes) 添加此数据集。

提供机构:
ulysses-camara
原始信息汇总

数据集概述

数据集名称

  • 名称: UlyssesNER-br

语言

  • 语言: 葡萄牙语 (巴西)

许可证

  • 许可证: 未指定

多语言性

  • 多语言性: 单语种

大小类别

  • 大小类别: 10K<n<100K

任务类别

  • 任务类别: 令牌分类

任务ID

  • 任务ID: 命名实体识别

引用信息

@inproceedings{UlyssesNER-Br, title={UlyssesNER-Br: A Corpus of Brazilian Legislative Documents for Named Entity Recognition}, author={Albuquerque, Hidelberg O. and Costa, Rosimeire and Silvestre, Gabriel and Souza, Ellen and da Silva, Nádia F. F. and Vitório, Douglas and Moriyama, Gyovana and Martins, Lucas and Soezima, Luiza and Nunes, Augusto and Siqueira, Felipe and Tarrega, João P. and Beinotti, Joao V. and Dias, Marcio and Silva, Matheus and Gardini, Miguel and Silva, Vinicius and de Carvalho, André C. P. L. F. and Oliveira, Adriano L. I.}, booktitle={Computational Processing of the Portuguese Language}, year={2022}, publisher={Springer International Publishing}, isbn={978-3-030-98305-5}, doi={https://doi.org/10.1007/978-3-030-98305-5_1} }

搜集汇总
数据集介绍
ulysses-camara/ulysses-ner-br 数据集图片
构建方式
在自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一,而面向特定领域的语料库构建尤为关键。UlyssesNER-Br数据集源自巴西立法机构的官方文档,旨在填补葡萄牙语巴西方言在立法文本NER任务中的资源空白。其构建过程严谨,首先从巴西众议院公开的立法提案、会议记录等原始文本中采集数据,随后由领域专家与语言学研究者协同制定标注规范,采用BIO(Begin-Inside-Outside)标注体系对人物、组织、地点、时间、法律条款等实体类别进行人工标注。为确保标注质量,数据集经过多轮交叉验证与一致性检验,最终形成了涵盖丰富实体类型的语料库。
特点
该数据集的核心特色在于其高度的领域专精性与规模适中的实用性。作为专为巴西立法文本设计的NER语料库,UlyssesNER-Br收录了超过数万个标注实例,实体类别紧密贴合法律语境,如立法者姓名、政党名称、法案编号等,显著区别于通用NER数据集。其标注粒度精细,兼顾了长实体与嵌套实体的识别需求,为模型学习领域特有的语言模式提供了坚实支撑。此外,数据集采用单语种葡萄牙语(巴西)设计,确保了语言变体的一致性,避免了多语混杂带来的噪声干扰,从而在立法文本NER任务中展现出卓越的代表性与针对性。
使用方法
在应用层面,UlyssesNER-Br提供了标准化的HuggingFace数据集接口,便于研究者直接集成至主流深度学习框架中。用户可通过加载'ulysses-camara/ulysses-ner-br'轻松获取数据,其结构包含token序列与对应的实体标签字段,支持直接用于序列标注模型的训练与评估。数据集已预设训练集、验证集和测试集划分,便于复现论文中的基准实验。使用时,建议结合预训练语言模型(如BERTimbau或XLM-R)进行微调,以充分捕捉立法文本中的语义与句法特征。同时,需注意数据集中可能存在的领域偏见,应在评估时关注模型对不同实体类别的泛化能力。
背景与挑战
背景概述
UlyssesNER-Br数据集由巴西多所高校及研究机构的研究人员于2022年创建,核心团队包括Hidelberg O. Albuquerque、Rosimeire Costa等,其研究聚焦于巴西立法文档中的命名实体识别(NER)任务。该数据集以巴西著名政治家Ulysses Guimarães命名,旨在填补葡萄牙语立法领域高质量标注语料库的空白。通过收录巴西众议院发布的官方文件,数据集覆盖了法律文本中特有的实体类型,如法案编号、立法机构名称等,为自然语言处理在法律领域的应用提供了重要资源。其影响力体现在推动了葡萄牙语NER技术从通用领域向专业法律文本的迁移,并为跨语言立法文档分析奠定了基础。
当前挑战
该数据集面临的核心挑战在于立法文档的复杂性和标注一致性。领域层面,法律文本中实体边界模糊、嵌套结构频繁(如‘第XX号法案第Y条’),且存在大量首字母缩略词和专有名词变体,对传统序列标注模型构成显著障碍。构建过程中,标注团队需处理巴西立法体系特有的层级化实体(如众议院、参议院及其下属委员会),并确保不同时期文档的标注标准统一。此外,数据来源的敏感性要求严格匿名化处理个人信息,而葡萄牙语形态丰富的特性(如名词阴阳性变化)进一步增加了标注难度,需设计精细的标注指南以平衡粒度与可行性。
常用场景
经典使用场景
UlyssesNER-Br数据集是面向巴西葡萄牙语立法文档的命名实体识别(NER)专用语料库,其核心应用场景在于精准抽取巴西议会文本中的人物、组织、地点、时间及法律条款等实体信息。该数据集以巴西众议院官方文件为来源,标注体系贴合立法语言的特殊性,为葡语自然语言处理领域提供了首个大规模、高质量的立法领域NER基准。研究者常利用该数据集训练和评估基于Transformer架构的序列标注模型(如BERTimbau、XLM-R),以验证模型在复杂法律语境中的实体边界识别与语义分类能力。该数据集的出现弥补了葡语法律文本资源匮乏的短板,推动了司法智能化进程中信息抽取技术的发展。
解决学术问题
该数据集解决了巴西立法文本自动解析中缺乏标准化标注语料的核心学术难题。以往葡语NER研究多聚焦新闻或通用领域,法律文本中特有的嵌套实体、长距离依赖及领域术语(如‘Projeto de Lei’、‘Emenda’)导致现有模型泛化能力不足。UlyssesNER-Br通过系统标注约1.5万条句子,覆盖11类实体标签,为学术社区提供了可复现的评估基准。其发布后显著促进了跨领域NER迁移学习研究,学者得以量化分析法律语言与通用语言之间的分布差异,并探索数据增强、半监督学习等策略在低资源场景下的有效性。该语料库的构建范式亦为其他罗曼语族语言的立法NER研究提供了方法论参考。
衍生相关工作
UlyssesNER-Br衍生了一系列推动葡语法律NLP发展的经典工作。基于该数据集,研究者提出了首个面向巴西立法文本的预训练语言模型LegalBERTimbau,通过领域自适应预训练显著提升了实体识别的F1得分。在评测任务方面,该语料库被纳入葡语NER共享任务(如PROPOR 2022的NER赛道),催生了多语言模型与对抗训练方法的对比研究。后续工作进一步扩展了数据集的标注维度,例如融合关系抽取任务构建立法知识图谱,以及引入时间表达式标准化模块。这些衍生研究不仅验证了UlyssesNER-Br作为基准的可靠性,还形成了从语料构建、模型优化到下游应用的完整研究链条,巩固了其在葡语法律NLP领域的基石地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务