遇见数据集

strombergnlp/named_timexes

收藏
Hugging Face2022-07-01 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated language_creators: - found language: - en license: - cc-by-4.0 multilinguality: - monolingual pretty_name: Named Temporal Expressions dataset size_categories: - 100K<n<1M source_datasets: - original task_categories: - token-classification task_ids: [] --- # Dataset Card for named_timexes ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-instances) - [Data Splits](#data-instances) - [Dataset Creation](#dataset-creation) - [Curation Rationale](#curation-rationale) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Considerations for Using the Data](#considerations-for-using-the-data) - [Social Impact of Dataset](#social-impact-of-dataset) - [Discussion of Biases](#discussion-of-biases) - [Other Known Limitations](#other-known-limitations) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) ## Dataset Description - **Homepage:** - **Repository:** - **Paper:** [https://aclanthology.org/R13-1015/](https://aclanthology.org/R13-1015/) - **Leaderboard:** - **Point of Contact:** [Leon Derczynski](https://github.com/leondz) ### Dataset Summary This is a dataset annotated for _named temporal expression_ chunks. The commonest temporal expressions typically contain date and time words, like April or hours. Research into recognising and interpreting these typical expressions is mature in many languages. However, there is a class of expressions that are less typical, very varied, and difficult to automatically interpret. These indicate dates and times, but are harder to detect because they often do not contain time words and are not used frequently enough to appear in conventional temporally-annotated corpora – for example *Michaelmas* or *Vasant Panchami*. For more details see [Recognising and Interpreting Named Temporal Expressions](https://aclanthology.org/R13-1015.pdf) ### Supported Tasks and Leaderboards * Task: Named Entity Recognition (temporal expressions) ### Languages Englsih ## Dataset Structure ### Data Instances ### Data Fields Each tweet contains an ID, a list of tokens, and a list of timex chunk flags. - `id`: a `string` feature. - `tokens`: a `list` of `strings` . - `ntimex_tags`: a `list` of class IDs (`int`s) for whether a token is out-of-timex or in a timex chunk. ``` 0: O 1: T ``` ### Data Splits Section|Token count ---|---: train|87 050 test|30 010 ## Dataset Creation ### Curation Rationale [Needs More Information] ### Source Data #### Initial Data Collection and Normalization [Needs More Information] #### Who are the source language producers? [Needs More Information] ### Annotations #### Annotation process [Needs More Information] #### Who are the annotators? [Needs More Information] ### Personal and Sensitive Information [Needs More Information] ## Considerations for Using the Data ### Social Impact of Dataset [Needs More Information] ### Discussion of Biases [Needs More Information] ### Other Known Limitations [Needs More Information] ## Additional Information ### Dataset Curators [Needs More Information] ### Licensing Information Creative Commons Attribution 4.0 International (CC BY 4.0) ### Citation Information ``` @inproceedings{brucato-etal-2013-recognising, title = "Recognising and Interpreting Named Temporal Expressions", author = "Brucato, Matteo and Derczynski, Leon and Llorens, Hector and Bontcheva, Kalina and Jensen, Christian S.", booktitle = "Proceedings of the International Conference Recent Advances in Natural Language Processing {RANLP} 2013", month = sep, year = "2013", address = "Hissar, Bulgaria", publisher = "INCOMA Ltd. Shoumen, BULGARIA", url = "https://aclanthology.org/R13-1015", pages = "113--121", } ``` ### Contributions Author-added dataset [@leondz](https://github.com/leondz)

--- 注释生成方式: - 专家生成 语言采集方式: - 公开采集 语言: - 英语(en) 许可协议: - CC BY 4.0(cc-by-4.0) 多语言属性: - 单语言 数据集名称: - 命名时间表达式数据集(Named Temporal Expressions dataset) 数据规模区间: - 10万~100万条(100K<n<1M) 源数据集类型: - 原创数据集 任务类别: - 令牌分类(token-classification) 任务子项: - 无 --- # named_timexes 数据集卡片 ## 目录 - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据样例](#data-instances) - [数据字段](#data-fields) - [数据划分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [标注信息](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集维护者](#dataset-curators) - [许可信息](#licensing-information) - [引用信息](#citation-information) ## 数据集描述 - **主页:** 无 - **代码仓库:** 无 - **论文:** [https://aclanthology.org/R13-1015/](https://aclanthology.org/R13-1015/) - **排行榜:** 无 - **项目联系人:** [Leon Derczynski](https://github.com/leondz) ### 数据集概述 本数据集针对**命名时间表达式(named temporal expression)**块进行标注。 最常见的时间表达式通常包含日期、时间类词汇,例如“四月”或“小时”。针对这类典型表达式的识别与理解研究在诸多语言中已较为成熟。然而,存在一类非常规、形式多样且难以自动解析的表达式:它们同样指代日期与时间,但因往往不包含时间词汇,且使用频率过低,难以出现在常规的时序标注语料库中——例如*米迦勒节(Michaelmas)*或*万春节(Vasant Panchami)*。 更多细节可参阅论文《Recognising and Interpreting Named Temporal Expressions》(https://aclanthology.org/R13-1015.pdf)。 ### 支持任务与排行榜 * 任务:时间表达式方向命名实体识别 ### 语言 英语 ## 数据集结构 ### 数据样例 ### 数据字段 每条推文包含一个ID、一个令牌列表,以及一个时间表达式块标记列表。 - `id`: 字符串(string)类型特征。 - `tokens`: 字符串(string)列表。 - `ntimex_tags`: 由整数类标签组成的列表,用于标记每个令牌是否属于时间表达式块,或不属于任何时间表达式块: 0: O(非时间表达式令牌) 1: T(属于时间表达式块的令牌) ### 数据划分 | 数据集划分 | 令牌总数 | | :---: | ---: | | 训练集 | 87050 | | 测试集 | 30010 | ## 数据集构建 ### 构建初衷 [待补充详细信息] ### 源数据 #### 初始数据收集与标准化处理 [待补充详细信息] #### 源语言数据的生产者 [待补充详细信息] ### 标注信息 #### 标注流程 [待补充详细信息] #### 标注人员 [待补充详细信息] ### 个人与敏感信息 [待补充详细信息] ## 数据使用注意事项 ### 数据集的社会影响 [待补充详细信息] ### 偏差讨论 [待补充详细信息] ### 其他已知局限性 [待补充详细信息] ## 附加信息 ### 数据集维护者 [待补充详细信息] ### 许可信息 知识共享署名4.0国际许可协议(CC BY 4.0) ### 引用信息 bibtex @inproceedings{brucato-etal-2013-recognising, title = "Recognising and Interpreting Named Temporal Expressions", author = "Brucato, Matteo and Derczynski, Leon and Llorens, Hector and Bontcheva, Kalina and Jensen, Christian S.", booktitle = "Proceedings of the International Conference Recent Advances in Natural Language Processing {RANLP} 2013", month = sep, year = "2013", address = "Hissar, Bulgaria", publisher = "INCOMA Ltd. Shoumen, BULGARIA", url = "https://aclanthology.org/R13-1015", pages = "113--121", } ### 贡献说明 本数据集由[@leondz](https://github.com/leondz)补充添加

提供机构:
strombergnlp
原始信息汇总

数据集概述

数据集名称

  • Pretty Name: Named Temporal Expressions dataset

数据集摘要

  • Dataset Summary: 该数据集标注了命名时间表达式的片段。这些表达式通常不包含时间词,且使用频率不高,难以在常规的时间标注语料库中检测到。

支持的任务

  • Supported Tasks: 命名实体识别(时间表达式)

语言

  • Languages: 英语

数据集结构

  • Data Instances: 每个实例包含一个ID、一组tokens和一组timex chunk标志。
  • Data Fields:
    • id: 字符串类型
    • tokens: 字符串列表
    • ntimex_tags: 整数列表,表示token是否属于时间表达式

数据分割

  • Data Splits:
    • 训练集: 87,050 tokens
    • 测试集: 30,010 tokens

许可证

  • Licensing Information: Creative Commons Attribution 4.0 International (CC BY 4.0)

引用信息

  • Citation Information:

    @inproceedings{brucato-etal-2013-recognising, title = "Recognising and Interpreting Named Temporal Expressions", author = "Brucato, Matteo and Derczynski, Leon and Llorens, Hector and Bontcheva, Kalina and Jensen, Christian S.", booktitle = "Proceedings of the International Conference Recent Advances in Natural Language Processing {RANLP} 2013", month = sep, year = "2013", address = "Hissar, Bulgaria", publisher = "INCOMA Ltd. Shoumen, BULGARIA", url = "https://aclanthology.org/R13-1015", pages = "113--121", }

搜集汇总
数据集介绍
strombergnlp/named_timexes 数据集图片
构建方式
该数据集聚焦于命名时间表达式的识别与标注,其构建基于对英文文本中非常规时间表达式的深度挖掘。与常见的时间词汇(如“April”或“hours”)不同,这类表达式如“Michaelmas”或“Vasant Panchami”往往不含显式时间词,且出现频率较低,难以在传统时间标注语料库中捕获。数据集的标注由领域专家完成,采用标记-分块策略,对每条文本中的每个词元赋予两类标签:O(非时间表达式)或T(时间表达式内部),从而形成结构化标注。
使用方法
该数据集主要用于基于词元分类的命名实体识别任务,特别聚焦于时间表达式的识别。使用者可加载数据集中的token字段与ntimex_tags标注,构建序列标注模型,如条件随机场或基于Transformer的架构。训练时,模型需学习从词元序列中预测每个位置是否为时间表达式的一部分。标准评估可基于测试集计算精确率、召回率与F1分数,以衡量模型对非常规时间表达式的辨识能力。
背景与挑战
背景概述
在自然语言处理领域,时间表达式的识别与理解是信息抽取中的关键任务,对问答系统、事件时序分析及知识图谱构建具有深远影响。传统研究多聚焦于包含明显时间词(如“四月”、“小时”)的典型表达式,然而现实文本中存在一类名为“命名时间表达式”(Named Temporal Expressions)的特殊实体,它们以专有名词形式隐含时间信息,例如“Michaelmas”或“Vasant Panchami”,这些表达式缺乏显式时间词汇且使用频率低,难以被常规语料库覆盖。为应对这一挑战,Leon Derczynski、Matteo Brucato等研究人员于2013年在RANLP会议上提出了该数据集,其核心研究问题在于构建一种能够识别并解释这类非典型时间实体的标注语料。该数据集由专家手工标注,包含约11.7万条英文推文,为时序信息抽取领域提供了稀缺的基准资源,推动了命名实体识别技术在复杂时间表达上的边界拓展。
当前挑战
当前数据集面临的核心挑战主要源于领域问题与构建过程双重层面。在领域层面,命名时间表达式识别需解决其高度变异性和稀疏性的难题:这类表达常嵌入文化、宗教或历史语境(如节日名称),缺乏统一形态模式,且因低频出现导致传统统计模型难以有效学习;同时,它们与普通命名实体(如人名、地点)在表面特征上高度重叠,增加了歧义消解难度。在构建过程中,数据采集面临标注一致性挑战,因为专家需在缺乏上下文线索的情况下判定晦涩时间指代,不同标注者可能对同一表达是否具有时间属性产生分歧;此外,推文文本的噪声性(如拼写错误、缩写)进一步加剧了标注复杂度,而有限的语料规模(约8.7万训练词)也限制了深度模型在此类细粒度任务上的泛化能力。
常用场景
经典使用场景
在自然语言处理领域,时间表达式识别是信息抽取的核心子任务之一。named_timexes数据集专为命名时间表达式的识别与边界检测而设计,其标注聚焦于那些不包含典型时间词汇(如“四月”、“小时”)的非常规时间指代,例如“Michaelmas”或“Vasant Panchami”。该数据集以token级别的序列标注形式呈现,为基于序列标注模型(如BiLSTM-CRF或Transformer架构)的命名实体识别研究提供了精细的评估基准,尤其适用于探索那些在传统语料库中罕有出现的文化或宗教节日类时间表达。
解决学术问题
该数据集直面传统时间表达式识别方法在处理非典型、低频时间指代时的性能瓶颈。在学术研究中,常规时间标注语料库往往遗漏了那些不包含显式时间词汇但实际指示特定日期的表达,这限制了时间信息抽取系统的泛化能力。named_timexes通过系统性地收集并标注此类“命名时间表达式”,为学界提供了一个针对这一长尾问题的专用训练与测试资源,推动了时间实体识别研究从依赖词汇线索向更复杂的语义推理方向演进,显著提升了模型对跨文化、跨语境时间信息的理解能力。
实际应用
在实际应用层面,该数据集所支持的时间表达式识别技术可赋能多种智能系统。例如,在智能问答和对话系统中,准确理解用户提及的“Michaelmas”等非标准时间指代,有助于提升日程管理、历史事件查询等服务的响应精度。此外,在新闻聚合、金融报告分析和社交媒体监控等场景中,自动识别并解析这些隐含时间信息的实体,能够优化事件时间线的构建、趋势预测以及内容推荐算法的时效性判断,从而增强信息处理系统的上下文感知能力。
数据集最近研究
最新研究方向
在自然语言处理领域,时间表达式识别是信息抽取的关键子任务,而传统方法多聚焦于包含明确时间词(如“四月”“小时”)的典型表达。然而,随着对非典型时间表达(如“米迦勒节”“五旬节”)关注度的提升,研究者开始探索更鲁棒的命名时间实体识别技术。该数据集聚焦于这类难以通过常规时间词库捕获的实体,其标注规模超过10万条,为训练和评估深度学习模型(如基于Transformer的序列标注架构)提供了基础资源。近期前沿方向包括将命名时间实体识别与事件抽取、知识图谱构建相结合,以应对社交媒体、历史文本等场景中时间信息的歧义性。该数据集推动了时间信息处理从规则驱动向数据驱动范式的转变,尤其对跨文化、跨语种的时间表达理解具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务