遇见数据集

coref-data/korean_ecmt_indiscrim

收藏
Hugging Face2024-01-22 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: sentences list: - name: id dtype: int64 - name: speaker dtype: 'null' - name: text dtype: string - name: tokens list: - name: id dtype: int64 - name: lemma dtype: string - name: text dtype: string - name: xpos dtype: string - name: coref_chains sequence: sequence: sequence: int64 - name: id dtype: string - name: text dtype: string - name: genre dtype: string - name: meta_data struct: - name: comment dtype: string splits: - name: train num_bytes: 36047013 num_examples: 1345 - name: validation num_bytes: 3639179 num_examples: 135 - name: test num_bytes: 3703845 num_examples: 207 download_size: 11763612 dataset_size: 43390037 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* --- This dataset was generated by reformatting [`coref-data/korean_ecmt_raw`](https://huggingface.co/datasets/coref-data/korean_ecmt_raw) into the indiscrim coreference format. See that repo for dataset details. See [ianporada/coref-data](https://github.com/ianporada/coref-data) for additional conversion details and the conversion script. Please create an issue in the repo above or in this dataset repo for any questions.

数据集信息: 特征集: - 字段名:sentences,类型为列表,包含以下子字段: - 字段名:id,数据类型:int64 - 字段名:speaker,数据类型:空类型(null) - 字段名:text,数据类型:字符串(string) - 字段名:tokens,类型为列表,包含以下子字段: - 字段名:id,数据类型:int64 - 字段名:lemma(词元),数据类型:字符串(string) - 字段名:text,数据类型:字符串(string) - 字段名:xpos(扩展词性标记),数据类型:字符串(string) - 字段名:coref_chains,类型为三层嵌套序列,最内层元素数据类型为int64 - 字段名:id,数据类型:字符串(string) - 字段名:text,数据类型:字符串(string) - 字段名:genre(文本体裁),数据类型:字符串(string) - 字段名:meta_data(元数据),类型为结构体,包含以下子字段: - 字段名:comment,数据类型:字符串(string) 数据集划分: - 划分名称:train(训练集),字节数:36047013,样本数:1345 - 划分名称:validation(验证集),字节数:3639179,样本数:135 - 划分名称:test(测试集),字节数:3703845,样本数:207 下载体积:11763612,数据集总存储体积:43390037 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train,路径:data/train-* - 划分:validation,路径:data/validation-* - 划分:test,路径:data/test-* 本数据集通过将 [`coref-data/korean_ecmt_raw`](https://huggingface.co/datasets/coref-data/korean_ecmt_raw) 重新格式化为无差别共指格式生成,数据集详细信息请参阅该仓库。 如需获取更多转换细节与转换脚本,请访问 [ianporada/coref-data](https://github.com/ianporada/coref-data) 仓库。 如有任何疑问,请在上述仓库或本数据集仓库中提交议题。

提供机构:
coref-data
原始信息汇总

数据集概述

数据集信息

  • 特征:

    • sentences:
      • id: 数据类型为 int64
      • speaker: 数据类型为 null
      • text: 数据类型为 string
      • tokens:
        • id: 数据类型为 int64
        • lemma: 数据类型为 string
        • text: 数据类型为 string
        • xpos: 数据类型为 string
    • coref_chains: 数据类型为 int64 的序列
    • id: 数据类型为 string
    • text: 数据类型为 string
    • genre: 数据类型为 string
    • meta_data:
      • comment: 数据类型为 string
  • 数据分割:

    • train:
      • 字节数: 36047013
      • 样本数: 1345
    • validation:
      • 字节数: 3639179
      • 样本数: 135
    • test:
      • 字节数: 3703845
      • 样本数: 207
  • 下载大小: 11763612 字节

  • 数据集大小: 43390037 字节

配置

  • default:
    • 数据文件:
      • train: 路径为 data/train-*
      • validation: 路径为 data/validation-*
      • test: 路径为 data/test-*
搜集汇总
数据集介绍
coref-data/korean_ecmt_indiscrim 数据集图片
构建方式
该数据集源于对原始韩语指代消解数据集`coref-data/korean_ecmt_raw`的深度重构与格式统一化处理。通过精心设计的转换脚本,将原始数据中零散的指代关系重新编排为结构化的`coref_chains`序列,每个指代链由多个整型标识符序列构成,清晰刻画了文本中实体的共指关系网络。数据集的构建严格遵循了indiscrim指代格式规范,确保了与同类语料库的兼容性,同时保留了原始语料中句子的词法分析结果,包括词元、词形及词性标注等精细特征。
特点
本数据集的核心特色在于其高度结构化的指代标注体系与多维度语言特征的有效融合。每条数据不仅包含完整的句子序列与词级标注信息,还通过嵌套的`coref_chains`字段精准记录了跨句的共指关系,为深层语义理解提供了坚实基础。数据集按标准划分为训练集、验证集和测试集,分别包含1345、135和207个样本,规模适中且分布均衡,特别适合韩语指代消解任务的模型训练与评估。其元数据字段还提供了注释信息,增强了数据可追溯性。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,用户只需指定配置名称`default`及所需的数据分割(`train`、`validation`或`test`)即可获取对应文件。在应用时,研究者可灵活利用`sentences`字段中的词级特征进行特征工程,或直接使用`coref_chains`序列构建指代消解模型。对于需要序列化输入的任务,建议将多句文本拼接并配合对应的指代链索引进行训练。数据集的标准化格式也便于与现有指代消解工具链无缝集成,支持快速开展韩语自然语言理解的相关研究。
背景与挑战
背景概述
在自然语言处理领域,指代消解是一项核心任务,旨在识别文本中指向同一实体的不同表述,对于提升机器对语言深层结构的理解至关重要。然而,针对韩语的指代消解研究长期受限于高质量标注资源的匮乏。为此,coref-data团队于近期构建了korean_ecmt_indiscrim数据集,该数据集由Ian Porada主导,通过将原始的韩语指代消解数据(korean_ecmt_raw)转换为统一的indiscrim格式而来。该数据集涵盖了1345条训练样本、135条验证样本和207条测试样本,每条样本包含句子序列、指代链、元数据等丰富特征,为韩语指代消解模型的训练与评估提供了标准化基准。其发布不仅填补了韩语领域指代消解数据集的空白,也为跨语言指代消解研究贡献了可复用的资源,对推动多语言自然语言理解技术的发展具有重要意义。
当前挑战
当前korean_ecmt_indiscrim数据集面临多重挑战。首先,在领域问题层面,韩语作为一种黏着语,其丰富的形态变化和灵活的语序使得指代消解任务尤为复杂,例如零代词现象频繁出现,而现有模型对此类现象的捕捉能力有限。其次,数据集构建过程中,原始数据来自不同来源,其标注一致性难以保证,尽管转换为了统一格式,但原始标注的歧义或错误可能被继承。此外,数据集规模相对较小(总计不足1700条样本),可能不足以支撑深度模型的充分训练,尤其在处理长文本或罕见指代模式时,模型的泛化能力面临考验。最后,数据集的元数据中仅包含注释字段,缺乏对说话人、场景等社交语用信息的系统记录,这限制了模型在真实对话场景中的鲁棒性提升。
常用场景
经典使用场景
在自然语言处理领域,指代消解(Coreference Resolution)是构建深层语义理解系统的关键环节。coref-data/korean_ecmt_indiscrim 数据集专为韩语指代消解任务而设计,其最经典的使用场景是作为基准数据集,训练和评估基于深度学习的指代消解模型。通过提供高精度的指代链标注,该数据集使得研究者能够系统性地探索韩语中代词、名词短语与实体之间的指代关系,从而推动多语言指代消解技术的进步。
解决学术问题
该数据集有效解决了韩语指代消解研究中标注资源匮乏的学术困境。此前,韩语领域缺乏大规模、高质量的标注语料,导致相关模型难以充分捕捉韩语特有的省略主语、话题优先等语言现象。借助该数据集,研究者得以开展跨语言对比实验,评估现有指代消解框架在韩语上的泛化能力,并针对韩语语法特征优化模型结构,进而提升了多语言自然语言理解系统的鲁棒性与准确性。
衍生相关工作
该数据集的发布催生了多项衍生研究工作。研究者基于该数据集开发了针对韩语特性的端到端指代消解模型,并引入了跨句指代链的图神经网络方法。后续工作还将其与多任务学习框架结合,同时进行命名实体识别与指代消解,显著提升了韩语篇章级语义分析的性能。此外,该数据集被用于验证预训练语言模型(如KoBERT、KoGPT)在指代消解任务上的迁移学习效果,为韩语自然语言处理社区提供了重要的实验基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务