coref-data/korean_ecmt_indiscrim
收藏资源简介:
--- dataset_info: features: - name: sentences list: - name: id dtype: int64 - name: speaker dtype: 'null' - name: text dtype: string - name: tokens list: - name: id dtype: int64 - name: lemma dtype: string - name: text dtype: string - name: xpos dtype: string - name: coref_chains sequence: sequence: sequence: int64 - name: id dtype: string - name: text dtype: string - name: genre dtype: string - name: meta_data struct: - name: comment dtype: string splits: - name: train num_bytes: 36047013 num_examples: 1345 - name: validation num_bytes: 3639179 num_examples: 135 - name: test num_bytes: 3703845 num_examples: 207 download_size: 11763612 dataset_size: 43390037 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* --- This dataset was generated by reformatting [`coref-data/korean_ecmt_raw`](https://huggingface.co/datasets/coref-data/korean_ecmt_raw) into the indiscrim coreference format. See that repo for dataset details. See [ianporada/coref-data](https://github.com/ianporada/coref-data) for additional conversion details and the conversion script. Please create an issue in the repo above or in this dataset repo for any questions.
数据集信息: 特征集: - 字段名:sentences,类型为列表,包含以下子字段: - 字段名:id,数据类型:int64 - 字段名:speaker,数据类型:空类型(null) - 字段名:text,数据类型:字符串(string) - 字段名:tokens,类型为列表,包含以下子字段: - 字段名:id,数据类型:int64 - 字段名:lemma(词元),数据类型:字符串(string) - 字段名:text,数据类型:字符串(string) - 字段名:xpos(扩展词性标记),数据类型:字符串(string) - 字段名:coref_chains,类型为三层嵌套序列,最内层元素数据类型为int64 - 字段名:id,数据类型:字符串(string) - 字段名:text,数据类型:字符串(string) - 字段名:genre(文本体裁),数据类型:字符串(string) - 字段名:meta_data(元数据),类型为结构体,包含以下子字段: - 字段名:comment,数据类型:字符串(string) 数据集划分: - 划分名称:train(训练集),字节数:36047013,样本数:1345 - 划分名称:validation(验证集),字节数:3639179,样本数:135 - 划分名称:test(测试集),字节数:3703845,样本数:207 下载体积:11763612,数据集总存储体积:43390037 配置项: - 配置名称:default(默认配置),数据文件: - 划分:train,路径:data/train-* - 划分:validation,路径:data/validation-* - 划分:test,路径:data/test-* 本数据集通过将 [`coref-data/korean_ecmt_raw`](https://huggingface.co/datasets/coref-data/korean_ecmt_raw) 重新格式化为无差别共指格式生成,数据集详细信息请参阅该仓库。 如需获取更多转换细节与转换脚本,请访问 [ianporada/coref-data](https://github.com/ianporada/coref-data) 仓库。 如有任何疑问,请在上述仓库或本数据集仓库中提交议题。
数据集概述
数据集信息
-
特征:
- sentences:
- id: 数据类型为
int64 - speaker: 数据类型为
null - text: 数据类型为
string - tokens:
- id: 数据类型为
int64 - lemma: 数据类型为
string - text: 数据类型为
string - xpos: 数据类型为
string
- id: 数据类型为
- id: 数据类型为
- coref_chains: 数据类型为
int64的序列 - id: 数据类型为
string - text: 数据类型为
string - genre: 数据类型为
string - meta_data:
- comment: 数据类型为
string
- comment: 数据类型为
- sentences:
-
数据分割:
- train:
- 字节数: 36047013
- 样本数: 1345
- validation:
- 字节数: 3639179
- 样本数: 135
- test:
- 字节数: 3703845
- 样本数: 207
- train:
-
下载大小: 11763612 字节
-
数据集大小: 43390037 字节
配置
- default:
- 数据文件:
- train: 路径为
data/train-* - validation: 路径为
data/validation-* - test: 路径为
data/test-*
- train: 路径为
- 数据文件:




