Seongill/nq_cbr
收藏资源简介:
--- dataset_info: features: - name: question dtype: string - name: answers sequence: string - name: ctxs list: - name: hasanswer dtype: bool - name: id dtype: string - name: score dtype: float64 - name: text dtype: string - name: title dtype: string - name: case_question dtype: string - name: case_context dtype: string - name: case_answer dtype: string splits: - name: train num_bytes: 654471488 num_examples: 87925 - name: test num_bytes: 26921812 num_examples: 3610 download_size: 386473537 dataset_size: 681393300 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---
数据集信息: 特征字段: - 名称:问题(question),数据类型:字符串(string) - 名称:答案序列(answers),数据类型:字符串序列 - 名称:上下文集合(ctxs),为列表类型,包含以下子字段: - 名称:是否含答案(hasanswer),数据类型:布尔值(bool) - 名称:标识符(id),数据类型:字符串(string) - 名称:得分(score),数据类型:64位浮点数(float64) - 名称:文本内容(text),数据类型:字符串(string) - 名称:标题(title),数据类型:字符串(string) - 名称:案例问题(case_question),数据类型:字符串(string) - 名称:案例上下文(case_context),数据类型:字符串(string) - 名称:案例答案(case_answer),数据类型:字符串(string) 数据集划分: - 划分名称:训练集(train),字节数:654471488,样本数:87925 - 划分名称:测试集(test),字节数:26921812,样本数:3610 下载总大小:386473537,数据集总大小:681393300 配置项: - 配置名称:默认配置(default),数据文件: - 训练集对应路径:data/train-* - 测试集对应路径:data/test-*
数据集信息
特征
- question: 类型为字符串。
- answers: 类型为字符串序列。
- ctxs: 类型为列表,包含以下子特征:
- hasanswer: 类型为布尔值。
- id: 类型为字符串。
- score: 类型为浮点数(float64)。
- text: 类型为字符串。
- title: 类型为字符串。
- case_question: 类型为字符串。
- case_context: 类型为字符串。
- case_answer: 类型为字符串。
数据分割
- train: 包含87925个样本,大小为654471488字节。
- test: 包含3610个样本,大小为26921812字节。
数据集大小
- 下载大小: 386473537字节。
- 数据集大小: 681393300字节。
配置
- default:
- train: 文件路径为
data/train-*。 - test: 文件路径为
data/test-*。
- train: 文件路径为




