tyzhu/lmind_nq_full_v1_qa
收藏资源简介:
--- configs: - config_name: default data_files: - split: train_qa path: data/train_qa-* - split: train_recite_qa path: data/train_recite_qa-* - split: eval_qa path: data/eval_qa-* - split: eval_recite_qa path: data/eval_recite_qa-* - split: all_docs path: data/all_docs-* - split: train path: data/train-* - split: validation path: data/validation-* dataset_info: features: - name: answers struct: - name: answer_start sequence: 'null' - name: text sequence: string - name: inputs dtype: string - name: targets dtype: string splits: - name: train_qa num_bytes: 6806082 num_examples: 58622 - name: train_recite_qa num_bytes: 43572611 num_examples: 58622 - name: eval_qa num_bytes: 752802 num_examples: 6489 - name: eval_recite_qa num_bytes: 4821829 num_examples: 6489 - name: all_docs num_bytes: 28100353 num_examples: 43935 - name: train num_bytes: 6806082 num_examples: 58622 - name: validation num_bytes: 752802 num_examples: 6489 download_size: 56900023 dataset_size: 91612561 --- # Dataset Card for "lmind_nq_full_v1_qa" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集配置: - 配置名称: 默认 数据文件: - 数据集划分(split): 训练问答集(train_qa) 路径: data/train_qa-* - 数据集划分(split): 训练背诵问答集(train_recite_qa) 路径: data/train_recite_qa-* - 数据集划分(split): 验证问答集(eval_qa) 路径: data/eval_qa-* - 数据集划分(split): 验证背诵问答集(eval_recite_qa) 路径: data/eval_recite_qa-* - 数据集划分(split): 全文档集(all_docs) 路径: data/all_docs-* - 数据集划分(split): 训练集(train) 路径: data/train-* - 数据集划分(split): 验证集(validation) 路径: data/validation-* 数据集信息: 特征字段: - 名称: answers(答案) 结构体: - 名称: answer_start(答案起始位置) 序列(sequence): 空值(null) - 名称: text(文本) 序列(sequence): 字符串 - 名称: inputs(输入) 数据类型(dtype): 字符串 - 名称: targets(目标) 数据类型(dtype): 字符串 数据集划分详情: - 划分名称: train_qa 字节数: 6806082 样本数: 58622 - 划分名称: train_recite_qa 字节数: 43572611 样本数: 58622 - 划分名称: eval_qa 字节数: 752802 样本数: 6489 - 划分名称: eval_recite_qa 字节数: 4821829 样本数: 6489 - 划分名称: all_docs 字节数: 28100353 样本数: 43935 - 划分名称: train 字节数: 6806082 样本数: 58622 - 划分名称: validation 字节数: 752802 样本数: 6489 下载大小: 56900023 数据集总大小: 91612561 --- # 数据集卡片:lmind_nq_full_v1_qa [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
配置信息
- 默认配置:
- 数据文件路径:
train_qa:data/train_qa-*train_recite_qa:data/train_recite_qa-*eval_qa:data/eval_qa-*eval_recite_qa:data/eval_recite_qa-*all_docs:data/all_docs-*train:data/train-*validation:data/validation-*
- 数据文件路径:
数据集信息
-
特征:
answers:answer_start: 序列类型为nulltext: 序列类型为string
inputs: 数据类型为stringtargets: 数据类型为string
-
分割:
train_qa:- 字节数: 6806082
- 样本数: 58622
train_recite_qa:- 字节数: 43572611
- 样本数: 58622
eval_qa:- 字节数: 752802
- 样本数: 6489
eval_recite_qa:- 字节数: 4821829
- 样本数: 6489
all_docs:- 字节数: 28100353
- 样本数: 43935
train:- 字节数: 6806082
- 样本数: 58622
validation:- 字节数: 752802
- 样本数: 6489
-
数据集大小:
- 下载大小: 56900023 字节
- 数据集大小: 91612561 字节




