遇见数据集

anon-submissions/narrativeqa_summaries

收藏
Hugging Face2026-03-30 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: document struct: - name: id dtype: string - name: kind dtype: string - name: url dtype: string - name: file_size dtype: int32 - name: word_count dtype: int32 - name: start dtype: string - name: end dtype: string - name: summary struct: - name: text dtype: string - name: tokens list: string - name: url dtype: string - name: title dtype: string - name: text dtype: string - name: question struct: - name: text dtype: string - name: tokens list: string - name: answers list: - name: text dtype: string - name: tokens list: string splits: - name: train num_bytes: 128184013 num_examples: 32747 - name: test num_bytes: 41048764 num_examples: 10557 - name: validation num_bytes: 13116259 num_examples: 3461 download_size: 181476136 dataset_size: 182349036 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - split: validation path: data/validation-* ---

数据集信息: 特征字段: - 字段名:document(文档) 结构体包含以下子字段: - 子字段id:数据类型为字符串 - 子字段kind:数据类型为字符串 - 子字段url(统一资源定位符):数据类型为字符串 - 子字段file_size(文件大小):数据类型为32位整型 - 子字段word_count(词数):数据类型为32位整型 - 子字段start(起始位置):数据类型为字符串 - 子字段end(结束位置):数据类型为字符串 - 子字段summary(摘要):结构体包含以下子字段: - 子字段text:数据类型为字符串 - 子字段tokens(词元Token):数据类型为字符串列表 - 子字段url(统一资源定位符):数据类型为字符串 - 子字段title(标题):数据类型为字符串 - 子字段text(正文文本):数据类型为字符串 - 字段名:question(问题) 结构体包含以下子字段: - 子字段text:数据类型为字符串 - 子字段tokens(词元Token):数据类型为字符串列表 - 字段名:answers(答案列表):数据类型为结构体列表,每个结构体包含以下子字段: - 子字段text:数据类型为字符串 - 子字段tokens(词元Token):数据类型为字符串列表 数据集划分: - 划分名称:train(训练集),字节数:128184013,样本数量:32747 - 划分名称:test(测试集),字节数:41048764,样本数量:10557 - 划分名称:validation(验证集),字节数:13116259,样本数量:3461 下载总大小:181476136字节 数据集总大小:182349036字节 配置项: - 配置名称:default(默认配置) 数据文件路径: - 对应训练集:data/train-* - 对应测试集:data/test-* - 对应验证集:data/validation-*

提供机构:
anon-submissions
二维码
社区交流群
二维码
科研交流群
商业服务