ravithejads/ms_marco_hi_mr_te
收藏资源简介:
--- dataset_info: features: - name: answers sequence: string - name: passages sequence: - name: is_selected dtype: int32 - name: passage_text dtype: string - name: url dtype: string - name: query dtype: string - name: query_id dtype: int32 - name: query_type dtype: string - name: wellFormedAnswers sequence: string - name: query_hi dtype: string - name: answers_hi dtype: string - name: passage_text_hi sequence: string - name: query_mr dtype: string - name: passage_text_mr sequence: string - name: answers_mr sequence: string - name: query_te dtype: string - name: passage_text_te sequence: string - name: answers_te sequence: string splits: - name: test num_bytes: 311285940 num_examples: 9650 download_size: 109117289 dataset_size: 311285940 configs: - config_name: default data_files: - split: test path: data/test-* ---
数据集信息: 特征列表: - 字段名: answers 数据类型: 字符串序列 - 字段名: passages 数据类型: 序列 序列元素: - 字段名: is_selected 数据类型: 32位整数(int32) - 字段名: passage_text 数据类型: 字符串 - 字段名: url 数据类型: 统一资源定位符(URL) - 字段名: query 数据类型: 字符串 - 字段名: query_id 数据类型: 32位整数(int32) - 字段名: query_type 数据类型: 字符串 - 字段名: wellFormedAnswers 数据类型: 字符串序列 - 字段名: query_hi(印地语查询文本) 数据类型: 字符串 - 字段名: answers_hi(印地语答案序列) 数据类型: 字符串序列 - 字段名: passage_text_hi(印地语段落文本序列) 数据类型: 字符串序列 - 字段名: query_mr(马拉地语查询文本) 数据类型: 字符串 - 字段名: passage_text_mr(马拉地语段落文本序列) 数据类型: 字符串序列 - 字段名: answers_mr(马拉地语答案序列) 数据类型: 字符串序列 - 字段名: query_te(泰卢固语查询文本) 数据类型: 字符串 - 字段名: passage_text_te(泰卢固语段落文本序列) 数据类型: 字符串序列 - 字段名: answers_te(泰卢固语答案序列) 数据类型: 字符串序列 数据集划分: - 划分名称: test(测试集) 字节数: 311285940 样本数量: 9650 下载体积: 109117289 字节 数据集总大小: 311285940 字节 配置项: - 配置名称: default(默认配置) 数据文件: - 对应划分: test(测试集) 文件路径: data/test-*
数据集概述
数据集特征
- answers: 字符串序列
- passages: 序列,包含以下字段:
- is_selected: 整型 (int32)
- passage_text: 字符串
- url: 字符串
- query: 字符串
- query_id: 整型 (int32)
- query_type: 字符串
- wellFormedAnswers: 字符串序列
- query_hi: 字符串
- answers_hi: 字符串
- passage_text_hi: 字符串序列
- query_mr: 字符串
- passage_text_mr: 字符串序列
- answers_mr: 字符串序列
- query_te: 字符串
- passage_text_te: 字符串序列
- answers_te: 字符串序列
数据集分割
- test:
- 字节数: 311285940
- 示例数: 9650
数据集大小
- 下载大小: 109117289
- 数据集大小: 311285940
配置
- config_name: default
- data_files:
- split: test
- path: data/test-*




