C-MTEB/CmedqaRetrieval
收藏资源简介:
--- configs: - config_name: default data_files: - split: corpus path: data/corpus-* - split: queries path: data/queries-* dataset_info: features: - name: id dtype: string - name: text dtype: string splits: - name: corpus num_bytes: 84962605 num_examples: 100001 - name: queries num_bytes: 728106 num_examples: 3999 download_size: 61319407 dataset_size: 85690711 --- # Dataset Card for "CmedqaRetrieval" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 配置项: - 配置名称:default 数据文件: - 数据集划分:corpus(语料库) 路径:data/corpus-* - 数据集划分:queries(查询集) 路径:data/queries-* 数据集信息: 特征: - 名称:id 数据类型:字符串(string) - 名称:text 数据类型:字符串(string) 数据集划分: - 名称:corpus(语料库) 字节数:84962605 样本数量:100001 - 名称:queries(查询集) 字节数:728106 样本数量:3999 下载大小:61319407 数据集总大小:85690711 --- # 「CmedqaRetrieval」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
配置信息
- 默认配置 (
config_name: default)- 数据文件路径
corpus分片:data/corpus-*queries分片:data/queries-*
- 数据文件路径
数据集信息
-
特征 (Features)
- id
- 数据类型: 字符串 (
dtype: string)
- 数据类型: 字符串 (
- text
- 数据类型: 字符串 (
dtype: string)
- 数据类型: 字符串 (
- id
-
分片信息 (Splits)
- corpus
- 字节数: 84962605
- 示例数: 100001
- queries
- 字节数: 728106
- 示例数: 3999
- corpus
-
下载大小 (download_size): 61319407
-
数据集大小 (dataset_size): 85690711




