dmrau/cqudubstack-english
收藏资源简介:
--- configs: - config_name: default data_files: - split: queries path: data/queries-* - split: corpus path: data/corpus-* dataset_info: features: - name: _id dtype: string - name: text dtype: string - name: title dtype: string splits: - name: queries num_bytes: 103588 num_examples: 1570 - name: corpus num_bytes: 18199570 num_examples: 40221 download_size: 11382247 dataset_size: 18303158 --- # Dataset Card for "cqudubstack-english" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 配置项: - 配置名称:默认配置(default) 数据文件: - 数据拆分:查询集(queries) 文件路径:data/queries-* - 数据拆分:语料库(corpus) 文件路径:data/corpus-* 数据集信息: 特征字段: - 字段名:_id 数据类型:字符串(string) - 字段名:文本(text) 数据类型:字符串(string) - 字段名:标题(title) 数据类型:字符串(string) 数据拆分: - 拆分名称:查询集(queries) 字节大小:103588 样本数量:1570 - 拆分名称:语料库(corpus) 字节大小:18199570 样本数量:40221 下载总大小:11382247 数据集总占用大小:18303158 --- # 「cqudubstack-english」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
配置
- 默认配置:
- 数据文件:
- 查询集:路径为
data/queries-* - 语料库:路径为
data/corpus-*
- 查询集:路径为
- 数据文件:
数据集信息
-
特征:
- _id:类型为字符串
- text:类型为字符串
- title:类型为字符串
-
拆分:
- 查询集:
- 字节数:103588
- 样本数:1570
- 语料库:
- 字节数:18199570
- 样本数:40221
- 查询集:
-
下载大小:11382247 字节
-
数据集大小:18303158 字节



