pietrolesci/yahoo_answers_topics
收藏资源简介:
--- configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* - config_name: embedding_all-mpnet-base-v2 data_files: - split: train path: embedding_all-mpnet-base-v2/train-* - split: test path: embedding_all-mpnet-base-v2/test-* dataset_info: - config_name: default features: - name: id dtype: int32 - name: topic dtype: class_label: names: '0': Society & Culture '1': Science & Mathematics '2': Health '3': Education & Reference '4': Computers & Internet '5': Sports '6': Business & Finance '7': Entertainment & Music '8': Family & Relationships '9': Politics & Government - name: question_title dtype: string - name: question_content dtype: string - name: best_answer dtype: string - name: text dtype: string - name: uid dtype: int64 splits: - name: train num_bytes: 1506571390 num_examples: 1400000 - name: test num_bytes: 64707724 num_examples: 60000 download_size: 1050038594 dataset_size: 1571279114 - config_name: embedding_all-mpnet-base-v2 features: - name: uid dtype: int64 - name: embedding_all-mpnet-base-v2 sequence: float32 splits: - name: train num_bytes: 4317600000 num_examples: 1400000 - name: test num_bytes: 185040000 num_examples: 60000 download_size: 5407717474 dataset_size: 4502640000 --- # Dataset Card for "yahooanswerstopics" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
--- 配置项: - 配置名称:default 数据文件: - 数据集划分:train(训练集),文件路径:data/train-* - 数据集划分:test(测试集),文件路径:data/test-* - 配置名称:embedding_all-mpnet-base-v2 数据文件: - 数据集划分:train(训练集),文件路径:embedding_all-mpnet-base-v2/train-* - 数据集划分:test(测试集),文件路径:embedding_all-mpnet-base-v2/test-* 数据集信息: - 配置名称:default 特征字段: - 字段名:id,数据类型:int32 - 字段名:topic(主题),数据类型: 类别标签: 类别映射: '0': 社会与文化 '1': 科学与数学 '2': 健康 '3': 教育与参考 '4': 计算机与互联网 '5': 体育 '6': 商业与金融 '7': 娱乐与音乐 '8': 家庭与人际关系 '9': 政治与政府 - 字段名:question_title(问题标题),数据类型:string(字符串) - 字段名:question_content(问题内容),数据类型:string(字符串) - 字段名:best_answer(最佳答案),数据类型:string(字符串) - 字段名:text(文本),数据类型:string(字符串) - 字段名:uid,数据类型:int64 数据集划分: - 划分名称:train(训练集),字节大小:1506571390,样本数量:1400000 - 划分名称:test(测试集),字节大小:64707724,样本数量:60000 下载总大小:1050038594 数据集总占用大小:1571279114 - 配置名称:embedding_all-mpnet-base-v2 特征字段: - 字段名:uid,数据类型:int64 - 字段名:embedding_all-mpnet-base-v2,数据类型:float32序列 数据集划分: - 划分名称:train(训练集),字节大小:4317600000,样本数量:1400000 - 划分名称:test(测试集),字节大小:185040000,样本数量:60000 下载总大小:5407717474 数据集总占用大小:4502640000 --- # "yahooanswerstopics"数据集卡片 [更多信息请参阅:https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards]
数据集概述
配置信息
-
默认配置 (
default)- 数据文件路径
- 训练集:
data/train-* - 测试集:
data/test-*
- 训练集:
- 特征信息
id: 数据类型为int32topic: 数据类型为class_label,包含以下类别:- 0: Society & Culture
- 1: Science & Mathematics
- 2: Health
- 3: Education & Reference
- 4: Computers & Internet
- 5: Sports
- 6: Business & Finance
- 7: Entertainment & Music
- 8: Family & Relationships
- 9: Politics & Government
question_title: 数据类型为stringquestion_content: 数据类型为stringbest_answer: 数据类型为stringtext: 数据类型为stringuid: 数据类型为int64
- 数据集划分
- 训练集: 1400000 个样本,1506571390 字节
- 测试集: 60000 个样本,64707724 字节
- 数据集大小
- 下载大小: 1050038594 字节
- 数据集大小: 1571279114 字节
- 数据文件路径
-
嵌入配置 (
embedding_all-mpnet-base-v2)- 数据文件路径
- 训练集:
embedding_all-mpnet-base-v2/train-* - 测试集:
embedding_all-mpnet-base-v2/test-*
- 训练集:
- 特征信息
uid: 数据类型为int64embedding_all-mpnet-base-v2: 数据类型为sequence,包含float32
- 数据集划分
- 训练集: 1400000 个样本,4317600000 字节
- 测试集: 60000 个样本,185040000 字节
- 数据集大小
- 下载大小: 5407717474 字节
- 数据集大小: 4502640000 字节
- 数据文件路径




