遇见数据集

sbordt/toaa_benchmark_contamination

收藏
Hugging Face2026-03-23 更新2026-03-29 收录
官方服务:

资源简介:

--- dataset_info: features: - name: prompt dtype: string - name: doc_id dtype: int64 - name: idx dtype: int64 - name: label dtype: int64 - name: benchmark dtype: string - name: norm dtype: string - name: split dtype: int64 splits: - name: train num_bytes: 94159994 num_examples: 133265 download_size: 16697030 dataset_size: 94159994 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息如下: 1. 特征字段: - 提示词(prompt):数据类型为字符串; - 文档ID(doc_id):数据类型为64位整数; - 索引(idx):数据类型为64位整数; - 标签(label):数据类型为64位整数; - 基准测试集(benchmark):数据类型为字符串; - 归一化方式(norm):数据类型为字符串; - 划分标识(split):数据类型为64位整数。 2. 数据集划分: 训练集(train):字节占用量为94159994,样本数目为133265。 3. 下载大小:16697030 4. 数据集总大小:94159994 5. 配置项: 默认配置(default)对应的数据文件包含训练划分,文件路径为data/train-*。

提供机构:
sbordt
二维码
社区交流群
二维码
科研交流群
商业服务