BarraHome/ultrafeedback_binarized
收藏资源简介:
--- dataset_info: features: - name: prompt dtype: string - name: prompt_id dtype: string - name: chosen list: - name: content dtype: string - name: role dtype: string - name: rejected list: - name: content dtype: string - name: role dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string - name: score_chosen dtype: float64 - name: score_rejected dtype: float64 splits: - name: train_prefs num_bytes: 405637300 num_examples: 61135 - name: train_sft num_bytes: 405637300 num_examples: 61135 - name: test_prefs num_bytes: 13176789 num_examples: 2000 - name: test_sft num_bytes: 6701456 num_examples: 1000 - name: train_gen num_bytes: 324989174 num_examples: 61135 - name: test_gen num_bytes: 5341818 num_examples: 1000 download_size: 649878235 dataset_size: 1161483837 configs: - config_name: default data_files: - split: train_prefs path: data/train_prefs-* - split: train_sft path: data/train_sft-* - split: test_prefs path: data/test_prefs-* - split: test_sft path: data/test_sft-* - split: train_gen path: data/train_gen-* - split: test_gen path: data/test_gen-* license: mit task_categories: - conversational language: - en size_categories: - 100K<n<1M ---
dataset_info: 特征项: - 名称: 提示词(prompt) 数据类型: 字符串(string) - 名称: 提示词ID(prompt_id) 数据类型: 字符串(string) - 名称: 优选回复(chosen) 数据类型: 列表 列表项: - 名称: 内容(content) 数据类型: 字符串(string) - 名称: 角色(role) 数据类型: 字符串(string) - 名称: 拒选回复(rejected) 数据类型: 列表 列表项: - 名称: 内容(content) 数据类型: 字符串(string) - 名称: 角色(role) 数据类型: 字符串(string) - 名称: 对话消息(messages) 数据类型: 列表 列表项: - 名称: 内容(content) 数据类型: 字符串(string) - 名称: 角色(role) 数据类型: 字符串(string) - 名称: 优选回复得分(score_chosen) 数据类型: 64位浮点型(float64) - 名称: 拒选回复得分(score_rejected) 数据类型: 64位浮点型(float64) 数据划分: - 名称: train_prefs 数据字节数: 405637300 样本数量: 61135 - 名称: train_sft 数据字节数: 405637300 样本数量: 61135 - 名称: test_prefs 数据字节数: 13176789 样本数量: 2000 - 名称: test_sft 数据字节数: 6701456 样本数量: 1000 - 名称: train_gen 数据字节数: 324989174 样本数量: 61135 - 名称: test_gen 数据字节数: 5341818 样本数量: 1000 下载大小: 649878235 数据集总大小: 1161483837 配置项: - 配置名称: default 数据文件: - 划分: train_prefs 路径: data/train_prefs-* - 划分: train_sft 路径: data/train_sft-* - 划分: test_prefs 路径: data/test_prefs-* - 划分: test_sft 路径: data/test_sft-* - 划分: train_gen 路径: data/train_gen-* - 划分: test_gen 路径: data/test_gen-* 许可证: MIT许可证(mit) 任务类别: 会话式(conversational) 语言: 英语(en) 样本规模类别: 100K<n<1M
数据集概述
数据特征
- prompt: 字符串类型
- prompt_id: 字符串类型
- chosen: 列表类型,包含以下字段:
- content: 字符串类型
- role: 字符串类型
- rejected: 列表类型,包含以下字段:
- content: 字符串类型
- role: 字符串类型
- messages: 列表类型,包含以下字段:
- content: 字符串类型
- role: 字符串类型
- score_chosen: 浮点数类型
- score_rejected: 浮点数类型
数据分割
- train_prefs: 405637300字节,61135个样本
- train_sft: 405637300字节,61135个样本
- test_prefs: 13176789字节,2000个样本
- test_sft: 6701456字节,1000个样本
- train_gen: 324989174字节,61135个样本
- test_gen: 5341818字节,1000个样本
数据集大小
- 下载大小: 649878235字节
- 数据集大小: 1161483837字节
配置
- config_name: default
- data_files:
- train_prefs: data/train_prefs-*
- train_sft: data/train_sft-*
- test_prefs: data/test_prefs-*
- test_sft: data/test_sft-*
- train_gen: data/train_gen-*
- test_gen: data/test_gen-*
- data_files:
许可
- license: MIT
任务类别
- task_categories: 对话
语言
- language: 英语
大小类别
- size_categories: 100K<n<1M




