遇见数据集

Self-GRIT/tulu-v2-sft-mixture-first-stage-classifier-outputs-dummy

收藏
Hugging Face2024-09-01 更新2025-04-26 收录
官方服务:

资源简介:

--- dataset_info: features: - name: dataset dtype: string - name: id dtype: string - name: messages list: - name: content dtype: string - name: role dtype: string - name: first_stage_prompt dtype: string - name: len_messages_user_assistant dtype: int64 - name: completion dtype: string - name: token_length dtype: int64 - name: failed dtype: bool splits: - name: train num_bytes: 1730293 num_examples: 200 download_size: 698830 dataset_size: 1730293 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征字段: - 字段名:dataset,数据类型:字符串(string) - 字段名:id,数据类型:字符串(string) - 字段名:messages,数据类型:列表(list),列表内每个元素为包含如下子字段的对象: - 子字段名:content,数据类型:字符串(string) - 子字段名:role,数据类型:字符串(string) - 字段名:first_stage_prompt,数据类型:字符串(string) - 字段名:len_messages_user_assistant(用户与助手的对话消息序列长度),数据类型:64位整数(int64) - 字段名:completion,数据类型:字符串(string) - 字段名:token_length(Token长度),数据类型:64位整数(int64) - 字段名:failed(是否执行失败),数据类型:布尔值(bool) 数据划分: - 划分集名称:train(训练集),字节占用量:1730293,样本数量:200 下载总大小:698830 数据集总大小:1730293 配置项: - 配置名称:default(默认配置),数据文件: - 划分集:train(训练集),文件路径:data/train-*

提供机构:
Self-GRIT
二维码
社区交流群
二维码
科研交流群
商业服务