遇见数据集

sft-datasets/openr1_dataset_llama_verification_true

收藏
Hugging Face2025-02-26 更新2025-11-01 收录
官方服务:

资源简介:

--- dataset_info: features: - name: problem dtype: large_string - name: solution dtype: large_string - name: answer dtype: large_string - name: problem_type dtype: large_string - name: question_type dtype: large_string - name: problem_is_valid dtype: large_string - name: solution_is_valid dtype: large_string - name: source dtype: large_string - name: synthetic dtype: bool - name: generations large_list: large_string - name: generations_count dtype: int64 - name: correctness struct: - name: llama_verification sequence: bool - name: math_verify_answer sequence: bool - name: math_verify_reparsed_answer sequence: bool - name: reparsed_answers sequence: string - name: messages list: - name: content dtype: string - name: role dtype: string splits: - name: train num_bytes: 6620216414.647867 num_examples: 124283 download_size: 2674834661 dataset_size: 6620216414.647867 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征字段: - 字段名:problem,数据类型:大字符串类型(large_string) - 字段名:solution,数据类型:大字符串类型(large_string) - 字段名:answer,数据类型:大字符串类型(large_string) - 字段名:problem_type,数据类型:大字符串类型(large_string) - 字段名:question_type,数据类型:大字符串类型(large_string) - 字段名:problem_is_valid,数据类型:大字符串类型(large_string) - 字段名:solution_is_valid,数据类型:大字符串类型(large_string) - 字段名:source,数据类型:大字符串类型(large_string) - 字段名:synthetic,数据类型:布尔类型(bool) - 字段名:generations,数据类型:大列表类型(large_list),元素类型为大字符串类型(large_string) - 字段名:generations_count,数据类型:64位整型(int64) - 字段名:correctness,数据类型为结构体类型(struct),包含以下子字段: - 子字段名:llama_verification,类型为布尔值序列(sequence<bool>) - 子字段名:math_verify_answer,类型为布尔值序列(sequence<bool>) - 子字段名:math_verify_reparsed_answer,类型为布尔值序列(sequence<bool>) - 字段名:reparsed_answers,数据类型为字符串序列(sequence<string>) - 字段名:messages,数据类型为列表类型(list),列表元素为包含以下字段的结构体: - 字段名:content,数据类型:字符串类型(string) - 字段名:role,数据类型:字符串类型(string) 数据集划分: - 划分名称:train(训练集),字节数:6620216414.647867,样本数量:124283 下载大小:2674834661 字节 数据集占用大小:6620216414.647867 字节 配置项: - 配置名称:default,数据文件: - 划分:train,路径:data/train-*

提供机构:
sft-datasets
二维码
社区交流群
二维码
科研交流群
商业服务