lyadalachanchu/gpt-oss-20b-hmmt-feb-2025-generations
收藏资源简介:
--- dataset_info: - config_name: default features: - name: run_id dtype: string - name: model dtype: string - name: tokenizer dtype: string - name: dataset dtype: string - name: dataset_config dtype: 'null' - name: dataset_split dtype: string - name: question_index dtype: int64 - name: k dtype: int64 - name: sample_index dtype: int64 - name: question dtype: string - name: ground_truth_answer dtype: string - name: ground_truth_normalized dtype: string - name: prediction_normalized dtype: string - name: is_correct dtype: bool - name: num_tokens dtype: int64 - name: text dtype: string - name: cot_text dtype: string - name: answer_with_working dtype: string - name: boxed_answer dtype: string splits: - name: generations num_bytes: 181818134 num_examples: 1920 download_size: 87724590 dataset_size: 181818134 - config_name: default_question_metrics features: - name: run_id dtype: string - name: model dtype: string - name: tokenizer dtype: string - name: dataset dtype: string - name: dataset_config dtype: 'null' - name: dataset_split dtype: string - name: question_index dtype: int64 - name: k dtype: int64 - name: question dtype: string - name: ground_truth_answer dtype: string - name: ground_truth_normalized dtype: string - name: solve_count dtype: int64 - name: solve_rate dtype: float64 - name: pass_at_k dtype: bool - name: avg_generation_tokens dtype: float64 - name: correct_pattern dtype: string splits: - name: question_metrics num_bytes: 22733 num_examples: 30 download_size: 17251 dataset_size: 22733 - config_name: default_summary features: - name: run_id dtype: string - name: model dtype: string - name: tokenizer dtype: string - name: dataset dtype: string - name: dataset_config dtype: 'null' - name: dataset_split dtype: string - name: questions dtype: int64 - name: k dtype: int64 - name: avg_at_k dtype: float64 - name: pass_at_k dtype: float64 - name: solved_questions dtype: int64 - name: total_correct_generations dtype: int64 - name: total_generations dtype: int64 - name: avg_generation_tokens dtype: float64 - name: avg_question_generation_tokens dtype: float64 - name: timestamp dtype: string splits: - name: summary num_bytes: 194 num_examples: 1 download_size: 7714 dataset_size: 194 configs: - config_name: default data_files: - split: generations path: data/generations-* - config_name: default_question_metrics data_files: - split: question_metrics path: default_question_metrics/question_metrics-* - config_name: default_summary data_files: - split: summary path: default_summary/summary-* ---
数据集信息: - 配置名称:默认(default) 特征: - 字段名:运行ID(run_id) 数据类型:字符串 - 字段名:模型(model) 数据类型:字符串 - 字段名:分词器(tokenizer) 数据类型:字符串 - 字段名:数据集(dataset) 数据类型:字符串 - 字段名:数据集配置(dataset_config) 数据类型:空 - 字段名:数据集划分(dataset_split) 数据类型:字符串 - 字段名:问题索引(question_index) 数据类型:64位整数 - 字段名:k值(k) 数据类型:64位整数 - 字段名:样本索引(sample_index) 数据类型:64位整数 - 字段名:问题(question) 数据类型:字符串 - 字段名:标准答案(ground_truth_answer) 数据类型:字符串 - 字段名:归一化标准答案(ground_truth_normalized) 数据类型:字符串 - 字段名:归一化预测结果(prediction_normalized) 数据类型:字符串 - 字段名:是否正确(is_correct) 数据类型:布尔值 - 字段名:Token数量(num_tokens) 数据类型:64位整数 - 字段名:文本(text) 数据类型:字符串 - 字段名:思维链文本(cot_text) 数据类型:字符串 - 字段名:带推理过程的答案(answer_with_working) 数据类型:字符串 - 字段名:框选答案(boxed_answer) 数据类型:字符串 数据集划分: - 划分名称:生成结果(generations) 字节数:181818134 样本数:1920 下载大小:87724590 数据集大小:181818134 - 配置名称:默认问题指标(default_question_metrics) 特征: - 字段名:运行ID(run_id) 数据类型:字符串 - 字段名:模型(model) 数据类型:字符串 - 字段名:分词器(tokenizer) 数据类型:字符串 - 字段名:数据集(dataset) 数据类型:字符串 - 字段名:数据集配置(dataset_config) 数据类型:空 - 字段名:数据集划分(dataset_split) 数据类型:字符串 - 字段名:问题索引(question_index) 数据类型:64位整数 - 字段名:k值(k) 数据类型:64位整数 - 字段名:问题(question) 数据类型:字符串 - 字段名:标准答案(ground_truth_answer) 数据类型:字符串 - 字段名:归一化标准答案(ground_truth_normalized) 数据类型:字符串 - 字段名:求解次数(solve_count) 数据类型:64位整数 - 字段名:求解率(solve_rate) 数据类型:64位浮点数 - 字段名:k通过率(pass_at_k) 数据类型:布尔值 - 字段名:平均生成Token数(avg_generation_tokens) 数据类型:64位浮点数 - 字段名:正确模式(correct_pattern) 数据类型:字符串 数据集划分: - 划分名称:问题指标(question_metrics) 字节数:22733 样本数:30 下载大小:17251 数据集大小:22733 - 配置名称:默认汇总(default_summary) 特征: - 字段名:运行ID(run_id) 数据类型:字符串 - 字段名:模型(model) 数据类型:字符串 - 字段名:分词器(tokenizer) 数据类型:字符串 - 字段名:数据集(dataset) 数据类型:字符串 - 字段名:数据集配置(dataset_config) 数据类型:空 - 字段名:数据集划分(dataset_split) 数据类型:字符串 - 字段名:问题总数(questions) 数据类型:64位整数 - 字段名:k值(k) 数据类型:64位整数 - 字段名:平均k指标(avg_at_k) 数据类型:64位浮点数 - 字段名:k通过率(pass_at_k) 数据类型:64位浮点数 - 字段名:已求解问题数(solved_questions) 数据类型:64位整数 - 字段名:总正确生成数(total_correct_generations) 数据类型:64位整数 - 字段名:总生成数(total_generations) 数据类型:64位整数 - 字段名:平均生成Token数(avg_generation_tokens) 数据类型:64位浮点数 - 字段名:单问题平均生成Token数(avg_question_generation_tokens) 数据类型:64位浮点数 - 字段名:时间戳(timestamp) 数据类型:字符串 数据集划分: - 划分名称:汇总(summary) 字节数:194 样本数:1 下载大小:7714 数据集大小:194 配置列表: - 配置名称:默认(default) 数据文件: - 划分:生成结果(generations) 路径:data/generations-* - 配置名称:默认问题指标(default_question_metrics) 数据文件: - 划分:问题指标(question_metrics) 路径:default_question_metrics/question_metrics-* - 配置名称:默认汇总(default_summary) 数据文件: - 划分:汇总(summary) 路径:default_summary/summary-*



