unlearning-cleanslate/generations-21-DEBUG-qwen3-8b-simnpo-gentle-igm-10b-target-100-localtrain-checkpoint-1
收藏资源简介:
该数据集包含多个配置,用于评估语言模型在多种推理任务上的性能。具体包括ARC挑战赛(ARC Challenge)和BBH(Big-Bench Hard)的思维链(CoT)少样本任务,涵盖布尔表达式、因果判断、日期理解、消歧问答、Dyck语言、形式谬误、几何形状、超常语序、逻辑推理(涉及三、五、七个对象)、电影推荐、多步算术、导航、物体计数、表格中的企鹅、彩色对象推理和名字毁坏等任务。每个配置包含输入、目标、生成参数、模型响应、过滤响应、评估指标等字段,用于记录模型生成和评估结果。数据集旨在测试模型在复杂、多步骤推理任务中的能力。
This dataset includes multiple configurations for evaluating language model performance on various reasoning tasks. Specifically, it covers the ARC Challenge and Big-Bench Hard (BBH) chain-of-thought (CoT) few-shot tasks, encompassing boolean expressions, causal judgement, date understanding, disambiguation QA, Dyck languages, formal fallacies, geometric shapes, hyperbaton, logical deduction (with three, five, and seven objects), movie recommendation, multistep arithmetic, navigation, object counting, penguins in a table, reasoning about colored objects, and ruin names. Each configuration contains fields such as input, target, generation arguments, model responses, filtered responses, and evaluation metrics, recording model generation and assessment outcomes. The dataset is designed to test model capabilities in complex, multi-step reasoning tasks.




