unlearning-cleanslate/generations-19-DEBUG-qwen3-8b-simnpo-gentle-bm25-10b-target-100-localtrain-checkpoint-1
收藏资源简介:
该数据集包含多个配置,主要用于评估语言模型的推理和常识能力。核心配置包括:1) arc_challenge:一个挑战性问答数据集,涉及科学和常识问题,具有选择题格式;2) bbh_cot_fewshot_*系列:基于Big-Bench Hard(BBH)任务的数据集,涵盖布尔表达式、因果判断、日期理解、消歧问答、Dyck语言、形式谬误、几何形状、超序、逻辑推理(三/五/七对象)、电影推荐、多步算术、导航、对象计数、表格中的企鹅、彩色物体推理和名称破坏等任务,采用思维链(CoT)和少样本学习设置。数据集特征包括问题输入、目标答案、生成参数(如采样设置)、模型响应、过滤响应和评估指标,适用于生成式AI模型的训练和基准测试。
This dataset includes multiple configurations designed for evaluating language models reasoning and commonsense capabilities. Key configurations are: 1) arc_challenge: A challenging question-answering dataset covering scientific and commonsense questions with multiple-choice format; 2) bbh_cot_fewshot_* series: Datasets based on Big-Bench Hard (BBH) tasks, encompassing boolean expressions, causal judgement, date understanding, disambiguation QA, Dyck languages, formal fallacies, geometric shapes, hyperbaton, logical deduction (three/five/seven objects), movie recommendation, multistep arithmetic, navigation, object counting, penguins in a table, reasoning about colored objects, and ruin names tasks, utilizing chain-of-thought (CoT) and few-shot learning setups. Features include input questions, target answers, generation arguments (e.g., sampling settings), model responses, filtered responses, and evaluation metrics, suitable for training and benchmarking generative AI models.




