unlearning-cleanslate/generations-16-DEBUG-llama-3_1-8b-simnpo-gentle-baseline-target-100-localtrain-checkpoint-1
收藏资源简介:
该数据集包含多个配置,用于评估AI模型的推理能力,特别是通过思维链(Chain-of-Thought)方法进行少样本学习。它包括ARC挑战赛(AI2推理挑战)和BBH(超越基准任务)的多个子任务,如布尔表达式、因果判断、日期理解、歧义问答、Dyck语言、形式谬误、几何形状、超常语序、逻辑推理(涉及三、五、七个对象)、电影推荐、多步算术、导航、对象计数、表格中的企鹅、关于彩色物体的推理和名称毁坏等任务。每个配置包含输入、目标、生成参数、响应和评估指标等特征,用于训练和测试模型的复杂推理技能。
This dataset comprises multiple configurations designed to evaluate the reasoning capabilities of AI models, with a specific focus on few-shot learning via the Chain-of-Thought (CoT) approach. It includes multiple subtasks from the ARC Challenge (AI2 Reasoning Challenge) and BBH (Beyond the Benchmark), such as Boolean Expressions, Causal Judgment, Date Understanding, Ambiguous Question Answering, Dyck Languages, Formal Fallacies, Geometric Shapes, Unusual Word Order, Logical Reasoning (involving three, five, and seven objects), Movie Recommendation, Multi-step Arithmetic, Navigation, Object Counting, Penguins in Tables, Reasoning about Colored Objects, and Name Ruining. Each configuration incorporates features including inputs, target outputs, generation parameters, responses, and evaluation metrics, which are used for training and testing models' complex reasoning skills.




