遇见数据集

IIfSLM-v1

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

IIfSLM(Small Language Models智力指数)v1是一个专为评估0.5B至3B参数范围内小型语言模型设计的抗污染基准测试套件。该数据集包含三个子集:gsm8krefn、humanevalrefn和arcchalrefn,分别源自OpenAI的GSM8K(数学应用题)、OpenAI的HumanEval(函数代码生成)和AllenAI的ARC-Challenge(科学选择题)。每个子集均对原始问题进行了重新表述(refined),但保留了原始答案和验证方法。具体而言,gsm8krefn包含重新措辞的数学文字题,答案格式为数字;humanevalrefn包含重新表述的函数文档字符串,正确性通过实际执行模型生成的代码并对照原始测试套件进行验证;arcchalrefn包含重新表述的多选题科学问题,正确性通过精确匹配标准答案判定。数据集的命名约定中“refn”代表“refined”,表明是对原始基准的优化版本。使用该数据集时需注意,报告分数对生成时的token预算(max_new_tokens)非常敏感,不同预算下的结果可能不可直接比较。数据集以Hugging Face Datasets格式提供,每个子集均有一个测试集(split='test'),可通过指定配置名称加载。许可证为CC-BY-4.0,但原始数据集保留各自的许可要求(如MIT、CC-BY-SA-4.0),其中arcchalrefn由于衍生自CC-BY-SA-4.0,需遵守相同许可协议。

IIfSLM (Small Language Models Intelligence Index) v1 is a contamination-resistant benchmark suite designed to evaluate small language models in the range of 0.5B to 3B parameters. It contains three subsets: gsm8krefn, humanevalrefn, and arcchalrefn, derived from OpenAIs GSM8K (math word problems), OpenAIs HumanEval (function code generation), and AllenAIs ARC-Challenge (science multiple-choice questions), respectively. Each subset features rephrased (refined) versions of the original questions while preserving the original answers and verification methods. Specifically, gsm8krefn includes reworded math word problems with numeric answers; humanevalrefn includes rephrased function docstrings, where correctness is evaluated by executing the generated code against the original test suite; arcchalrefn includes rephrased multiple-choice science questions, with correctness determined by exact match to the standard answers. The refn in the naming convention stands for refined, indicating optimized versions of the original benchmarks. Users should note that reported scores are sensitive to the token budget (max_new_tokens) during generation, and results under different budgets may not be directly comparable. The dataset is provided in Hugging Face Datasets format, with each subset having a test set (split=test) accessible by specifying the configuration name. It is licensed under CC-BY-4.0, but original datasets retain their respective licenses (e.g., MIT, CC-BY-SA-4.0), and arcchalrefn, being derived from CC-BY-SA-4.0, must comply with the same license.

创建时间:
2026-07-31
原始信息汇总

IIfSLM - 小型语言模型智能指数 v1

数据集概述

IIfSLM(Intelligence Index for Small Language Models)是一个用于评估0.5B至3B参数范围内小型语言模型的基准测试套件,具备抗污染特性,旨在为社区提供标准化的模型评估平台。

数据集配置

数据集包含三个子配置,均提供测试集(split: test),所有配置的原始问题均经过改写(refined),但保留原始已验证的答案:

配置名称 来源数据集 原始许可 内容格式
gsm8krefn openai/gsm8k MIT 改写后的数学文字题,需输出数值答案
humanevalrefn openai/openai_humaneval MIT 改写后的函数文档字符串,通过执行代码验证正确性
arcchalrefn allenai/ai2_arc CC-BY-SA-4.0 改写后的科学选择题,需与标注选项精确匹配

评估方法说明

  • 生成预算影响:评测分数对生成令牌预算高度敏感。在初步评估中,将max_new_tokens从512提升至900,同一组299道gsm8krefn问题的准确率提升了20个百分点,原因是减少了答案截断。复现分数时必须匹配条目中注明的令牌预算。
  • humanevalrefn验证:正确性通过实际执行模型代码并对照原测试套件验证,而非简单的字符串匹配。
  • arcchalrefn验证:正确性通过与标注选项的精确匹配判定。

使用方式

可通过load_dataset函数加载各配置的测试集,例如: python from datasets import load_dataset

gsm8k = load_dataset("NovatasticRoScript/IIfSLM-v1", "gsm8krefn", split="test") humaneval = load_dataset("NovatasticRoScript/IIfSLM-v1", "humanevalrefn", split="test") arc = load_dataset("NovatasticRoScript/IIfSLM-v1", "arcchalrefn", split="test")

排行榜

社区成员可通过"Community"讨论区提交模型得分及平均值(需附证明),官方仅接受0.5B至3B参数范围的小型模型。当前排行榜首位为Atomight-V2.5-1.7B(1.7B参数),其gsm8krefn得分为86.96%,其余指标仍在评估中。

许可信息

  • 本数据集许可:CC-BY-4.0
  • 注意事项:底层来源数据集保留各自原始许可及归属要求(见上述表格),本仓库的改写问题属于衍生作品,不替代原始许可条款。尤其arcchalrefn衍生自CC-BY-SA-4.0许可的来源,需遵守相同的分享要求。
搜集汇总
数据集介绍
IIfSLM-v1 数据集图片
构建方式
IIfSLM-v1(小型语言模型智能指数)是一个专为0.5B至3B参数范围模型设计的抗污染基准套件。其构建基于三大经典数据集的重构:gsm8krefn源自OpenAI的GSM8K数学应用题,经重新表述后保留数值答案;humanevalrefn改编自OpenAI的HumanEval代码生成任务,重写函数文档字符串,答案正确性由实际执行验证;arcchalrefn派生自AI2 ARC科学选择题,题目选项经改写,答案通过精确匹配判定。所有改写仅调整题目措辞,绝不改动原始答案,确保基准的纯净性。
特点
该数据集的核心优势在于其社区驱动性和抗污染设计。每个配置均以‘refn’(refined)命名,强调对原始基准的语义等价改写,有效降低模型因记忆训练数据而虚高得分的风险。评估流程高度严谨:GSM8K得分对生成token预算敏感,需精确控制(如512至900 tokens引发20%差异);HumanEval通过真实代码执行与测试套件校验,杜绝字符串匹配的伪通过;ARC挑战则确保多选答案的精确匹配。数据集支持多领域评估,整合数学推理、编程能力与科学知识,为小型语言模型提供全面而严格的性能标尺。
使用方法
使用IIfSLM-v1极为便捷,通过HuggingFace datasets库即可加载。用户可分别调用load_dataset函数选择特定配置(如'gsm8krefn')并在test分割上运行评估。需注意,复现结果须匹配各条目记录的生成token预算,以免因截断导致精度偏差。对于humanevalrefn,建议采用官方测试套件执行代码验证;arcchalrefn则依赖精确选项匹配。数据集采用CC-BY-4.0许可,但派生配置(如arcchalrefn)可能附加相同方式共享条款,引用时应遵循原始数据集许可。
背景与挑战
背景概述
IIfSLM-v1(Intelligence Index for Small Language Models)是由研究者NovatasticRoScript于2026年创建的一个基准测试套件,旨在评估参数规模在0.5B至3B之间的小型语言模型的智能水平。该数据集通过重新表述GSM8K、HumanEval和ARC-Challenge三个经典基准,形成抗污染(contamination-resistant)的测试集,并采用社区驱动(community-driven)的排行榜机制,鼓励研究者提交模型得分。其核心研究问题在于:面对大语言模型领域日益严峻的数据污染问题,如何为小型模型提供公平、可靠且可复现的评估方法。该数据集以CC-BY-4.0许可发布,并通过Zenodo分配DOI,为小型语言模型的标准化评估提供了新的参考,对相关领域具有积极的推动作用。
当前挑战
IIfSLM-v1所解决的领域问题聚焦于小型语言模型评估中的多重挑战。其一,现有基准多被大型模型训练数据污染,导致评估结果失真,IIfSLM-v1通过重新表述问题文本来降低污染风险,但如何确保改写不改变原始语义和答案正确性,是构建中的核心挑战。其二,评估指标对生成参数高度敏感,如实验中,将`max_new_tokens`从512提升至900,同一批测试的准确率跃升20个百分点,这说明低预算的复现测试可能产生误导性结果,如何规范生成预算以保证分数可比性,是评估过程中的重要挑战。此外,`humanevalrefn`需通过实际执行代码验证正确性,而非简单字符串匹配,这增加了评估的复杂性和计算成本。同时,社区驱动的排行榜机制依赖参与者提供证明,但如何确保提交的准确性、避免作弊,以及维护排行榜的公信力,也是持续存在的挑战。最后,数据集衍生于多个原始基准,各自许可不同(如CC-BY-SA-4.0的分享相同要求),在合规使用和衍生发布方面需谨慎处理,确保法律风险最小化。
常用场景
经典使用场景
IIfSLM-v1作为专为0.5B至3B参数规模小型语言模型设计的抗污染基准套件,经典使用场景聚焦于对这类模型进行标准化能力评估。研究者通过加载其三个核心子集——数学推理(gsm8krefn)、代码生成(humanevalrefn)与科学知识问答(arcchalrefn),可分别衡量模型的数值推理、程序合成及多学科常识掌握水平。该基准强调对原始题目的语义改写以降低数据记忆效应,确保评估反映真实泛化能力,因此广泛用于小模型预训练后的性能校验、不同架构设计的横向对比,以及模型迭代中的回归测试,是小型语言模型研发流程中不可或缺的量化工具。
衍生相关工作
IIfSLM的发布激发了若干衍生研究工作,尤其在基准净化与评估方法论领域。后续工作借鉴其重述改写策略,设计更具鲁棒性的抗泄漏评测集,如动态生成测试样本或引入对抗性扰动。同时,该基准促进了对小型模型能力边界的系统探究,研究者结合其分项得分与模型架构,分析推理瓶颈与知识缺口,催生了一系列针对小模型参数效率提升的改进方案,如知识蒸馏、结构化剪枝和模块化设计。此外,其开放排行榜模式也被后续社区基准效仿,推动了集体智慧参与下的评估生态建设,进一步丰富了小型语言模型的评测工具族。
数据集最近研究
最新研究方向
IIfSLM-v1作为面向0.5B至3B参数规模小型语言模型的抗污染基准套件,其最新研究聚焦于评估范式革新与社区驱动的动态排行榜构建。在小型模型能力快速攀升的背景下,该数据集通过重构GSM8K、HumanEval与ARC-Challenge等经典任务的题干表述,在不改变原始标注答案的前提下有效规避了数据泄露风险,为精准度量小模型在数学推理、代码生成及科学问答领域的真实泛化水平提供了可靠工具。尤为值得关注的是,其评测流程强调生成令牌预算的敏感性控制与代码执行验证的严谨性,这些方法学细节正引领小模型评测向更高标准化与可复现性迈进。该基准的发布不仅填补了中等参数规模模型系统性评测的空白,亦通过开放排行榜机制促进了社区协作与模型迭代的良性循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务