遇见数据集

IdeaGene-Bench (IG-Bench)

收藏
arXiv2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

IdeaGene-Bench是由上海交通大学等多家机构联合构建的科学谱系推理评估基准,其核心框架将学术论文抽象为可遗传的'思想基因组'对象。该数据集涵盖10个科学领域的1,961条黄金谱系轨迹、1,085个精心标注的思想基因组对象及920对基因组差异记录,数据规模达到1,029个评估实例,主要来源于自然语言处理、计算机视觉等领域的经典文献。数据构建过程采用专家提名种子论文、基于引用的谱系扩展、多轮大语言模型辅助提取与专家审计相结合的四阶段流程,通过50名跨学科研究生进行严格质量验证。该数据集旨在评估人工智能系统在机制继承层面的科学谱系推理能力,解决当前评估体系难以检验研究提案是否真正继承核心机制、修复已知局限的深层次问题。

IdeaGene-Bench is a scientific lineage reasoning evaluation benchmark jointly constructed by Shanghai Jiao Tong University and several other institutions. Its core framework abstracts academic papers into heritable "thought genome" objects. This dataset covers 1,961 golden lineage trajectories across 10 scientific disciplines, 1,085 meticulously annotated thought genome objects, and 920 pairs of genomic difference records, with a total of 1,029 evaluation instances. It is primarily sourced from classic literature in fields such as Natural Language Processing (NLP) and Computer Vision (CV). The dataset construction process adopts a four-stage workflow combining expert-nominated seed papers, citation-based lineage expansion, multi-round Large Language Model (LLM)-assisted extraction, and expert auditing, with strict quality verification performed by 50 interdisciplinary graduate students. This benchmark aims to evaluate the scientific lineage reasoning ability of AI systems in terms of mechanism inheritance, and address the in-depth problem that current evaluation systems struggle to verify whether research proposals truly inherit core mechanisms and rectify known limitations.

创建时间:
2026-07-10
搜集汇总
数据集介绍
IdeaGene-Bench (IG-Bench) 数据集图片
构建方式
在科学研究日益依赖于文献继承与机制进化的背景下,IdeaGene-Bench(IG-Bench)应运而生。该数据集的构建遵循四阶段严谨流程:首先,由领域专家遴选各学科里程碑式论文作为种子文献;其次,通过引文链路、语义检索及领域策展,将种子文献扩展为由3至7篇论文组成的谱系轨迹;随后,借助多轮LLM辅助抽取与专家审核,将每篇论文转化为一组最小化、带类型标注、有证据支撑的Idea Genome对象,并生成成对的GenomeDiff记录,以对齐对象、标注命运与驱动因素;最后,通过程序化校验与独立审核员确保模式合理性、时间一致性及谱系连贯性。最终,数据集覆盖10个科学领域,包含1,961条黄金谱系轨迹、1,085个精心策展的Idea Genome对象及920条成对GenomeDiff记录。
特点
IG-Bench的独到之处在于其将科学思想进化视为类似生物基因组的可审计结构。其核心特征体现在三个层面:其一,细粒度的表示单元——Idea Genome对象被严格定义为具备类型(如机制、局限、增量)、证据锚点与最小自包含性的可遗传单元,避免了论文级别描述的模糊性;其二,操作化的进化动力学分类——通过GenomeDiff对齐,将六种进化模式(突变、适应性辐射、杂交、物种形成、生态位竞争与隔离)转化为可计算的标准,使谱系判断不再依赖主题相似性或引文拓扑;其三,双轨评估架构——IG-Exam提供42种任务类型与1,029个封闭式实例,检验基因组抽象、继承追踪、进化推理与谱系验证四类能力;IG-Arena则通过群体进化得分(PES),从遗传、变异与选择三维度衡量开放式思想生成的质量。
使用方法
使用者可根据研究需求灵活调用IG-Bench的两大评估模块。对于封闭式谱系理解,可选用IG-Exam中的4类能力轴共42种任务类型,每项任务提供匿名化的谱系上下文与严格精确匹配的评分标准,系统需同时正确识别父系、驱动因素与对象命运方能得分。对于开放式思想生成,可在IG-Arena的三种信息控制设置(仅问题、无结构文库、结构化谱系)下生成提案,并通过PES度量提案作为谱系后代的插入质量:遗传性衡量是否继承正确的Idea Genome对象,变异性评估是否带来有意义的创新,选择性判断其未来研究价值。此外,数据集提供了14个LLM基线的性能标杆,使用者可将自研系统与这些基线进行横向对比,从而精准定位自身在谱系推理与生成链条上的薄弱环节。
背景与挑战
背景概述
2026年7月,上海交通大学杨雪团队联合卡内基梅隆大学、中国科学院大学等机构发布了IdeaGene-Bench (IG-Bench)数据集。该数据集聚焦于科学谱系推理与谱系锚定的想法生成,旨在评估AI系统能否追踪科学思想在论文间的继承、变异与重组。IG-Bench构建了1,961条黄金谱系轨迹、1,085个精心策划的Idea基因组对象和920条成对基因组差异记录,覆盖10个科学领域。通过设立IG-Exam封闭式推理与IG-Arena开放式生成两大评估体系,该数据集揭示了当前最强AI系统在谱系推理上的精确准确率仅为27.3%,为自动科研系统的能力边界提供了关键基准。
当前挑战
IG-Bench面临的核心挑战在于科学谱系推理的组成性瓶颈。现有AI系统在理解灵感如何继承核心机制、修复已知局限并保持谱系一致性方面表现薄弱,即使最先进模型在谱系验证任务上准确率也仅达17.4%。构建过程中的挑战尤为突出:需要将论文抽象为带有类型、证据锚点和最小自包含性的Idea基因组对象,这对专家标注提出极高要求;跨10个领域的1,085个基因组对象和920对基因组差异记录需确保标注一致性,团队依靠50名研究生与多轮专家审核将标注者间一致性维持在84.7%。此外,生成模型常产出表面新颖但谱系不连贯的想法,突显了可信度与谱系连贯性之间的鸿沟。
常用场景
经典使用场景
在人工智能赋能科学研究的浪潮中,IdeaGene-Bench (IG-Bench) 作为首套聚焦于科学谱系推理与谱系驱动想法生成的基准测试集,为评估大语言模型在科学创新中的深层能力提供了全新范式。其经典使用场景涵盖两个核心维度:一是闭式谱系理解评测(IG-Exam),通过42类任务类型与1029个实例,系统性地测试模型在基因组抽象、继承追踪、演化推理与谱系验证四个能力轴上的表现;二是开放式谱系驱动生成评测(IG-Arena),要求模型在给定问题、文献库或结构化谱系条件下,撰写能够作为特定谱系种群合理后裔的研究提案。这一设计使得研究者能够精准衡量模型是否具备从论文表层信息跃升至机制级继承推理的能力。
衍生相关工作
IG-Bench 的提出催生了一系列后续研究工作,深刻影响了科学智能领域的评估范式。在谱系表示层面,该工作启发了 Intern-Atlas 等面向方法论演化的知识图谱构建工作,推动从文档级引文拓扑向方法级实体与谱系关系的跃迁。在评测方法上,研究者基于 IG-Bench 的基因组比对思路,发展了更精细的谱系连贯性度量指标,并将其融入 AI Scientist-v2 和 CoI-Agent 等自动化科研系统的能力评估框架中。此外,该基准揭示的‘组合性瓶颈’直接推动了若干关于大语言模型推理模块的研究,促使学界重新审视检索增强与组合验证之间的协同关系。近期工作开始探索如何将基因组差分结构嵌入到生成模型中,以期实现从‘生成流利文本’到‘生成谱系连贯提案’的质性跃迁。
数据集最近研究
最新研究方向
IdeaGene-Bench(IG-Bench)聚焦于科学思想谱系推理与谱系驱动的想法生成能力评估,代表了自动科研系统评价范式的根本性变革。该基准前沿研究方向集中于挖掘大型语言模型在机制级继承、突变与重组推理上的组成性瓶颈,并通过基因组级对齐(GenomeDiff)与演化动力学分类(如突变、适应性辐射、杂交)来替代传统的论文级相关性判断。研究热点围绕如何将科研文本的流畅性与谱系连贯性解耦,推动自动科研系统从文献检索与表面新颖性生成迈向可审计的谱系验证与衍生能力。IG-Bench的提出揭示了现有顶尖系统在谱系推理上仅达27.3%精确准确率的显著局限,为构建具备组成性验证模块的下一代自动科研智能体提供了不可或缺的评估基座与理论基石。
相关研究论文
  • 1
    Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation上海交通大学; 卡内基梅隆大学; 中国科学院大学; 上海人工智能实验室; 中国科学技术大学; 华东师范大学; 微软公司 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务