Encyclo-K
收藏资源简介:
Encyclo-K是由字节跳动种子中国、中国科学院等机构联合构建的动态知识评估基准数据集,旨在解决传统基准的数据污染、单知识点评估局限性和高标注成本问题。该数据集从62本权威教科书中提取21,525条正确知识陈述,并生成21,494条错误陈述,覆盖11个学科的43个领域,最终组合成5,038道含8-10个陈述的综合性问题。通过程序化随机组合机制,每个问题平均包含3,113个token,实现了评估内容的动态更新与多知识点联合理解测试。该数据集主要应用于大语言模型的百科全书式知识理解能力评估,特别擅长检测模型对跨学科细粒度知识的综合掌握程度。
Encyclo-K is a dynamic knowledge evaluation benchmark dataset jointly constructed by institutions including ByteDance Seed China and the Chinese Academy of Sciences, aiming to address the issues of data contamination, limitations of single-knowledge-point evaluation and high annotation cost in traditional benchmarks. It extracts 21,525 correct knowledge statements and generates 21,494 incorrect knowledge statements from 62 authoritative textbooks, covering 43 subfields across 11 academic disciplines. Finally, 5,038 comprehensive questions each containing 8 to 10 statements are compiled. Through a procedural random combination mechanism, each question contains an average of 3,113 tokens, enabling dynamic updates of evaluation content and tests of joint multi-knowledge-point understanding. This dataset is primarily applied to evaluate the encyclopedic knowledge comprehension ability of large language models, and is particularly adept at detecting the comprehensive mastery of cross-disciplinary fine-grained knowledge by models.
Encyclo-K 数据集概述
数据集简介
Encyclo-K 是一个基于知识陈述的基准测试,它从根本上重新思考了基准测试的构建方式。其核心观点是:问题本身不一定是构建的最小单元——独立的知识陈述可以成为构建单元。
该数据集从权威教科书中提取独立的知识陈述,并在测试时通过随机采样动态地将这些陈述组合成评估问题。其组合空间过于庞大而无法被记忆,从而支持可靠的数据集定期更新。
关键特性
- 动态评估:从权威教科书中提取独立的知识陈述,并在测试时通过随机采样动态组合成评估问题。
- 多陈述理解:每个问题聚合 8-10 个陈述,用于全面的多知识评估,超越了单陈述问题所能探究的范围。
- 经济高效的标注:标注者仅需验证格式合规性,无需领域专业知识,大幅降低了标注成本。
- 抗污染性:即使单个陈述出现在训练数据中,它们的组合也形成了一个过于庞大而无法记忆的组合空间。
数据集概览
- 问题总数:5,038
- 问题构成:每个问题包含 8–10 个陈述、4–8 个选项和 2–4 个组合。
- 覆盖范围:涵盖 11 个学科、44 个领域和 62 个子领域。
问题学科分布
| 学科 | 问题数量 | 占比 |
|---|---|---|
| 科学 | 1,242 | 24.7% |
| 工程 | 892 | 17.7% |
| 医学 | 654 | 13% |
| 经济学 | 489 | 9.7% |
| 法学 | 387 | 7.7% |
| 历史学 | 312 | 6.2% |
| 教育学 | 276 | 5.5% |
| 管理学 | 234 | 4.6% |
| 社会学 | 198 | 3.9% |
| 哲学 | 198 | 3.9% |
| 文学 | 156 | 3.1% |
关键发现
单陈述与多陈述性能对比:模型在从单陈述判断任务过渡到多陈述综合理解任务时,始终表现出显著的性能下降。这揭示了当前大语言模型在联合推理多个知识点(而非孤立的事实回忆)能力上的根本局限性。
排行榜摘要
该基准评估了 50+ 个大语言模型,具有强大的区分能力。
表现最佳的模型:
- 最佳聊天模型:Qwen3-235B-A22B-Instruct-2507,平均得分 50.40%。
- 最佳推理模型:OpenAI-GPT-5.1-high,平均得分 62.07%。
排行榜前三名模型:
- OpenAI-GPT-5.1-high (closed):平均得分 62.07%。
- Gemini-3-Pro-Preview-Exp (closed):平均得分 61.75%。
- Gemini-2.5-Pro (closed):平均得分 58.93%。
引用信息
如果 Encyclo-K 对您的研究有帮助,请引用我们的论文:
@article{liang2025encyclo0k0, title = {Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements}, author = {Yiming Liang and Yizhi Li and Yantao Du and Ge Zhang and Jiayi Zhou and Yuchen Wu and Yinzhu Piao and Denghui Cao and Tong Sun and Ziniu Li and Li Du and Bo Lei and Jiaheng Liu and Chenghua Lin and Zhaoxiang Zhang and Wenhao Huang and Jiajun Zhang}, year = {2025}, journal = {arXiv preprint arXiv: 2512.24867} }




