遇见数据集

KINA

收藏
github2026-05-28 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

KINA(Knowledge Index of Noahs Ark)是一个包含899个项目的知识基准,涵盖261个细粒度学科,用于评估前沿大语言模型,每个问题提供从A到J的字母选项,其中只有一个正确答案。

KINA (Knowledge Index of Noah's Ark) is a knowledge benchmark containing 899 items spanning 261 fine-grained disciplines, developed to evaluate state-of-the-art large language models (LLMs). Each question provides letter options ranging from A to J, with exactly one correct answer.

创建时间:
2026-05-18
原始信息汇总

数据集概述:KINA (Knowledge Index of Noahs Ark Benchmark)

KINA 是一个用于评估前沿大型语言模型(LLMs)的多学科知识基准,包含 899 个测试项,覆盖 261 个细粒度学科。所有问题均为单选题,正确答案为字母 A 至 J 中的唯一选项。

数据集详情

  • 名称: KINA (Knowledge Index of Noahs Ark Benchmark)
  • 规模: 899 个问题
  • 学科覆盖: 261 个细粒度学科
  • 问题格式: 多项选择题,选项为 A-J,有且仅有一个正确答案。
  • 数据文件: 可从 Hugging Face 下载:https://huggingface.co/datasets/2077AIDataFoundation/KINA
  • 数据格式: JSON 数组,每个对象包含以下字段:
    • index (int): 全局索引 (0-898)
    • discipline (string): 学科/领域
    • question (string): 完整的题目文本
    • options (array): 选项列表,包含 keyanswer 及可选的 explanationsource
    • correct_answer (string): 正确答案的字母 (A-J)
    • question_source (string, 可选): 题目来源
    • question_material (string, 可选): 题目素材(如图片或上下文)

评估工具与使用方法

该项目提供了一套完整的评估工具链,支持通过 API 运行模型推理并进行 Pass@1 评分。

1. 环境准备

  • 创建 Conda 环境并安装依赖: bash conda create -n kina_bench python=3.10 -y && conda activate kina_bench pip install -e .

  • 如需使用本地服务器(如 SGLang),需另行安装: bash pip install sglang[all]

2. 数据准备

  • 从 Hugging Face 下载数据集 JSON 文件。
  • 将文件放置或链接至项目 KINA/data/ 目录下,并确保文件名与 --data_name 参数一致(默认为 KINA,对应 data/KINA.json)。
  • 示例: bash mkdir -p data ln -sf ../../data/KINA.json data/KINA.json

3. 运行评估

支持使用商业 API(如 OpenAI、OpenRouter)或本地 OpenAI 兼容服务器(如 SGLang、vLLM)。

  • 使用商业 API: bash export OPENAI_BASE="https://api.openai.com/v1" export OPENAI_KEY="your-api-key" python src/kina_bench/run_openai_chat.py --model_id "gpt-4o" --data_name "KINA" --n_thread 32

  • 使用本地服务器 (以 SGLang 为例):

    1. 启动服务器: bash python -m sglang.launch_server --model-path Qwen/Qwen3-8B --port 8000

    2. 运行评估: bash export OPENAI_BASE="http://localhost:8000/v1" export OPENAI_KEY="EMPTY" python src/kina_bench/run_openai_chat.py --model_id "Qwen/Qwen3-8B" --data_name "KINA" --n_thread 64

4. 关键命令行参数

参数 默认值 描述
--model_id (必需) 传递给 API 的模型 ID
--data_name KINA data/{data_name}.json 的基础文件名
--n_sampling 1 每道题的并行补全次数 (可选 1, 4, 8)
--max_tokens 16384 最大输出 token 数
--think_mode none 思考模式:none, thinknothink
--reasoning_effort None 推理努力程度:low, medium, high (用于 o1/GPT-5 系列)
--n_thread 1 并发请求数量
--overwrite False 是否覆盖已有的 jsonl 文件
--timeout 300 单次请求超时 (秒)
--limit None 限制运行的剩余项目数量 (调试用)
--skip_inference False 跳过 API 调用,仅对已有的 jsonl 文件进行评分

5. 查看聚合分数

bash python src/kina_bench/pretty_print.py --data_name KINA

输出结果

  • 中间结果: results/{model_id}/n{n}_tokens{max}/{data_name}.jsonl
    • 每行一个 JSON 对象,包含 idrequestresponsesmetadata 和 token 使用量。
  • 最终结果: results/{model_id}/n{n}_tokens{max}/{data_name}.json
    • 一个列表,其中每个元素包含:
      • id: 问题索引
      • score: Pass@1 分数 (0-1)
      • extracted_predictions: 每个并行样本提取的字母列表
      • gt: 数据集中的正确答案 (correct_answer)

项目仓库结构

KINA-Benchmark/ ├── data/ │ └── KINA.json # 数据文件 (需添加或链接) ├── results/ │ └── {model_id}/ │ └── n{n}_tokens{max}/ │ ├── {data_name}.jsonl │ └── {data_name}.json ├── src/ │ └── kina_bench/ │ ├── run_openai_chat.py │ ├── utils.py │ ├── pretty_print.py │ └── config.py └── pyproject.toml

搜集汇总
数据集介绍
KINA 数据集图片
构建方式
KINA基准测试集由899道知识题构成,涵盖261个精细学科领域,旨在对前沿大语言模型进行高诊断性评估。每道题为选择题,设有一个正确答案,选项以字母A至J标识。数据集以JSON数组格式存储,每个条目包含全局索引、学科领域、问题文本、选项列表(含键值、答案、可选解释与来源)、正确答案字母、问题来源与辅助材料等字段。用户需从Hugging Face下载KINA.json文件,并放置于KINA/data目录下,或通过符号链接指向实际路径。
使用方法
用户可通过商业API或本地兼容OpenAI的服务器进行模型测评。使用前需设置环境变量OPENAI_BASE与OPENAI_KEY,并通过run_openai_chat.py脚本指定模型ID、数据集名称、采样次数、最大生成长度、思考模式、推理努力程度及并发线程数等参数。评测结果以JSONL格式逐条记录中间过程,最终汇总为JSON文件,包含每题得分与预测详情。通过pretty_print.py脚本可查看聚合后的整体评分结果。
背景与挑战
背景概述
KINA(Knowledge Index of Noah's Ark Benchmark)是由诺亚方舟数据基金会于近期发布的一项大规模知识评估基准,旨在对前沿大型语言模型(LLMs)进行高细粒度诊断。该数据集涵盖261个精细学科,包含899道题目,每道题目均为从A到J的单选题,且仅有一个正确答案。KINA的创建源于对LLMs在跨学科知识推理能力评估中日益增长的需求,其核心研究问题在于如何系统性地衡量模型在多领域知识掌握上的准确性与深度。通过提供高度结构化的评估框架,KINA为研究社区提供了一个极具价值的工具,显著推动了对LLMs知识边界与推理鲁棒性的理解,成为衡量模型性能的重要标杆。
当前挑战
KINA数据集主要面临两大挑战。在领域问题层面,LLMs往往在单一学科内表现优异,但在跨越261个精细学科的多领域知识评估中,模型常暴露出知识覆盖不均衡、推理能力受限于特定领域的问题,尤其是在需要深度理解与逻辑推理的复杂题目上,准确率显著下降,这成为评估前沿模型综合知识储备的主要障碍。在构建过程中,设计并验证899道高质量单选题需确保题目难度分布合理、选项干扰性强且领域划分精确,同时避免试题内容与训练数据重叠而导致的评估偏差。此外,构建过程中还需处理多源异构知识的一致性和权威性,确保每一学科的代表性题目能够真实反映模型在该领域的掌握程度,这对数据清洗与专家审核提出了极高要求。
常用场景
经典使用场景
在人工智能与自然语言处理的交叉领域中,KINA 数据集作为一项涵盖 261 个精细学科、包含 899 道题目的知识基准测试,主要被用于评估前沿大语言模型在广泛学科知识上的掌握程度与推理能力。研究者通过让模型从 A 至 J 的多个选项中选择唯一正确答案,并采用 Pass@1 指标进行诊断性评分,以此衡量模型在面对跨学科知识问答时的表现。这一场景对于揭示模型的知识广度与深度具有重要价值,也为多学科知识评估提供了标准化的测试框架。
解决学术问题
KINA 数据集的提出有效解决了当前大语言模型评估中缺乏精细化学科划分与高难度诊断性测试的难题。传统基准测试往往局限于少数通用领域或简单常识推理,难以全面反映模型在专业学科知识上的真实水平。KINA 通过覆盖人文学科、自然科学、工程技术等 261 个子领域,为学术研究提供了一个能够精准定位模型知识盲区与薄弱环节的工具。这不仅有助于系统性地分析模型在不同学科上的能力差异,还推动了多学科知识评估方法论的完善与发展。
实际应用
在实际应用层面,KINA 数据集被广泛用于大语言模型的产品化测试与迭代优化。开发者可通过该基准对模型进行跨学科知识诊断,从而针对性地改进模型在特定领域(如医学、法律、工程等)的知识记忆与逻辑推理能力。此外,KINA 也为知识问答系统、教育辅助工具、智能顾问等应用场景中的模型选型提供了可靠依据。通过对比不同模型在同一测试集上的表现,企业能够做出更具信息量的技术决策,确保最终产品在复杂知识场景下的稳健性。
数据集最近研究
最新研究方向
KINA数据集作为前沿大语言模型(LLM)多学科知识诊断的标杆,其研究方向紧密聚焦于评估模型在涵盖261个细粒度学科的899道高难度题目上的知识覆盖与推理精度。当前热点领域包括:利用该数据集对GPT-4o、Qwen3等商业及开源模型进行Pass@1准确率的系统评估,探索思维链(think_mode)与推理预算(reasoning_effort)等提示策略对多选知识问答性能的影响。此外,KINA推动了模型跨领域知识薄弱环节的量化分析,助力科研人员定位知识盲区。其影响在于为LLM知识深度的标准化评测提供了可复现的基准,对构建更可靠、更广博的智能知识系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务