遇见数据集

qasper-v2

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

该数据集是laion/qasper-v2,基于mlfoundations-dev/qasper-sandboxes的LLM法官验证版数据集,包含10,000个QASPER论文问答任务。每个任务指定一篇论文并提出一个问题,有时包含论文文本。任务遵循nemotron_gym的LLM法官验证器合约,包括指令文件、pytest可运行的LLM法官测试、默认奖励为0的测试脚本、包含任务指令和评分标准的验证器数据、基于ubuntu:24.04的Docker环境配置以及用于传递环境变量的task.toml。LLM法官根据答案的正确性、完整性和对论文的根基性进行评分。

The laion/qasper-v2 dataset is an LLM judge-verified version based on mlfoundations-dev/qasper-sandboxes. It contains 10,000 QASPER paper question-answering tasks, each specifying a paper and asking a question (sometimes with the paper text). Tasks follow the nemotron_gym LLM judge verifier contract, including an instruction file (instruction.md), a pytest-runnable LLM judge test (tests/test_state.py), a test script with default reward 0 (tests/test.sh), verifier data containing task instructions and scoring criteria (tests/verifier_data.json), a Docker environment configuration based on ubuntu:24.04 (environment/Dockerfile), and a task.toml for passing environment variables (e.g., OPENAI_API_KEY and JUDGE_MODEL). The LLM judge scores answers based on correctness, completeness, and grounding in the paper.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

laion/qasper-v2 数据集详情

数据集概述

laion/qasper-v2mlfoundations-dev/qasper-sandboxes 的一个经 LLM 评审验证的版本,包含 10,000 个任务。该数据集基于 QASPER 论文问答任务构建,每个任务指定一篇论文并提出一个问题(部分任务包含论文全文),由 LLM 评审员根据正确性、完整性和论文依据进行评分。

任务特性

  • 任务形式:每个任务包含一篇论文名称和对应问题,部分任务附带论文文本。
  • 评分标准:LLM 评审员从三个维度评估回答——正确性(correctness)、完整性(completeness)、对论文的基于性(groundedness)。
  • 验证机制:每个任务遵循 nemotron_gym LLM 评审验证协议。

文件结构与内容

每个任务包含以下组件:

文件 说明
instruction.md 原始任务指令,附有提交指导(要求代理将回答写入 /app/response.txt
tests/test_state.py 可运行的 pytest LLM 评审脚本,读取回答文件、验证数据,调用 litellm.completion 进行评分,并将分数写入 /logs/verifier/reward.txt
tests/test.sh 默认奖励为 0,然后运行测试脚本
tests/verifier_data.json 任务指令及针对每个数据集的评分细则
environment/Dockerfile 环境配置:基于 ubuntu:24.04,包含 python3、pip、openai、pytest、litellm
task.toml LLM 评审任务配置,包含 LLM_JUDGE_TASK_TOML 设置,支持 OPENAI_API_KEY / JUDGE_MODEL 环境变量传入验证容器

技术实现要点

  • 评审模型:默认使用 openai/gpt-4o-mini,温度为 0。
  • 评分解析:从模型输出中解析 oxed{<score>} 格式的分数。
  • 兼容性:支持 /app/response.txt 为主回答文件,兼容遗留的 /app/answer.txt
  • API 要求:验证时需提供 OPENAI_API_KEY
  • 测试机制:通过 pytest 运行测试,失败时默认奖励分数为 0。
搜集汇总
数据集介绍
qasper-v2 数据集图片
构建方式
qasper-v2数据集是基于LLM评判验证框架对原始QASPER任务进行重构与升级的产物。其构建过程遵循nemotron_gym验证器协议,为每项任务精心配备了instruction.md指令文件,指引智能体将答案写入指定路径;同时构建了可执行的pytest测试模块test_state.py,该模块通过读取响应文件与验证数据,调用litellm.completion接口,依据评分标准对答案进行自动评分,并将结果记录于日志。此外,每个任务还配备了环境配置文件与task.toml,确保了评判过程的可复现性与环境一致性。
特点
该数据集的核心特色在于其引入了LLM评判机制,以弥补传统自动评估在语义理解上的不足。评判维度涵盖正确性、完整性与依据性,能够全面衡量答案质量。数据集包含10000个源自QASPER论文问答的任务,每项任务均指向特定论文并附带问题,部分任务还包含论文原文。评判过程采用GPT-4o-mini作为默认评判模型,确保了评分标准的客观性与一致性。
使用方法
使用时,需具备OPENAI_API_KEY以驱动评判模型。任务通过pytest框架执行,运行test_state.py脚本,该脚本会读取响应文件、验证数据及评分标准,自动调用语言模型进行评分,并将分数写入指定日志文件。用户可依据task.toml配置自定义评判模型,灵活适配不同场景。该数据集适用于评估问答系统在学术文献理解上的表现,尤其适合需要细粒度质量评判的研究任务。
背景与挑战
背景概述
qasper-v2数据集由LAION机构于近期创建,其前身为mlfoundations-dev/qasper-sandboxes,旨在为科学论文问答(Paper-QA)任务提供经过大语言模型(LLM)裁判验证的高质量基准。该数据集隶属于QASPER项目,核心研究问题聚焦于如何利用LLM对开放域科学问答答案进行自动化、可复现的评估,以替代或辅助人工评判。其影响力体现在为QA系统提供了一个具有严格验证协议的评测环境,促进了科学文献理解与自动问答技术的发展。
当前挑战
该数据集所解决的领域问题在于科学论文问答任务的评估难题,即答案的正确性、完整性和基于文献的扎实性难以客观量化,qasper-v2通过引入LLM裁判统一了评估标准,但LLM裁判本身存在主观性或偏见风险。构建过程中,挑战包括设计适配pytest框架的裁判机制,兼容旧版答案路径,确保Docker环境的跨平台稳定性,以及处理大规模(10000任务)下裁判调用开销与一致性维护,同时需平衡指令内的论文文本长度与上下文限制,保证任务可执行性。
常用场景
经典使用场景
qasper-v2数据集作为经LLM裁判验证的高质量问答基准,其经典使用场景聚焦于对科学文献理解能力的评测。该数据集依托QASPER任务框架,要求模型针对特定学术论文回答深度问题,并依据论文内容进行事实性校验。此类场景不仅考验模型的信息抽取与推理能力,更强调对长文本上下文的整合与多跳推理,成为衡量大语言模型在专业领域知识掌握程度的重要标尺。
实际应用
在实际应用中,qasper-v2可服务于学术搜索引擎、科研辅助工具及智能文献综述系统。研究人员能借助该数据集微调或评估模型,构建面向特定学科领域的问答助手,自动提取论文核心发现、方法比较或实验结论。此外,其任务格式与评判框架也适用于科技情报分析、专利检索及教育场景中的学术能力测试,为多层级知识服务提供可靠的技术支撑。
衍生相关工作
基于qasper-v2衍生出的经典工作包括构建更健壮的文献理解模型、开发自动化答案评估器以及探索跨论文的多文档问答体系。其LLM裁判验证机制启发了后续研究对评测协议的改进,如引入对抗性验证、多维评分权重调优等,进而催生了面向科研数据库的专用语言模型。这些工作共同推动了学术问答从单篇文本理解向知识图谱融合、跨文献推理及可解释性方向的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务