qasper-v2
收藏资源简介:
该数据集是laion/qasper-v2,基于mlfoundations-dev/qasper-sandboxes的LLM法官验证版数据集,包含10,000个QASPER论文问答任务。每个任务指定一篇论文并提出一个问题,有时包含论文文本。任务遵循nemotron_gym的LLM法官验证器合约,包括指令文件、pytest可运行的LLM法官测试、默认奖励为0的测试脚本、包含任务指令和评分标准的验证器数据、基于ubuntu:24.04的Docker环境配置以及用于传递环境变量的task.toml。LLM法官根据答案的正确性、完整性和对论文的根基性进行评分。
The laion/qasper-v2 dataset is an LLM judge-verified version based on mlfoundations-dev/qasper-sandboxes. It contains 10,000 QASPER paper question-answering tasks, each specifying a paper and asking a question (sometimes with the paper text). Tasks follow the nemotron_gym LLM judge verifier contract, including an instruction file (instruction.md), a pytest-runnable LLM judge test (tests/test_state.py), a test script with default reward 0 (tests/test.sh), verifier data containing task instructions and scoring criteria (tests/verifier_data.json), a Docker environment configuration based on ubuntu:24.04 (environment/Dockerfile), and a task.toml for passing environment variables (e.g., OPENAI_API_KEY and JUDGE_MODEL). The LLM judge scores answers based on correctness, completeness, and grounding in the paper.
laion/qasper-v2 数据集详情
数据集概述
laion/qasper-v2 是 mlfoundations-dev/qasper-sandboxes 的一个经 LLM 评审验证的版本,包含 10,000 个任务。该数据集基于 QASPER 论文问答任务构建,每个任务指定一篇论文并提出一个问题(部分任务包含论文全文),由 LLM 评审员根据正确性、完整性和论文依据进行评分。
任务特性
- 任务形式:每个任务包含一篇论文名称和对应问题,部分任务附带论文文本。
- 评分标准:LLM 评审员从三个维度评估回答——正确性(correctness)、完整性(completeness)、对论文的基于性(groundedness)。
- 验证机制:每个任务遵循
nemotron_gymLLM 评审验证协议。
文件结构与内容
每个任务包含以下组件:
| 文件 | 说明 |
|---|---|
instruction.md |
原始任务指令,附有提交指导(要求代理将回答写入 /app/response.txt) |
tests/test_state.py |
可运行的 pytest LLM 评审脚本,读取回答文件、验证数据,调用 litellm.completion 进行评分,并将分数写入 /logs/verifier/reward.txt |
tests/test.sh |
默认奖励为 0,然后运行测试脚本 |
tests/verifier_data.json |
任务指令及针对每个数据集的评分细则 |
environment/Dockerfile |
环境配置:基于 ubuntu:24.04,包含 python3、pip、openai、pytest、litellm |
task.toml |
LLM 评审任务配置,包含 LLM_JUDGE_TASK_TOML 设置,支持 OPENAI_API_KEY / JUDGE_MODEL 环境变量传入验证容器 |
技术实现要点
- 评审模型:默认使用
openai/gpt-4o-mini,温度为 0。 - 评分解析:从模型输出中解析
oxed{<score>}格式的分数。 - 兼容性:支持
/app/response.txt为主回答文件,兼容遗留的/app/answer.txt。 - API 要求:验证时需提供
OPENAI_API_KEY。 - 测试机制:通过 pytest 运行测试,失败时默认奖励分数为 0。




