staqc-v2
收藏资源简介:
该数据集是 laion/staqc-v2,为 mlfoundations-dev/staqc-sandboxes 的 LLM 评判验证版本。数据集基于 Stack Overflow 问题-代码对(STAQC),包含 10,000 个任务。每个任务要求代理回答编程问题,并由 LLM 评判器根据正确性、完整性和清晰度对答案进行评分。任务遵循 nemotron_gym 验证器合约,提供指令文件(instruction.md)、LLM 评判测试脚本(tests/test_state.py)、运行脚本(tests/test.sh)、验证数据(tests/verifier_data.json)、Docker 环境(environment/Dockerfile)和任务配置(task.toml)。适用于评估和训练编程问答系统的 LLM 代理。
This dataset is laion/staqc-v2, an LLM judge validation version of mlfoundations-dev/staqc-sandboxes. Based on Stack Overflow question-code pairs (STAQC), it contains 10,000 tasks. Each task requires an agent to answer a programming question, and an LLM judge scores the answer based on correctness, completeness, and clarity. Tasks follow the nemotron_gym verifier contract, providing an instruction file (instruction.md), LLM judge test script (tests/test_state.py), run script (tests/test.sh), verification data (tests/verifier_data.json), Docker environment (environment/Dockerfile), and task configuration (task.toml). It is suitable for evaluating and training LLM agents for programming QA systems.
laion/staqc-v2 数据集详情
数据集简介
该数据集是 mlfoundations-dev/staqc-sandboxes 的 LLM-裁判验证版本,基于 Stack Overflow 的问答对(问题与对应代码)构建。数据集中每个任务要求智能体回答编程问题,并由 LLM 裁判根据答案的正确性、完整性和清晰度进行评分。
任务格式与结构
每个任务遵循 nemotron_gym LLM 裁判验证协议,包含以下组件:
| 文件/目录 | 说明 |
|---|---|
instruction.md |
原始任务指令,附加提交指引,要求智能体将答案写入 /app/response.txt |
tests/test_state.py |
可运行 pytest 的 LLM 裁判脚本:读取 /app/response.txt(兼容旧版 /app/answer.txt)及 tests/verifier_data.json 中的指令与评分标准,调用 litellm.completion(默认 openai/gpt-4o-mini,温度为0)进行评分,解析 oxed{<score>} 格式的分数,并将浮点分数写入 /logs/verifier/reward.txt |
tests/test.sh |
默认奖励为0,然后运行 python3 -m pytest /tests/test_state.py |
tests/verifier_data.json |
包含任务指令和每个数据集特定的评分标准 |
environment/Dockerfile |
基于 ubuntu:24.04,安装 python3、pip、openai、pytest 和 litellm |
task.toml |
定义 LLM_JUDGE_TASK_TOML,使 OPENAI_API_KEY / JUDGE_MODEL 通过 [verifier].env 传入验证容器(试运行时需要 OPENAI_API_KEY) |
评分标准
评分维度包括:
- 正确性(correctness)
- 完整性(completeness)
- 清晰度(clarity)
数据集规模
包含 10,000 个任务。



