遇见数据集

staqc-v2

收藏
Hugging Face2026-07-30 更新2026-08-01 收录
官方服务:

资源简介:

该数据集是 laion/staqc-v2,为 mlfoundations-dev/staqc-sandboxes 的 LLM 评判验证版本。数据集基于 Stack Overflow 问题-代码对(STAQC),包含 10,000 个任务。每个任务要求代理回答编程问题,并由 LLM 评判器根据正确性、完整性和清晰度对答案进行评分。任务遵循 nemotron_gym 验证器合约,提供指令文件(instruction.md)、LLM 评判测试脚本(tests/test_state.py)、运行脚本(tests/test.sh)、验证数据(tests/verifier_data.json)、Docker 环境(environment/Dockerfile)和任务配置(task.toml)。适用于评估和训练编程问答系统的 LLM 代理。

This dataset is laion/staqc-v2, an LLM judge validation version of mlfoundations-dev/staqc-sandboxes. Based on Stack Overflow question-code pairs (STAQC), it contains 10,000 tasks. Each task requires an agent to answer a programming question, and an LLM judge scores the answer based on correctness, completeness, and clarity. Tasks follow the nemotron_gym verifier contract, providing an instruction file (instruction.md), LLM judge test script (tests/test_state.py), run script (tests/test.sh), verification data (tests/verifier_data.json), Docker environment (environment/Dockerfile), and task configuration (task.toml). It is suitable for evaluating and training LLM agents for programming QA systems.

提供机构:
LAION eV
创建时间:
2026-07-30
原始信息汇总

laion/staqc-v2 数据集详情

数据集简介

该数据集是 mlfoundations-dev/staqc-sandboxesLLM-裁判验证版本,基于 Stack Overflow 的问答对(问题与对应代码)构建。数据集中每个任务要求智能体回答编程问题,并由 LLM 裁判根据答案的正确性、完整性和清晰度进行评分。

任务格式与结构

每个任务遵循 nemotron_gym LLM 裁判验证协议,包含以下组件:

文件/目录 说明
instruction.md 原始任务指令,附加提交指引,要求智能体将答案写入 /app/response.txt
tests/test_state.py 可运行 pytest 的 LLM 裁判脚本:读取 /app/response.txt(兼容旧版 /app/answer.txt)及 tests/verifier_data.json 中的指令与评分标准,调用 litellm.completion(默认 openai/gpt-4o-mini,温度为0)进行评分,解析 oxed{<score>} 格式的分数,并将浮点分数写入 /logs/verifier/reward.txt
tests/test.sh 默认奖励为0,然后运行 python3 -m pytest /tests/test_state.py
tests/verifier_data.json 包含任务指令和每个数据集特定的评分标准
environment/Dockerfile 基于 ubuntu:24.04,安装 python3、pip、openai、pytest 和 litellm
task.toml 定义 LLM_JUDGE_TASK_TOML,使 OPENAI_API_KEY / JUDGE_MODEL 通过 [verifier].env 传入验证容器(试运行时需要 OPENAI_API_KEY

评分标准

评分维度包括:

  • 正确性(correctness)
  • 完整性(completeness)
  • 清晰度(clarity)

数据集规模

包含 10,000 个任务

二维码
社区交流群
二维码
科研交流群
商业服务