JETTS Benchmark
收藏资源简介:
JETTS Benchmark是由Salesforce AI Research创建的数据集,用于评估LLM-judges在测试时间扩展中的性能。该数据集包括三个任务:响应重排、步骤级束搜索和基于批评的响应精炼。涵盖数学推理、代码生成和指令遵循三个领域,包含多个子数据集。数据集通过模拟三种不同的测试时间扩展场景,评估LLM-judges对生成器模型的改进效果。
The JETTS Benchmark is a dataset developed by Salesforce AI Research for evaluating the performance of LLM-judges in test-time scaling scenarios. It comprises three core tasks: response reranking, step-level beam search, and critique-based response refinement. Spanning three domains including mathematical reasoning, code generation, and instruction following, the dataset includes multiple sub-datasets. It assesses the efficacy of LLM-judges in improving generator models by simulating three distinct test-time scaling scenarios.
JETTS数据集概述
数据集简介
- 数据集名称:JETTS (Judge Evaluation for Test-Time-Scaling)
- 作者:Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty
- 目的:评估LLM-as-Judges在测试时扩展评估中的表现
数据集内容
数据文件
-
reranking_and_refinement
- 格式:jsonl文件
- 内容:模型对特定数据集的响应,每个文件包含最多10个响应
- 命名格式:
{dataset}_{generator_model}.jsonl
-
beam_search
- 格式:子文件夹包含完全扩展的beam搜索树
- 命名格式:
{dataset}_{N}_{M}_{d}_{generator_model} - 文件:
0.jsonl到{L-1}.jsonl对应数据集中的L个查询
数据下载
- 下载方式:通过
gcloud命令行工具下载 - 数据存储位置:Google Cloud
- 数据文件:
- reranking_and_refinement.tar.gz (143MB压缩,650MB解压)
- beam_search.tar.gz (6.7GB压缩,51GB解压)
数据集任务
-
Response Reranking
- 脚本:
scripts/reranking.py - 输入:
reranking_and_refinement中的jsonl文件 - 输出:
outputs/reranking文件夹中的排名结果文件
- 脚本:
-
Step-Level Beam Search
- 脚本:
scripts/beam_search.py - 输入:
beam_search中的子文件夹 - 输出:
outputs/beam_search文件夹中的beam搜索决策文件
- 脚本:
-
Critique-Based Refinement
- 脚本:
scripts/refinement.py - 输入:
reranking_and_refinement中的jsonl文件 - 输出:
outputs/refinement文件夹中的精炼响应文件
- 脚本:
评估方法
- 评估脚本:
evaluate_refinement.py - 支持的数据集:gsm8k, math, champ, humaneval, mbpp, bigcodebench, alpacaeval, ifeval
- 评估环境:
- 通用环境:
jetts-eval - BigCodeBench专用环境:
jetts-eval-bcb
- 通用环境:
模型支持
Judge模型
- 支持模型:prom7b, sc8b, ob8b, thm8b, prom8x7b, sc70b, ste70b, llama8b
- 启动方式:
scripts/launch_judge.py
Generator模型
- 支持模型:llama8b, llama70b, qwen32b, qwen72b
- 启动方式:
scripts/launch_generator.py
注意事项
- 数据文件暂未上传至Huggingface
- SFR-Judge模型权重暂未发布
- BigCodeBench评估需要单独的环境配置

- 1Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling EvaluatorsSalesforce AI Research · 2025年



