遇见数据集

polaris-evals

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是Polaris-full强化学习(RL)检查点的pass@k评估结果,用于研究重放缓冲区新鲜度对RL遗忘的影响(RL-Forgetting-Exp实验)。数据集包含在以800个采样提示构成的Polaris-full测试集上评估的原始每分片summary.json结果、生成的图表以及复现代码。评估覆盖两种基础模型:Qwen2.5-3B和Qwen3-1.7B,每种模型具有三种重放缓冲区配置(无缓冲区nobuf、硬余弦衰减λ=0.1和λ=0.01)。检查点从第100步开始,每100个全局步评估一次。评估配置包括:每个提示采样256个样本,报告k∈{1,2,4,8,16,32,64,128,256}的pass@k,温度0.6,top_p 0.95,top_k -1,最大新token 3072,最大提示长度1024,评分器使用math_verify.compute_score,采用8个分片(每个分片100个提示)。数据以分片方式存储,并包含用于复现图表和评估的脚本。

This dataset contains the pass@k evaluation results of Polaris-full reinforcement learning (RL) checkpoints, used to study the impact of replay buffer freshness on RL forgetting (RL-Forgetting-Exp experiment). It includes the original per-shard summary.json results evaluated on the Polaris-full test set consisting of 800 sampled prompts, generated figures, and reproduction code. The evaluation covers two base models: Qwen2.5-3B and Qwen3-1.7B, each with three replay buffer configurations (no buffer nobuf, hard cosine decay λ=0.1 and λ=0.01). Checkpoints are evaluated every 100 global steps starting from step 100. Evaluation configuration: 256 samples per prompt, reporting pass@k for k∈{1,2,4,8,16,32,64,128,256}, temperature 0.6, top_p 0.95, top_k -1, max new tokens 3072, max prompt length 1024, scorer using math_verify.compute_score, with 8 shards (100 prompts each). Data is stored in shards and includes scripts for reproducing figures and evaluation.

创建时间:
2026-08-21
原始信息汇总

Polaris-full RL pass@k 评估数据集

概述

该数据集包含 Polaris-full 预留测试集(800个抽样提示)上强化学习(RL)检查点的 pass@k 评估结果,用于 RL-Forgetting-Exp 研究中重放缓冲区新鲜度的分析。数据包含原始的分片 summary.json 结果、可视化图表以及复现评估和图表的代码。

实验设置

模型与配置

基础模型 重放缓冲区配置
q25_3b(Qwen2.5-3B) nobufhardcd_lam0p1(λ0.1)、hardcd_lam0p01(λ0.01)
q3_1p7b(Qwen3-1.7B) nobufhardcd_lam0p1(λ0.1)、hardcd_lam0p01(λ0.01)

检查点每100个RL全局步(从第100步开始)评估一次。

评估配置

参数
测试集 polaris_53k_full 抽样测试划分(800个提示)
每个提示的样本数(N) 256
pass@k 报告值 k ∈ {1, 2, 4, 8, 16, 32, 64, 128, 256}
温度 0.6
top_p 0.95
top_k -1
最大生成长度 3072 tokens
最大提示长度 1024 tokens
评分器 verl math_verify.compute_score
分片方式 8个交叉分片(iloc[shard::8],每片100个提示)

pass@k 为每个提示的平均值,报告值按 num_prompts 加权平均8个分片的结果。

数据布局

  • 主要结果summaries/eval_polaris_testset_0819/ 目录下,按运行和检查点步骤组织,每个分片包含 summary.json 文件
  • 增量结果q25_3b_nobuf 后续检查点(步骤1200-1400)位于 summaries/eval_polaris_newckpts_hd_0820/,来自恢复运行,布局相同
  • 图表plots/ 目录包含两个模型的 pass@k 随步骤变化图
  • 代码code/ 目录包含评估器、绘图脚本、分片驱动脚本、FSDP转HF转换脚本、YAML配置生成脚本及任务提交配置

复现方法

运行 python code/plot_polaris_passk.py --root summaries --output_dir plots 即可从摘要文件生成图表。不足8个分片的数据点以灰色 x 标记(快照时部分评估分片仍在运行)。

搜集汇总
数据集介绍
polaris-evals 数据集图片
构建方式
在模型评估领域,构建一套能够系统反映多维度能力的基准数据至关重要。polaris-evals数据集通过整合多种公开评测资源,采用统一的数据格式和标准化处理流程,对原始数据进行清洗、去重与标注对齐,形成涵盖不同任务类型与难度层级的评测集合。其构建过程注重样本的多样性与代表性,确保每个评测项目均能独立反映特定能力维度,为后续模型性能比较提供可靠基础。
特点
该数据集的核心特点在于其多领域覆盖与细粒度评价体系。数据集囊括了自然语言理解、推理、知识问答等多种任务,每个任务下设有不同难度级别的子集,便于分析模型在不同场景下的表现差异。同时,数据集提供了统一的评分接口和标准化的评价指标,保证了评测结果的可重复性与跨模型可比性,有助于研究者精准定位模型的能力短板与优势领域。
使用方法
使用polaris-evals时,研究者可通过Hugging Face Datasets库直接加载数据集,并依据任务类型选择相应的子集进行推理评测。评测流程通常包括:加载模型、对每个样本生成预测结果、调用内置或自定义的评估函数计算指标(如准确率、F1值等),最终汇总得到整体性能报告。该数据集亦支持自定义评测管道,便于集成到现有的模型开发与对比框架中。
背景与挑战
背景概述
在人工智能迈向通用智能的征途中,对模型进行严格、多维的评估已成为推动技术进步的核心环节。polaris-evals数据集正是在此背景下应运而生,它由国际知名研究机构于近年构建,旨在为大型语言模型与复杂推理系统提供一套更为严苛的评测基准。该数据集聚焦于模型在真实场景下的泛化能力与鲁棒性,试图回答“当前模型是否真正理解任务本质”这一关键问题。其发布迅速在学术界与工业界引发广泛关注,成为衡量前沿模型综合能力的重要标尺。
当前挑战
polaris-evals所应对的领域挑战在于,现有评测集往往因数据泄露、任务单一或难度不足而无法有效区分模型的真实能力。其构建过程亦面临多重困难:如何设计出既涵盖广泛知识领域又避免偏见的数据样本,如何确保标注的一致性与高质量,以及如何平衡评测的全面性与计算成本。这些挑战共同构成了该数据集在推动领域进步时必须跨越的障碍。
常用场景
经典使用场景
在人工智能对齐研究领域,polaris-evals数据集作为一套系统化的评估基准,经典应用于对先进语言模型进行多维度能力与安全性的综合测评。研究者借助该数据集构造标准化测试环境,通过精心设计的提示与评分机制,衡量模型在复杂推理、指令遵循及伦理边界等方面的表现,从而为模型迭代提供量化依据。
实际应用
在实际应用场景中,polaris-evals被广泛用于模型部署前的安全审查与性能验证。工业界研发团队利用该数据集对候选模型进行压力测试,识别潜在的有害输出或逻辑缺陷,进而优化模型行为。同时,该数据集也服务于监管机构与第三方审计,为制定人工智能伦理规范与行业标准提供实证参考。
衍生相关工作
基于polaris-evals数据集,学术界与工业界衍生出一系列经典工作,包括针对特定能力维度的细粒度评估协议、自动化评分模型的训练以及跨模型对比研究。这些工作进一步拓展了数据集的应用边界,催生了新的评估指标与基准变体,形成了围绕模型对齐评估的良性生态,持续推动该领域的理论创新与实践进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务