OPERA数据集
收藏资源简介:
OPERA数据集是由香港理工大学、美团龙猫团队等机构联合构建的大规模推理轨迹数据集,旨在为开放域任务提供高质量的强化学习训练数据。该数据集包含20,000条经过精心筛选的推理轨迹,每条轨迹通过困惑度引导的迭代合成方法生成,确保逻辑一致性和统计稳定性。数据创建过程采用认知制动机制和困惑度优先展开技术,模拟人类反思性推理模式,最终形成结构化推理链。该数据集主要应用于开放域创造性写作、逻辑推理等任务,旨在解决传统基于LLM评判的奖励模型存在的风格偏见和位置不一致性问题,为强化学习提供更客观的内在奖励信号。
The OPERA dataset is a large-scale reasoning trajectory dataset jointly constructed by institutions including The Hong Kong Polytechnic University and Meituan Longmao Team, aiming to provide high-quality reinforcement learning training data for open-domain tasks. This dataset contains 20,000 carefully screened reasoning trajectories, each generated via a perplexity-guided iterative synthesis method to ensure logical consistency and statistical stability. The data creation process adopts a cognitive braking mechanism and perplexity-first unfolding technology to simulate human reflective reasoning patterns, ultimately forming structured reasoning chains. This dataset is mainly applied to tasks such as open-domain creative writing and logical reasoning, aiming to address the issues of style bias and position inconsistency in traditional reward models evaluated by LLMs, and provide more objective intrinsic reward signals for reinforcement learning.
数据集概述:OPERA
-
核心内容:OPERA 是一个支持冷启动数据生成和强化学习训练循环的资料库。
-
主要组件:
- 冷启动 SFT 数据生成:通过
sft_data_sync/reer_tot_parallel_ppl.py脚本实现,采用并行处理策略生成冷启动的监督微调数据。 - 强化学习训练:主入口脚本为
verl/sh_rethinking_grpo.sh,基于 VeRL 框架并使用群组相对策略优化进行优化。 - 模型检查点转换:
verl/all2hf.sh脚本用于将训练后的强化学习模型检查点转换为标准 Hugging Face 格式,便于评估和部署。
- 冷启动 SFT 数据生成:通过
-
注意事项:资料库中不包含标准评估和基准测试代码,以保持匿名性和仓库整洁。用户需从相应的官方仓库下载并直接运行这些代码。




