audieleon/reward-failure-dataset
收藏资源简介:
Reward Failure Dataset是一个包含212个结构化编码的强化学习(RL)奖励配置数据集,这些配置来自133篇已发表的论文(1983–2025年),覆盖18个领域。该数据集支持goodhart,一个用于静态分析强化学习奖励函数的工具。每个条目将已发表RL系统的奖励结构编码为一个类型化的`EnvironmentModel`,包含完整的来源、真实情况和分析结果。数据集可用于基准测试奖励分析工具、研究奖励设计模式、教学奖励设计以及奖励函数搜索。
The Reward Failure Dataset contains 212 structured encodings of RL reward configurations from 133 published papers (1983–2025) across 18 domains. This dataset supports goodhart, a static analysis tool for reinforcement learning reward functions. Each entry encodes the reward structure of a published RL system as a typed `EnvironmentModel` with full provenance, ground truth, and analysis results. The dataset is useful for benchmarking reward analysis tools, studying reward design patterns, teaching reward design, and reward function search.




