遇见数据集

frontiersmith-tasks-graded-v1

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

FrontierSmith — Graded-Reward Harbor Tasks (v1) 是一个包含10个开放式竞争性编程优化任务的数据集,采用OpenThoughts-Agent/Harbor格式。该数据集专为启发式算法优化设计,任务不提供封闭形式的最优解,而是要求开发者编写C++17启发式代码来解决复杂优化问题。每个任务中,代理需要将解决方案写入`/app/solution.cpp`文件,随后由容器内法官在10个隐藏测试用例上进行评估。评估过程会计算每个用例的连续质量比率(范围[0,1],越高越好),取10个比率的平均值,并与预设的TAU阈值比较,最终转换为二进制奖励(平均值≥TAU时奖励为“1”,否则为“0”)。这种“通过”标准要求提交的解决方案超越确定性基线一定幅度,而非达到理论最优。数据集提供了每个任务的基线比率、TAU阈值和参考启发式平均比率等具体数值。技术实现上,验证完全在单个任务容器内进行,无需Docker Compose或侧车法官,所有测试资产(包括测试用例、检查器和生成器)均位于`tests/`目录下以确保环境一致性。数据集还包含手工编写的启发式C++求解器作为参考解决方案,这些求解器均能通过各自的TAU阈值。数据内容源自MIT许可的FrontierCS/Frontier-CS仓库,对应上游算法问题306–315,经过Harbor转换、容器内法官实现、TAU阈值设定和启发式参考解决方案的添加,最终以MIT许可证发布,需注明原始来源归属。

FrontierSmith — Graded-Reward Harbor Tasks (v1) is a dataset containing 10 open-ended competitive programming optimization tasks, using the OpenThoughts-Agent/Harbor format. This dataset is specifically designed for heuristic algorithm optimization: no closed-form optimal solutions are provided for the tasks, and developers are required to write C++17 heuristic code to solve complex optimization problems. For each task, an AI Agent must write its solution to the `/app/solution.cpp` file, which is then evaluated by an in-container judge across 10 hidden test cases. The evaluation process calculates a continuous quality ratio for each test case (ranging from [0, 1], with higher values indicating better performance), takes the average of the 10 ratios, compares it against a preset TAU threshold, and finally converts the result into a binary reward: "1" if the average is ≥ TAU, and "0" otherwise. This "pass" criterion implies that a submitted solution must exceed a deterministic baseline by a certain margin, rather than reaching the theoretical optimal solution. Each task in the dataset has a dedicated baseline ratio, TAU threshold, and reference heuristic average ratio, with their specific values listed in the accompanying documentation. In terms of technical implementation, validation is conducted entirely within a single task container, eliminating the need for Docker Compose or sidecar judges. All test assets (including test cases, checkers, and generators) are stored in the `tests/` directory to ensure environmental consistency. The dataset also provides handcrafted heuristic C++ solvers as reference solutions, all of which can pass their respective TAU thresholds. The dataset content is sourced from the MIT-licensed FrontierCS/Frontier-CS repository, corresponding to upstream algorithm problems 306–315. After undergoing Harbor format conversion, in-container judge implementation, TAU threshold configuration, and addition of heuristic reference solutions, it is finally released under the MIT license, with attribution to the original source required.

提供机构:
LAION eV
创建时间:
2026-06-23
原始信息汇总

数据集概览:FrontierSmith — Graded-Reward Harbor Tasks (v1)

  • 名称:FrontierSmith — Graded-Reward Harbor Tasks (v1)
  • 许可证:MIT
  • 标签:harbor, agent-tasks, competitive-programming, optimization, graded-reward

核心特性

  • 任务类型:10个开放式的竞争性编程优化任务,采用OpenThoughts-Agent / Harbor格式。
  • 任务格式:智能体需编写C++17启发式解法(写入/app/solution.cpp),由容器内裁判在10个隐藏测试用例上评分,并将连续分数通过阈值转换为二值奖励(Harbor奖励)。
  • 奖励机制
    • 由于问题为开放式优化,不存在封闭形式的最优解,预期采用启发式方法。
    • 上游检查器对每个测试用例输出一个[0,1]的连续质量比率(越高越好,不可行解为0)。
    • 容器内裁判计算10个比率的平均值,并与任务特定的阈值(TAU)比较:

      reward = "1" iff mean_ratio >= TAU, else "0"

    • “通过”意味着提交的解法的表现超过了确定性基线的一定幅度,而非找到了最优解。

任务数据(基线比率、阈值与启发式平均比率)

任务 基线比率 TAU阈值 启发式平均比率
frontiersmith-1 0.10 0.18 0.374
frontiersmith-2 0.00 0.07 0.265
frontiersmith-3 0.50 0.54 0.650
frontiersmith-4 0.50 0.54 0.653
frontiersmith-5 0.00 0.12 0.403
frontiersmith-6 0.50 0.51 0.551
frontiersmith-7 0.20 0.23 0.289
frontiersmith-8 0.50 0.62 0.904
frontiersmith-9 0.50 0.51 0.570
frontiersmith-10 0.00 0.20 0.699
  • 基线比率为0.50表示“匹配上游确定性裁判基线”,需要比率大于0.50才能超越。

执行与验证

  • 容器架构:验证完全在单个任务容器内部执行,无需Docker Compose、go-judge sidecar或主机绑定挂载,确保与Daytona快照兼容。
  • 运行流程tests/test.sh 调用 tests/run_judge.py,编译测试专用检查器,运行每个测试用例,解析比率,计算平均值并与TAU比较。
  • 共享环境:所有任务共享一个字节完全相同的 environment/Dockerfile,因此所有10个任务仅产生1个唯一的Daytona快照

参考解法

  • 由于不存在黄金解法,每个任务提供了一个由人工/教师编写的启发式C++求解器(solution/solve.sh),其平均比率均超过TAU。
  • 验证结果:10/10的启发式解法均通过其TAU的Daytona oracle门控,所有任务共享1个唯一快照。

归属与许可

  • 问题内容(包括题目描述、testlib生成器/检查器、测试用例)源自MIT许可的上游仓库 FrontierCS/Frontier-CS(对应上游算法问题306–315)。
  • 仅此固定种子集的10个问题可再分发,遵循MIT许可并需注明出处。
  • Harbor转换、容器内裁判、TAU阈值设定及启发式解法为OpenThoughts-Agent的原创内容。
搜集汇总
数据集介绍
frontiersmith-tasks-graded-v1 数据集图片
构建方式
FrontierSmith任务的构建基于MIT协议的开源上游仓库FrontierCS/Frontier-CS中的10个算法问题(编号306至315),由OpenThoughts-Agent团队完成Harbor格式转换、容器内评判器设计、阈值设定及启发式示范求解。每个任务要求代理编写C++17启发式解,存放于/app/solution.cpp;容器内评判器对10个隐藏测试用例计算连续质量比(范围[0,1]),并求均值,依此与特定于每个任务的阈值TAU比较,仅当均值比率不低于TAU时输出奖励1,否则为0。所有任务共享同一容器环境,测试资源独立挂载,确保单一日志快照,并验证10个启发式示范解均达标。
特点
该数据集涵盖10个开放式的竞争性编程优化问题,其核心特点在于不存在封闭形式的最优解,启发式方法为预期求解路径。评判机制创新性地采用分级连续分数后阈值化为二值奖励,以奖励代理超越确定性基线。每个任务拥有单独设定的TAU阈值及记录于task.toml和tests/judge_meta.json的详细依据。验证完全在单容器内完成,无需额外评判侧车,且上游适配器的组合部署拓扑已被重构为内进程执行,确保了Daytona快照的稳定性和一致性。10个任务共用一个环境镜像,实现了资源优化与高效管理。
使用方法
用户通过代理在OpenThoughts-Agent或兼容Harbor格式的系统中运行任务。代理需生成C++17启发式解并写入指定路径/app/solution.cpp;容器内评判器自动执行测试脚本tests/test.sh,该脚本编译并运行验证程序,在规定的时空限制下评估每个测试用例。最终奖励依据10个隐藏案例的均值比率与任务特定TAU比较得出。用户可根据task.toml中记录的TAU值和评判元数据优化启发式策略,提升通过率。所有任务资产位于tests/目录,便于调试与分布执行。
背景与挑战
背景概述
FrontierSmith-Graded-Reward Harbor Tasks v1 数据集诞生于2024年,由OpenThoughts-Agent团队基于FrontierCS/Frontier-CS仓库中的算法问题(编号306-315)构建而成,专注于开放式的竞争编程优化领域。该数据集的核心研究问题在于评估智能体在无封闭形式最优解、仅依赖启发式策略的复杂优化任务中的表现,通过将连续质量评分阈值化为二元奖励信号,突破传统编程任务对精确最优解的依赖。作为首个将分级奖励机制与开放式优化问题深度融合的基准,FrontierSmith推动了智能体在结构不明确问题中的自主学习能力评估,为自动化算法设计、自适应启发式搜索等领域提供了标准化的测试平台,对强化学习与程序合成的交叉研究产生了深远影响。
当前挑战
该数据集面临的核心挑战在于其开放式优化问题的本质:由于精确最优解不可求,任务仅能通过启发式方法逼近,这使得传统基于单一最优解的评估范式失效。构建过程中,研究人员需为每个问题设定合理阈值(TAU),以区分有意义的改进与随机扰动,而0.00至0.50不等的基线比率进一步凸显了问题难度的异质性。此外,在容器化环境中实现无外部裁判侧车的全内部验证,需解决资源限制与快照安全性之间的平衡,确保10个任务共享唯一Docker镜像的同时,隐藏测试用例与阈值逻辑不被泄露,这对系统设计与数据隔离提出了严格工程技术挑战。
常用场景
经典使用场景
在人工智能与程序合成领域,FrontierSmith-Tasks-Graded-V1数据集为评估智能体在开放式竞争编程优化任务中的表现提供了标准化测试平台。该数据集包含10道源自FrontierCS仓库的算法问题,每道问题均要求智能体编写C++17启发式求解器,在无封闭形式最优解的情境下,通过容器内置裁判器对10个隐藏测试用例的质量比率进行平均,并依据任务特定的阈值(TAU)生成二元奖励信号。这一设计促使智能体探索超越确定性基线的启发式策略,从而在算法优化与程序生成研究中成为衡量智能体创新性、鲁棒性与自适应性能力的理想基准。
解决学术问题
该数据集核心解决了开放式优化问题中缺乏封闭形式解与精确最优解导致的评估困境。传统编程任务多依赖正确性验证,难以捕捉启发式算法的近似性能与渐进改进。FrontierSmith通过引入连续质量比率与阈值化二元奖励机制,使得智能体在无法获得全局最优解时,仍能通过构造超越确定性基线的启发式解来获得正面奖励。这一评估范式有效支持了关于搜索空间探索、解质量泛化与奖励稀疏性问题的研究,尤其促进了程序合成、强化学习与进化计算领域中对可扩展、稳健启发式生成方法的探索。
衍生相关工作
该数据集衍生出多项具有启发性的经典工作,其中核心成果包括其上游论文《Synthesizing Open-Ended Coding Problems at Scale》(FrontierCS/FrontierSmith仓库),该论文系统性地提出了从经典算法问题中规模化合成开放式编码任务的方法论。基于本数据集的特性,后续研究可围绕自适应阈值机制开展,探索动态调整TAU以匹配智能体能力增长的自进化训练范式。此外,该数据集的评分模型——将连续质量比率映射至二元奖励——为隐式奖励建模、逆强化学习与基于人类反馈的强化学习(RLHF)提供了实证案例,激励了关于半马尔可夫决策过程与部分可观测环境下奖励设计的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务