遇见数据集

algal-experiments

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是ALGAL项目实验结果的存档,收录了多个不成功的实验及其方法和限制。数据集包含多个研究(如编码测试、综合仓库路线、综合记录分类及其后续校准和条件池版本),每个研究对应一个JSON结果文件,详细记录了实验过程、成功/失败状态、性能分数、资源使用(如模型调用次数)、以及传输故障等元数据。数据规模包括约2,663次模型调用尝试(其中390次用于种子搜索,2,273次用于比较阶段)。JSON schema因研究而异,但均保留原始记录,包括失败案例、空值使用、来源标识和限制。该数据集适用于代理评估、实验分析、方法比较等场景,帮助研究者了解ALGAL系统的测试方法和性能边界。

This dataset is an archive of experimental results from the ALGAL project, containing multiple unsuccessful experiments along with their methods and limitations. It includes several studies (e.g., encoding tests, comprehensive warehouse routes, comprehensive record classification with subsequent calibration and conditional pooling versions), each corresponding to a JSON result file that records detailed experimental processes, success/failure status, performance scores, resource usage (e.g., number of model calls), and metadata such as transmission failures. The data scale includes approximately 2,663 model call attempts (390 for seed search and 2,273 for comparison phase). JSON schemas vary by study but preserve original records, including failure cases, null values, source identifiers, and limitations. This dataset is suitable for agent evaluation, experimental analysis, method comparison, etc., helping researchers understand the testing methods and performance boundaries of the ALGAL system.

创建时间:
2026-09-28
原始信息汇总

数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/hranesscom/algal-experiments
  • 许可证:MIT
  • 语言:英语(en)
  • 标签:agents、evaluation、experiments

数据集简介

该数据集为 ALGAL(https://algal.computer)记录实验结果的归档档案,包含未成功的实验及其方法与限制,供读者查看测试内容与结果。

研究(Studies)

研究 文件 结果
Coding-harness 试点,2026年9月20日 studies/coding-harness-pilot-2026-09-20/results.json 全部 12 次试验均未通过任务评分;8 份 ALGAL 执行回执经离线验证。
合成仓库路线,2026年9月23日 studies/application-research-2026-09-23/results.json 结构化事实在 8 个精确答案中答对 6 个;加入已验证查询答案后答对 5 个;无修订被激活。
合成记录分类,2026年9月28日 studies/cumulative-skill-v5-2026-09-28/results.json 3 次种子搜索中 1 次产出通过的程序;三语料库对比仍不充分。
合成记录分类校准,2026年9月28日 studies/cumulative-skill-v6-2026-09-28/results.json 3 个校准种子中 2 个通过;预注册门槛终止了九区块对比。
带开发反馈的合成记录分类,2026年9月29日 studies/cumulative-skill-v7-2026-09-29/results.json 4 个校准种子中 2 个通过,每个开发批次分数均为零;预注册门槛终止了九区块对比。
带分级开发反馈的合成记录分类,2026年9月29日 studies/cumulative-skill-v8-2026-09-29/results.json 4 个校准种子中 2 个通过,1 次搜索耗尽 8 代,第 4 次被中断;分级分数在 0.33 至 0.80 之间波动但未通过,门槛失败,预注册的 line rule 终止了该种子线。
带条件种子池的合成记录分类,2026年9月30日 studies/cumulative-skill-v9-pool-2026-09-30/results.json 14 次种子搜索中 6 次通过;5 个优化器区块缺少可用于冻结评估的最终程序,优化器与固定策略的主要对比覆盖不足,无结论。

各研究说明

  • Coding-harness 试点:使用 Terminal-Bench 2.0、4 次尝试上限及 claude/sonnet/low 选择器。其方法与解释(https://github.com/hraness/algal/blob/0c458a95ee04a01f16265dd9825c202b75b929d9/docs/coding-harness-pilot-results.md)描述了小样本、策略选择以及不可用的 token 与订阅成本归因。回执验证检查记录的执行完整性;任务评分衡量任务成功。所选策略仍为原始策略。该试点未展示性能收益。

  • 仓库路线研究(https://github.com/hraness/algal/blob/0c458a95ee04a01f16265dd9825c202b75b929d9/docs/application-research.md):使用 8 个固定顺序的合成案例及 anthropic/claude-haiku-4.5。其提案超出固定理由长度限制并被拒绝。单独的冻结对比已完成。这些案例不支持任何一般性性能结论。

  • 记录分类研究:通过 https://api.x.ai/v1 使用 grok-4.5。四种策略从同一通过验证且资源上限相同的生成程序出发。额外两个语料库各自耗尽 8 次种子生成尝试仍未产出通过的程序,其失败尝试仍计入成本总计。学习分数与固定程序的最终评估分开报告。ALGAL 工作单元与模型调用次数描述记录的执行;提供商费用不可用。一个完成的语料库与每种策略一个会话不足以证明后续工作的普遍改进。

  • 后续校准:使用 3 个带标注训练样本且仅用训练反馈的全新语料库。2 个种子通过验证,第 3 个耗尽 8 代,因此无确认臂运行。固定校准测试通过 2/8 与 3/8;一次记录的传输失败存在外部完成不确定与用量缺失。报告了运行时工作与计费尝试总计,但提供商账单仍不可用。

  • 第二次校准:增加第 4 个语料库、一个独立的开发批次(其通过指标是种子编写器收到的唯一新信号),以及 8 种修订模式的固定调度。2 个种子通过验证,2 个耗尽 8 代。全部 22 个计分开发批次失败,因此编写器的分数历史从未变化。两个固定种子均通过 4/8 测试。一次记录的传输失败同样存在用量缺失。新抽取与先前校准之间无配对比较。

  • 第三次校准:将开发通过指标替换为分级一致性分数(四舍五入到百分位),并预注册 line rule:若其门槛失败则终止开发反馈思路。2 个种子通过验证,1 个耗尽 8 代,第 4 次搜索在生成第 7 代时被启动会话中断,按协议未重试;以一份核对记录替代驱动器的收集。15 个计分开发批次分数在 0.33 至 0.80 之间,未达到 0.9 阈值。两个固定种子均显示余量(3/8 与 1/8)。每个效应都记录了用量;提供商账单仍不可用。仅凭三个完整区块门槛即失败,该线终止。

  • 条件池研究:使用未更改的 grok-4.5 种子流程,在 6 个具有通过种子的最低索引区块上比较四种策略。其唯一完整的主要区块 p-14 在冻结任务上优化器通过 8/8,固定策略通过 2/8。全部 6 个区块所需覆盖缺失,因此结果不充分,无法确立优化器优势。基于通过种子的选择可能有利于优化器;所有区块共享一个合成家族,且各策略记录的支出不相等。预注册的 line rule 终止了该研究设计线。

运行时统计

  • 记录了 2,663 次模型调用尝试,其中 390 次用于种子搜索,2,273 次用于对比阶段。
  • 12 条传输失败记录存在外部完成不确定与用量缺失,导致完整 token 总量与提供商费用未知。
  • 离线重放检查了跨 54 个存储的 2,695 个回执文件;复制的种子回执在每个包含它们的存储中再次计数。
  • 重放检查记录的执行,与任务正确性分开。

文件与复用

  • JSON 文件逐字节保留已发布的结果记录,包括记录的失败、空用量值、来源标识与限制。
  • 各研究 schema 不同,因为研究回答不同问题。
  • 使用 Python 的 json 模块或其他 JSON 读取器检查某项研究;此档案不定义组合训练划分。
  • export-manifest.json 记录源路径、哈希与源 Git 提交。
  • 使用这些结果时引用研究路径与不可变的 Hugging Face 提交。
  • 每个研究目录保持固定;后续实验接收新目录。
  • MIT 许可证覆盖此档案的已发布摘要。
  • Terminal-Bench 任务、原始执行存储、私有追踪与提供商账户记录被排除。

相关链接

  • 项目:https://algal.computer
  • 源码:https://github.com/hraness/algal
搜集汇总
数据集介绍
algal-experiments 数据集图片
构建方式
该数据集源于ALGAL系统在自动化实验评估领域的持续探索,其构建遵循预注册实验协议与严格的记录保全原则。研究团队围绕编码工具测试、合成仓库路径规划及记录分诊等任务,设计了一系列递进式实验,将每次试验的原始结果、方法细节、资源限制乃至失败轨迹完整存档。所有数据以JSON格式逐字保留发布记录,涵盖空值使用量、传输失败标识与执行回执,并通过导出清单固化源路径、哈希与Git提交版本,确保实验过程可追溯、可复核。
使用方法
使用者可通过Python的json模块或其他JSON读取器直接检视单项研究,各研究目录内容固定不变,后续实验另行建立新目录。引用时需标注具体研究路径与Hugging Face的不可变提交哈希,以保障溯源的准确性。该档案不提供合并训练集,亦不包含Terminal-Bench任务、原始执行存储、私有轨迹或供应商账户记录,MIT许可仅覆盖已发布的摘要性内容。离线回放可校验54个存储中的2695份回执文件,用以检查执行完整性,但须与任务正确性分开解读。
背景与挑战
背景概述
以智能体评估与可复现实验为核心关切,ALGAL实验档案于2026年9月由ALGAL项目团队(hraness等)创建,托管于Hugging Face。该数据集系统收录编码测试台试点、合成仓储路径规划与合成记录分流等系列研究,秉持将未成功实验及其方法与边界条件一并保存的理念,力图揭示受测系统的真实行为。其核心研究问题在于:在大语言模型驱动的智能体执行任务时,性能增益的可验证性与实验设计的统计充分性如何得到保障。该档案为智能体评估领域提供了珍贵的负结果证据,对元科学、可复现性研究及基准方法学具有潜在影响力。
当前挑战
该数据集所面对的挑战兼具领域与构建双重维度。就领域问题而言,智能体任务评估长期受制于样本量不足、基线漂移与评价指标混淆等因素,性能结论难以泛化;本档案各研究普遍出现通过率偏低、预注册门控中止、优化器与固定策略对比覆盖不足等现象,凸显小样本与多合成语料下因果推断的脆弱性。从构建过程看,模型调用记录中十二次传输失败导致外部完成状态与用量缺失,完整token总量与供应商计费无法复原;离线回放对54个存储、2695份回执进行校验,但复制种子回执的重复计数与模式异构性进一步增加了数据整合与复用难度。
常用场景
经典使用场景
在自主智能体评估与可复现性研究领域,algal-experiments数据集以其对失败实验的完整记录而别具一格,它承载了ALGAL系统在编码支架、合成仓库路径规划、合成记录分诊等任务上的多轮实验数据。该数据集最经典的使用场景在于,研究者借助其中保存的结果JSON文件,按研究维度逐项复现实验条件,审视失败发生的具体环节,例如编码支架试点中十二次试验全部未通过任务评分,或记录分诊校准中预注册门槛触发而终止比较。通过比对不同日期的实验版本与方法限制,使用者能够识别策略选择、种子搜索与资源上限对实验结果的影响,从而在智能体开发中做出更为审慎的设计决策,并以此为基础开展方法学层面的反思与改进。
解决学术问题
该数据集直面学术研究中长期存在的发表偏倚与负面结果缺失问题,将原本容易散佚的失败实验连同其方法、局限和离线执行凭证一并保存。它使得研究者能够考察智能体在编码、路径规划与记录分诊等任务中失败的具体模式,检验预注册门槛、开发反馈和种子池条件对方法演进的实际作用,并进一步分析提供者计费缺失、传输失败等外部因素对实验结论的干扰。经由这些记录,学界得以在更完整的证据基础上评估智能体策略的真实效能,避免仅凭成功案例得出过度乐观的推断,进而推动实验设计规范与结果报告标准的完善,对可复现研究和负责任创新具有深远的示范意义。
实际应用
在产业实践中,algal-experiments数据集为智能体系统的部署前评估提供了难得的参照材料,工程团队可借助其中的编码支架试点与仓库路径规划研究,了解在Terminal-Bench任务和合成场景下智能体的实际表现边界。运维与合规人员能够依据执行凭证验证记录,区分执行完整性与任务正确性,从而在模型选型、策略配置与资源分配时纳入失败风险的考量。数据集所记录的模型调用次数、传输失败与费用归属缺失等情况,亦可辅助成本估算与供应商沟通,帮助企业在缺乏完整计费信息时仍能对智能体方案的可行性与局限性形成合理判断。
数据集最近研究
最新研究方向
在智能体评估领域,对失败实验的系统性记录正成为提升研究可复现性的关键实践。ALGAL实验档案以预注册门控与校准机制为核心,探索编码智能体在Terminal-Bench 2.0等任务中的表现边界。该数据集通过保留未成功实验、执行收据与成本记录,为优化器策略与固定策略的对比研究提供了透明基线。当前前沿方向聚焦于种子搜索的通过率、开发反馈的梯度信号以及条件种子池的覆盖不足等问题,强调在资源受限与提供方计费不可得的现实约束下,如何建立可信的评估协议。这一工作对智能体研究的可审计性与负面结果的价值认知具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务