algal-experiments
收藏资源简介:
该数据集是ALGAL项目实验结果的存档,收录了多个不成功的实验及其方法和限制。数据集包含多个研究(如编码测试、综合仓库路线、综合记录分类及其后续校准和条件池版本),每个研究对应一个JSON结果文件,详细记录了实验过程、成功/失败状态、性能分数、资源使用(如模型调用次数)、以及传输故障等元数据。数据规模包括约2,663次模型调用尝试(其中390次用于种子搜索,2,273次用于比较阶段)。JSON schema因研究而异,但均保留原始记录,包括失败案例、空值使用、来源标识和限制。该数据集适用于代理评估、实验分析、方法比较等场景,帮助研究者了解ALGAL系统的测试方法和性能边界。
This dataset is an archive of experimental results from the ALGAL project, containing multiple unsuccessful experiments along with their methods and limitations. It includes several studies (e.g., encoding tests, comprehensive warehouse routes, comprehensive record classification with subsequent calibration and conditional pooling versions), each corresponding to a JSON result file that records detailed experimental processes, success/failure status, performance scores, resource usage (e.g., number of model calls), and metadata such as transmission failures. The data scale includes approximately 2,663 model call attempts (390 for seed search and 2,273 for comparison phase). JSON schemas vary by study but preserve original records, including failure cases, null values, source identifiers, and limitations. This dataset is suitable for agent evaluation, experimental analysis, method comparison, etc., helping researchers understand the testing methods and performance boundaries of the ALGAL system.
数据集概述
基本信息
- 数据集地址:https://huggingface.co/datasets/hranesscom/algal-experiments
- 许可证:MIT
- 语言:英语(en)
- 标签:agents、evaluation、experiments
数据集简介
该数据集为 ALGAL(https://algal.computer)记录实验结果的归档档案,包含未成功的实验及其方法与限制,供读者查看测试内容与结果。
研究(Studies)
| 研究 | 文件 | 结果 |
|---|---|---|
| Coding-harness 试点,2026年9月20日 | studies/coding-harness-pilot-2026-09-20/results.json |
全部 12 次试验均未通过任务评分;8 份 ALGAL 执行回执经离线验证。 |
| 合成仓库路线,2026年9月23日 | studies/application-research-2026-09-23/results.json |
结构化事实在 8 个精确答案中答对 6 个;加入已验证查询答案后答对 5 个;无修订被激活。 |
| 合成记录分类,2026年9月28日 | studies/cumulative-skill-v5-2026-09-28/results.json |
3 次种子搜索中 1 次产出通过的程序;三语料库对比仍不充分。 |
| 合成记录分类校准,2026年9月28日 | studies/cumulative-skill-v6-2026-09-28/results.json |
3 个校准种子中 2 个通过;预注册门槛终止了九区块对比。 |
| 带开发反馈的合成记录分类,2026年9月29日 | studies/cumulative-skill-v7-2026-09-29/results.json |
4 个校准种子中 2 个通过,每个开发批次分数均为零;预注册门槛终止了九区块对比。 |
| 带分级开发反馈的合成记录分类,2026年9月29日 | studies/cumulative-skill-v8-2026-09-29/results.json |
4 个校准种子中 2 个通过,1 次搜索耗尽 8 代,第 4 次被中断;分级分数在 0.33 至 0.80 之间波动但未通过,门槛失败,预注册的 line rule 终止了该种子线。 |
| 带条件种子池的合成记录分类,2026年9月30日 | studies/cumulative-skill-v9-pool-2026-09-30/results.json |
14 次种子搜索中 6 次通过;5 个优化器区块缺少可用于冻结评估的最终程序,优化器与固定策略的主要对比覆盖不足,无结论。 |
各研究说明
-
Coding-harness 试点:使用 Terminal-Bench 2.0、4 次尝试上限及
claude/sonnet/low选择器。其方法与解释(https://github.com/hraness/algal/blob/0c458a95ee04a01f16265dd9825c202b75b929d9/docs/coding-harness-pilot-results.md)描述了小样本、策略选择以及不可用的 token 与订阅成本归因。回执验证检查记录的执行完整性;任务评分衡量任务成功。所选策略仍为原始策略。该试点未展示性能收益。 -
仓库路线研究(https://github.com/hraness/algal/blob/0c458a95ee04a01f16265dd9825c202b75b929d9/docs/application-research.md):使用 8 个固定顺序的合成案例及
anthropic/claude-haiku-4.5。其提案超出固定理由长度限制并被拒绝。单独的冻结对比已完成。这些案例不支持任何一般性性能结论。 -
记录分类研究:通过
https://api.x.ai/v1使用grok-4.5。四种策略从同一通过验证且资源上限相同的生成程序出发。额外两个语料库各自耗尽 8 次种子生成尝试仍未产出通过的程序,其失败尝试仍计入成本总计。学习分数与固定程序的最终评估分开报告。ALGAL 工作单元与模型调用次数描述记录的执行;提供商费用不可用。一个完成的语料库与每种策略一个会话不足以证明后续工作的普遍改进。 -
后续校准:使用 3 个带标注训练样本且仅用训练反馈的全新语料库。2 个种子通过验证,第 3 个耗尽 8 代,因此无确认臂运行。固定校准测试通过 2/8 与 3/8;一次记录的传输失败存在外部完成不确定与用量缺失。报告了运行时工作与计费尝试总计,但提供商账单仍不可用。
-
第二次校准:增加第 4 个语料库、一个独立的开发批次(其通过指标是种子编写器收到的唯一新信号),以及 8 种修订模式的固定调度。2 个种子通过验证,2 个耗尽 8 代。全部 22 个计分开发批次失败,因此编写器的分数历史从未变化。两个固定种子均通过 4/8 测试。一次记录的传输失败同样存在用量缺失。新抽取与先前校准之间无配对比较。
-
第三次校准:将开发通过指标替换为分级一致性分数(四舍五入到百分位),并预注册 line rule:若其门槛失败则终止开发反馈思路。2 个种子通过验证,1 个耗尽 8 代,第 4 次搜索在生成第 7 代时被启动会话中断,按协议未重试;以一份核对记录替代驱动器的收集。15 个计分开发批次分数在 0.33 至 0.80 之间,未达到 0.9 阈值。两个固定种子均显示余量(3/8 与 1/8)。每个效应都记录了用量;提供商账单仍不可用。仅凭三个完整区块门槛即失败,该线终止。
-
条件池研究:使用未更改的
grok-4.5种子流程,在 6 个具有通过种子的最低索引区块上比较四种策略。其唯一完整的主要区块p-14在冻结任务上优化器通过 8/8,固定策略通过 2/8。全部 6 个区块所需覆盖缺失,因此结果不充分,无法确立优化器优势。基于通过种子的选择可能有利于优化器;所有区块共享一个合成家族,且各策略记录的支出不相等。预注册的 line rule 终止了该研究设计线。
运行时统计
- 记录了 2,663 次模型调用尝试,其中 390 次用于种子搜索,2,273 次用于对比阶段。
- 12 条传输失败记录存在外部完成不确定与用量缺失,导致完整 token 总量与提供商费用未知。
- 离线重放检查了跨 54 个存储的 2,695 个回执文件;复制的种子回执在每个包含它们的存储中再次计数。
- 重放检查记录的执行,与任务正确性分开。
文件与复用
- JSON 文件逐字节保留已发布的结果记录,包括记录的失败、空用量值、来源标识与限制。
- 各研究 schema 不同,因为研究回答不同问题。
- 使用 Python 的
json模块或其他 JSON 读取器检查某项研究;此档案不定义组合训练划分。 export-manifest.json记录源路径、哈希与源 Git 提交。- 使用这些结果时引用研究路径与不可变的 Hugging Face 提交。
- 每个研究目录保持固定;后续实验接收新目录。
- MIT 许可证覆盖此档案的已发布摘要。
- Terminal-Bench 任务、原始执行存储、私有追踪与提供商账户记录被排除。
相关链接
- 项目:https://algal.computer
- 源码:https://github.com/hraness/algal





