StableEval Arena
收藏资源简介:
StableEval Arena是一个历史回放基准测试,用于评估代理AI系统是否能作为成本感知、可信赖的稳定币风险代理。每个案例为代理提供一个冻结的30天回顾数据包,要求其预测未来7天的稳定/观察/压力状态、脱锚概率和美元锚定偏差。该基准测试包含两个数据集块:StableEval-120-Enriched(120个案例,用于压力增强的罕见风险诊断)和StableEval-507-Natural(507个案例,用于自然分布扩展和鲁棒性结果),涵盖USDT、USDC、DAI等稳定币,并包含BTC和ETH市场背景。
StableEval Arena is a historical replay benchmark developed to assess whether proxy AI systems can act as cost-aware and trustworthy stablecoin risk proxies. Each case provides the agent with a frozen 30-day retrospective dataset, requiring it to predict the 7-day-ahead stable, observable, and stressed states, depegging probability, and US dollar anchoring deviation. This benchmark includes two dataset splits: StableEval-120-Enriched (120 cases for stress-augmented rare risk diagnosis) and StableEval-507-Natural (507 cases for natural distribution generalization and robustness evaluation), covering stablecoins such as USDT, USDC, DAI, alongside the market backgrounds of BTC and ETH.
数据集概述
StableEval Arena 是一个用于评估智能体AI系统在稳定币价格稳定性预测中表现的历史回放基准测试。其核心目标是衡量AI系统是否能够作为具备成本意识和可信赖的稳定币风险代理。
核心任务
每个测试案例包含一个目标稳定币、一个观察时间点(t)、一个冻结的30天回顾窗口以及一个隐藏的7天预测期。智能体仅能依据回顾窗口内的数据进行预测,并输出严格的JSON格式结果,包括:
- 未来7天的价格稳定性状态(稳定/观察/压力)
- 脱锚概率
- 预测的最大绝对偏差(基点)
- 偏差方向
- 置信度
- 理由说明
数据集构成
数据集由两个基准测试块组成:
| 数据集块 | 作用 | 当前发布状态 |
|---|---|---|
| StableEval-120-Enriched | 压力增强的稀有风险评估 | 完整:120个案例,包含六个系统、基线、消融实验及冻结清单 |
| StableEval-507-Natural | 自然分布下的规模化与鲁棒性评估 | 完整:507个案例,包含基线、四个原生/框架级智能体、两个基于适配器的 -Claw 扩展 |
数据分布
- StableEval-120-Enriched: 54个稳定、45个观察、21个压力案例
- StableEval-507-Natural: 441个稳定、45个观察、21个压力案例
涉及的稳定币与资产
- 稳定币: USDT、USDC、DAI
- 背景资产: BTC 和 ETH 的市场上下文数据
评估的智能体系统
共评估六个智能体系统:
- 原生/框架级智能体: Nanobot、LangGraph、Hermes AI、EvoAgentX
- 基于适配器的扩展: OpenClaw 和 NanoClaw(通过 StableEval 适配器)
所有系统均使用相同的模型后端(通过 OpenRouter 的 qwen/qwen-2.5-72b-instruct)。
评估维度
基准测试围绕三个核心维度展开:
- 评估:在冻结的历史回放环境下,比较智能体系统与非智能体基线。
- 可信赖性:记录包括遗漏的压力事件、误报、布里尔分数、延迟、代币成本、失败率和原始输出有效性。
- 智能体能力:记录执行元数据、原始输出、解析后的 JSON 和消融实验,评估智能体工作流而不仅仅是最终标签。
关键发现与注意事项
- 压力召回率较弱:这是基准测试的一个中心发现,智能体当前未能解决稳定币压力预测问题。
- 模型后端统一:所有系统使用相同的 LLM 后端,因此比较的是平台中介的智能体执行、可靠性、成本和结构化输出行为,而非独立的基础模型能力。
- API 密钥安全:API 密钥不会存储于代码仓库中。
数据集文件结构
数据集的文件组织如下:
- StableEval-120-Enriched:
- 案例列表:
results/stableeval_120_enriched/validation_case_list.csv - 提示数据包:
data/benchmark/stableeval_120_enriched/prompt_packets.jsonl - 原始预测结果:
results/stableeval_120_enriched/predictions_base_raw/ - 校准后预测结果:
results/stableeval_120_enriched/predictions_base_calibrated/ - 主要指标:
results/stableeval_120_enriched/evaluation_base_calibrated/ - 最终表格:
results/stableeval_120_enriched/final_tables/ - 冻结清单:
results/stableeval_120_enriched/freeze_manifest/
- 案例列表:
- StableEval-507-Natural:
- 案例列表:
data/benchmark/stableeval_507_natural/case_list.csv - 标签数据:
data/benchmark/stableeval_507_natural/labels.csv - 提示数据包:
data/benchmark/stableeval_507_natural/prompt_packets.jsonl - 原始预测结果:
results/stableeval_507_natural/raw_predictions/ - 校准后预测结果:
results/stableeval_507_natural/calibrated_predictions/ - V6排行榜:
results/stableeval_507_natural/final_tables/stableeval_507_natural_v6_leaderboard.csv - 审计与指标重算:
results/stableeval_507_natural/metrics/和results/stableeval_507_natural/reports/
- 案例列表:
复现说明
可以通过保存的结果文件复现指标,无需调用模型 API。代码仓库提供了 Python 脚本用于重新计算两个基准测试块的指标。 如需基于 API 重新运行预测,需要在环境中设置 OpenRouter API 密钥,但这不是必需的步骤。
许可证与数据再分发
- 仓库代码、脚本、提示和文档采用 Apache License 2.0 许可。
- 基准测试工件(
data/benchmark/和results/目录下的内容)可能包含来自上游提供商(如 CryptoCompare/CCData 和 DeFiLlama)的处理或衍生市场数据,以及 LLM 生成的输出。这些工件仅供学术复现使用,再分发和重用可能受原始提供者条款约束。



