遇见数据集

StableEval Arena

收藏
github2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

StableEval Arena是一个历史回放基准测试,用于评估代理AI系统是否能作为成本感知、可信赖的稳定币风险代理。每个案例为代理提供一个冻结的30天回顾数据包,要求其预测未来7天的稳定/观察/压力状态、脱锚概率和美元锚定偏差。该基准测试包含两个数据集块:StableEval-120-Enriched(120个案例,用于压力增强的罕见风险诊断)和StableEval-507-Natural(507个案例,用于自然分布扩展和鲁棒性结果),涵盖USDT、USDC、DAI等稳定币,并包含BTC和ETH市场背景。

StableEval Arena is a historical replay benchmark developed to assess whether proxy AI systems can act as cost-aware and trustworthy stablecoin risk proxies. Each case provides the agent with a frozen 30-day retrospective dataset, requiring it to predict the 7-day-ahead stable, observable, and stressed states, depegging probability, and US dollar anchoring deviation. This benchmark includes two dataset splits: StableEval-120-Enriched (120 cases for stress-augmented rare risk diagnosis) and StableEval-507-Natural (507 cases for natural distribution generalization and robustness evaluation), covering stablecoins such as USDT, USDC, DAI, alongside the market backgrounds of BTC and ETH.

创建时间:
2026-06-08
原始信息汇总

数据集概述

StableEval Arena 是一个用于评估智能体AI系统在稳定币价格稳定性预测中表现的历史回放基准测试。其核心目标是衡量AI系统是否能够作为具备成本意识和可信赖的稳定币风险代理。

核心任务

每个测试案例包含一个目标稳定币、一个观察时间点(t)、一个冻结的30天回顾窗口以及一个隐藏的7天预测期。智能体仅能依据回顾窗口内的数据进行预测,并输出严格的JSON格式结果,包括:

  • 未来7天的价格稳定性状态(稳定/观察/压力)
  • 脱锚概率
  • 预测的最大绝对偏差(基点)
  • 偏差方向
  • 置信度
  • 理由说明

数据集构成

数据集由两个基准测试块组成:

数据集块 作用 当前发布状态
StableEval-120-Enriched 压力增强的稀有风险评估 完整:120个案例,包含六个系统、基线、消融实验及冻结清单
StableEval-507-Natural 自然分布下的规模化与鲁棒性评估 完整:507个案例,包含基线、四个原生/框架级智能体、两个基于适配器的 -Claw 扩展

数据分布

  • StableEval-120-Enriched: 54个稳定、45个观察、21个压力案例
  • StableEval-507-Natural: 441个稳定、45个观察、21个压力案例

涉及的稳定币与资产

  • 稳定币: USDT、USDC、DAI
  • 背景资产: BTC 和 ETH 的市场上下文数据

评估的智能体系统

共评估六个智能体系统:

  • 原生/框架级智能体: Nanobot、LangGraph、Hermes AI、EvoAgentX
  • 基于适配器的扩展: OpenClaw 和 NanoClaw(通过 StableEval 适配器)

所有系统均使用相同的模型后端(通过 OpenRouter 的 qwen/qwen-2.5-72b-instruct)。

评估维度

基准测试围绕三个核心维度展开:

  1. 评估:在冻结的历史回放环境下,比较智能体系统与非智能体基线。
  2. 可信赖性:记录包括遗漏的压力事件、误报、布里尔分数、延迟、代币成本、失败率和原始输出有效性。
  3. 智能体能力:记录执行元数据、原始输出、解析后的 JSON 和消融实验,评估智能体工作流而不仅仅是最终标签。

关键发现与注意事项

  • 压力召回率较弱:这是基准测试的一个中心发现,智能体当前未能解决稳定币压力预测问题。
  • 模型后端统一:所有系统使用相同的 LLM 后端,因此比较的是平台中介的智能体执行、可靠性、成本和结构化输出行为,而非独立的基础模型能力。
  • API 密钥安全:API 密钥不会存储于代码仓库中。

数据集文件结构

数据集的文件组织如下:

  • StableEval-120-Enriched:
    • 案例列表:results/stableeval_120_enriched/validation_case_list.csv
    • 提示数据包:data/benchmark/stableeval_120_enriched/prompt_packets.jsonl
    • 原始预测结果:results/stableeval_120_enriched/predictions_base_raw/
    • 校准后预测结果:results/stableeval_120_enriched/predictions_base_calibrated/
    • 主要指标:results/stableeval_120_enriched/evaluation_base_calibrated/
    • 最终表格:results/stableeval_120_enriched/final_tables/
    • 冻结清单:results/stableeval_120_enriched/freeze_manifest/
  • StableEval-507-Natural:
    • 案例列表:data/benchmark/stableeval_507_natural/case_list.csv
    • 标签数据:data/benchmark/stableeval_507_natural/labels.csv
    • 提示数据包:data/benchmark/stableeval_507_natural/prompt_packets.jsonl
    • 原始预测结果:results/stableeval_507_natural/raw_predictions/
    • 校准后预测结果:results/stableeval_507_natural/calibrated_predictions/
    • V6排行榜:results/stableeval_507_natural/final_tables/stableeval_507_natural_v6_leaderboard.csv
    • 审计与指标重算:results/stableeval_507_natural/metrics/results/stableeval_507_natural/reports/

复现说明

可以通过保存的结果文件复现指标,无需调用模型 API。代码仓库提供了 Python 脚本用于重新计算两个基准测试块的指标。 如需基于 API 重新运行预测,需要在环境中设置 OpenRouter API 密钥,但这不是必需的步骤。

许可证与数据再分发

  • 仓库代码、脚本、提示和文档采用 Apache License 2.0 许可。
  • 基准测试工件(data/benchmark/results/ 目录下的内容)可能包含来自上游提供商(如 CryptoCompare/CCData 和 DeFiLlama)的处理或衍生市场数据,以及 LLM 生成的输出。这些工件仅供学术复现使用,再分发和重用可能受原始提供者条款约束。
搜集汇总
数据集介绍
构建方式
在去中心化金融领域,稳定币的价格稳定性是维系市场信心的基石。StableEval Arena数据集通过历史回放机制构建,从USDT、USDC和DAI三大主流稳定币中提取案例。每个案例包含一个冻结的30天回顾窗口,要求智能体预测未来7天的稳定/观察/压力状态、脱钩概率及相对于美元锚定的偏差值。数据分为两个基准块:StableEval-120-Enriched(120个案例,富集稀有风险事件)和StableEval-507-Natural(507个案例,自然分布),并融入BTC与ETH市场背景作为上下文资产。所有智能体均通过OpenRouter调用相同的Qwen 72B后端模型,在统一提示模板、零温度和校准规则下运行,确保了比较的公平性与可复现性。
特点
该数据集的核心特色在于其成本感知的多维度评估体系。它不仅衡量预测准确性(如Brier分数、漏报压力事件与误报率),还细致记录延迟、令牌消耗、失败率和原始输出有效性,从而全面评价智能体工作流的执行效率与可靠性。此外,数据集中包含六种不同的智能体系统——从原生框架级代理(Nanobot、LangGraph、Hermes AI、EvoAgentX)到适配器扩展型代理(OpenClaw、NanoClaw),均在同一模型后端上运行,使比较聚焦于平台中介的智能体执行而非基础模型能力。特别地,压力回忆率弱这一发现作为可报告的可信度结论被明确标注,凸显了当前系统在稳定币压力预测任务中的局限性。
使用方法
使用者可通过两类轻量级脚本来复现结果。对于StableEval-120-Enriched,运行`scripts/evaluate/recompute_stableeval_120_enriched.py`即可从保存的校准预测中重现指标;对于StableEval-507-Natural,则使用`recompute_stableeval_507_natural.py`脚本,其最终结果将生成在`results/stableeval_507_natural/final_tables/stableeval_507_natural_v6_leaderboard.csv`中。若需调用真实API进行重跑,只需在shell中设置`OPENROUTER_API_KEY`环境变量,但密钥严禁写入仓库文件。所有操作均需事先安装`requirements-core.txt`中的依赖包。数据集按Apache 2.0许可发布,但包含的衍生市场数据(源自CryptoCompare和DeFiLlama)仍需遵守上游提供者的分发条款,仅用于学术复现目的。
背景与挑战
背景概述
StableEval Arena是由研究人员Sean Wan等人在2025年创建的一个历史回放基准测试平台,专注于评估代理型人工智能系统在稳定币价格稳定性预测中的表现。该数据集由两个核心模块构成:StableEval-120-Enriched专注于压力事件的稀有风险诊断,包含120个案例;StableEval-507-Natural则专注于自然分布下的可扩展性与鲁棒性验证,包含507个案例。通过统一的大语言模型后端Qwen 72B,该基准测试比较了Nanobot、LangGraph、Hermes AI等六种代理系统在成本感知、可信赖性方面的表现。StableEval Arena的提出填补了稳定币领域缺乏结构化、可复现的代理系统评估工具的空白,为金融科技与人工智能的交叉研究提供了重要参考框架。
当前挑战
该数据集所解决的领域问题主要围绕稳定币价格稳定性预测中的信任缺失与评估标准不统一。具体挑战包括:1)稳定币在极端市场波动下的压力事件预测准确性极低,现有代理系统对此类事件的召回率普遍薄弱,成为核心可信度问题;2)不同代理系统在输出格式、成本控制与延迟表现上差异显著,缺乏统一的成本感知评估指标;3)构建过程中,研究者需要处理大量历史市场数据的清洗与标注,同时确保30天回看窗口与7天预测窗口之间的数据隔离,避免信息泄露。此外,API密钥的安全存储与输出结果的可复现性也是构建过程中的重要考量,所有系统需在相同的大语言模型后端下执行,以消除模型能力差异对比较结果的干扰。
常用场景
经典使用场景
在去中心化金融(DeFi)与算法稳定币风险管理的交汇地带,StableEval Arena为评估智能体人工智能系统在稳定币价格稳定性预测中的成本敏感性与可信度提供了标准化历史回测框架。该数据集经典使用场景聚焦于给定30天冻结回顾窗口的市场数据包,要求智能体预测未来7天内稳定币所处的稳定、警戒或压力状态,并量化脱锚概率及美元锚定偏离幅度。通过统一的提示协议、温度参数为零的确定性输出以及校准规则,研究者得以在跨六个智能体系统的可控实验中,剥离底层大语言模型的固有能力,专门考察平台介导的智能体执行效能与结构化输出可靠性。
解决学术问题
StableEval Arena系统性地填补了现有稳定币风险评估研究中智能体成本-信任度联合评估的方法论空白。学术层面,该数据集主要解决两大核心问题:一是如何通过冻结历史回测实现对智能体系统在罕见压力事件中召回能力的诊断,二是如何将执行延迟、令牌消耗、失败率等成本维度与传统分类指标(如Brier分数)整合为一个多维评估框架。其意义在于揭示了当前主流智能体系统在压力状态召回方面普遍存在的脆弱性,这一发现挑战了业界对智能体金融风控能力过于乐观的假设,并为后续改进提供了可复现的基准基线。
衍生相关工作
围绕StableEval Arena已衍生出多项富有影响力的后续工作。基于数据集揭示的压力事件召回短板,研究者开发了针对智能体压力敏感度感知的提示工程优化方法,通过注入历史危机案例的上下文模板来提升脆弱性识别能力。另一类衍生工作聚焦于成本感知型智能体架构设计,借鉴OpenClaw与NanoClaw的适配器模式,探索在保持预测精度的同时显著降低API调用开销的轻量级执行框架。此外,数据集的标准化评估协议已被扩展至多模态市场信号融合领域,衍生出整合链上元数据与社交情绪信号的智能体风险评估新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务