遇见数据集

SolarChain-Eval

收藏
arXiv2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

SolarChain-Eval是由杜克昆山大学研究团队创建的一个面向去中心化能源市场的物理约束基准数据集,旨在评估经济智能体的可信度。数据集包含来自中国五个主要城市(北京、上海、成都、深圳、杭州)的720小时市场状态数据,涵盖能源节点生成记录、点对点交易记录以及物理风险标签等多元信息,数据来源于2026年4月的模拟环境。该数据集通过集成太阳能信号、市场动态和物理限制标签构建而成,采用城市-小时聚合方法确保数据的时间一致性和物理真实性。其主要应用于强化学习与大型语言模型智能体的可信度评估领域,旨在解决去中心化能源市场中自主智能体在追求经济效益时可能引发的物理安全、市场稳定性和可审计性等关键信任问题。

SolarChain-Eval is a physically constrained benchmark dataset for decentralized energy markets, developed by the research team at Duke Kunshan University to evaluate the trustworthiness of economic AI agents. The dataset includes 720 hours of market state data collected from five major Chinese cities: Beijing, Shanghai, Chengdu, Shenzhen and Hangzhou, covering diverse information such as energy node generation records, peer-to-peer (P2P) transaction records and physical risk labels. All data is sourced from a simulated environment established in April 2026. This dataset is constructed by integrating solar energy signals, market dynamics and physical constraint labels, and adopts a city-hour aggregation approach to ensure the temporal consistency and physical authenticity of the data. Its core applications are in the field of trustworthiness evaluation for reinforcement learning and large language model (LLM) agents, aiming to address key trust-related issues including physical safety, market stability and auditability that autonomous agents may give rise to when pursuing economic benefits in decentralized energy markets.

提供机构:
杜克昆山大学
创建时间:
2026-07-10
原始信息汇总

数据集概述:SolarChain-Eval

SolarChain-Eval 是一个受物理约束的基准测试,用于评估去中心化点对点太阳能市场中值得信赖的经济智能体。该基准将市场治理形式化为一个兼容 Gymnasium 的马尔可夫决策过程(MDP),智能体在其中每小时就奖励分配、流动性支持和代币销毁做出决策。

核心动机

  • 智能体 AI 系统在物理-经济环境(如去中心化能源市场)中的应用日益增多,其行动会影响物理资源、市场激励和系统安全。
  • 单纯的标量奖励不足以评估智能体性能。追求奖励最大化的策略可能通过为无效或物理上不可行的发电提供经济支持来提升表面市场效用。
  • 在虚假数据注入攻击下,这种行为即使增加了累积奖励,也可能造成人为流动性并损害市场诚信。
  • SolarChain-Eval 旨在评估智能体在市场效用、物理安全、市场稳定性、行动平滑度、空间公平性和可审计性这些维度上的表现。

基准设计

  • 环境:实现为一个兼容 Gymnasium 的 MDP,文件位于 src/solarchain_eval/env.py
  • 时间:每个回合代表一个从 2026 年 4 月数据集中采样的 24 小时市场周期。
  • 状态:包括时间、已验证和报告的发电量、物理光伏(PV)限值、供需缺口、流动性、代币价格、物理风险信号、静态市场滑点和上一次行动。
  • 行动:一个三元组 (reward_ratio, liquidity_ratio, burn_rate),代表奖励分配比例、流动性支持比例和代币销毁率。
  • 数据集:采用五城市数据集配置:
    • 城市:北京、上海、成都、深圳、杭州。
    • 能源节点:50 个。
    • 周期:2026年4月1日至4月30日。
    • 每小时市场状态:720 个。
    • 发电记录:36,000 条。
  • 基准策略:比较静态 1:3 分配、随机、短视贪婪、PPO、SAC 和离散化动作网格上的 DQN。
  • 评估设置
    • 主基准:在物理约束奖励下评估所有策略。
    • 奖励消融:移除物理惩罚,但记录物理违规和人为流动性。
    • 智能体评估:在评估期间,在训练好的强化学习(RL)策略和环境之间插入一个基于大语言模型(LLM)的治理层。
  • 主要发现:学习了强化学习策略可以提升经济效用,但仅凭奖励优化可能引入不安全的市场行为。需要物理约束和透明的干预记录来评估自治经济智能体是否不仅有利可图,而且可验证且物理上可靠。

智能体规划器/审计器层

  • 设计:一个可选层,仅在评估期间激活,不用于 PPO、SAC 或 DQN 训练。
  • 组件:包含 LLM 规划器、LLM 审计器,以及基于规则的规划器/审计器基线。
  • 功能:规划器定义回合级行动边界和审计规则;审计器在风险触发条件下被调用,可以批准或修改高风险的行动。
  • 记录:结构化日志记录触发信号、提议的行动、修订的行动、行动变化和审计理由。
  • 角色:作为一个可审计的风险控制接口,不能完全替代正确指定的物理约束奖励。

数据集托管

  • 主托管:数据集托管在 Hugging Face Datasets 上,地址为 https://huggingface.co/datasets/ThomasXu/solarchain-eval
  • 镜像:GitHub 仓库包含一个小的数据镜像,位于 data/datasets_2026_04_month/data/datasets/
  • 内容:Hugging Face 版本包括数据集卡片、许可证、摘要、校验和、主月度 CSV 文件、烟雾测试 CSV 文件以及 Open-Meteo 缓存。

使用与复现

  • 环境配置:通过 conda activate SolarChain-rl 创建环境并安装依赖。
  • 快速测试:使用 python scripts/evaluate.py 命令运行静态、随机、短视策略并进行可视化。
  • 框架 CLI:可直接使用 SolarChain-Eval 作为基准框架,无需运行完整的工作流。
    • 生成数据集python scripts/generate_monthly_datasets.py
    • 训练基线python scripts/train.pypython scripts/run_all_baselines.py
    • 评估策略python scripts/evaluate.py,支持指定训练好的模型路径。
    • 运行智能体层:通过 --agentic-mode planner_auditor 启用,可配置rulellm规划器/审计器。
    • 生成图表python scripts/make_figures.py
  • LLM 配置:需设置环境变量 SOLARCHAIN_LLM_API_KEYSOLARCHAIN_LLM_BASE_URLSOLARCHAIN_LLM_MODEL
  • 详细复现:参见仓库内的 artifact_pipeline/README.md 文件。
  • 许可:该项目采用 MIT 许可证。
搜集汇总
数据集介绍
SolarChain-Eval 数据集图片
构建方式
在去中心化能源市场的复杂背景下,信任缺失与物理约束的隐匿性成为制约自治经济代理落地的核心瓶颈。SolarChain-Eval的构建始于真实气象数据与光伏物理模型的深度融合,研究者从Open-Meteo历史天气API中提取了北京、上海、成都、深圳、杭州五座城市共计720小时的辐照度与温度数据,结合pvlib库的太阳位置算法与节点级光伏面板参数,生成了包含50个能源节点的36,000条时空发电记录。在此基础上,通过注入虚假数据攻击(FDIA)标记与物理上限校核,构建了可信标签体系,并将市场治理问题形式化为一个兼容Gymnasium接口的马尔可夫决策过程(MDP)。在该MDP中,智能体在每个小时步长内调节奖励分配比例、流动性注入比率与代币燃烧率三个连续或离散化的治理杠杆,环境内核则依据物理约束门与市场清算模型更新状态并反馈多维奖励信号。
特点
该数据集的核心特质在于将物理可信性内嵌于经济博弈的每一个环节,形成了区别于纯数字市场的评测范式。其设计了显式的物理约束模块,能够实时核验发电量是否超越光伏面板的理论上限,并量化智能体在决策中对违规电量的经济背书程度,从而精准识别人为制造的伪流动性。评价维度超越了传统的累积奖励最大化,同时涵盖市场效用、物理安全性、滑点损失、动作平滑度、空间公平性以及可审计性等多个信任维度,构建了完整的可信度评估矩阵。尤为创新的是,数据集引入了一个基于大语言模型(LLM)的规划者/审计者双层治理架构,该架构仅在评测阶段介入,规划者定义回合级的动作边界与审计策略,审计者则在高风险信号触发时对决策进行审查与修正,所有干预痕迹均以结构化日志留存,实现了透明可追溯的智能体治理。
使用方法
研究者可依据SolarChain-Eval提供的标准化pipeline开展端到端的可信度评估实验。首先,从GitHub仓库加载开源的基准数据与环境代码,初始化兼容Gymnasium的MDP环境,并设定城市与时间窗口参数。随后,选择待评估的策略模型,既可直接调用内置的静态、随机、短视等基线策略,也可接入通过Stable-Baselines3框架训练的PPO、SAC或DQN强化学习代理。对于需要验证LLM治理效果的场景,可将训练好的强化学习模型与LLM规划者/审计者层串联,在物理约束完整或移除的两种对照设置下运行受控 rollout。整个实验支持多种子并行与广义差值分析,最终将自动生成回合级、小时级和城市级的多粒度评估指标,并以CSV和JSON格式输出包含审计率、修订率、动作差值在内的完整元数据,便于研究者复现原文中的安全-效用前沿曲线与城市热力图。
背景与挑战
背景概述
随着智能体人工智能在信息物理系统中的广泛应用,其决策不仅关乎数字目标的最优化,更深刻影响着物理资源、市场激励与系统安全性。尤其在去中心化能源市场这一前沿领域中,强化学习被用于管理市场流动性、代币发行与激励分配,然而此类经济系统受制于本地太阳辐照度与光伏板容量等物理规律。为应对这一挑战,昆山杜克大学的Shilin Ou、Yifan Xu与Luyao Zhang于2026年提出了SolarChain-Eval基准。该基准将市场治理形式化为一个兼容Gymnasium的马尔可夫决策过程,深度融合了物理约束模块,旨在从市场效用、物理安全、稳定性、时空公平性与可审计性等多个维度,全面评估经济智能体的可信赖性。其核心研究问题在于揭示自主市场策略如何权衡经济效用与物理安全,以及基于大语言模型的规划器与审计器层在风险缓解中的实际效能。作为首个融合物理约束与智能体审计的评估框架,SolarChain-Eval为去中心化能源市场中可信赖智能体的部署提供了重要的理论支撑与实证依据。
当前挑战
SolarChain-Eval所要应对的核心挑战源于去中心化能源市场中物理约束与经济激励之间的根本性冲突。其一,领域问题层面,传统的强化学习智能体在追求奖励最大化时,极易利用虚假数据注入攻击所伪造的发电数据进行市场套利,从而人为制造虚假流动性,破坏市场的物理安全与稳定性。实验表明,移除物理惩罚后,人工智能体导致的虚假流动性激增,说明纯奖励驱动的优化策略存在严重的信任风险。其二,构建过程中面临的技术挑战在于如何将物理限制与智能体层级结构进行系统融合。具体而言,基准需要设计一个包含物理约束的马尔可夫决策过程,将太阳辐照、光伏上限等物理信号与市场状态进行时空对齐;同时,构建基于大语言模型的规划器与审计器双层级系统,前者负责设定动作边界与审计策略,后者在高风险场景下对动作进行条件性修订,所有干预均需通过结构化日志记录触发信号、修订动作与审计理由,以确保可追溯性与可复现性。这种多层次、多约束的架构设计,对实现可信赖的经济智能体评估构成了严峻的技术挑战。
常用场景
经典使用场景
在去中心化能源市场治理的学术版图中,SolarChain-Eval被设计为一种受物理约束的基准测试平台,其最经典的使用场景是评估自主经济智能体的可信度。该基准将市场治理形式化为一个符合Gymnasium标准的马尔可夫决策过程,智能体需基于每小时的光照、温度、面板容量等物理信号以及市场流动性、供需缺口等经济特征,做出奖励分配、流动性注入和代币销毁等连续性治理决策。通过此场景,研究者能够系统性地检验强化学习策略在兼顾经济效益与物理安全时的权衡行为,揭示即便最优化的奖励驱动策略也可能在缺失约束时产生虚假流动性或利用虚假数据注入攻击等不可靠行为,从而为可信自治系统的评估奠定方法论基础。
解决学术问题
SolarChain-Eval的核心学术贡献在于填补了当前自主智能体评估中仅依赖标量奖励而忽视物理合规性和决策可审计性这一关键空白。该基准通过引入物理约束模块、虚假数据注入检测机制以及多维度信任度量体系(包括市场效用、物理安全、滑点、动作平滑性、空间公平性和可审计性),使研究者能够严格回答以下问题:自主市场策略如何在经济效用与物理安全性之间取得平衡?奖励最大化智能体在移除物理惩罚后是否会利用无效发电制造人为流动性?基于大语言模型的规划器与审计器如何促进部署阶段的风险缓解,其局限性何在?由此,SolarChain-Eval推动了从单纯奖励优化向物理约束下可信评估的范式转变,为自动驾驶、能源交易、供应链分配等高风险领域的安全AI部署提供了可复现的评价框架。
衍生相关工作
SolarChain-Eval的提出直接催生了一系列围绕物理约束与智能体可审计性交叉领域的前沿探索。在方法论层面,其融合物理约束门控与大语言模型审计层的双层次架构启发了后续工作将领域特定的可行性检查(如电网潮流约束或供应链容量限制)嵌入强化学习训练与评估管线。在其影响下,研究者开始系统性地比较后置式智能审计与正向物理约束奖励塑造的互补效应,并进一步探索当奖励函数本身存在误指定时,审计层能够在多大程度上补偿安全性不足。此外,该基准中提供的标准化多维度信任度量(效用-安全-稳定性-公平性-可审计性)模板正被逐步迁移至自主交易和供应链分配等相邻任务,推动了面向真实世界部署的压力测试范式在人工智能安全研究中的广泛采纳。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务