SolarChain-Eval
收藏资源简介:
SolarChain-Eval是由杜克昆山大学研究团队创建的一个面向去中心化能源市场的物理约束基准数据集,旨在评估经济智能体的可信度。数据集包含来自中国五个主要城市(北京、上海、成都、深圳、杭州)的720小时市场状态数据,涵盖能源节点生成记录、点对点交易记录以及物理风险标签等多元信息,数据来源于2026年4月的模拟环境。该数据集通过集成太阳能信号、市场动态和物理限制标签构建而成,采用城市-小时聚合方法确保数据的时间一致性和物理真实性。其主要应用于强化学习与大型语言模型智能体的可信度评估领域,旨在解决去中心化能源市场中自主智能体在追求经济效益时可能引发的物理安全、市场稳定性和可审计性等关键信任问题。
SolarChain-Eval is a physically constrained benchmark dataset for decentralized energy markets, developed by the research team at Duke Kunshan University to evaluate the trustworthiness of economic AI agents. The dataset includes 720 hours of market state data collected from five major Chinese cities: Beijing, Shanghai, Chengdu, Shenzhen and Hangzhou, covering diverse information such as energy node generation records, peer-to-peer (P2P) transaction records and physical risk labels. All data is sourced from a simulated environment established in April 2026. This dataset is constructed by integrating solar energy signals, market dynamics and physical constraint labels, and adopts a city-hour aggregation approach to ensure the temporal consistency and physical authenticity of the data. Its core applications are in the field of trustworthiness evaluation for reinforcement learning and large language model (LLM) agents, aiming to address key trust-related issues including physical safety, market stability and auditability that autonomous agents may give rise to when pursuing economic benefits in decentralized energy markets.
数据集概述:SolarChain-Eval
SolarChain-Eval 是一个受物理约束的基准测试,用于评估去中心化点对点太阳能市场中值得信赖的经济智能体。该基准将市场治理形式化为一个兼容 Gymnasium 的马尔可夫决策过程(MDP),智能体在其中每小时就奖励分配、流动性支持和代币销毁做出决策。
核心动机
- 智能体 AI 系统在物理-经济环境(如去中心化能源市场)中的应用日益增多,其行动会影响物理资源、市场激励和系统安全。
- 单纯的标量奖励不足以评估智能体性能。追求奖励最大化的策略可能通过为无效或物理上不可行的发电提供经济支持来提升表面市场效用。
- 在虚假数据注入攻击下,这种行为即使增加了累积奖励,也可能造成人为流动性并损害市场诚信。
- SolarChain-Eval 旨在评估智能体在市场效用、物理安全、市场稳定性、行动平滑度、空间公平性和可审计性这些维度上的表现。
基准设计
- 环境:实现为一个兼容 Gymnasium 的 MDP,文件位于
src/solarchain_eval/env.py。 - 时间:每个回合代表一个从 2026 年 4 月数据集中采样的 24 小时市场周期。
- 状态:包括时间、已验证和报告的发电量、物理光伏(PV)限值、供需缺口、流动性、代币价格、物理风险信号、静态市场滑点和上一次行动。
- 行动:一个三元组
(reward_ratio, liquidity_ratio, burn_rate),代表奖励分配比例、流动性支持比例和代币销毁率。 - 数据集:采用五城市数据集配置:
- 城市:北京、上海、成都、深圳、杭州。
- 能源节点:50 个。
- 周期:2026年4月1日至4月30日。
- 每小时市场状态:720 个。
- 发电记录:36,000 条。
- 基准策略:比较静态 1:3 分配、随机、短视贪婪、PPO、SAC 和离散化动作网格上的 DQN。
- 评估设置:
- 主基准:在物理约束奖励下评估所有策略。
- 奖励消融:移除物理惩罚,但记录物理违规和人为流动性。
- 智能体评估:在评估期间,在训练好的强化学习(RL)策略和环境之间插入一个基于大语言模型(LLM)的治理层。
- 主要发现:学习了强化学习策略可以提升经济效用,但仅凭奖励优化可能引入不安全的市场行为。需要物理约束和透明的干预记录来评估自治经济智能体是否不仅有利可图,而且可验证且物理上可靠。
智能体规划器/审计器层
- 设计:一个可选层,仅在评估期间激活,不用于 PPO、SAC 或 DQN 训练。
- 组件:包含 LLM 规划器、LLM 审计器,以及基于规则的规划器/审计器基线。
- 功能:规划器定义回合级行动边界和审计规则;审计器在风险触发条件下被调用,可以批准或修改高风险的行动。
- 记录:结构化日志记录触发信号、提议的行动、修订的行动、行动变化和审计理由。
- 角色:作为一个可审计的风险控制接口,不能完全替代正确指定的物理约束奖励。
数据集托管
- 主托管:数据集托管在 Hugging Face Datasets 上,地址为
https://huggingface.co/datasets/ThomasXu/solarchain-eval。 - 镜像:GitHub 仓库包含一个小的数据镜像,位于
data/datasets_2026_04_month/和data/datasets/。 - 内容:Hugging Face 版本包括数据集卡片、许可证、摘要、校验和、主月度 CSV 文件、烟雾测试 CSV 文件以及 Open-Meteo 缓存。
使用与复现
- 环境配置:通过
conda activate SolarChain-rl创建环境并安装依赖。 - 快速测试:使用
python scripts/evaluate.py命令运行静态、随机、短视策略并进行可视化。 - 框架 CLI:可直接使用 SolarChain-Eval 作为基准框架,无需运行完整的工作流。
- 生成数据集:
python scripts/generate_monthly_datasets.py - 训练基线:
python scripts/train.py或python scripts/run_all_baselines.py - 评估策略:
python scripts/evaluate.py,支持指定训练好的模型路径。 - 运行智能体层:通过
--agentic-mode planner_auditor启用,可配置rule或llm规划器/审计器。 - 生成图表:
python scripts/make_figures.py
- 生成数据集:
- LLM 配置:需设置环境变量
SOLARCHAIN_LLM_API_KEY、SOLARCHAIN_LLM_BASE_URL和SOLARCHAIN_LLM_MODEL。 - 详细复现:参见仓库内的
artifact_pipeline/README.md文件。 - 许可:该项目采用 MIT 许可证。




