SynthFin Trading Bench
收藏资源简介:
SynthFin Trading Bench 是一个用于LLM代理的无污染顺序交易基准,基于完全合成的市场数据。它包含1000个股票代码×10个宏观场景的合成数据,生成价格路径、基本面、新闻文章等,确保没有模型可以记忆这些数据,从而构建一个无污染的基准。数据集用于评估语言模型作为投资组合管理器的性能,通过多期决策序列计算风险调整收益和选股能力。
SynthFin Trading Bench is a contamination-free sequential trading benchmark for LLM Agents, built on fully synthetic market data. It encompasses synthetic data across 1000 stock tickers and 10 macroeconomic scenarios, generating price trajectories, fundamental metrics, news articles and other relevant content. The design ensures that no model can memorize the dataset, thereby establishing a fully contamination-free benchmark. This dataset is intended to evaluate the performance of language models acting as portfolio managers, with risk-adjusted returns and stock-picking ability calculated via multi-period sequential decision-making sequences.
数据集核心定位
SynthFin Trading Bench 是一个专为 LLM 智能体设计的无污染序列化交易基准。其核心优势在于合成数据——所有价格路径、基本面数据和新闻文章均由 SynthFin 生成引擎创建,从未公开发布,从根本上杜绝了训练数据污染问题。
核心特点
- 完全合成、无污染:市场数据为全合成生成,模型无法记忆,确保了基准评估的纯净性。
- 点及时序视图:每个决策周期,模型接收严格截至决策日的市场数据,包括价格、基本面、新闻、文件等。
- 无前瞻性:文档按日期、财务报告按提交日期严格限制,执行在决策后的下一交易时段进行。
- 拆股安全:所有损益在拆股调整后的价格空间内计算,避免了公司行为对份额数的扭曲。
- 技能评估:核心指标为评估比率(年化 Alpha / 特质波动),衡量扣除市场贝塔后的选股能力。
与其他基准对比
| 特性 | 真实市场基准 | SynthFin Trading Bench |
|---|---|---|
| 训练数据污染 | 通过使用未来数据缓解,随时间退化 | 不可能——数据为合成且未发布 |
| 真实技能信号 | 通过回归推断 | 可实现 + 有标注的生成器分解 |
| 场景覆盖 | 取决于市场实际表现 | 经过策划的宏观场景:AI 泡沫破裂、金融危机重演、COVID、台海封锁、软着陆等 |
| 可重复性 | 数据修订、幸存者偏差 | 冻结语料库,含内容哈希;确定性重放 |
| 刷新 | 等待新的市场历史 | 可按需生成全新未见过语料库 |
运行机制
- 输入:语料库提供点及时序观察(价格、新闻、基本面、持仓等)。
- 决策:智能体输出目标投资组合权重。
- 执行:在下一个交易时段开盘执行订单,并支付交易成本。
- 循环:每
rebalance_every_days天重复一次。 - 评估:通过 NAV 序列和轨迹计算风险调整后收益和选股能力,生成排行榜。
快速开始
- 安装:
pip install -e ".[dev]",可选增加[anthropic]/[openai]/[gemini]/[all]支持对应模型。 - 无 API 烟雾测试:
python -m bench.runner configs/validation_50x10.yaml --run-id smoke - 真实模型测试:
python -m bench.runner configs/default.yaml --run-id demo(需设置 API 密钥) - 完整基准测试:
python -m bench.runner configs/full_1000x10.yaml --run-id v1 - 生成排行榜:
python -m bench.leaderboard results/v1
已发布排行榜(1000×10, v1)
- 测试了 Claude Fable 5、Grok 4.5、GPT-5.5、Gemini 3.5 Flash 等前沿 LLM。
- 所有 LLM 均出现负收益和负 Alpha,没有一个击败买入并持有基线。
- 等权再平衡基线(
baseline_ew_rebal)表现最佳,年化 Alpha +0.12%,评估比率 +0.14。
仓库结构
bench/:核心框架,包括语料库加载、观察构建、模拟器、评分和智能体适配器。configs/:配置文件(50×10, 默认, 1000×10)。docs/:方法论、数据卡片、污染说明、发布说明。scripts/:工具脚本(哈希、子集、构建网站、上传)。tests/:不变性测试(无前瞻、会计、归因、CAPM)。
扩展性
- 新模型提供商:子类化
LLMAgent,实现_client_init和_complete,在__init__.py注册。 - 新基线:在
bench/agents/baselines.py中添加策略。 - 新语料库:任何 SynthFin 导出格式(
index.json+structured/+unstructured/)均可直接使用,需设置corpus_path。




