遇见数据集

SynthFin Trading Bench

收藏
github2026-07-21 更新2026-07-23 收录
官方服务:

资源简介:

SynthFin Trading Bench 是一个用于LLM代理的无污染顺序交易基准,基于完全合成的市场数据。它包含1000个股票代码×10个宏观场景的合成数据,生成价格路径、基本面、新闻文章等,确保没有模型可以记忆这些数据,从而构建一个无污染的基准。数据集用于评估语言模型作为投资组合管理器的性能,通过多期决策序列计算风险调整收益和选股能力。

SynthFin Trading Bench is a contamination-free sequential trading benchmark for LLM Agents, built on fully synthetic market data. It encompasses synthetic data across 1000 stock tickers and 10 macroeconomic scenarios, generating price trajectories, fundamental metrics, news articles and other relevant content. The design ensures that no model can memorize the dataset, thereby establishing a fully contamination-free benchmark. This dataset is intended to evaluate the performance of language models acting as portfolio managers, with risk-adjusted returns and stock-picking ability calculated via multi-period sequential decision-making sequences.

创建时间:
2026-07-20
原始信息汇总

数据集核心定位

SynthFin Trading Bench 是一个专为 LLM 智能体设计的无污染序列化交易基准。其核心优势在于合成数据——所有价格路径、基本面数据和新闻文章均由 SynthFin 生成引擎创建,从未公开发布,从根本上杜绝了训练数据污染问题。

核心特点

  • 完全合成、无污染:市场数据为全合成生成,模型无法记忆,确保了基准评估的纯净性。
  • 点及时序视图:每个决策周期,模型接收严格截至决策日的市场数据,包括价格、基本面、新闻、文件等。
  • 无前瞻性:文档按日期、财务报告按提交日期严格限制,执行在决策后的下一交易时段进行。
  • 拆股安全:所有损益在拆股调整后的价格空间内计算,避免了公司行为对份额数的扭曲。
  • 技能评估:核心指标为评估比率(年化 Alpha / 特质波动),衡量扣除市场贝塔后的选股能力。

与其他基准对比

特性 真实市场基准 SynthFin Trading Bench
训练数据污染 通过使用未来数据缓解,随时间退化 不可能——数据为合成且未发布
真实技能信号 通过回归推断 可实现 + 有标注的生成器分解
场景覆盖 取决于市场实际表现 经过策划的宏观场景:AI 泡沫破裂、金融危机重演、COVID、台海封锁、软着陆等
可重复性 数据修订、幸存者偏差 冻结语料库,含内容哈希;确定性重放
刷新 等待新的市场历史 可按需生成全新未见过语料库

运行机制

  1. 输入:语料库提供点及时序观察(价格、新闻、基本面、持仓等)。
  2. 决策:智能体输出目标投资组合权重。
  3. 执行:在下一个交易时段开盘执行订单,并支付交易成本。
  4. 循环:每rebalance_every_days天重复一次。
  5. 评估:通过 NAV 序列和轨迹计算风险调整后收益和选股能力,生成排行榜。

快速开始

  • 安装pip install -e ".[dev]",可选增加 [anthropic]/[openai]/[gemini]/[all] 支持对应模型。
  • 无 API 烟雾测试python -m bench.runner configs/validation_50x10.yaml --run-id smoke
  • 真实模型测试python -m bench.runner configs/default.yaml --run-id demo(需设置 API 密钥)
  • 完整基准测试python -m bench.runner configs/full_1000x10.yaml --run-id v1
  • 生成排行榜python -m bench.leaderboard results/v1

已发布排行榜(1000×10, v1)

  • 测试了 Claude Fable 5、Grok 4.5、GPT-5.5、Gemini 3.5 Flash 等前沿 LLM。
  • 所有 LLM 均出现负收益和负 Alpha,没有一个击败买入并持有基线。
  • 等权再平衡基线(baseline_ew_rebal)表现最佳,年化 Alpha +0.12%,评估比率 +0.14。

仓库结构

  • bench/:核心框架,包括语料库加载、观察构建、模拟器、评分和智能体适配器。
  • configs/:配置文件(50×10, 默认, 1000×10)。
  • docs/:方法论、数据卡片、污染说明、发布说明。
  • scripts/:工具脚本(哈希、子集、构建网站、上传)。
  • tests/:不变性测试(无前瞻、会计、归因、CAPM)。

扩展性

  • 新模型提供商:子类化 LLMAgent,实现 _client_init_complete,在 __init__.py 注册。
  • 新基线:在 bench/agents/baselines.py 中添加策略。
  • 新语料库:任何 SynthFin 导出格式(index.json + structured/ + unstructured/)均可直接使用,需设置 corpus_path
搜集汇总
数据集介绍
SynthFin Trading Bench 数据集图片
构建方式
SynthFin Trading Bench是基于完全合成数据构建的交易基准测试集,旨在评估大语言模型作为投资组合管理者的能力。该数据集通过SynthFin生成引擎模拟完整的市场生态,包括价格路径、基本面数据、新闻文本及监管文件等,每个数据点均带有精确的时间戳以确保点时间视图。构建过程采用分场景策略,覆盖AI泡沫破裂、全球金融危机重演、疫情冲击、地缘冲突等十种宏观情景,每种情景包含1000只股票的完整历史轨迹。所有数据均为首次生成发布,从根本上杜绝了训练数据污染问题,并通过内容哈希确保数据集的确定性与可复现性。
特点
该数据集最为突出的特性在于其抗污染性设计——所有合成数据从未在公开领域出现,模型无法通过记忆获取任何先验知识,使得评估结果真实反映模型的决策能力。数据集提供多维度的点时间观测数据,包括价格序列、季度财务报表、盈余惊喜、分析师预期、机构持仓及内幕交易等结构化信息,以及新闻、公告和会议记录等非结构化文本,每种数据均受制于自身的可用性日期。评估体系采用CAPM模型回归得到的评估比率(Appraisal Ratio)作为核心指标,能够有效区分模型的选择技能与市场运气,配合因子归因分析进一步解析收益来源。
使用方法
使用者通过pip安装核心工具包后,可直接运行内置的50×10验证数据集进行免API测试。运行命令采用YAML配置文件驱动,支持验证(validation_50x10)、默认(default)和完整(full_1000x10)三种规模配置。每次运行自动生成包含运行元数据、逐场景轨迹、评分结果和排行榜的完整报告。对于新的模型接入,只需继承LLMAgent基类并实现客户端初始化和补全方法;新的基准策略可通过添加至baselines.py实现扩展;新的语料库支持任何符合SynthFin导出格式的数据集直接接入,通过修改corpus_path配置即可切换。
背景与挑战
背景概述
在金融交易领域,大语言模型(LLM)的决策能力评估长期受困于训练数据污染与真实市场不可复现的困境。传统的真实市场基准如StockBench,由于模型可能记忆历史数据,导致绩效评估存在系统性偏差。2025年,由SynthFin团队开发的SynthFin Trading Bench基准应运而生,该基准通过完全合成生成的价格路径、基本面与新闻数据,构建了一个无缝染的序贯交易评估框架。核心研究问题在于:LLM能否在零先验知识条件下展现出超越简单买入持有策略的选股能力?基于1000只股票×10个宏观情景的大型语料库测试,包括Claude Fable 5、GPT-5.5在内的前沿模型均录得负收益且未击败基线,这一惊人结果不仅揭示了当前LLM在金融决策中的深层局限,更为计算金融与人工智能交叉领域树立了全新的评估范式。
当前挑战
该基准面临双重挑战。从领域问题看,首要挑战在于解决LLM在金融时序决策中普遍存在的“伪能力”现象——模型可能依赖记忆的价格模式而非真实的市场理解来获利,SynthFin通过合成数据从根本上切断了这一捷径,但如何确保合成市场的统计特性与真实市场等价以维持评估有效性,仍是开放问题。从构建过程看,挑战集中于三点:其一,生成引擎需在合成时模拟2008年金融危机、AI泡沫破裂等极端情景,确保情景覆盖的多样性与现实感;其二,必须严格实施点时间(point-in-time)数据观测,杜绝任何未来信息泄露,这要求对每个决策时刻的价格、新闻、财报按实际可用日期精确切割;其三,为支撑模型排序的统计显著性,需构建足够大的语料库(1000只股票×10年),并与公开数据保持内容哈希可验证的完整性。
常用场景
经典使用场景
SynthFin Trading Bench 的核心用途在于评估大语言模型(LLM)作为投资组合管理者的时序决策能力。在该场景下,模型在每个决策周期收到严格按时间点对齐的市场快照,涵盖价格、基本面、新闻及监管文件等多源信息,并需输出目标仓位权重。系统随后以下一交易日的开盘价执行订单并扣除交易成本,历经多年度回测后,基于风险调整收益与选股能力对模型绩效进行量化评分。这一框架尤其适用于检验LLM在多步决策中整合异质信息、抵御市场噪声与规避数据污染的真实交易水平。
实际应用
在实际量化投资领域,SynthFin Trading Bench可作为私募基金、资产管理公司及金融科技机构遴选与验证LLM投资策略的标准化沙盒。机构可利用其生成的分层数据集,在不涉及真实资本与市场隐私的前提下,测试模型在极端行情、高换手率约束及交易成本冲击下的组合管理表现。此外,该框架亦可用于监控与审计模型漂移——当前沿LLM版本更新后,同一套合成基准可快速复现其交易绩效,从而为部署决策提供稳健的边际安全保障。
衍生相关工作
围绕SynthFin Trading Bench已衍生了多项标志性工作:首先是基于CAPM回归的评估范式的确立,其中关键绩效指标(如评估比率和生成器归因分析)成为后续模型对比的统一度量。其次,该基准催生了多种针对LLM交易行为的归因研究,例如解析模型在新闻文本理解与基本面信号提取间的能力分离。此外,公开排行榜上不同模型在各宏观经济场景下的表现差异,直接推动了对抗性提示工程、分层仓位约束及决策链可解释性等方法来提升LLM金融推理稳健性的研究分支。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务