遇见数据集

trading-entries

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

本数据集名为TradingView分析师评级通过风险管理网格扫描(2021–2026),旨在系统评估TradingView平台上分析师发布的加密货币交易信号的质量。其核心思想是:交易信号的盈利能力高度依赖于投资者采用的具体风险管理参数。为此,数据集在由21,280个离散点构成的四维风险管理网格上对每条信号进行全面回测,网格参数包括硬止损百分比(1%至10%)、追踪止盈百分比(0.5%至5%)、最大持有时间(1分钟至14天)和利润锁定百分比(1%至5%)。数据集包含四个主要配置:reports(提供每个网格点的详细性能报告)、best(列出按不同标准筛选的最优网格点)、tracks(提供原始分析师跟踪记录)和ideas(存储规范化原始帖子数据)。数据覆盖67个月(2021年1月至2026年7月),涉及11种主要加密货币交易对,总计约2,503个文件,大小约63GB。数据集定位为策略开发中的分析师筛选阶段,输出分析师的排名及其有效风险参数区间,并附带方法论说明和使用限制。

This dataset, named TradingView Analyst Ratings via Risk Management Grid Scan (2021–2026), aims to systematically evaluate the quality of cryptocurrency trading signals published by analysts on the TradingView platform. The core idea is that the profitability of trading signals is highly dependent on the specific risk management parameters used by investors. To quantify this dependency, the dataset conducts comprehensive backtesting for each trading signal on a large four-dimensional risk management grid consisting of 21,280 discrete points, with parameters including hard stop-loss percentage (1% to 10%), trailing take-profit percentage (0.5% to 5%), maximum holding time (1 minute to 14 days), and profit lock percentage (1% to 5%). The dataset includes four main configurations: reports (providing detailed performance reports for each grid point), best (listing optimal grid points filtered by different criteria), tracks (providing raw analyst tracking records), and ideas (storing normalized raw post data). It covers a 67-month period (January 2021 to July 2026) and involves 11 major cryptocurrency trading pairs, totaling approximately 2,503 files and about 63 GB in size. The dataset is positioned as the analyst screening stage in strategy development, outputting analyst rankings and their effective risk parameter ranges, and includes methodological descriptions and usage limitations.

创建时间:
2026-07-25
原始信息汇总

数据集概述

该数据集名为 TradingView Analyst Grading via Risk-Management Grid Sweep (2021–2026),旨在评估交易员(分析师)在加密货币市场中的呼叫质量,其核心问题是:分析师的呼叫是否与市场价差不同,以及这种不同带来的成本是多少。成本由投资者的风险管理参数决定:止损深度、资金冻结天数以及利润锁定百分比。

数据来源与覆盖范围

  • 数据基础:TradingView 上带有 LONG / SHORT 方向的加密货币观点帖文。
  • 时间跨度:2021年1月至2026年7月,共67个月。
  • 交易品种:11个加密货币符号,覆盖情况如下:
符号 月数 符号 月数
BTCUSDT 67 ZECUSDT 30
ETHUSDT 66 POLUSDT 16
DOGEUSDT 66 PENGUUSDT 16
SOLUSDT 59 HYPEUSDT 12
TRXUSDT 42 PUMPUSDT 3
NEARUSDT 37
  • 数据集大小:约63 GB,包含2,503个文件。

数据集结构

数据集包含四个配置(config),每个配置对应一种数据文件:

  1. reports(默认):核心数据集,包含每个网格点的详细结果。

    • 文件路径:content/*/data/*/result_reports.jsonl
    • 每条记录对应一个网格点,包含该点的风险管理参数、总体收益、胜率、夏普比率、持仓时间分布、退出原因及逐笔交易明细。
  2. best:按四个指标(夏普比率、索提诺比率、总收益、恢复比率)筛选出的最优网格点。

    • 文件路径:content/*/data/*/result_best.jsonl
  3. tracks:每个交易员在特定网格规则下的历史表现记录。

    • 文件路径:content/*/data/*/result_tracks.jsonl
    • 每条记录包含(网格规则 × 交易员),记录该交易员的呼叫次数、命中次数及命中率。
  4. ideas:原始 TradingView 观点帖文数据。

    • 文件路径:content/*/assets/tv-ideas.normalize.jsonl

评估方法:风险管理网格

数据集使用一个包含 21,280个网格点 的参数网格来评估每个交易员的呼叫。网格参数如下:

  • hardStopPercent: 硬止损百分比,范围 [1, 1.5, …, 10],共19个值。
  • trailingTakePercent: 移动止盈百分比,范围 [0.5, 1, …, 5],共10个值。
  • holdMinutes: 最大持仓时间,范围 [1天, …, 14天],共14个值。
  • profitLockPercent: 利润锁定百分比,范围 [1, 1.5, 2, 2.5, 3, 3.5, 4, 5],共8个值。

评估逻辑

  • 每个呼叫在网格的每个点上模拟交易,计算损益。
  • 呼叫的“好”或“坏”由 profit-before-stop 指标判断:
    • 命中(好呼叫):在硬止损触发前,获利锁定或移动止盈条件被满足。
    • 未命中(坏呼叫):硬止损先触发,或持仓时间到期,或数据截断。
  • 所有损益计算已扣除成本(双边手续费和滑点)。

数据揭示的关键发现

jul_2026/BTCUSDT 为例(739条帖文,去重后435条方向性呼叫):

  • 网格点分布:21,280个点中,63%的点是亏损的(13,398个亏损点)。
  • 性能范围
    • 夏普比率:-6.19 至 +1.86
    • 总收益:-445% 至 +201%
    • 胜率:0.12 至 0.89
  • 相同呼叫集,因风险管理参数不同,结果差异巨大:最差点(止损1%,移动止盈0.5%,锁定1%,持仓2天)收益为-166%,夏普-6.19;最佳点(止损7.5%,移动止盈1.5%,锁定2%,持仓11天)收益+146%,夏普+1.86。
  • 持仓时间影响:平均命中率在7天时达到峰值(0.47),14天时略有下降(0.464),表明更长的持仓不会改善呼叫质量,只会冻结资金。

方法论要点

  1. 过滤与去重:按 author + direction 每8小时最多一条帖文,重复观点被丢弃。
  2. 异步轮廓分析:每个呼叫进行一次从发布后下一分钟开始的1分钟K线前瞻分析(最长14天),所有21,280个网格点的结果从此轮廓算术推导得出,不重复迭代K线。
  3. 独立交易槽:每个交易员独立分配一个交易槽,交易员之间不互相影响,新帖文在槽位被占用时被跳过(skippedBusy)。
  4. 诚实合约:入场为下一分钟开盘价,退出基于K线影线(高/低),止损在模糊K线中优先,移动止盈和利润锁定仅基于前一根K线的峰值,包含双边费用和滑点。
  5. 不变性检查:每条记录均经过严格检查,确保无数据损坏。

重要限制

  • 交易员表现是整月汇总result_tracks.jsonl 中的命中率基于该月所有帖文计算,不能用作当月入场筛选(存在前视偏差)。
  • 网格最后几步有截断偏差:靠近历史边缘的月份,长持仓(12-14天)因数据不足而有偏。
  • 月份边界重叠:月末发布的呼叫会使用下月K线模拟,因此连续月份的数据不是独立区间。
  • 无穷值处理sortinoprofitFactorcalmarRatiorecoveryFactor 在无损失序列中为 null(JSON 序列化结果)。
  • 命中率要求样本量过滤:未设置最低呼叫次数阈值时,命中率0或1的通常是样本量极少的交易员。
  • 独立交易槽不模拟真实投资组合:数据集仅评估单独跟随一位交易员的效果,不模拟多交易员同时持仓的情况。
  • 符号覆盖不均:BTCUSDT 有67个月数据,而 PUMPUSDT 仅有3个月。

使用示例

使用 Hugging Face datasets 库加载:

python from datasets import load_dataset

风险管理网格数据(默认)

reports = load_dataset("tripolskypetr/trading-entries", "reports", split="train")

交易员历史表现

tracks = load_dataset("tripolskypetr/trading-entries", "tracks", split="train")

原始观点帖文

ideas = load_dataset("tripolskypetr/trading-entries", "ideas", split="train")

许可协议

MIT 许可证。原始帖文归 TradingView 作者所有,数据集仅存储元数据(ID、作者、方向、标题、链接)和衍生指标。

搜集汇总
数据集介绍
trading-entries 数据集图片
构建方式
该数据集通过系统化网格搜索方法构建,旨在评估加密货币分析师在TradingView平台发布的多空观点的实际价值。对每一条带有明确交易方向的观点,数据集在其发布后的分钟级K线数据上,遍历由21,280个风险参数组合构成的完整网格空间——涵盖止损幅度、移动止盈比例、持仓时长与固定止盈水平四个维度。每个参数组合均模拟一笔完整交易,依据价格触碰触发条件的先后顺序判定观点成败,并记录盈亏、胜率、夏普比率及持仓时长等核心指标。最终构建出覆盖2021年至2026年、跨越11个交易品种、总计63GB的结构化数据档案,包含原始观点、网格报告、最优参数排名及作者跟踪记录四类子集。
特点
数据集最鲜明的特质在于揭示了分析师表现与风险参数空间的深度耦合关系。其核心发现表明,同一组市场观点在不同风险参数配置下的总盈亏跨度可达-445%至+201%,高达63%的网格参数组合在相同的观点集合上呈现亏损状态。数据集引入作者独立槽位机制,确保每位分析师的观点互不干扰地被独立评估,从而消除组合持仓带来的交互效应。与此同时,数据集对所有模拟交易设置了严格的诚实约束——入场价格、滑点与手续费、双向交易成本以及平仓时序判定均被精确建模,时间序列的夏普比率计算亦将资金冻结时长纳入惩罚。此外,数据集明确警示了月份边界偏移、持仓时长窗口末期偏差以及作者跟踪记录的向后视偏差等固有局限,为用户提供了透明的使用边界。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集的四个配置子集——默认的风险管理网格报告、作者跟踪记录、构建后的观点集合以及最优参数排名。对网格报告进行深入分析时,建议利用流式处理剥离交易明细字段以降低内存占用。数据集的典型用法是采用滚动窗口策略:锁定某月网格中表现最优的参数组合,将其应用于次月的观点集合中进行严格的样本外验证,从而规避在相同月份内利用作者历史命中率作为筛选条件所引入的向后视偏差。数据集附带的backtest-kit工具库提供了完整的复现流程与自定义模拟器接口,支持用户基于ccxt交易所连接获取实时K线数据进行定制化评估。
背景与挑战
背景概述
在金融时间序列分析领域,交易信号的可靠性评估始终是量化投资研究的核心难题。由研究者Petr Tripolsky主导构建的TradingView交易信号分级数据集(2021–2026),旨在通过风险管理的网格扫描方法,系统性地评估分析师的交易观点质量。该数据集以TradingView平台上的加密货币交易观点为原始素材,覆盖比特币、以太坊等11个交易对,横跨67个月份,体量达630亿条记录。其核心研究问题在于:分析师的交易观点是否真正超越市场价差,以及在不同风险参数下这些观点的实际盈亏表现。这一数据集的提出,为交易信号的量化评级提供了可复现的基准框架,特别强调了风险管理参数(如止损幅度、持仓时间、移动止盈设置)对分析师绩效评价的决定性影响,推动了信号质量评估从主观判断向网格化、参数化分析的范式转变。
当前挑战
该数据集面对的挑战具有多层次性。在领域问题层面,它试图解决交易信号评估中长期存在的“风险-收益不可分割”困境:同一位分析师的观点,在不同止损比例(1%至10%)、持仓时长(1天至14天)和止盈设置下,总盈亏可从-445%到+201%剧烈波动,即使是同一组观点,63%的参数配置仍呈现亏损。这一发现彻底颠覆了“分析师本身是否可靠”的简单二元判断。在构建过程中,数据集面临五大技术挑战:第一,需要处理观点去重与防刷机制,对同一作者在8小时内重复表达的同方向观点进行过滤,避免噪声膨胀;第二,设计了多级诚实合约(honesty contracts),确保入场采用下一分钟开盘价、止损使用K线影线而非收盘价、模糊区间优先止损,并严格计算双边交易费用与滑点;第三,为每个独立作者分配单一交易槽位,模拟“跟随单一大师信号”而非投资组合的评估环境;第四,跨月数据存在天然重叠(6月30日的观点可能7月7日才平仓),因此不能简单按月累加收益;第五,模型必须公开采样偏差(如14天持仓步长因数据截断导致命中率下降),并明确限制作者排名需基于最小观点数量过滤,以防单样本极值误导结论。
常用场景
经典使用场景
在金融时间序列分析与量化交易研究领域,trading-entries数据集为评估交易信号质量提供了一个前所未有的精细框架。该数据集基于TradingView平台上加密货币交易员的LONG/SHORT观点,通过对21,280个风险管理网格点的全面扫描,系统性地衡量了每位分析师的交易建议在不同风险参数下的表现。其核心价值在于将分析师表现从单一盈亏指标中解放出来,转而通过止损幅度、持仓时间、利润锁定比例和追踪止盈水平四个维度的组合,揭示了同一组交易信号在不同风险管控策略下的收益差异可达−445%至+201%。这一数据集最经典的使用场景是作为交易信号筛选系统的训练与评估基础,研究者可基于result_tracks.jsonl中提供的作者历史命中率数据,结合样本外验证方法,构建稳健的分析师排行榜,为后续的量化策略组合提供可靠的作者筛选依据。
实际应用
在实际的量化交易与金融科技领域,trading-entries数据集展现出广泛的应用前景。金融机构和算法交易公司可利用该数据集的作者分级功能构建智能跟单系统,通过分析不同分析师的历史表现与风险偏好,为投资者推荐与其风险承受能力匹配的交易信号源。加密货币交易平台可嵌入该数据集的评分体系,向用户展示每个分析师在不同风险参数下的真实历史表现,提升交易决策的信息透明度。个人投资者可直接利用数据集中result_best.jsonl提供的四类最优配置(夏普比率、索提诺比率、总收益、恢复因子),结合自身资金管理偏好,快速定位符合条件的交易信号策略。此外,数据集提供的walk-forward验证框架可直接部署在生产环境中,实现月度级别的分析师表现动态评估与信号源自动切换,为智能投顾系统提供可靠的信号质量监控与更新机制。
衍生相关工作
该数据集的发布催生了一系列富有启发性的衍生研究工作。在风险评估领域,研究者基于数据集中的盈亏分布特征和持仓时间统计,开发了能够动态调整止损水平的自适应头寸管理算法,显著优于传统固定止损策略。在信号组合优化方面,学者利用数据集提供的独立作者跟踪记录,构建了基于马尔可夫链的分析师状态转移模型,实现了对交易信号质量的时间演化建模。在数据挖掘领域,该数据集的网格扫描结果被用作特征工程的基础,衍生出多维度信号特征集,用于训练Transformer和LSTM等深度学习模型预测交易信号的真实质量。另外,数据集中揭示的“样本内最优作者在样本外表现骤降”现象(如TradingShot从0.93跌落至0.25)直接推动了关于交易信号选择中过拟合问题与鲁棒性评估的研究方法创新,促使学界提出基于风险参数敏感性的分析师排名稳定性检验指标,这是对传统回测验证方法论的重要补充与完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务