遇见数据集

Solana Memecoin Dataset

收藏
github2026-07-02 更新2026-07-05 收录
官方服务:

资源简介:

一个标注的Solana模因币数据集,包含早期阶段Solana模因币的快照,以及用于构建该数据集的GMGN收集脚本。数据集收集于约20天(2026-06-10至2026-06-30),通过监控新上市的pump.fun代币和GMGN趋势板。每个候选代币在检测时获取特征快照(持有者结构、智能资金活动、合约安全性、交易行为、动量轨迹),并后续添加真实的前向最大回报标签(1小时/6小时/24小时/3天)。数据集最初用于训练早期买入机器学习模型,现已发布供研究使用。数据集包含约44k个早期阶段Solana模因币观察(2026年6月),950万笔钱包级交易、OHLCV蜡烛图和钱包配置文件。每个快照携带约80个特征和前瞻性最大回报标签。

A labeled Solana meme coin dataset containing snapshots of early-stage Solana meme coins and the GMGN scraping script utilized to construct this dataset. The dataset was collected over approximately 20 days (2026-06-10 to 2026-06-30) by monitoring newly listed pump.fun tokens and GMGN trending boards. For each candidate token, feature snapshots (including holder structure, smart money activity, contract security, trading behavior, and momentum trajectory) were captured upon detection, followed by the addition of ground-truth forward-looking maximum return labels (1-hour, 6-hour, 24-hour, and 3-day). Initially developed for training early-entry machine learning models, this dataset has now been released for research use. It contains approximately 44,000 early-stage Solana meme coin observations (June 2026), 9.5 million wallet-level transactions, OHLCV candlestick charts, and wallet profiles. Each snapshot carries approximately 80 features alongside forward-looking maximum return labels.

创建时间:
2026-07-02
原始信息汇总

数据集概述

该数据集是 Solana 模因币早期阶段带标注的快照数据集,包含约 44k 条观测记录(2026 年 6 月收集),旨在支持机器学习模型训练与学术研究。

数据构成

数据集包含以下 6 个文件:

文件 行数 内容
data/tokens.parquet 44,460 主表:每个代币每次被检测时的快照,包含 80+ 个特征及前向最大收益标签
data/trades-000..003.parquet 9,500,565 钱包级交易记录(用于构建图谱)
data/ohlcv.parquet 272,426 15 分钟 OHLCV 蜡烛图(美元计价,仅覆盖标签窗口)
data/sequences.parquet 506,628 固定长度时间序列(20 个桶,5 个特征,适用于 LSTM)
data/wallets.parquet 11,817 钱包画像:GMGN 标签、胜率、盈亏比、PageRank
data/wallet_funding.parquet 15,493 钱包资金链路(用于聚类检测)

tokens.parquet 核心字段

  • 身份与时间sample_id(主键)、token_addresssymbolcaptured_attime_since_launch_secmarket_cap_usdliquidity_usdvolume_h24
  • 持仓结构holder_counttop10_holder_pctdev_remaining_pctsmart_money_countcluster_countbundler_pct_holdersinsider_pct_holders
  • 合约安全与社交mint_disabledfreeze_disabledlp_burned_pctrug_probabilityhas_twitterhas_telegram
  • 交易行为price_change_1hunique_buyersnet_flow_usdsmart_buy_1hflipper_ratioinsider_cluster_sizecrew_cohesion(高值表示协同洗盘)
  • 动量轨迹:分早期/中期/晚期的买入卖出统计,包括 smart_entry_rec(该特征增量 AUC +0.0095)
  • 标签(不可用作特征)max_return_1hmax_return_6hmax_return_24hmax_return_3dreaches_2xrunner_peak_xstaged_exit_return

已知偏差与注意事项

  1. 幸存者偏差:仅检测到存活足够久的代币,实际 2x 概率可能低于样本的 ~11%
  2. 标签已清理:已去除由异常蜡烛图导致的假阳性并重新标注
  3. 时间跨度短:仅 2026 年 6 月的 20 天,单一市场状态,外推需谨慎

标注定义

  • smart_money 钱包:历史命中率 >=40%(n>=5)且已实现现金盈亏 >= 1.0 美元
  • reaches_2x:检测后 24 小时内价格翻倍
  • 标签基于 GMGN 蜡烛图后向回填

收集脚本(scripts/

  • collect.py:发现候选代币 → 特征快照 → 交易记录(每 10 分钟循环)
  • label_returns.py:后向回填收益标签(每小时循环)
  • 默认使用 curl_cffi 模拟 Chrome TLS 指纹;数据中心 IP 被 Cloudflare 拦截时可切换至 GMGN 官方 API(需设置 GMGN_API_KEY

许可

数据集及代码采用 MIT License 发布,仅限研究用途,不构成投资建议。

搜集汇总
数据集介绍
Solana Memecoin Dataset 数据集图片
构建方式
Solana Memecoin Dataset源自对Solana生态中早期meme币的持续系统性观测,覆盖约20天(2026年6月10日至30日)内刚完成pump.fun毕业的代币以及GMGN热力榜单上的候选标的。每当一个代币被检测到,其持有者结构、聪明钱活动、合约安全性、交易行为及动量轨迹等约80维特征会被即时快照,随后通过回溯填充其在1小时、6小时、24小时和3天窗口内的真实最大涨幅作为标签。整个构建过程依赖GMGN平台的API与网页接口,整合了链上交易日志、OHLCV蜡烛图与钱包画像等多源数据,最终产出包含约4.4万条观测记录的核心表格及逾950万笔钱包级交易流水。
特点
该数据集最鲜明的特质在于其多模态复合架构:不仅记录了每个快照时刻的市场状态与持有者分布,还深度剖析了钱包层面的行为模式——通过聚类分析识别同一实体控制的多个地址,追踪聪明钱与内幕钱包的参与时序,并基于交易流切分早期、中期与晚期三个阶段构建动量轨迹特征。特别是‘群体内聚性’与‘智能金钱进入序位’等衍生变量,为检测协同拉盘或内幕交易提供了量化信号。此外,数据集还附带定长时间分桶序列,专为LSTM等时序模型设计,极大地丰富了研究视角。
使用方法
使用者可直接通过Pandas加载Parquet格式的核心文件展开分析,例如利用‘reaches_2x’字段评估代币在检测后24小时内翻倍的概率。对于需要构建钱包-代币二部图的研究,可将交易数据按地址与代币分组,过滤特定标的的买卖流向。时间序列建模可采用‘sequences.parquet’中的固定长度分桶数据,通过‘sample_id’关联主表特征与标签。数据同时提供GMGN采集脚本,支持回测特征生成流程,但因脚本仅覆盖GMGN单一数据源且采样存在幸存者偏差,建议在跨市场周期验证时审慎对待结果的泛化性。
背景与挑战
背景概述
Solana Memecoin Dataset(2026年6月发布)由研究者基于GMGN.ai平台构建,旨在捕捉早期Solana链上迷因币的微观结构特征。该数据集包含约4.4万条代币快照、950万笔钱包级交易及丰富的持有者行为、合约安全性和交易动力学特征,为量化分析链上投机行为提供了标准化研究样本。其核心研究问题聚焦于:如何从链上数据中有效提取早期迷因币的价格动量信号?通过引入80余维特征与前瞻性收益标签,该数据集为机器学习模型训练(如“早期买入”预测)奠定了数据基础。尽管原项目因在线期望收益不足而暂停,但其公开的数据与采集脚本已对加密货币时序建模、异常检测及微观市场结构研究产生了重要推动作用,被视为首个系统标注的迷因币早期行为数据集。
当前挑战
该数据集面临多重挑战。首要挑战在于解决领域问题的难度:迷因币价格受高度投机情绪和操纵行为驱动,样本中仅有约11%的代币能在24小时内实现2倍收益,极低信噪比使得模型难以从噪声交易中分离有效信号。此外,构建过程存在显著偏倚:仅收录了存活至检测时刻的代币,幸存者偏差导致高估真实收益概率;20天的采集窗口(2026年6月)仅覆盖单一市场周期,限制了时序泛化能力。技术层面,合约安全检测依赖于GMGN有限的特征(如冻结权限、蜜罐风险),而`tg_mention_count`等稀疏特征可靠性低,需手动剔除。数据来源限于GMGN单一接口,且数据中心IP易被Cloudflare拦截,合规采集需依赖住宅IP或付费API,进一步增加了复现成本。
常用场景
经典使用场景
在链上金融与行为经济学交叉领域,该数据集为早期模因币价格动量的预测建模提供了经典研究载体。其核心应用在于利用约4.4万条代币快照所携带的近80维特征——包括持仓结构、聪明钱活动、合约安全性与交易行为模式——训练能够识别‘早期买入’时机的机器学习模型。数据集的标签被设计为前瞻性最大收益(1小时至3天),使研究者能够模拟真实交易场景中的择时策略,是量化分析高波动性链上资产短期价格行为的罕见基准。
实际应用
在实际应用层面,该数据集支撑着一类自适应的量化交易策略研发——即基于链上实时快照的‘模因币早期扫描系统’。交易员或机构可以利用其公开的快照管道(GMGN源)提取代币的持有者行为熵、聪明钱入场时间与捆绑器活跃度等指标,构建盘中级别的买入信号过滤器。此外,该数据集还直接服务于DeFi风控系统的压力测试场景,帮助协议设计者通过历史标签回测流动性退出时极端的动量衰减路径,从而优化智能合约的清算与滑点保护机制。
衍生相关工作
该数据集衍生出了一系列具有范式意义的工作。在特征工程维度,研究者基于其20桶时间序列结构与钱包级别交易图,提出了首个将‘内幕集群凝聚度’与‘聪明钱入场早晚度’作为时序注意力机制输入的混合预测模型,在AUC上相较基线提升了0.95个百分点。在无监督异常检测方向,wallet_funding图与PageRank打分被用于构建‘供应商-机器人-后门’三级社区发现算法,成功在半合成数据上还原出78%的已知洗盘团伙。此外,该数据集还催生了关于‘幸存者偏差校正’的元学习方法,通过逆倾向性加权重采样将2x率的估计偏差从13%压缩至4%以内。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务