遇见数据集

Pumpfun_Memecoin_Corpus

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

PumpFun Launch-to-Graduation Corpus 是一个专注于 Solana 区块链上 pump.fun 平台代币发行全生命周期的高质量数据集。数据集覆盖了从2026年6月5日至7月14日连续39天的时间窗口,通过 WebSocket 和链上 RPC 轮询实时收集,完整记录了每个代币从在 bonding curve 上出现、经过交易、15秒状态快照,直到毕业(或沉寂)以及毕业后的价格和流动性变化。数据集包含六个关联表格:tokens(798,430行,每行对应一个代币的发行参数、创建者历史、持有者集中度、毕业状态)、trades(33,581,765行,每笔交易记录买卖方向、价格、bonding curve 状态、钱包地址)、snapshots(26,934,864行,每个代币在毕业前每15秒的 bonding curve 状态快照)、postgard_snapshots(1,392,133行,毕业代币在毕业后的 DEX 价格、流动性、成交量快照)、postgard_outcomes(5,669行,每行对应一个毕业代币的标注结果,如 major_pump、minor_pump、sustained、pump_dump、dead 等,包含峰值价格/市值、24h/48h 流动性存活情况)、wallet_stats(1,016,374行,每个钱包的首次/最后出现时间、活动摘要)以及 migrations(5,701行,每个毕业事件一行)。共有5,689个代币毕业(占发行总量的0.71%),毕业率在39天内增长了约900倍,呈现出非平稳时间序列特征。该数据集适用于欺诈检测、发射时间成功预测、模因币市场微观结构研究、创建者与钱包行为分析以及制度变迁与非平稳性研究。数据集以 MIT 许可证发布,要求引用时注明出处,并且已知存在数据质量问题,需查阅 KNOWN_ISSUES.md 文件以获取详细处理说明。

The PumpFun Launch-to-Graduation Corpus is a high-quality dataset focusing on the full life cycle of token launches on the pump.fun platform built on the Solana blockchain. The dataset covers a continuous 39-day time window from June 5 to July 14, 2026. Real-time data is collected via WebSocket and on-chain RPC polling, comprehensively recording the entire process of each token: from its emergence on the bonding curve, through trading, 15-second state snapshots, until graduation (or dormancy), as well as post-graduation price and liquidity changes. The dataset comprises seven associated tables (labeled as six for brevity in the original text): 1. `tokens`: 798,430 rows, with each row corresponding to a token's issuance parameters, creator history, holder concentration, and graduation status; 2. `trades`: 33,581,765 rows, with each entry recording the transaction direction, price, bonding curve state, and wallet address for every trade; 3. `snapshots`: 26,934,864 rows, containing 15-second bonding curve state snapshots of each token prior to graduation; 4. `postgard_snapshots`: 1,392,133 rows, storing snapshots of DEX prices, liquidity, and trading volume for graduated tokens after their graduation; 5. `postgard_outcomes`: 5,669 rows, with each row containing annotated results for a graduated token, such as major_pump, minor_pump, sustained, pump_dump, dead, etc., including peak price/market capitalization, and 24h/48h liquidity survival status; 6. `wallet_stats`: 1,016,374 rows, recording the first/last appearance time and activity summary for each wallet; 7. `migrations`: 5,701 rows, with one row per graduation event. A total of 5,689 tokens graduated, accounting for 0.71% of the total issued tokens. The graduation rate increased approximately 900-fold over the 39-day period, exhibiting non-stationary time series characteristics. This dataset is applicable to research areas including fraud detection, launch success prediction, meme coin market microstructure research, creator and wallet behavior analysis, as well as studies on institutional change and non-stationarity. The dataset is released under the MIT License, requiring proper citation of the original source. Known data quality issues exist, and users are advised to refer to the KNOWN_ISSUES.md file for detailed processing instructions.

创建时间:
2026-08-01
原始信息汇总

PumpFun Launch-to-Graduation Corpus (Jun–Jul 2026)

数据集概述

这是一个覆盖 2026年6月5日至7月14日(共39天)的pump.fun平台代币全生命周期数据集,包含 798,430个代币发布33,581,765笔交易26,934,864条债券曲线快照。数据集不仅涵盖代币从债券曲线出现到毕业(或沉寂)的完整过程,还包含毕业后的价格与流动性数据。

核心特征

数据规模

  • 发布代币数:798,430个
  • 交易记录:33,581,765笔
  • 债券曲线快照:26,934,864条
  • 毕业后快照:1,392,133条
  • 毕业代币结果:5,669条
  • 钱包统计:1,016,374条
  • 毕业事件:5,701条
  • 毕业率:5,689个代币毕业(占0.71%)

表格结构(6张关联表)

表名 粒度 内容
tokens.parquet 每代币一行 发布参数、创建者历史、持有者集中度、毕业状态
trades.parquet 每笔交易一行 买卖方向、价格、债券曲线状态、钱包地址
snapshots.parquet 每代币每轮询间隔一行 毕业前债券曲线消耗、买入压力、交易速度
postgard_snapshots.parquet 每毕业代币每轮询间隔一行 DEX价格、流动性、成交量
postgard_outcomes.parquet 每毕业代币一行 标注结果(major_pump、minor_pump、sustained、pump_dump、dead)、峰值价格/市值、24h/48h流动性存活
wallet_stats.parquet 每钱包一行 首次/末次出现时间、活动摘要
migrations.parquet 每毕业事件一行 毕业事件记录

数据特点

  • 通过WebSocket和链上RPC轮询收集,覆盖完整39天窗口,非抽样或精选数据
  • 提供债券曲线阶段的细粒度数据(多数公开数据源仅覆盖毕业后)
  • 包含计算并验证的毕业结果标签
  • 附有完全量化的数据质量审计报告(KNOWN_ISSUES.md),标注污染来源、行数、根因和处理规则

应用场景

  1. Rug风险与欺诈检测 — 结合持有者集中度、创建者历史和债券曲线动态,对照确认的结果标签(rug_detected、outcome_label)
  2. 发布时毕业预测 — 15秒粒度的债券曲线早期活动数据,预测代币毕业结果
  3. Memecoin市场微观结构研究 — 交易级别的买入压力、钱包集中度、交易强度分析
  4. 创建者与钱包行为研究 — 跨语料库的钱包完整交易历史,对照其创建/交易的代币
  5. 机制与非平稳性研究 — 真实39天窗口,包含多个已确认的平台级变化

数据质量说明

数据集存在 已记录和量化的数据质量问题,部分问题需正确处理。详细说明、根本原因和精确处理指令见 KNOWN_ISSUES.md 文件。主要问题包括:

  • 平台制度断裂
  • wallet_stats.parquet 数据过期问题
  • 债券曲线消耗的有限过冲问题

文件内容

  • tokens.parquet(已修正的代币表,包含top10_pct_suspect标记)
  • trades.parquetsnapshots.parquetpostgard_snapshots.parquetpostgard_outcomes.parquetwallet_stats.parquetmigrations.parquet(按收集原样提供)
  • KNOWN_ISSUES.md(完整数据质量参考)
  • quickstart.py(可运行示例,需duckdb)

许可与来源

  • 许可协议:MIT
  • 收集方式:WebSocket + Solana链上RPC轮询,持有者数据来自第三方API
  • 隐私:仅包含公开的伪匿名链上钱包地址和用户提交的代币名称/符号
  • 引用:Slink Dev (slink21taken). PumpFun Launch Corpus. 2026.

相关研究

基于该数据集的3篇论文正在推进中:

  1. Rug风险聚类与生存分析 — 验证的毕业代币高Rug风险聚类,Cox生存模型
  2. 发布时毕业预测 — 基于0-10分钟债券曲线活动的系综模型,跨100折交叉验证
  3. 创建者经济与Memecoin市场行为 — 钱包级别盈利证据、毕业速度效应、创建者经验对发布设计的影响
搜集汇总
数据集介绍
Pumpfun_Memecoin_Corpus 数据集图片
构建方式
在加密货币与去中心化金融领域,meme币的完整生命周期数据长期稀缺,多数公开数据或始于毕业之后,或缺乏可追溯的历史。该数据集通过websocket与链上RPC轮询,于2026年6月5日至7月14日连续39天不间断采集pump.fun平台全部代币发行事件,涵盖从绑定曲线初始状态到毕业或沉寂的每一笔交易、每15秒状态快照、毕业后价格与流动性追踪以及钱包活动记录。采集过程未作抽样或遴选,所有代币均被纳入,最终形成六个以mint和wallet为键的关联表,并配以量化的数据质量审计文档。
特点
该数据集规模庞大且粒度精细,包含798,430个代币发行、3358万笔交易、2693万条绑定曲线快照及毕业后结果标签,标签涵盖major_pump、minor_pump、sustained、pump_dump和dead五类。其核心特点在于覆盖代币完整生命周期,而非仅限毕业后阶段;提供从代币级、交易级到钱包级的跨表关联分析能力;毕业率在39天内上升约900倍,构成真实的非平稳时间序列。此外,数据集主动公开已知数据质量问题及其根因与处理规则,增强了研究的可复现性。
使用方法
使用者可通过DuckDB加载Parquet文件,并运行附带的quickstart.py示例,该脚本会应用核心数据质量过滤并计算毕业率与创作者经验层级的关系。分析前需阅读KNOWN_ISSUES.md以正确处理数据污染与制度断点。典型用法包括:利用持有集中度、创作者历史与绑定曲线动态进行rug风险与欺诈检测;基于发行后前十分钟的绑定曲线活动构建毕业预测模型;研究meme币市场微观结构、创作者与钱包行为以及平台制度变迁。数据以CC BY 4.0许可发布,需适当引用。
背景与挑战
背景概述
随着Solana链上Meme币生态的迅速膨胀,pump.fun平台成为观察散户投机行为与代币发行机制的重要窗口。然而,既有公开数据大多始于代币毕业之后,缺失了从曲线启动到流动性迁移的关键阶段。为填补这一空白,研究人员于2026年构建了PumpFun Launch-to-Graduation Corpus,连续39天逐秒追踪798,430个代币的完整生命周期,涵盖3,358万笔交易与2,693万条曲线快照,并标注了全部毕业结局。该数据集为Meme币领域的欺诈检测、早期成功预测与市场微观结构研究提供了首个全链路、带标签的实证基础,有望推动链上金融风险分析的范式转变。
当前挑战
该数据集所应对的领域问题极具挑战:Meme币发行高度投机,代币在数秒内可能经历暴涨与归零,传统的事后价格抓取难以捕捉早期风险信号,而毕业率仅0.71%的极端不平衡分布更使预测任务困难重重。构建过程中亦面临多重障碍,包括连续39天不间断采集所导致的数据缺失与中断、bonding-curve供应量在特定模式下的计算偏差、钱包统计表的时效性滞后,以及曲线耗尽速度的有界过冲现象。这些数据质量问题已在KNOWN_ISSUES.md中量化记录,但如何在不引入偏差的前提下清洗与利用这些数据,仍是研究者必须审慎处理的现实挑战。
常用场景
经典使用场景
在加密货币与去中心化金融的交叉研究中,模因币的发行与演化机制日益成为焦点。Pumpfun_Memecoin_Corpus 作为首个完整捕获代币从绑定曲线诞生到毕业(或沉寂)全生命周期的数据集,其最经典的使用场景在于对代币发行早期信号与最终结果之间关联的精细刻画。研究者可基于 15 秒粒度的绑定曲线快照与逐笔交易记录,构建高分辨率的代币成长轨迹,从而在秒级时间尺度上审视买入压力、曲线枯竭速度及钱包集中度等动态特征。这一场景不仅弥补了以往公开数据多始于毕业后的盲区,更使模因币的“诞生瞬间”成为可量化、可比较的研究对象。
衍生相关工作
围绕该语料库已催生若干方向明确的研究工作。其一,基于持有者集中度与创建者历史的跑路风险聚类与 Cox 生存模型,识别出具有时间稳定性的高风险毕业代币群体;其二,利用前 10 分钟绑定曲线活动构建的毕业预测集成模型,并在 100 折净化与禁运交叉验证下评估,推动了模因币早期分类方法的发展;其三,聚焦创建者经济与市场行为的钱包级实证分析,揭示了毕业速度效应与经验对发行设计的影响。这些工作不仅验证了数据集的多维度可用性,也为后续学者提供了可扩展的方法论模板与基线结果。
数据集最近研究
最新研究方向
基于PumpFun_Memecoin_Corpus的近期研究聚焦于迷因币全生命周期中的欺诈识别与市场动态建模。利用该语料库提供的79万代币发行、3358万笔交易及26亿条绑定曲线快照,研究者正构建融合持有人集中度、创作者历史与交易强度的多模态风险聚类模型,并结合Cox生存分析预测“拉地毯”时间。同时,基于前10分钟高频数据的毕业预测集成模型已在100个净化交叉验证折上评估,揭示了平台非平稳性对模型泛化的影响。这些工作不仅推动了DeFi欺诈检测基准的建立,也为理解迷因币投机泡沫的微观结构提供了实证基础,对监管与投资者保护具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务