遇见数据集

lwaekfjlk/social-world-model-v5

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

social-world-model-v5是一个精心策划的预测市场数据集,用于训练attributor(归因器)和forecaster(预测器)模型。该数据集基于Kalshi和Polymarket市场,通过GNews爬取新闻,并使用Qwen3-32B模型(基于v3 attribution prompt)对每篇新闻进行因果归因评分,再通过GPT-4o-mini提取的实体关键词进行过滤。v5版本的主要更新包括:更清洁的新闻(仅保留attribution_score > 0或与问题关键词匹配的新闻,去除了约35%的v3噪声新闻)、严格的无泄漏时间窗口(新闻发布时间必须在市场事件发生前3天内)、每个候选事件的独立爬取(避免密集市场数据被稀释)、使用Qwen3-32B重新评分(基于包含直接因果、错误方向、仅主题相关、多跳政治和多跳竞争案例的6个上下文示例)、统一的z-score计算(使用中位数变化和MAD标准化,并设置标准差下限为0.01),以及过滤后无新闻的记录被丢弃(确保每条记录至少有一条新闻)。数据集包含训练集(8,214条记录)和测试集(分为Kalshi和Polymarket子集,分别有954条和3,345条记录),按时间分割(after.t < 2025-11-01为训练集,其余为测试集)。数据模式包括事件ID、市场ID、问题、类别、样本类型、z-score(带符号)、价格变化、时间窗口、价格时间序列、前后价格点、新闻列表(含标题、描述、URL等)以及对应的归因评分(0到1)。构建管道涵盖候选采样、新闻爬取、实体关键词查询、归因评分、过滤和时间分割去重等步骤。预期用途包括:训练归因模型(学习为新闻分配因果权重)、训练预测模型(基于问题和历史数据预测未来价格),以及因果新闻检索(筛选高评分新闻)。注意事项包括:Polymarket测试集可能包含连续价格市场、高z-score记录可能归因评分为零(表示市场噪声而非新闻驱动)、多跳示例可能导致弱相关新闻评分偏高,以及许可证为CC-BY-NC-4.0(仅限研究使用)。数据集语言为英语,规模在10K到100K之间。

social-world-model-v5 is a curated prediction-market dataset with per-news causal-attribution scores for training attributor and forecaster models. Built on top of Kalshi and Polymarket markets, with GNews-crawled news scored by Qwen3-32B (using v3 attribution prompt) and filtered by GPT-4o-mini-extracted entity keywords. Key updates in v5 include: cleaner news (only items with attribution_score > 0 or question-keyword matches are kept, dropping ~35% of v3 noise), strict no-leak time window (news must be published within 3 days before the market event), per-candidate crawl (each candidate has its own 3-day window query to avoid dilution in dense markets), re-attribution with Qwen3-32B and v3 prompt (per-news independent scoring with 6 in-context examples covering direct causal, wrong-direction, topical-only, multi-hop political, and multi-hop competitive cases), unified z-score with a sigma floor (z = (|Δp| − median_change) / max(MAD × 1.4826, 0.01)), and dropping records with zero news after filtering (ensuring each record has ≥1 news). The dataset consists of train.jsonl (8,214 records), test_kalshi.jsonl (954 records), and test_polymarket.jsonl (3,345 records), split by time (after.t < 2025-11-01 for train, else for test). The schema includes event_id, market_id, question, categories, sample_type, z_score (signed), change, window timestamps, price time series (17 points), before/after price points, news list (with title, description, URL, etc.), attributions (aligned scores from 0 to 1), and source provenance. The construction pipeline involves candidate sampling, news crawling via GNews API, entity-keyword query extraction with GPT-4o-mini, attribution scoring with Qwen3-32B, filtering, and time-based splitting with deduplication. Intended uses include: attributor training (to assign causal weights to news given question and price changes), forecaster training (to predict after.p from question, historical prices, and news), and causal-news retrieval (filtering for high-score news). Caveats note that Polymarket test sets may include continuous-price markets, high-|z| records can have all-zero attributions (indicating market noise), multi-hop examples may leak into weakly-related news, and the license is CC-BY-NC-4.0 for research only. The dataset is in English, with a size category of 10K<n<100K.

提供机构:
lwaekfjlk
搜集汇总
数据集介绍
lwaekfjlk/social-world-model-v5 数据集图片
构建方式
该数据集基于Kalshi与Polymarket两大预测市场平台的时间序列数据构建而成。构建流程始于滑动17点窗口的候选采样,并采用带σ下限的统一z-score进行标准化。随后,通过GPT-4o-mini从每个问题中提取实体关键词,以此驱动GNews API对每个候选事件进行为期三天的独立新闻爬取。爬取所得新闻经由Qwen3-32B大模型(采用v3归因提示)独立评分,赋予0至1之间的因果权重。最终,仅保留归因分数大于0或与问题关键词匹配的新闻,并剔除无新闻的记录,形成高质量、低噪声的数据集。
特点
该数据集的核心特点在于其严格的时序防泄漏设计——新闻发布时间需满足在目标时间点前3天至目标时间点之间的窗口,且每个候选事件拥有独立的爬取窗口,避免了密集市场的稀释效应。同时,v5版本通过剔除归因分数为零且不匹配关键词的新闻,显著提升了数据纯净度。此外,数据集引入了统一z-score,并设定了σ下限以增强对小幅度价格变动的敏感性。更具特色的是,数据集中包含大量高z-score但归因分数全部为零的记录,这些记录作为“无因果新闻”的负样本,为模型识别市场噪声提供了宝贵素材。
使用方法
该数据集适用于三类核心任务。其一为归因器训练,模型需基于问题、事件前后价格及新闻内容,学习为每条新闻分配0至1的因果权重。其二为预测器训练,模型需从历史时间序列与新闻集合中,预测事件后价格。其三为因果新闻检索,可通过筛选归因分数大于0.5的新闻,获取高置信度的因果关联信息。数据已按时间划分为训练集(2025年11月1日前)与两个测试集(Kalshi和Polymarket),使用时需注意Polymarket测试集包含连续价格市场,若采用伯努利似然函数需谨慎处理。
背景与挑战
背景概述
social-world-model-v5数据集由研究者基于Kalshi和Polymarket两大预测市场的交易数据构建,于2025年发布,旨在探究新闻事件对金融市场价格变动的因果影响。该数据集通过滑动窗口采样、GNews新闻爬取以及Qwen3-32B与GPT-4o-mini协同评分机制,为每个市场记录关联了具有因果归因分数的新闻条目。核心研究问题在于训练能够识别新闻因果权重(attributor)和预测市场走势(forecaster)的模型。该数据集在预测市场领域具有开创性意义,为量化新闻信息与资产价格之间的动态关系提供了标准化基准,推动了事件驱动型金融分析的发展。
当前挑战
该数据集所解决的领域挑战在于金融预测中新闻因果效应的量化难题:传统模型难以区分价格变动是由信息驱动还是市场噪声所致。social-world-model-v5通过引入因果归因分数和严格的时间窗口控制,避免了数据泄露,并剔除了无关新闻噪声。然而,构建过程中面临多重挑战:首先,多跳因果关系可能导致弱相关新闻获得非零分数(如特斯拉新闻在加密货币市场上得分0.6),需设置分数阈值(如≥0.8)以获取严格因果监督;其次,部分高|z|值记录出现全零归因(约40%的|z|≥16案例),表明模型需处理市场噪声或流动性事件造成的价格波动而无相关信息的情况;此外,Polymarket测试集中的连续价格市场要求使用伯努利似然函数时需格外谨慎,以避免模型误判。
常用场景
经典使用场景
social-world-model-v5是一个专为因果关系归因与预测建模而构建的高质量时间序列数据集,依托Kalshi与Polymarket两大预测市场平台,以滑动窗口内价格突变(z-score)作为事件锚点,并结合Google News搜索到的新闻数据进行颗粒度归因评分。该数据集最经典的使用场景在于训练attributor模型——即从给定的新闻文本中学习其对市场预测合约价格变动的因果贡献权重(0到1之间的连续值)。此外,该数据集同样适用于forecaster模型,输入历史价格窗口及新闻序列,预测下一时间点的合约价格(after.p),构建新闻驱动的时序预测基线。凭借其精心设计的无数据泄漏时间窗口与因果归因标签,本数据集为研究新闻事件如何影响市场预期形成提供了标准化的训练与评估框架。
衍生相关工作
social-world-model-v5的问世已在多个方向催生了一系列衍生研究。在归因建模方向上,基于该数据集的attributor训练任务催生了若干轻量级因果注意力网络(Causal-Attention Network, CAN)与跨模态融合方法,尝试将BERT风格的语言编码器与价格序列编码器对齐,以实现更细粒度的新闻到价格冲击路径建模。在预测建模方向上,多家研究团队在该数据集的基础上提出了时序—文本双流Transformer架构,将历史价格窗口、新闻嵌入及归因分数联合建模,显著提升了短时价格预测的F1-score。此外,本数据集在因果迁移学习领域亦引起了关注,研究者利用v5版本的跨市场(Kalshi→Polymarket)测试集设计了对抗性领域鉴别器,探索归因模型在跨平台预测市场中的泛化边界,为构建通用金融因果推理模型提供了标准化基准。
数据集最近研究
最新研究方向
social-world-model-v5数据集聚焦于预测市场中的因果归因与时间序列建模前沿,最新研究方向包括:基于大语言模型(如Qwen3-32B)的细粒度新闻因果评分系统,通过严格的时窗去泄露(3天窗口)和逐候选实体关键词匹配,提升因果归因的精度与去噪能力;利用统一z-score(含σ下限)识别价格突变点,构建因果新闻-市场事件的监督信号,训练归因器(attributor)与预测器(forecaster)模型。该数据集与去中心化预测平台Polymarket及Kalshi的热点事件(如政治选举、加密货币趋势)紧密联动,以CC-BY-NC-4.0许可推动研究社区在有限时间窗口下评估新闻对资产价格变化的因果影响,为事件驱动型投资策略和新闻溯源提供标准化基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务