遇见数据集

lwaekfjlk/social-world-model-v6

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

social-world-model-v6是一个用于预测市场和新闻归因分析的数据集,作为v5版本的继任者,它基于Qwen3-32B模型和v3归因提示构建,并通过GNews爬取和GPT-4o-mini关键词过滤进行扩展。数据集新增了1,347条记录,重点关注z-score在[1, 4)区间的中值范围,以改善数据分布。所有记录的description字段已补充完整,并通过该字段消除了Kalshi平台中伞形问题的歧义。模式已精简为10个核心字段,包括market_id、question、description、categories、z_score、news、attributions、history和target。数据集分为训练集和测试集(基于Kalshi和Polymarket),时间分割以2025年11月1日为界。它适用于归因模型训练、预测模型训练和因果新闻检索,但需注意部分记录可能存在归因零值或新闻噪声。数据集遵循CC-BY-NC-4.0许可证,仅供研究使用。

授权协议:CC-BY-NC-4.0 语言:英语 标签: - 预测市场 - Kalshi - Polymarket - 新闻归因 - 时间序列 数据规模类别:10K < 样本数 < 100K # social-world-model-v6 **social-world-model-v6** 是 **social-world-model-v5** 的后继版本。保留了相同的构建流程(Qwen3-32B + v3归因提示词、按候选抓取GNews、GPT-4o-mini关键词过滤),新增**+1,347条新记录**,聚焦于占比偏低的|z| ∈ [1, 4)分数桶,同时完成了若干数据格式清理工作。 ## v6相较于v5的更新要点 1. **更多mid-z分数桶样本**:从|z| ∈ [1, 4)中采样16,000个新候选,按候选抓取GNews(严格3天窗口),使用Qwen3-32B + v3提示词完成归因,经相同的关键词+归因过滤流程合并后,净增1,347条记录(主要为[1, 2)桶增加739条、[2, 4)桶增加608条)。 2. **全记录回填`description`字段**:早期版本仅v3来源的记录包含该字段(约40%),当前99.99%的记录已完成填充(数据取自原始Kalshi/Polymarket处理转储文件)。 3. **通过`description`消除Kalshi通用问题歧义**:626条记录共享事件级通用问题(例如“2025年洪都拉斯将选举谁为总统?”、“特朗普总统将在2026年1月1日前赦免谁?”)。保留原始通用`question`字段不变,`description`字段承载候选/选项标签(例如`Rixi Moncada`、`Eric Adams`)。二者结合可明确每条记录对应的子市场,避免基于规则的问题重写带来的语法瑕疵。 4. **数据格式精简至10个字段**:移除冗余/仅调试用字段(`window_ts`现已可通过`history + [target]`推导得出,移除`before`、`after`、`change`、`sample_type`、`source`、`source_split`、`window_start`、`window_end`、`subtitle`、`question_original`)。 ## 数据集文件 | 文件名 | 样本数 | |---|---| | `train.jsonl` | 8,546 | | `test_kalshi.jsonl` | 760 | | `test_polymarket.jsonl` | 3,483 | **时间拆分规则**:若`target.t < 2025-11-01`则划分为训练集;否则划分为`test_{kalshi,polymarket}`。 **节奏过滤规则**:移除满足`target.t − history[-1].t > 1.5天`的记录(目标时间前的陈旧历史数据)。该操作会移除v6中约7.7%的记录(共1,071条),大多为更新频率较低的Kalshi市场数据;Polymarket记录不受影响(均有约1天的更新节奏)。 ## z分数桶分布 | 分数桶 | 训练集 | test_kalshi | test_polymarket | |---|---|---|---| | [0, 0.5) | 869 | 154 | 854 | | [0.5, 1) | 508 | 173 | 646 | | [1, 2) | 1,749 | 266 | 742 | | [2, 4) | 1,608 | 191 | 286 | | [4, 8) | 2,679 | 186 | 580 | | [8, 16) | 1,092 | 45 | 264 | | [16+) | 832 | 25 | 111 | 相较于v5版本:训练集的[1, 2)桶增加565条,[2, 4)桶增加558条;其余桶无变化。训练集的mid-z分数桶占比从27.2%提升至36.0%。 ## 数据格式(Schema) json { "market_id": "...", // Kalshi(字母前缀)或 Polymarket(数字前缀) "event_id": "...", // 市场所属的通用事件ID "question": "Will X happen by ...?", // 已针对候选修改(已应用通用问题重写) "description": "...", // 决议规则(Polymarket)或候选名称(Kalshi) "categories": ["Politics", ...], "z_score": 5.4, // 带符号分数:sign(Δp) * |z|,统一中位数绝对偏差(Median Absolute Deviation, MAD)并设置σ下限 "news": [ {"title": "...", "description": "...", "url": "...", "published_at": "2025-11-24T11:02:17Z", "source": "..."} ], "attributions": [ // 按news_idx与`news`字段对齐 {"news_idx": 0, "score": 0.0} // 得分范围0~1,由Qwen3-32B + v3提示词生成 ], "history": [{"t": ..., "p": ...}, ...], // 16个点的输入序列 "target": {"t": ..., "p": ...} // 1个点的预测目标 } ## 构建流程 1. **候选采样**:基于Kalshi + Polymarket时间序列,使用滑动17点窗口生成样本,统一z分数并设置σ下限(`z = (|Δp| − 中位数) / max(MAD × 1.4826, 0.01)`)。 2. **新闻抓取**:调用GNews API,按候选设置3天窗口(`DAYS_BEFORE=3, DAYS_AFTER=0`,严格满足`< target.t`)。 3. **实体-关键词查询**:由GPT-4o-mini从每个问题中提取类似`"Donald Trump" OR "Trump campaign"`的搜索查询,已缓存。 4. **归因**:使用Qwen3-32B(TP=8)搭配v3提示词;每条新闻的独立得分∈{0, 0.2, 0.4, 0.6, 0.8, 1.0}。|z|<1的记录将自动跳过(所有新闻得分设为0)。 5. **过滤**:保留新闻当且仅当`score > 0`或文本匹配问题关键词;过滤后无有效新闻的记录将被移除。 6. **时间拆分+去重**:按`target.t < 2025-11-01`拆分数据集;按`(market_id, target.t)`进行去重。 7. **问题/描述修复(仅v6)**:从原始数据回填缺失的`description`字段;使用`subtitle`重写通用Kalshi问题。 8. **数据格式裁剪**:仅保留上述10个必要字段。 ## 预期用途 - **归因器训练**:基于(问题、历史数据、目标值、新闻)学习每条新闻的因果权重∈[0, 1]。 - **预测器训练**:基于(问题、描述、历史数据、新闻)预测`target.p`。 - **因果新闻检索**:筛选`attributions[*].score > 0.5`以保留置信度最高的因果新闻。 ## 注意事项 - 训练集中约26%的记录归因得分全为0(仅通过关键词匹配得以保留)。|z|≥4的高z分数桶中,94%~97%的记录归因得分非零;|z| ∈ [1,4)的桶中约70%的记录归因得分非零。 - 仍有2条记录的`description`字段为空(来自Kalshi历史数据,未出现在任何原始转储文件中)。 - 对于Kalshi的按候选划分的子市场,`question`字段为原始事件级通用问题;候选标签位于`description`字段中。训练代码应同时使用这两个字段。 - Polymarket的多结果市场仍存在问题歧义(例如“谁将赢得皮内拉斯县选举?”未附带候选标签);v6版本尚未对这类情况进行消歧。 - 新闻片段来自GNews;小众市场(例如洪都拉斯总统选举)的新闻命中率较低,宽泛的查询会引入大量无关噪声(归因过滤器会过滤掉此类噪声,但训练代码应具备对噪声检索的鲁棒性)。 ## 授权协议 CC-BY-NC-4.0 — 仅可用于研究用途。GNews的新闻片段受各自来源的条款约束。

提供机构:
lwaekfjlk
搜集汇总
数据集介绍
lwaekfjlk/social-world-model-v6 数据集图片
构建方式
social-world-model-v6数据集是social-world-model-v5的演进版本,其构建流程涵盖候选采样、新闻爬取、实体关键词查询、归因标注与过滤等多个环节。具体而言,从Kalshi与Polymarket两大预测市场的时间序列数据中,以滑动17点窗口提取候选样本,并基于统一MAD方法计算z分数。随后,利用GNews API对每个候选事件进行为期3天的新闻爬取,并通过GPT-4o-mini从问题中提取实体关键词作为查询。归因阶段,借助Qwen3-32B模型(采用v3提示)对每条新闻独立评分,分数离散值为0至1.0之间的六档。最终,仅保留归因分数大于0或匹配关键词的新闻记录,并依据时间戳切分训练与测试集。v6版本在原有基础上新增了1,347条记录,重点补充了z分数处于[1,4)区间的样本,使得中间z值区间的数据占比从27.2%提升至36.0%。
特点
该数据集具有多个显著特性。首先,其schema精简为10个核心字段,删除了冗余或可推导的变量,包括窗口时间戳、价格变化等,仅保留market_id、question、description、z_score、news、attributions等关键信息。其次,description字段已为99.99%的记录进行了回填,尤其对于Kalshi中626条伞状问题,description承载了候选标签信息,与原始question共同指明具体子市场,避免了基于规则的问题重写带来的语法瑕疵。此外,数据集的z分数分布覆盖了从[0,0.5)到[16+)的七个区间,训练集中高z值(≥4)记录的非零归因比例高达94%至97%,而低z值区间则相对稀疏。约26%的训练记录具有全零归因,这些记录仅通过关键词匹配予以保留。数据按时间切分,目标时间早于2025年11月1日的归入训练集,其余归入测试集,同时剔除了历史至目标间隔超过1.5天的记录以保持数据时效性。
使用方法
该数据集的主要用途包括三类典型任务。其一,归因模型训练:利用(问题、历史序列、目标、新闻)四元组,学习每条新闻对价格变动的因果权重,输出介于0到1之间的归因分数。其二,预测模型训练:基于(问题、描述、历史价格序列、相关新闻)建模,预测目标时间点的价格概率。其三,因果新闻检索:通过筛选attributions中分数大于0.5的条目,保留高置信度的因果相关新闻用于下游分析。在使用过程中需注意,Kalshi的子市场记录中question为事件级伞状问题,候选标签存储于description字段,训练代码应联合使用这两个字段。对于Polymarket的多结果市场,部分问题仍缺乏候选标签信息,v6版本尚未对此进行消歧。此外,新闻摘要来自GNews,部分小众市场(如洪都拉斯总统选举)的命中率较低,且宽泛查询可能引入噪声,归因过滤器虽能剔除大部分无关内容,但训练代码需具备对噪声检索的鲁棒性。
背景与挑战
背景概述
social-world-model-v6数据集由研究团队于2026年构建,旨在通过整合预测市场(Kalshi、Polymarket)的时间序列数据与新闻归因信息,探索外部事件如何驱动市场概率的动态演化。该数据集聚焦于量化新闻事件对预测合约价格变动的因果影响,为事件驱动的预测模型提供了结构化的训练基准。相较于前代版本,v6通过扩充中等z-score区间(|z|∈[1,4))的记录至1,347条,显著提升了样本分布的均衡性,并优化了数据模式,将字段精简至10个核心变量。这一改进使得数据集在归因器训练和预测器开发中更具代表性,推动了预测市场建模与因果推断领域的交叉研究。
当前挑战
该数据集面临的挑战主要体现在三方面。首先,在领域问题层面,预测市场中的价格波动常被多重并发新闻事件所驱动,现有归因方法难以精确区分因果与噪声,导致约26%的训练记录归因分数全为零;其次,中等z-score区间(|z|∈[1,4))的新闻命中率不足,尤其是针对尼加拉瓜总统选举等小众市场,GNews检索结果噪声高、相关度低,迫使模型需具备噪声鲁棒性。在构建过程中,Kalshi子市场的伞式问题(umbrella questions)依赖description字段消歧义,但2条历史记录仍缺失描述;Polymarket多结果市场的问题歧义尚未解决,限制了模型对复杂场景的泛化能力。
常用场景
经典使用场景
social-world-model-v6数据集在预测市场与新闻因果归因的前沿交叉领域,提供了标准化的训练与评估基准。其经典使用场景涵盖三类核心任务:一是基于新闻文本与历史价格序列,训练归因模型以学习每篇新闻对市场价格的因果权重;二是构建预测模型,融合问题描述、历史走势与实时新闻来预测目标价格;三是执行因果新闻检索,通过筛选高归因得分的新闻报道,识别驱动市场变动的关键信息。数据集采用滑动窗口构建17个时间点的连续样本,并统一计算z-score来衡量价格变动的显著性,使得模型能够在不同波动强度下学习新闻与市场关系的泛化模式。
实际应用
在实际产业应用中,social-world-model-v6为算法交易、风险预警与舆情监控等领域注入了新的数据动力。金融机构可利用该数据集训练的归因模型,实时解析海量新闻中哪些事件真正影响标的资产价格,从而优化交易策略的决策逻辑。政策研究机构则能借助因果新闻检索功能,从嘈杂的信息流中提取对选举结果、政策变动或经济指标有实质性影响的报道,辅助舆情研判与预测分析。此外,该数据集的属性归因机制可直接嵌入新闻推荐系统,帮助用户过滤无关噪音,聚焦于具有市场影响力的关键信息,提升信息消费的效率和决策质量。
衍生相关工作
social-world-model-v6的持续迭代催生了系列衍生的经典研究路径。基于其归因数据的设计,研究者可探索基于transformer的注意力归因网络与因果效应估计模型的融合方案,推动新闻驱动的市场预测从关联分析向因果推断进化。该数据集的9字段精简架构也启发了一系列针对短时间序列预测的效率优化工作,包括利用预训练语言模型编码新闻语义、历史价格特征工程以及多任务联合学习范式。更有学者在其基础上构建跨领域迁移学习框架,将预测市场中的新闻归因知识迁移至股市、加密货币等更广泛的价格预测任务,验证了基于预测市场设计的数据集在泛化能力上的独特优势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务