CiteTrace
收藏资源简介:
CiteTrace是一个包含761,495个可评估(查询、来源、答案)三元组的数据集,源自10个搜索增强的LLM回答28个Stack Exchange站点上的11,200个问题(技术和学术社区占比过高)。数据集包含多个配置文件,如查询、来源、引用、模型响应等,主要用于文本分类和问答任务。数据集提供了详细的分类和评分系统,包括查询意图(QI)、来源目的(SP)、答案-来源保真度(ASF)、来源领域(SD)和来源类型(ST)。评估的模型包括OpenAI、Anthropic、Google、xAI和Perplexity的多个版本。数据集适用于复制论文中的引用质量指标、训练分类器以及验证或扩展IPAM和SSM评分矩阵。数据集遵循CC BY 4.0和CC BY-SA 4.0许可协议,Stack Exchange查询需署名。
CiteTrace is a dataset containing 761,495 evaluable (query, source, answer) triples, derived from 10 search-enhanced LLMs answering 11,200 questions across 28 Stack Exchange sites (with an overrepresentation of technical and academic communities). The dataset includes multiple configuration files such as queries, sources, citations, and model responses, primarily used for text classification and question-answering tasks. It provides detailed classification and scoring systems, including Query Intent (QI), Source Purpose (SP), Answer-Source Fidelity (ASF), Source Domain (SD), and Source Type (ST). Evaluated models include various versions from OpenAI, Anthropic, Google, xAI, and Perplexity. The dataset is suitable for replicating citation quality metrics in papers, training classifiers, and validating or extending the IPAM and SSM scoring matrices. The dataset is licensed under CC BY 4.0 and CC BY-SA 4.0, with Stack Exchange queries requiring attribution.
数据集概述:CiteTrace
CiteTrace 是一个专注于引用质量评估的数据集,包含 761,495 个可评估的(查询,来源,答案)三元组,覆盖 10 个搜索增强型大语言模型对 11,200 个 Stack Exchange 问题 的回答,这些问题来自 28 个站点(技术和学术社区占比较高)。
数据组成与文件结构
数据集包含以下主要文件(以 Parquet 格式存储):
| 文件 | 行数 | 列数 | 描述 |
|---|---|---|---|
data/queries.parquet |
11,200 | 6 | Stack Exchange 问题(每个站点 400 个问题,共 28 个站点) |
data/sources.parquet |
231,105 | 9 | 被引用的 URL 及其爬取状态和标签 |
data/citations.parquet |
761,495 | 8 | 可评估的引用三元组 |
data/model_responses.parquet |
112,000 | 3 | 原始 LLM 响应(10 个模型 × 11,200 个查询) |
data/analysis_master.parquet |
761,495 | 20 | 主分析表 — 连接并评分后的数据 |
data/ipam_human_eval.parquet |
30 | 8 | IPAM 矩阵人类验证数据 |
data/ssm_human_eval.parquet |
60 | 10 | SSM 矩阵人类验证数据 |
scoring_matrices/{ipam,ssm}_matrix.tsv |
30 / 60 | — | IPAM 和 SSM 评分查找表 |
site_topology/se_official_audience.json |
28 | — | Stack Exchange API 快照 |
连接键:query_id 连接 queries ↔ citations ↔ analysis_master;url_id 连接 sources ↔ citations ↔ analysis_master。
分类与评分体系
数据集围绕五个核心维度构建分类与评分:
| 维度 | 代码 | 标签 |
|---|---|---|
| 查询意图 (QI) | QI1..QI5 | 事实性、解释性、指令性、比较性、观点性 |
| 来源目的 (SP) | SP1..SP6 | 推广、告知、指导、报告、讨论、发表观点 |
| 答案-来源忠实性 (ASF) | ASF1..ASF5 | 捏造、归因错误、矛盾、放大、支持 |
| 来源领域 (SD) | SD1..SD10 | 医疗、法律、金融、教育、科学、代码/数据、技术、社交/专业、购物/旅行、日常 |
| 来源类型 (ST) | ST1..ST6 | 官方、研究、新闻、维基/论坛、博客/社交媒体、公司 |
评分机制:ipam_score = IPAM[QI][SP],ssm_score = SSM[SD][ST],asf_score = ASF{k} → k。
评估的模型
数据集包含 10 个来自 5 家提供商的模型(2026 年第一季度 API 版本,数据收集时间为 2026-03-26 至 2026-04-09):
- OpenAI:gpt-5, gpt-5-mini
- Anthropic:claude-sonnet-4.6, claude-haiku-4.5
- Google:gemini-3.1-pro, gemini-3-flash
- xAI:grok-4.1-reasoning, grok-4.1-non-reasoning
- Perplexity:sonar, sonar-reasoning-pro
预期用途与范围外用途
- 预期用途:复现论文中报告的每个模型的引用质量指标;训练用于引用意图或来源适合性的分类器;通过新的专家小组验证或扩展 IPAM 和 SSM 评分矩阵。
- 范围外用途:数据集中的模型排名仅反映 15 天内(2026-03-26 至 2026-04-09)的提供商搜索后端快照,不应被视为任何单一提供商的永久质量评估;论文的核心主张是结构性失败模式,而非模型排名。
许可信息
| 组件 | 许可证 |
|---|---|
| 查询(Stack Exchange 帖子标题) | CC BY-SA 4.0 |
| 模型响应(原始响应、引用的句子) | CC BY 4.0 + 各提供商 API 服务条款 |
| 分类体系、评分矩阵、人类评估标注、代码 | CC BY 4.0 |
| 爬取的来源全文 | 不重新分发 |
使用查询集时需要注明 Stack Exchange 来源。使用者在复用数据时应自行检查各提供商的当前服务条款。




