遇见数据集

anon-citetrace/CiteTrace

收藏
Hugging Face2026-05-07 更新2026-05-31 收录
官方服务:

资源简介:

CiteTrace 是一个引用级别的数据集,包含来自10个搜索增强大型语言模型(LLM)回答28个站点(技术和学术社区占比过高)的11,200个Stack Exchange问题所产生的**761,495个可评估的(查询、来源、答案)三元组**。

> 许可证: - CC BY-SA 4.0 - CC BY 4.0 语言: - 英语 友好名称:CiteTrace 数据规模类别:10万 < 样本数 < 100万 任务类别: - 文本分类 - 问答 标签: - 大语言模型(Large Language Model,LLM) - 搜索 - 引用 - 基准测试 - 检索增强生成(Retrieval-Augmented Generation,RAG) - Stack Exchange(堆栈交换) 配置项: - 配置名称:queries,数据文件:data/queries.parquet - 配置名称:sources,数据文件:data/sources.parquet - 配置名称:citations,数据文件:data/citations.parquet - 配置名称:model_responses,数据文件:data/model_responses.parquet - 配置名称:analysis_master,数据文件:data/analysis_master.parquet - 配置名称:ipam_human_eval,数据文件:data/ipam_human_eval.parquet - 配置名称:ssm_human_eval,数据文件:data/ssm_human_eval.parquet - 配置名称:qi_human_eval,数据文件:data/qi_human_eval.parquet - 配置名称:sp_human_eval,数据文件:data/sp_human_eval.parquet - 配置名称:sd_human_eval,数据文件:data/sd_human_eval.parquet - 配置名称:st_human_eval,数据文件:data/st_human_eval.parquet - 配置名称:asf_human_eval,数据文件:data/asf_human_eval.parquet # CiteTrace 本数据集为引用级数据集,包含来自10个搜索增强型大语言模型(Large Language Model,LLM)针对28个站点的11200个Stack Exchange(堆栈交换)问题生成的761495条可评估(查询、来源、答案)三元组,其中技术与学术社区占比偏高。 | 文件 | 行数 | 列数 | 描述 | | --------------------------------------------- | -----: | ---: | -------------------------------------------------------------------- | | `data/queries.parquet` | 11200 | 6 | Stack Exchange(堆栈交换)问题,每个站点400个问题,共28个站点 | | `data/sources.parquet` | 231105 | 9 | 带爬取状态与标签的被引用URL | | `data/citations.parquet` | 761495 | 8 | 可评估的引用三元组 | | `data/model_responses.parquet` | 112000 | 3 | 原始大语言模型回复(10个模型 × 11200个查询) | | `data/analysis_master.parquet` | 761495 | 20 | **主分析表**——已完成连接与评分 | | `data/ipam_human_eval.parquet` | 30 | 8 | IPAM矩阵人工验证(每个单元格标注样本数N=10) | | `data/ssm_human_eval.parquet` | 60 | 10 | SSM矩阵人工验证(每个单元格标注样本数N=10) | | `data/qi_human_eval.parquet` | 200 | 6 | 单轴评判者验证:QI——GPT-4o-mini标注 + 3名人工标注者 | | `data/sp_human_eval.parquet` | 200 | 6 | 单轴评判者验证:SP——GPT-4o-mini标注 + 3名人工标注者 | | `data/sd_human_eval.parquet` | 200 | 6 | 单轴评判者验证:SD——GPT-4o-mini标注 + 3名人工标注者 | | `data/st_human_eval.parquet` | 200 | 6 | 单轴评判者验证:ST——GPT-4o-mini标注 + 3名人工标注者 | | `data/asf_human_eval.parquet` | 200 | 6 | 单轴评判者验证:ASF——GPT-4o-mini标注 + 3名人工标注者 | | `scoring_matrices/{ipam,ssm}_matrix.tsv` | 30/60 | — | `ipam_score`、`ssm_score`的查找表 | | `site_topology/se_official_audience.json` | 28 | — | Stack Exchange API快照 | 完整的列schema与RAI字段(收集、标注、偏差、个人可识别信息、社会影响、维护)详见`croissant.json`(遵循Croissant 1.1 + RAI 1.0规范)。连接键:`query_id`用于连接查询表、引用表与主分析表;`url_id`用于连接来源表、引用表与主分析表。 ## 加载数据 python from datasets import load_dataset # 主分析表(每行对应一个可评估引用) ds = load_dataset("anon-citetrace/CiteTrace", "analysis_master", split="train") print(ds[0]) 其他配置项包括:`queries`、`sources`、`citations`、`model_responses`、`ipam_human_eval`、`ssm_human_eval`、`qi_human_eval`、`sp_human_eval`、`sd_human_eval`、`st_human_eval`、`asf_human_eval`。 ## 分类法与评分规则 | 评估维度 | 编码规则 | 标签 | | ---------------------------- | ------------ | --------------------------------------------------------------------------------------------------------------------- | | 查询意图(Query Intent,QI) | QI1..QI5 | 事实型、解释型、指令型、比较型、观点型 | | 来源意图(Source Purpose,SP)| SP1..SP6 | 推广、告知、指导、报告、讨论、发表观点 | | 答案-来源保真度(Answer-Source Fidelity,ASF) | ASF1..ASF5 | 捏造、错误归因、矛盾、夸大、佐证 | | 来源领域(Source Domain,SD) | SD1..SD10 | 医疗、法律、金融、教育、科学、代码/数据、技术、社会/专业、购物/出行、日常 | | 来源类型(Source Type,ST) | ST1..ST6 | 官方、学术研究、新闻、维基/论坛、博客/社交网络、企业 | `ipam_score = IPAM[QI][SP]`,`ssm_score = SSM[SD][ST]`,`asf_score = ASF{k} → k`。其中IPAM(5×6)与SSM(10×6)矩阵基于10次人工标注生成,已发布为`ipam_human_eval.parquet`与`ssm_human_eval.parquet`。 ## 评估模型 本次评估共覆盖5家提供商的10个模型(基于2026年第一季度API检查点,数据采集时间为2026年3月26日至2026年4月9日):OpenAI(gpt-5、gpt-5-mini)、Anthropic(claude-sonnet-4.6、claude-haiku-4.5)、Google(gemini-3.1-pro、gemini-3-flash)、xAI(grok-4.1-reasoning、grok-4.1-non-reasoning)、Perplexity(sonar、sonar-reasoning-pro)。 ## 预期与超出范围用途 **预期用途**:复现配套论文中报告的各模型引用质量指标,训练用于引用意图或来源适配性的分类器,通过新的专家小组验证或扩展IPAM与SSM评分矩阵。 **超出范围用途**:本数据集中的各模型排名仅反映提供商搜索后端15天的运行快照(2026年3月26日至2026年4月9日),不应被视为对任何单一提供商的永久质量评估;搜索后端会持续演进,论文中记录的结构失效模式才是核心研究主张,而非各模型的排序结果。 ## 许可证协议 | 组件类型 | 许可证协议 | | --------------------------------------------------------- | ------------------------------------------- | | 查询内容(Stack Exchange帖子标题) | CC BY-SA 4.0 | | 模型回复(`raw_response`、`cited_sentence`) | CC BY 4.0 + 各提供商API服务条款 | | 分类法、矩阵、人工评估标注、代码 | CC BY 4.0 | | 爬取的来源全文 | 未进行重新分发 | 复用查询集时需注明Stack Exchange来源。各提供商服务条款已于2026年4月24日逐家验证(OpenAI、Anthropic、Google、xAI、Perplexity);复用者需在复用当下重新核查当前服务条款。

提供机构:
anon-citetrace
二维码
社区交流群
二维码
科研交流群
商业服务