ViWikiFC
收藏资源简介:
ViWikiFC(Vietnamese Wikipedia Fact-Checking Dataset)是首个基于越南语维基百科构建的大规模开放域事实核查数据集,旨在支持越南语的自动事实验证、证据检索和自然语言推理(NLI)研究。
ViWikiFC (Vietnamese Wikipedia Fact-Checking Dataset) is the first large-scale open-domain fact-checking dataset built from Vietnamese Wikipedia, designed to support Vietnamese automatic fact verification, evidence retrieval, and natural language inference (NLI) research.
ViWikiFC:越南语维基百科事实核查数据集
数据集概述
ViWikiFC 是首个大规模开放域越南语事实核查数据集,基于越南语维基百科构建,旨在支持自动化事实核查、证据检索和自然语言推理(NLI)研究。数据集包含 20,916 条人工标注的声明-证据对,来源于 73 篇越南语维基百科文章中的 3,812 条证据句子,涵盖历史、地理、科学、文化、哲学和社会等多个领域。
每条声明包含三种标签之一:
- SUPPORTED:证据支持声明
- REFUTED:证据反驳声明
- NOT_ENOUGH_INFORMATION (NEI):证据不足以验证声明
所有声明由越南语母语标注者人工撰写,具有自然的语言多样性和真实的推理模式。
数据集结构
数据字段
| 字段 | 描述 |
|---|---|
claim |
人工撰写的越南语声明 |
evidence |
从维基百科提取的证据句子 |
label |
验证标签(SUPPORTED、REFUTED、NOT_ENOUGH_INFORMATION) |
数据划分
| 划分 | 样本数 |
|---|---|
| 训练集 | 16,738 |
| 开发集 | 2,090 |
| 测试集 | 2,091 |
| 总计 | 20,916 |
各划分的标签分布大致均衡。
数据构建
- 来源:越南语维基百科(73篇文章、1,479个段落、3,812条证据句子)
- 标注者:30名越南语母语者
- 标注流程:四阶段流程(标注者招募与培训、证据选择、声明生成、语料库开发)
- 多样性策略:同义词替换、改写、句法重构、主动/被动转换、推理修改、预设、数量与时间变化、否定等
- 标注一致性:Fleiss κ 系数达到 95.87%,表明标注高度一致
数据集统计
| 属性 | 数值 |
|---|---|
| 证据句子 | 3,812 |
| 维基百科文章 | 73 |
| 声明-证据对 | 20,916 |
| 标注者 | 30 |
| 标签类别 | 3 |
| Fleiss κ | 95.87% |
基准测试结果
证据检索任务
| 方法 | Top-1 准确率 |
|---|---|
| TF-IDF | 51.32% |
| SBERT | 65.12% |
| BM25 | 77.27% |
裁决预测任务
最强基线模型为 InfoXLM-Large:
- 准确率:86.50%
- Macro F1:86.51%
端到端流水线
最佳流水线(BM25 + InfoXLM-Large)的严格准确率为 67.00%,表明越南语事实核查仍具挑战性。
预期用途
- 自动化事实核查
- 证据检索
- 自然语言推理
- 检索增强生成(RAG)
- 越南语大语言模型评估
- 信息验证
- 检索模型基准测试
局限性
- 证据仅限于越南语维基百科
- 声明基于单一证据句子生成
- 不包含表格或图像等多模态证据
- 聚焦于开放域事实核查,不涵盖社交媒体虚假信息
许可
数据集采用 CC BY 4.0 许可证发布。
致谢
本研究由越南国立大学胡志明市分校(VNU-HCM)资助,资助编号为 DS2025-26-01。




