遇见数据集

ViWikiFC

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

ViWikiFC(Vietnamese Wikipedia Fact-Checking Dataset)是首个基于越南语维基百科构建的大规模开放域事实核查数据集,旨在支持越南语的自动事实验证、证据检索和自然语言推理(NLI)研究。

ViWikiFC (Vietnamese Wikipedia Fact-Checking Dataset) is the first large-scale open-domain fact-checking dataset built from Vietnamese Wikipedia, designed to support Vietnamese automatic fact verification, evidence retrieval, and natural language inference (NLI) research.

创建时间:
2026-08-05
原始信息汇总

ViWikiFC:越南语维基百科事实核查数据集

数据集概述

ViWikiFC 是首个大规模开放域越南语事实核查数据集,基于越南语维基百科构建,旨在支持自动化事实核查、证据检索和自然语言推理(NLI)研究。数据集包含 20,916 条人工标注的声明-证据对,来源于 73 篇越南语维基百科文章中的 3,812 条证据句子,涵盖历史、地理、科学、文化、哲学和社会等多个领域。

每条声明包含三种标签之一:

  • SUPPORTED:证据支持声明
  • REFUTED:证据反驳声明
  • NOT_ENOUGH_INFORMATION (NEI):证据不足以验证声明

所有声明由越南语母语标注者人工撰写,具有自然的语言多样性和真实的推理模式。


数据集结构

数据字段

字段 描述
claim 人工撰写的越南语声明
evidence 从维基百科提取的证据句子
label 验证标签(SUPPORTED、REFUTED、NOT_ENOUGH_INFORMATION)

数据划分

划分 样本数
训练集 16,738
开发集 2,090
测试集 2,091
总计 20,916

各划分的标签分布大致均衡。


数据构建

  • 来源:越南语维基百科(73篇文章、1,479个段落、3,812条证据句子)
  • 标注者:30名越南语母语者
  • 标注流程:四阶段流程(标注者招募与培训、证据选择、声明生成、语料库开发)
  • 多样性策略:同义词替换、改写、句法重构、主动/被动转换、推理修改、预设、数量与时间变化、否定等
  • 标注一致性:Fleiss κ 系数达到 95.87%,表明标注高度一致

数据集统计

属性 数值
证据句子 3,812
维基百科文章 73
声明-证据对 20,916
标注者 30
标签类别 3
Fleiss κ 95.87%

基准测试结果

证据检索任务

方法 Top-1 准确率
TF-IDF 51.32%
SBERT 65.12%
BM25 77.27%

裁决预测任务

最强基线模型为 InfoXLM-Large

  • 准确率:86.50%
  • Macro F1:86.51%

端到端流水线

最佳流水线(BM25 + InfoXLM-Large)的严格准确率为 67.00%,表明越南语事实核查仍具挑战性。


预期用途

  • 自动化事实核查
  • 证据检索
  • 自然语言推理
  • 检索增强生成(RAG)
  • 越南语大语言模型评估
  • 信息验证
  • 检索模型基准测试

局限性

  • 证据仅限于越南语维基百科
  • 声明基于单一证据句子生成
  • 不包含表格或图像等多模态证据
  • 聚焦于开放域事实核查,不涵盖社交媒体虚假信息

许可

数据集采用 CC BY 4.0 许可证发布。


致谢

本研究由越南国立大学胡志明市分校(VNU-HCM)资助,资助编号为 DS2025-26-01

搜集汇总
数据集介绍
ViWikiFC 数据集图片
构建方式
ViWikiFC数据集的构建源于对越南语维基百科事实核查任务的深度探索,其核心在于构建一个涵盖多领域的高质量语料库。构建过程始于从73篇越南语维基百科文章中精心挑选1,479个段落,进而提取出3,812条证据句。由30名母语为越南语的标注者组成团队,经过系统培训后,针对每条证据句子,通过同义词替换、改写、句法重构、主动被动转换、推理调整、预设、数量与时间变化、否定等多种策略,手动生成支持、反驳和证据不足三种标签的声明,从而形成20,916条声明-证据对。最终,通过弗莱斯kappa系数高达95.87%的标注一致性评估,确保了数据集的高质量和可靠性。
特点
ViWikiFC作为首个大规模开放域越南语事实核查数据集,展现了独特的语言学价值与挑战。其声明全部由母语者手工编写,自然呈现了越南语表达的多样性与真实推理模式,避免了自动生成数据的机械性。数据集覆盖历史、地理、科学、哲学、文化和社会等多重知识领域,标签分布均衡,使其成为评估越南语自然语言推理、证据检索及事实核查模型的多功能基准。此外,基准实验显示,即使最先进的模型如InfoXLM-Large在裁决预测上达到86.5%的F1分数,但端到端流水线仅实现67.0%的严格准确率,凸显了越南语事实核查任务的难度,也证明了数据集的挑战性。
使用方法
ViWikiFC的设计支持多种自然语言处理任务的评估,其使用方法灵活多元。研究者可直接利用预划分的训练、验证和测试集(分别包含16,738、2,090和2,091条样本)进行监督学习,用于事实验证、自然语言推断或证据检索模型的训练与评测。数据还可与检索增强生成(RAG)框架结合,评估越南语语言模型的检索与生成能力。稀疏检索或密集检索模型(如BM25、SBERT)可在证据检索任务中测试,而跨编码器重排序也可基于该语料优化。此外,数据集标注的三种标签为二元和三元分类提供了清晰的基准,适用于越南语模型的多任务评估与跨语言比较研究。
背景与挑战
背景概述
ViWikiFC数据集由越南国立大学胡志明市分校的研究团队于2026年创建,旨在填补越南语事实核查领域缺乏大规模人工标注数据集的空白。该数据集从73篇越南语维基百科文章中提取3812条证据句,由30名母语者手工生成20916条声明-证据对,覆盖历史、地理、科学、哲学、文化与社会等多个领域,标签分为支持、反驳与信息不足三类。作为首个面向越南语的开放域事实验证语料库,ViWikiFC为低资源语言的事实核查、证据检索及自然语言推理研究提供了基准,其高标注一致性(Fleiss' κ=95.87%)确保了数据质量,对推动越南语自然语言处理研究具有重要价值。
当前挑战
ViWikiFC所应对的领域挑战在于越南语事实核查任务中证据检索与判定准确性的平衡,尤其是对信息不足类别的识别,现有最优模型BM25在证据检索上对NEI标签的准确率仅56.67%,端到端流水线的严格准确率仅67%,表明语义推理与跨句信息整合仍需突破。构建过程中的挑战包括:从维基百科提取的证据句需覆盖多领域并保持语言多样性,为此设计了多种改写策略;人工标注需统一标准以避免主观偏差,通过多阶段培训与一致性检验(κ=95.87%)确保标签可靠;数据规模受限于人工成本,最终仅生成约2万对,且证据来源单一(维基百科)限制了多模态与社交媒体场景的适用性。
常用场景
经典使用场景
ViWikiFC作为首个面向越南语维基百科的大规模开放域事实验证数据集,其核心应用场景聚焦于自动化事实核查、证据检索与自然语言推理三大任务。研究者可基于该语料库训练并评估模型在给定声明的证据句检索能力,以及判定声明与证据间蕴含、矛盾或证据不足的语义关系。凭借其人工标注的高质量声明-证据对,该数据集为低资源语言的事实核查研究提供了标准化的基准测试环境,尤其适用于验证跨语言模型在越南语上的迁移性能。
解决学术问题
该数据集填补了越南语事实验证领域高质量标注资源的空白,解决了低资源语言中事实核查研究缺乏可靠基准的问题。其构建过程通过严格的人工标注流程,实现了95.87%的Fleiss' κ一致性,保障了标注的权威性。ViWikiFC支持对证据检索与判定模型的独立及联合评估,揭示了现有模型在越南语上的性能瓶颈,为自然语言处理社区提供了研究跨语言推理、证据筛选及低资源场景下模型泛化能力的宝贵资源,推动了非英语事实验证技术的学术进展。
衍生相关工作
基于ViWikiFC的发布,已衍生出多项后续研究工作。在模型层面,研究者探索了针对越南语的专用预训练语言模型及跨语言模型微调策略,以提升事实验证性能;在方法层面,针对证据检索任务,比较了稀疏与稠密检索模型的融合方案,并开发了基于重排序的端到端事实核查流水线。此外,该数据集被用作评估越南语大型语言模型(如PhoGPT、Vietcuna)的基准之一,推动了低资源语言自然语言处理工具链的发展,其构建方法亦被借鉴至其他低资源语言的事实核查数据集建设中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务