遇见数据集

TamilFact

收藏
github2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

TamilFact是第一个针对泰米尔语的大规模事实核查数据集,旨在支持低资源达罗毗荼语言的自动事实核查研究。它基于一个包含77.1万份文档的语料库构建,涵盖百科全书、新闻、政府来源、健康、科学和教育等领域,覆盖泰米尔知识的全谱。

TamilFact is the first large-scale fact-checking dataset tailored for the Tamil language, designed to support automated fact-checking research for low-resource Dravidian languages. Built upon a corpus comprising 771,000 documents, it covers diverse domains including encyclopedic materials, news, government sources, health, science and education, spanning the full spectrum of Tamil knowledge.

创建时间:
2026-07-27
原始信息汇总

数据集概述:TamilFact

基本信息

  • 数据集名称:TamilFact
  • 语言:泰米尔语(Tamil,ISO 639-1: ta)
  • 许可证:数据集采用 Creative Commons Attribution 4.0 (CC BY 4.0),代码采用 MIT License
  • 存储库:https://github.com/akashka005/Tamilfact

数据集规模

  • 源文档总量:771,447 篇文档
  • 清洗后文档:762,062 篇(保留率 98.8%)
  • 句子总量:约 21,000,000 句
  • 数据集大小:4.06 GB
  • 平均每篇文档句子数:27.5

数据来源与可信度

数据集整合了 8 个来源,涵盖 7 个类别:

类别 来源 文档数 估计句子数 可信度
百科全书 泰米尔语维基百科 188,978 ~4.0M ⭐⭐⭐⭐⭐
语料库 AI4Bharat Sangraha 478,765 ~16.7M ⭐⭐⭐⭐⭐
网络语料 CC100 Tamil 91,232 ~130k ⭐⭐⭐
命名实体识别 WikiANN Tamil 12,105 ~10k ⭐⭐⭐⭐⭐
新闻 Dinamalar 290 ~4k ⭐⭐⭐⭐
新闻 BBC Tamil 24 ~2k ⭐⭐⭐⭐⭐
新闻 OneIndia Tamil 37 ~1k ⭐⭐⭐⭐
健康 UNICEF Tamil 13 ~500 ⭐⭐⭐⭐⭐

声明数据集

  • 训练集:约 80,000 条(80%)
  • 验证集:约 10,000 条(10%)
  • 测试集:约 10,000 条(10%)
  • 总量:超过 100,000 条声明

数据格式

数据集以 CSV 格式提供(文件名:tamilfact_v1.csv),包含以下字段:

  • id:唯一声明 ID(字符串)
  • claim:泰米尔语事实声明(字符串)
  • source:来源名称(字符串)
  • url:来源 URL(字符串)
  • date:发布日期(字符串)
  • category:领域类别(字符串)
  • title:文档标题(字符串)
  • label:判定结果(字符串),取值为 SUPPORTED / REFUTED / NEI / UNVERIFIED
  • evidence:支持证据(字符串)
  • language:语言代码(字符串,值为 ta

声明标签体系

标签 含义 FEVER 等效标签
SUPPORTED 声明可验证且为真 SUPPORTS
REFUTED 声明可验证且为假 REFUTES
NEI 信息不足 NOT ENOUGH INFO
UNVERIFIED 等待验证

声明提取方法论

采用多阶段语言学过滤流水线:

  1. 长度过滤:20-300 字符
  2. 疑问句过滤:移除包含泰米尔疑问词的句子
  3. 观点过滤:移除主观表述
  4. 事实指示符:必须通过至少一个条件(年份、数字+泰米尔单位、泰米尔系词/事实动词)
  5. 泰米尔字符比例:泰米尔Unicode字符(U+0B80–U+0BFF)占比不低于 20%
  6. 去重:基于 MD5 哈希的声明去重

领域覆盖

泰米尔语维基百科覆盖以下领域:历史、政治、科学、健康、教育、体育、电影、文化、文学、地理

对抗鲁棒性设计

参照 Liu et al. (2025) 的攻击分类法,支持以下攻击类别研究:

  • 声明攻击:字符/词级扰动(计划 v2 版本)
  • 证据攻击:证据投毒与省略(计划 v2 版本)
  • 配对攻击:对称声明-证据构建(计划 v2 版本)

限制

  • 当前版本标签均为 UNVERIFIED,需人工或基于 LLM 的验证
  • 新闻覆盖因泰米尔语新闻网站的抓取限制而有限
  • 政府来源数据量极少
  • CC100 语料可能存在噪声
  • 数据集反映截至 2026 年中的知识

路线图

  • v1.0(已完成):原始语料收集(771k 文档)、清洗与句子分割(21M 句子)、声明提取(100k+ 声明)
  • v1.1(计划中):证据链接、基于 LLM 的标签验证
  • v2.0(计划中):对抗性声明生成、证据投毒攻击、对称数据集构建、HuggingFace Hub 上传

引用

bibtex @dataset{tamilfact2026, author = {Akash, K A}, title = {{TamilFact}: The First Large-Scale Tamil Automated Fact-Checking Dataset}, year = {2026}, publisher = {GitHub}, url = {https://github.com/akashka005/TamilFact}, language = {Tamil (ta)}, license = {CC BY 4.0}, note = {771,447 documents • 21M sentences • 100k+ claims} }

搜集汇总
数据集介绍
TamilFact 数据集图片
构建方式
TamilFact数据集面向低资源德拉维达语系中的泰米尔语,针对自动事实核查任务精心构建。其构建流程始于一个囊括维基百科、新闻、政府信息、健康、科学与教育等多领域的庞大语料库,共计77.1万份文档。数据经由专门的采集引擎从30余个来源获取后,历经Unicode标准化、噪声去除、泰米尔语分句、去重及质量筛选等严格清洗工序,最终保留约76.2万份高质量文档与约2100万条句子。在此基础上,采用多阶段语言学过滤器从句子中抽取事实性声明,过滤条件包括长度限制、疑问句与主观句剔除、事实指示词(如年份、数量单位、泰米尔语系动词)匹配以及泰米尔语字符比例阈值,并通过MD5哈希实现跨源去重,最终生成逾10万条声明,构成完整的TamilFact数据集。
特点
TamilFact数据集具备多重突出特点。作为首个面向泰米尔语的大规模自动事实核查资源,它填补了低资源语言在此领域的关键空白。其语料来源丰富多元,横跨百科全书、新闻、政府机构、医疗及科学等八个可靠渠道,覆盖历史、政治、科学、文化等十大知识域,保证了内容的广度与权威性。数据集包含超过10万条声明,并遵循FEVER基准设计了SUPPORTED、REFUTED、NEI与UNVERIFIED四种标签体系,便于模型训练与评估。尤为重要的是,TamilFact从设计之初便融入了对抗性鲁棒性考量,支持声明攻击、证据攻击及成对攻击等对抗场景,为研究多语言大模型在面对恶意扰动时的表现提供了坚实平台。
使用方法
使用者可通过直观的方式快速上手TamilFact数据集。数据以CSV格式提供,每条记录包含唯一ID、声明文本、来源、URL、日期、类别、标题、标签、证据及语言字段,结构清晰。加载方式灵活,既可直接使用Pandas读取CSV文件,也可通过HuggingFace Datasets库便捷调用预划分的训练集、验证集与测试集。利用Transformers库,用户可基于IndicBERT等多语言预训练模型对声明与证据进行编码,进而训练用于事实标签预测的分类器。此外,数据集支持按来源或领域过滤,便于聚焦特定子集进行研究。完整的代码与文档已开源在GitHub,允许用户重复整个采集与处理流程,为泰米尔语自然语言处理与自动事实核查研究提供了可复现的坚实基础。
背景与挑战
背景概述
在低资源语言自然语言处理领域,事实核查任务长期面临数据匮乏的困境。TamilFact数据集由K. A. Akash于2026年创建,依托印度Lovely Professional University的研究力量,专为泰米尔语自动事实核查而设计。该数据集以FEVER基准为蓝本,整合了泰米尔语维基百科、AI4Bharat的Sangraha语料库、新闻及政府文档等八类来源,构建了包含77万余篇文档、约2100万句子的庞大语料库,并从中提取出逾10万条事实性声明。TamilFact的发布填补了达罗毗荼语系在事实核查领域的空白,为低资源语言对抗性鲁棒性研究提供了关键支撑,推动了多语言大模型在该方向上的评测与演进。
当前挑战
TamilFact所解决的领域问题在于:泰米尔语作为低资源语言,缺乏大规模、高质量且覆盖多领域的事实核查数据集,现有模型在该语言上的验证能力难以迁移。其构建过程中面临多重挑战:首先,新闻来源受限,因泰米尔语新闻网站的反爬机制导致数据采集量不足;其次,政府与官方来源的RSS订阅源返回内容稀少,影响政务类声明覆盖;再者,CC100网络语料虽体量可观但噪声较大,需依赖精细清洗流程(Unicode标准化、去重、质量过滤)以提升纯度;此外,声明的自动提取需设计复杂的语言学规则,包括长度筛选、疑问句与主观句剔除、事实性动词及年份等模式匹配,才能从海量文本中精准抽取出可验证的事实性陈述。
常用场景
经典使用场景
TamilFact 数据集专为低资源语言中的自动化事实核查(Automated Fact-Checking, AFC)任务而设计,其经典使用场景在于训练和评估面向泰米尔语(Tamil)的事实验证模型。研究人员可利用该数据集中超过十万条标注了支持(SUPPORTED)、反驳(REFUTED)或信息不足(NEI)等标签的声明(claim)及其对应的证据文本,构建从声明提取、证据检索到最终分类的端到端事实核查流水线。该数据集特别适用于在德拉维达语系这一资源匮乏的领域中,复现和拓展类似 FEVER 基准的评估范式,为后续对抗性鲁棒性研究奠定了实验基础。
实际应用
在实际应用层面,TamilFact 数据集可赋能面向泰米尔语用户群体的新闻真实性验证平台、社交媒体虚假信息检测系统以及公共健康知识库的质量管控工具。例如,媒体机构可利用基于该数据集微调的 AFC 模型,对泰米尔语新闻稿件中的历史事件声明、卫生防疫建议或政府政策表述进行自动交叉核对,从而提升内容的可信度。此外,该数据集还可服务于教育科技领域,用于开发泰米尔语学习场景中的知识问答验证模块,辅助教师快速甄别学生作业中的事实性错误。其与 HuggingFace Datasets 库的无缝集成亦降低了技术门槛,使得更多本地化应用能够便捷部署事实核查能力。
衍生相关工作
TamilFact 数据集的发布催生了一系列围绕泰米尔语及低资源语言事实核查的衍生研究。一方面,研究者基于其声明抽取方法论,陆续构建了面向马拉雅拉姆语、泰卢固语等其他德拉维达语系语言的类似资源,形成了跨语言事实核查基准的雏形。另一方面,受其对抗性鲁棒性设计启发,后续工作探索了针对证据链路的多跳检索与对抗性样本生成技术,例如通过对比学习对声明-证据对进行去偏处理,或引入反事实增强策略提升模型对同义改写攻击的防御能力。此外,该数据集亦被用于评估多语言预训练模型(如 IndicBERT、XLM-R)在低资源场景下的事实推理表现,推动了多语言事实核查领域的评测方法论革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务