TamilFact
收藏资源简介:
TamilFact是第一个针对泰米尔语的大规模事实核查数据集,旨在支持低资源达罗毗荼语言的自动事实核查研究。它基于一个包含77.1万份文档的语料库构建,涵盖百科全书、新闻、政府来源、健康、科学和教育等领域,覆盖泰米尔知识的全谱。
TamilFact is the first large-scale fact-checking dataset tailored for the Tamil language, designed to support automated fact-checking research for low-resource Dravidian languages. Built upon a corpus comprising 771,000 documents, it covers diverse domains including encyclopedic materials, news, government sources, health, science and education, spanning the full spectrum of Tamil knowledge.
数据集概述:TamilFact
基本信息
- 数据集名称:TamilFact
- 语言:泰米尔语(Tamil,ISO 639-1: ta)
- 许可证:数据集采用 Creative Commons Attribution 4.0 (CC BY 4.0),代码采用 MIT License
- 存储库:https://github.com/akashka005/Tamilfact
数据集规模
- 源文档总量:771,447 篇文档
- 清洗后文档:762,062 篇(保留率 98.8%)
- 句子总量:约 21,000,000 句
- 数据集大小:4.06 GB
- 平均每篇文档句子数:27.5
数据来源与可信度
数据集整合了 8 个来源,涵盖 7 个类别:
| 类别 | 来源 | 文档数 | 估计句子数 | 可信度 |
|---|---|---|---|---|
| 百科全书 | 泰米尔语维基百科 | 188,978 | ~4.0M | ⭐⭐⭐⭐⭐ |
| 语料库 | AI4Bharat Sangraha | 478,765 | ~16.7M | ⭐⭐⭐⭐⭐ |
| 网络语料 | CC100 Tamil | 91,232 | ~130k | ⭐⭐⭐ |
| 命名实体识别 | WikiANN Tamil | 12,105 | ~10k | ⭐⭐⭐⭐⭐ |
| 新闻 | Dinamalar | 290 | ~4k | ⭐⭐⭐⭐ |
| 新闻 | BBC Tamil | 24 | ~2k | ⭐⭐⭐⭐⭐ |
| 新闻 | OneIndia Tamil | 37 | ~1k | ⭐⭐⭐⭐ |
| 健康 | UNICEF Tamil | 13 | ~500 | ⭐⭐⭐⭐⭐ |
声明数据集
- 训练集:约 80,000 条(80%)
- 验证集:约 10,000 条(10%)
- 测试集:约 10,000 条(10%)
- 总量:超过 100,000 条声明
数据格式
数据集以 CSV 格式提供(文件名:tamilfact_v1.csv),包含以下字段:
- id:唯一声明 ID(字符串)
- claim:泰米尔语事实声明(字符串)
- source:来源名称(字符串)
- url:来源 URL(字符串)
- date:发布日期(字符串)
- category:领域类别(字符串)
- title:文档标题(字符串)
- label:判定结果(字符串),取值为
SUPPORTED/REFUTED/NEI/UNVERIFIED - evidence:支持证据(字符串)
- language:语言代码(字符串,值为
ta)
声明标签体系
| 标签 | 含义 | FEVER 等效标签 |
|---|---|---|
| SUPPORTED | 声明可验证且为真 | SUPPORTS |
| REFUTED | 声明可验证且为假 | REFUTES |
| NEI | 信息不足 | NOT ENOUGH INFO |
| UNVERIFIED | 等待验证 | — |
声明提取方法论
采用多阶段语言学过滤流水线:
- 长度过滤:20-300 字符
- 疑问句过滤:移除包含泰米尔疑问词的句子
- 观点过滤:移除主观表述
- 事实指示符:必须通过至少一个条件(年份、数字+泰米尔单位、泰米尔系词/事实动词)
- 泰米尔字符比例:泰米尔Unicode字符(U+0B80–U+0BFF)占比不低于 20%
- 去重:基于 MD5 哈希的声明去重
领域覆盖
泰米尔语维基百科覆盖以下领域:历史、政治、科学、健康、教育、体育、电影、文化、文学、地理
对抗鲁棒性设计
参照 Liu et al. (2025) 的攻击分类法,支持以下攻击类别研究:
- 声明攻击:字符/词级扰动(计划 v2 版本)
- 证据攻击:证据投毒与省略(计划 v2 版本)
- 配对攻击:对称声明-证据构建(计划 v2 版本)
限制
- 当前版本标签均为
UNVERIFIED,需人工或基于 LLM 的验证 - 新闻覆盖因泰米尔语新闻网站的抓取限制而有限
- 政府来源数据量极少
- CC100 语料可能存在噪声
- 数据集反映截至 2026 年中的知识
路线图
- v1.0(已完成):原始语料收集(771k 文档)、清洗与句子分割(21M 句子)、声明提取(100k+ 声明)
- v1.1(计划中):证据链接、基于 LLM 的标签验证
- v2.0(计划中):对抗性声明生成、证据投毒攻击、对称数据集构建、HuggingFace Hub 上传
引用
bibtex @dataset{tamilfact2026, author = {Akash, K A}, title = {{TamilFact}: The First Large-Scale Tamil Automated Fact-Checking Dataset}, year = {2026}, publisher = {GitHub}, url = {https://github.com/akashka005/TamilFact}, language = {Tamil (ta)}, license = {CC BY 4.0}, note = {771,447 documents • 21M sentences • 100k+ claims} }




