webfaq_cleaned
收藏资源简介:
webfaq_cleaned 是一个经过清理的多语言问答数据集,涵盖44种语言,总计约5850万个问答对。该数据集源自网页抓取的FAQ页面,原始数据包含大量SEO门户页面、垃圾内容、不匹配的电子商务列表页面、近重复模板和编码错误。通过多层清理管道(包括子字符串阻止列表、重复检测、编码修复等步骤)过滤了这些噪声,同时保留了实质性的问答内容。每个数据样本包含两个字符串字段:query(问题)和document(答案/支持段落)。数据集按语言分为不同的配置,每种配置仅包含训练分割,适用于对比学习训练、检索系统评估等自然语言处理任务。已知限制包括某些语言仍存在约15-20%的不匹配对,但大多数语言的实质内容保留率在90-100%之间。
webfaq_cleaned is a cleaned multilingual question-answering (QA) dataset covering 44 languages, with a total of approximately 58.5 million QA pairs. This dataset is sourced from web-crawled FAQ pages. The raw data contained a large volume of SEO portal pages, spam content, mismatched e-commerce listing pages, near-duplicate templates, and encoding errors. A multi-layer cleaning pipeline was applied to filter out these noises while retaining the substantive question-answering content. Each data sample contains two string fields: `query` (the question) and `document` (the answer/supporting paragraph). The dataset is organized into language-specific configurations, where each configuration only includes the training split. This dataset is suitable for natural language processing (NLP) tasks such as contrastive learning training and retrieval system evaluation. The cleaning process includes steps such as substring blocklists, duplicate detection, and encoding correction, aiming to conservatively remove templated noises while preserving semantically aligned QA pairs. Known limitations include that approximately 15-20% of mismatched pairs still exist in certain languages, while the retention rate of substantive content for most languages ranges between 90% and 100%.
数据集概述:webfaq_cleaned
webfaq_cleaned 是一个经过清洗的多语言问答对数据集,旨在用于对比学习或检索评估。它源自 PaDaS-Lab/webfaq 数据集,通过多层清洗流程过滤了原数据中的大量噪音(如SEO入口页面、赌博垃圾信息、不匹配的产品列表、近似重复模板、编码错误),同时保留了高质量的问答内容。
数据结构
- 数据格式:每一条记录为一个问答对。
- 字段说明:
- query(字符串):问题。
- document(字符串):答案或相关段落。
- 数据集划分:每个语言配置(config)仅包含一个
train分割(split)。 - 总数据规模:约58.5M个问答对,覆盖44种语言。
语言列表与数据统计
以下为各语言的数据保留情况,按清洗后保留的问答对数量排序。source 为原始数据量,kept 为清洗后保留量,kept% 为保留比例。
| 语言 | 原始数据量 | 保留数据量 | 保留比例 | 语言 | 原始数据量 | 保留数据量 | 保留比例 |
|---|---|---|---|---|---|---|---|
| en (英语) | 49,275,346 | 40,817,655 | 82.8% | ro (罗马尼亚语) | 546,709 | 378,587 | 69.2% |
| fa (波斯语) | 969,748 | 841,712 | 86.8% | fi (芬兰语) | 641,009 | 373,519 | 58.3% |
| ar (阿拉伯语) | 1,000,000 | 829,000 | 82.9% | th (泰语) | 502,215 | 355,047 | 70.7% |
| tr (土耳其语) | 1,000,000 | 820,040 | 82.0% | el (希腊语) | 494,019 | 349,025 | 70.7% |
| fr (法语) | 1,000,000 | 805,753 | 80.6% | hu (匈牙利语) | 363,866 | 283,635 | 78.0% |
| nl (荷兰语) | 1,000,000 | 802,485 | 80.2% | no (挪威语) | 316,320 | 248,062 | 78.4% |
| de (德语) | 1,000,000 | 798,319 | 79.8% | he (希伯来语) | 391,084 | 188,530 | 48.2% |
| es (西班牙语) | 1,000,000 | 797,885 | 79.8% | sk (斯洛伐克语) | 177,748 | 141,875 | 79.8% |
| it (意大利语) | 1,000,000 | 796,614 | 79.7% | bg (保加利亚语) | 164,015 | 134,795 | 82.2% |
| pt (葡萄牙语) | 1,000,000 | 793,637 | 79.4% | lt (立陶宛语) | 119,192 | 89,490 | 75.1% |
| ru (俄语) | 1,000,000 | 784,173 | 78.4% | is (冰岛语) | 91,630 | 64,358 | 70.2% |
| pl (波兰语) | 1,000,000 | 782,624 | 78.3% | lv (拉脱维亚语) | 79,443 | 59,446 | 74.8% |
| vi (越南语) | 1,000,000 | 723,073 | 72.3% | ca (加泰罗尼亚语) | 80,189 | 57,740 | 72.0% |
| zh (中文) | 1,000,000 | 682,722 | 68.3% | et (爱沙尼亚语) | 69,643 | 56,385 | 81.0% |
| sv (瑞典语) | 832,140 | 675,465 | 81.2% | bn (孟加拉语) | 57,943 | 50,329 | 86.9% |
| ja (日语) | 1,000,000 | 662,302 | 66.2% | sl (斯洛文尼亚语) | 49,867 | 42,019 | 84.3% |
| da (丹麦语) | 768,688 | 609,387 | 79.3% | mr (马拉地语) | 30,658 | 26,642 | 86.9% |
| ko (韩语) | 646,996 | 592,344 | 91.6% | ms (马来语) | 24,448 | 20,867 | 85.4% |
| uk (乌克兰语) | 805,505 | 580,032 | 72.0% | te (泰卢固语) | 23,949 | 19,578 | 81.7% |
| id (印尼语) | 652,660 | 482,649 | 74.0% | az (阿塞拜疆语) | 19,738 | 18,357 | 93.0% |
| hi (印地语) | 537,488 | 478,818 | 89.1% | tl (他加禄语) | 21,467 | 16,743 | 78.0% |
| cs (捷克语) | 538,343 | 392,826 | 73.0% | ta (泰米尔语) | 19,815 | 16,305 | 82.3% |
清洗流程
清洗采用迭代式方法,包含四个轻量级的过滤步骤:
- 子串黑名单:使用跨语言的SEO品牌标记(如KAYAK、momondo、Tripadvisor)以及部分语言特定的模式。
- 回声/问题模板过滤:针对受影响的语言,过滤简单的“是/否”回显及问题模板。
- 近似重复去重:使用MinHash LSH(64排列,16条带,字符级5-gram,Jaccard相似度≥0.85)进行去重。
- 编码修复:修复HTML实体、JSON Unicode转义残留及字面量特殊字符(如
),并丢弃包含非法字符(ufffd)的行。
该流程设计保守,主要针对模板化噪音和已知编码问题,而非衡量语义相关性,因此即使表面形式有些模板化的问答对仍被保留。
已知局限性
- 产品列表SEO噪音残留:在部分语言中,仍存在约15-20%的不匹配问答对。主要模式为产品标题查询与不相关的用户评论配对,由于这些配对是唯一的(去重无法捕捉)且缺乏明显的子串标记,需要语义相关性分类器才能有效移除。
- 保留比例大幅下降的语言(如希伯来语、芬兰语、罗马尼亚语等):这些下降主要反映了对模板化旅行聚合器酒店页面的大规模移除,而非实质问答内容的丢失。抽查显示这些语言保留的条目中90-100%为实质内容。
- 其他语言的质量:英语、阿拉伯语、印地语、韩语、德语、法语等语言的抽查显示,90-100%为实质内容。剩余约5-10%主要是良性的模板化单一来源答案(如价格预测、天气摘要、酒店信息),而非真正不匹配的问答对。
来源与引用
该数据集是 PaDaS-Lab/webfaq 的衍生和过滤版本。使用时请引用原始WebFAQ发布以及本次清洗工作。该数据集仅供研究使用。




