Cross-Language Dataset
收藏资源简介:
这是一个多语言、多风格和多粒度的数据集,用于跨语言文本相似性检测。数据集包含法语、英语和西班牙语,提供不同粒度的跨语言对齐信息,包括文档级、句子级和块级。数据集基于平行和可比语料库,包含人工和机器翻译文本,部分数据经过修改以增加跨语言相似性检测的复杂性。文档由不同类型的作者撰写,从普通作者到专业作者。
This is a multilingual, multi-style and multi-granularity dataset intended for cross-lingual text similarity detection. The dataset covers French, English and Spanish, and provides cross-lingual alignment information at different granularities, including document-level, sentence-level and chunk-level. Built upon parallel and comparable corpora, it contains both human-translated and machine-translated texts, with a portion of the data modified to increase the complexity of cross-lingual text similarity detection tasks. The documents are written by authors of various categories, ranging from ordinary individual writers to professional authors.
Cross-Language Dataset
描述
该数据集是一个用于跨语言文本相似性检测的多语言、多风格和多粒度数据集。具体特点如下:
- 多语言:包含法语、英语和西班牙语。
- 多粒度:提供不同粒度的跨语言对齐信息,包括文档级、句子级和块级。
- 基于语料库:基于平行语料和可比语料。
- 翻译类型:包含人工翻译和机器翻译文本。
- 数据处理:部分数据经过修改(以增加跨语言相似性检测的复杂性),其余部分保持无噪声。
- 作者类型:文档由不同类型的作者编写,从普通到专业。
特征
| 子语料库 | 对齐类型 | 作者类型 | 翻译类型 | 翻译者 | 修改 | NE (%) |
|---|---|---|---|---|---|---|
| JRC Acquis<sup>2</sup> | 平行 | 政治家 | 人工 | 专业 | 否 | 3.74 |
| Europarl<sup>1</sup> | 平行 | 政治家 | 人工 | 专业 | 否 | 7.74 |
| Wikipedia<sup>2</sup> | 可比 | 任何人 | - | - | 噪声 | 8.37 |
| PAN-PC-11<sup>3</sup> | 平行 | 专业作者 | 人工 | 专业 | 是 | 3.24 |
| APR (Amazon Product Reviews<sup>4</sup>) | 平行 | 任何人 | 机器 | Google Translate | 否 | 6.04 |
| 会议论文 | 可比 | 计算机科学家 | 人工 | 计算机科学家 | 噪声 | 9.36 |
统计数据
| 子语料库 | 对齐文档数量 | 对齐句子数量 | 对齐名词块数量 |
|---|---|---|---|
| JRC-Acquis<sup>2</sup> | 10,000 | 149,506 | 10,094 |
| Europarl<sup>1</sup> | 9,431 | 475,834 | 25,603 |
| Wikipedia<sup>2</sup> | 10,000 | 4,792 | 132 |
| PAN-PC-11<sup>3</sup> | 2,920 | 88,977 | 1,360 |
| APR (Amazon Product Reviews<sup>4</sup>) | 6,000 | 23,235 | 2,603 |
| 会议论文 | 35 | 1,304 | 272 |
数据集结构
dataset/documents/目录:包含文档级对齐的平行和可比文件。dataset/sentences/目录:包含句子级对齐的平行和可比文件。dataset/chunks/目录:包含块级对齐的平行和可比文件。dataset/documents/Conference_papers/目录:包含原始科学论文的 PDF 格式文件。dataset/*/PAN11/子目录:包含 PAN-PC-11 对齐的额外元数据。docs/目录:包含与数据集相关的论文。masks/目录:包含用于构建评估折的掩码。scripts/目录:包含重建数据集所需的脚本。stats/目录:包含数据集的统计数据 XLSX 文件。study/目录:包含 BUCC 2017 论文中进行的研究的 XLSX 文件。
脚本目录
scripts/chunking/目录:包含从 TreeTagger 的 POS 序列中提取名词块的脚本。scripts/create_translations_dico/目录:包含为 HunAlign 构建一元翻译字典的脚本。scripts/create_verif_align/目录:包含以可读格式打印和保存对齐的脚本。scripts/enrich_dico_with_dbnary/目录:包含使用 DBNary 条目丰富一元翻译字典的脚本。scripts/parse_APR_collection/目录:包含解析 Webis-CLS-10 语料库并提取英法对齐对的脚本。scripts/parse_PAN_collection/目录:包含解析 PAN-PC-11 语料库并提取英西对齐对及其元数据的脚本。scripts/parse_conf_papers_bibtex/目录:包含解析 TALN BibTeX,爬取网页并构建法英会议论文对的脚本。
引用
使用此数据集时,请引用:
@inproceedings{CrossLanguageDatasetLREC2016, TITLE = {{A Multilingual, Multi-Style and Multi-Granularity Dataset for Cross-Language Textual Similarity Detection}}, AUTHOR = {J{e}r{e}my Ferrero and Fr{e}d{e}ric Agn{`e}s and Laurent Besacier and Didier Schwab}, BOOKTITLE = {{The 10th edition of the Language Resources and Evaluation Conference (LREC 2016)}}, ADDRESS = {Portoro{v z}, Slovenia}, YEAR = {2016}, MONTH = May, KEYWORDS = {Cross-language plagiarism detection ; Dataset ; Cross-language dataset ; Cross-language similarity detection ; Evaluation}, }




