遇见数据集

atahanuz/setimes-en-tr-aligned-corpus

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

SETimes EN-TR — 句子对齐、LLM清理版本是一个经过清理和重新对齐的SETimes英语-土耳其语平行语料库。原始SETimes数据是段落风格的——每个“对”可能包含标题、日期行、多个正文句子和来源引用,所有内容都粘合在一行上。此版本将所有内容拆分为适当的句子对,因此每一行都是一个英语句子及其土耳其语翻译。数据集包含144,065个句子对,存储在一个CSV文件中。清理过程使用大型语言模型(gpt-oss-120b)进行分割和过滤,以移除无关内容(如独立日期行、来源引用块)并确保句子对齐,同时通过嵌入模型(qwen3-embedding-8b)计算跨语言余弦相似度进行过滤。数据来源于SETimes平行语料库(Tyers和Alperen,2010),包含2003-2012年SETimes.com发布的关于东南欧事务的新闻文章,采用CC-BY-4.0许可证。

语言: - 英语 - 土耳其语 授权协议:CC-BY-4.0 多语言类型: - 翻译型 友好名称:SETimes 英-土(句子对齐、经大语言模型清洗) 规模区间:10万<样本量<100万 源数据集: - 扩展|setimes 标签: - 翻译 - 机器翻译 - 平行语料库(parallel corpus) - 英语 - 土耳其语 - 经大语言模型清洗 任务类别: - 翻译 配置项: - 配置名称:default 数据文件: - 划分:训练集 路径:setimes_en_tr_aligned.csv # SETimes 英-土平行语料库 — 句子对齐、经大语言模型清洗 本数据集为原始SETimes英土平行语料库的清洗重对齐版本。原始SETimes语料采用段落式结构,每组“语料对”可能包含标题、发稿栏、若干正文语句及来源标注,全部拼接于同一行内。本版本将所有内容拆分为标准语句对,每一行均对应一条英语语句及其土耳其语译版。 本数据集包含**144,065条语句对**,存储于单个CSV文件中。 ## 快速统计数据 | 统计项 | 数值 | |---|---| | 总语料对数量 | 144,065 | | 单语料对英语词汇量(中位数/均值) | 20 / 20.7 | | 单语料对土耳其语词汇量(中位数/均值) | 16 / 17.1 | | 相似度得分(均值/5分位数/95分位数) | 0.80 / 0.70 / 0.87 | | 对齐前的源段落数量 | 119,162 | ## 字段说明 | 字段名 | 数据类型 | 描述 | |---|---|---| | `en` | 字符串 | 英语语句 | | `tr` | 字符串 | 土耳其语语句 | | `sim` | 浮点数 | 两侧语句的跨语言余弦相似度(cross-lingual cosine similarity),由`qwen3-embedding-8b`生成。数值越高表示词汇相似度越高——但需注意,该指标仅反映同源词重叠程度,而非翻译质量。来源标注与日期类语句得分最高;低同源性语句的合格译版得分通常约为0.5。 | | `source_line` | 整数 | 该语句来源的原始SETimes段落索引。若某段落被拆分为多个语句对,则多条记录会共享同一`source_line`值。 | ## 清洗流程说明 原始SETimes语料库在训练翻译模型时存在若干实际问题: 1. 大量“语料对”并非单一句对,而是将完整的新闻文章头部拼接而成:包括标题、日期、地点发稿栏、1至2条正文语句及来源标注,全部集中于同一行。基于此类语料训练的模型会学习到无法泛化的长距离模式。 2. 部分“语料对”为纯来源标注内容,例如`(Reuters, AP - 12/04/05)`,两侧内容完全一致,无翻译学习价值。 3. 少量语料对因源稿件的编辑修订,出现单侧内容错误的问题。 为解决上述问题,我们将每一组原始段落对输入至大语言模型(Large Language Model,LLM)`gpt-oss-120b`,并附带严格提示词,要求模型完成以下操作: - **保留**所有完整语句与标题(保留标题旁附带的日期信息)。 - **剔除**独立的发稿栏(例如`ZAGREB, Croatia --`)、来源标注块(例如`(Reuters, AP - ...)`)及孤立的日期戳。 - **拆分**被逗号拼接的标题与正文语句——此前版本的提示词中该场景为主要问题之一。 - **绝对禁止**翻译、释义或修正拼写错误——模型仅需选择保留内容与划分方式。 完成大语言模型处理后,我们使用`qwen3-embedding-8b`对所有输出语句进行句嵌入(embedding),并过滤掉满足以下任一条件的语料对: - 英语与土耳其语语句完全一致(未经过翻译)。 - 两侧词汇长度比例极端(超出`[0.25, 4.0]`区间)。 - 任意一侧语句词汇量少于3个。 - 两侧语句词汇重叠率超过80%(同源词占比过高或存在复制内容)。 - 跨语言余弦相似度低于0.35(大语言模型为两侧匹配了错误的语句)。 本次清洗从原始144,244条语料对中移除了179条,虽删除量不大,但大幅提升了语料质量。 ## 数据集加载方法 python from datasets import load_dataset ds = load_dataset("atahanuz/setimes-en-tr-aligned") print(ds["train"][0]) # {'en': '...', 'tr': '...', 'sim': 0.73, 'source_line': 59} 也可通过pandas直接加载: python import pandas as pd df = pd.read_csv("setimes_en_tr_aligned.csv") ## 来源与授权协议 本数据集的原始文本来自**SETimes**平行语料库(Tyers与Alperen,2010),该语料库收录了2003年至2012年间SETimes.com发布的东南欧事务相关新闻文章。SETimes采用CC-BY-4.0协议发布,本衍生数据集沿用相同授权协议。 若使用本数据集,请引用原始SETimes论文: Tyers, F. M., & Alperen, M. S. (2010). South-East European Times: A parallel corpus of Balkan languages. Proceedings of the LREC workshop on exploitation of multilingual resources and tools for Central and (South-) Eastern European Languages.

提供机构:
atahanuz
搜集汇总
数据集介绍
atahanuz/setimes-en-tr-aligned-corpus 数据集图片
构建方式
SETimes EN-TR对齐语料库源自SETimes英文-土耳其语平行语料库(Tyers与Alperen,2010),原始数据以段落形式呈现,每对样本可能混杂标题、日期、多个正文句子及来源引用。本研究利用大语言模型(LLM)对原始语料进行精细化处理:通过gpt-oss-120b模型,依据严格指令保留每个完整句子与标题,剔除孤立日期行、来源引用块等无效信息,并将融合于标题后的正文句子拆分。随后,借助qwen3-embedding-8b嵌入模型计算跨语言余弦相似度,结合词长比例、词重叠率等指标进行过滤,最终保留144,064个高质量句对,划分为训练集(142,064)、开发集(1,000)与测试集(1,000)。
特点
该数据集的核心特色在于其经过LLM与嵌入模型双层清洗的高质量句级对齐。原始段落式数据被精准拆分为独立的英语-土耳其语句对,有效消除了长距离噪声模式的干扰。每个句对附带跨语言余弦相似度评分(sim列),由qwen3-embedding-8b计算,反映词法层面的重叠程度,但需注意高相似度可能源于同源词而非翻译质量。此外,source_line字段保留了原始段落索引,便于追溯句对的语篇来源。过滤规则严苛:剔除未翻译的相同内容、词长比例极端(超出0.25至4.0范围)、任一侧不足3词、词重叠率超80%以及相似度低于0.35的句对,最终仅移除179对低质数据,确保语料的纯净度与实用性。
使用方法
用户可通过HuggingFace datasets库便捷加载:使用load_dataset("atahanuz/setimes-en-tr-aligned-corpus")即可获取包含训练、开发与测试三分的DatasetDict对象,每个样本包含英语句(en)、土耳其语句(tr)、相似度得分(sim)及来源行号(source_line)。也可直接通过pandas读取CSV文件:pd.read_csv("setimes_en_tr_aligned_train.csv")等。该语料适用于机器翻译模型的训练与评估,特别适合需要句级对齐平行数据的场景,开发与测试集已严格隔离以确保评估的公正性。
背景与挑战
背景概述
SETimes EN-TR平行语料库由Tyers与Alperen于2010年创建,源于SETimes.com在2003至2012年间发布的东南欧新闻文章,旨在为英语-土耳其语机器翻译研究提供基础数据资源。该数据集经大型语言模型重对齐与清洗,将原始段落级配对拆分为144,064条精准句对,显著提升了翻译模型训练的可靠性与泛化能力。作为低资源语言对翻译领域的重要基准,其公开的CC-BY-4.0许可促进了跨语种自然语言处理技术的广泛探索与验证。
当前挑战
该数据集所解决的领域挑战是英语-土耳其语机器翻译中的平行语料质量瓶颈:原始SETimes语料中大量‘配对’实为包含标题、日期、正文及来源信息的段落拼接,导致模型难以学习有效翻译信号;同时存在重复引用、单侧内容错误等问题。构建过程中,研究团队采用LLM严格拆分并丢弃孤立日期行与整段引用,借助跨语言余弦相似度与词长比率等指标滤除179条噪音对,在保证144,064条句对规模的同时实现了高质量对齐。
常用场景
经典使用场景
在机器翻译研究领域,SETimes英语-土耳其语平行语料库的句级对齐版本堪称一项基础性资源。该数据集源自SETimes新闻语料库,经过大语言模型的精细清洗与重对齐,最终呈现为144,064个高质量的句级平行对。其经典使用场景在于为神经机器翻译模型提供训练与评估数据,尤其在英语与土耳其语这类形态丰富、语序差异显著的语言对之间,该语料库通过去除段落级噪声、舍弃无翻译信号的纯引用文本,显著提升了翻译模型的泛化能力与鲁棒性。研究人员常将其作为低资源语言对机器翻译的基准数据集,用以探索跨语言语义对齐与长距离依赖建模的深层机制。
衍生相关工作
该数据集的发布催生了一系列具有影响力的衍生研究工作。首先,其LLM清洗管线启发了后续的自动语料质量评估方法,研究者借鉴其基于嵌入相似性与长度比率的过滤策略,开发出针对其他语言对的通用清洗框架。其次,该语料库被广泛用作预训练语言模型微调阶段的翻译任务数据集,例如在mT5或XLM-R等跨语言模型上评估其英-土翻译能力。此外,基于该对齐版本,部分工作进一步探索了跨语言语义相似度计算在机器翻译评价中的有效性,论证了余弦相似度指标与人工翻译质量之间的关联性,从而推动了更鲁棒的自动评价指标的设计。
数据集最近研究
最新研究方向
在低资源神经机器翻译领域,SETimes英-土平行语料库的细粒度清洗与句级对齐方法正成为前沿热点。该数据集通过大语言模型进行语义分解与噪声过滤,去除旁白、版权注解等无翻译信号的冗余片段,并利用跨语言嵌入相似度阈值剔除错配句对,显著提升了平行语料质量。这一研究路径响应了机器翻译系统对高质量、细粒度训练数据的迫切需求,尤其是在土耳其语这类形态丰富、资源稀缺的语言对中,其LLM清洗策略为构建更可靠的低资源翻译基准提供了范式参考,对推动多语种语料库标准化建设具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务