遇见数据集

LAIT

收藏
arXiv2026-06-25 更新2026-06-26 收录
数据链接:
官方服务:

资源简介:

LAIT(文学人工智能翻译)数据集是由西蒙弗雷泽大学、魁北克大学蒙特利尔分校与微软研究院联合构建的读者中心化评估语料库,专注于文学翻译质量的多维度评测。该数据集包含15部法文、波兰文和日文小说的英文开篇节选,涵盖约8千词规模的原文、人工翻译与智能体大语言模型流水线生成的机器翻译对齐文本,总计产生1千条读者评论、2千项判断与偏好评分以及7.2千个片段级标注。数据通过专业译者翻译与自动化预处理流程构建,结合沉浸式阅读与细粒度对比评估方法,旨在系统量化读者对文学翻译的感知差异,为机器翻译在文学领域的应用提供实证评估基准。

The LAIT (Literary AI Translation) dataset is a reader-centric evaluation corpus jointly constructed by Simon Fraser University, Université du Québec à Montréal, and Microsoft Research, focusing on multi-dimensional evaluation of literary translation quality. This dataset includes English opening excerpts from 15 novels originally written in French, Polish, and Japanese, with aligned text sets totaling approximately 8,000 words covering source texts, human translations, and machine translations generated via AI agent pipelines powered by large language models. It encompasses 1,000 reader comments, 2,000 judgment and preference ratings, and 7,200 segment-level annotations. Developed through professional translator work and automated preprocessing workflows, the dataset integrates immersive reading and fine-grained comparative evaluation methodologies, with its core aim to systematically quantify readers' perceived differences in literary translation and provide an empirical evaluation benchmark for the application of machine translation in the literary domain.

创建时间:
2026-06-25
原始信息汇总

数据集概述:LAIT(Literary AI Translation)

LAIT 是一个关于文学文本人工翻译与机器翻译质量的读者研究数据集,由西蒙菲莎大学、魁北克大学蒙特利尔分校和微软的研究人员创建。

研究目标

  • 评估读者对文学文本人工翻译(HT)与机器翻译(MT)的偏好与质量感知。
  • 探究读者能否准确识别AI翻译。

数据规模

  • 15 名 深度阅读型读者
  • 15 部 近期出版的小说(原文为法语、波兰语、日语)
  • 所有翻译目标语言:英语
  • 总读者评论数:952 条
  • 总高亮标注数:7,234 个(读者在逐段对比时标记为“好”或“差”的措辞)

研究流程

  1. 沉浸式阅读阶段
    • 每位读者阅读两篇完整的约 8,000 词的英译小说摘录(一次阅读HT,一次阅读MT)。
    • 对每篇翻译进行评分(5分量表,评估四项质量指标)和评论。
    • 对比两种翻译版本,给出相对评分、偏好判断及理由。
    • 盲测:读者不知道哪篇是人工翻译,哪篇是机器翻译,且阅读顺序平衡。
    • 数据量:30 次摘录对比,60 次单次阅读。
  2. 细粒度对比阶段
    • 经过 24 小时休整后,读者将约 300 词的短句段(共 386 个句段)并排对比。
    • 高亮标记措辞为“好”或“差”。
    • 选择更好的版本并解释原因。
    • 数据量:772 次句段对比。

主要发现

  • 读者总体上偏好人工翻译:无论是整篇摘录还是短句段对比,人工翻译的得分均高于机器翻译。在句段级对比中,偏好更明显。
  • 人工翻译质量更稳定:人工翻译质量在整部小说中相对稳定,而机器翻译质量句段间波动更大。
  • 读者无法可靠识别机器翻译:AI 检测准确率在两种评估阶段均较低。
  • 高分亮点分布:人工翻译获得显著更多的“好”高亮标注。

数据集内容与获取

  • 数据集包含:读者对人工和机器翻译质量的全部 952 条评论(按主题、翻译版本、源语言、读者、书籍等筛选查看)和 7,234 个高亮标注示例。评论涵盖读者对译本优劣的评价、偏好理由、AI识别判断理由等。
  • 不包含:人工翻译原文或源文本原文。
  • 获取方式:研究人员需通过申请(Research Purposes Only)获取完整数据集: Apply for dataset access →
搜集汇总
数据集介绍
LAIT 数据集图片
构建方式
在文学文本机器翻译评估领域,现有方法多聚焦于小单元或破坏沉浸感的片段级评分,难以捕捉读者的真实阅读体验。为填补这一空白,LAIT数据集以读者为中心进行构建,选取了2025至2026年间出版的法语、波兰语和日语小说各五部,每部节选约8000词的开篇段落。研究者将职业人工翻译(HT)与基于智能体大语言模型流水线(MT)生成的译文进行配对,并招募15名热爱阅读的受试者,每位受试者评估两本书,每本书由两名读者独立评价。评估流程包含沉浸式通读全文与间隔一天后的细读对照,共收集了386个对齐的HT-MT语块对的772次比较判断。
特点
该数据集的核心特色在于其多维度、深层次的读者反馈体系。它不仅包含了约2000条偏好评级与1000条读者评语,更提供了7200个跨语段级别的标注,覆盖了从流畅度、沉浸感到文学性渲染等多个质性维度。尤为独特的是,LAIT同步收集了读者对译文来源的猜测及信心水平,揭示了读者虽难以可靠区分HT与MT,却倾向于偏好其认为出自人类之手的译文。数据还显示,MT的质量在同一本书内波动远大于HT,且自动评估指标与读者偏好呈弱相关甚至负相关,凸显了以读者体验为中心评估的必要性。
使用方法
LAIT数据集适用于多种文学机器翻译评估与研究场景。研究者可利用其精细化的语块级对齐与偏好标注,进行细粒度的译文质量分析,例如探究特定叙事元素(如对话处理、词汇丰富度)如何影响读者偏好。该数据集提供的开放式评语与标注,可用于定性分析读者判断背后的语言线索与认知机制。此外,数据集附带的评估协议与界面代码支持可重复的研究设计,便于后续工作在不同语言对或翻译系统上进行对比实验,从而推动文学翻译评估方法论的演进。
背景与挑战
背景概述
LAIT(Literary AI Translation)数据集由西蒙菲莎大学与魁北克大学蒙特利尔分校的研究人员于2026年构建,聚焦于文学文本机器翻译的读者体验评估。该数据集旨在填补现有评估体系仅关注忠实度与流利度、却忽视读者沉浸感与文学效果的空白。研究团队招募15位资深读者,对包含法语、波兰语和日语在内的15部近期小说,分别评估其人工译本与基于智能体大语言模型流水线生成的机器译本。通过沉浸式阅读与细读相结合的方法,系统收集了超过1000条读者评论、2000项偏好判断及7200个片段级标注,为理解文学翻译中读者真实接受度提供了稀缺的实证资源。该数据集对推动文学翻译质量评估从技术指标向读者中心范式转型具有重要影响力。
当前挑战
LAIT数据集面临的核心挑战在于文学翻译评估的多维度复杂性。首先,领域问题层面,传统自动评估指标如BLEU或LLM-as-a-judge方法,虽能衡量表面忠实度,却无法捕捉文学文本特有的韵律、情感、文体特征及叙事沉浸感,导致评估结果与实际读者偏好严重偏离——实验表明这些指标普遍倾向于机器译本,与读者偏好人工译本形成鲜明对比。其次,数据集构建过程中,确保评估生态效度的挑战尤为突出:如何在不破坏读者沉浸体验的前提下,完成长达8000字摘录的对比评估;如何平衡不同语系(法、波、日)与文学传统差异带来的变量控制;如何设计既支持宏观全局感受又涵盖局部细节的混合评估流程,同时克服高昂的招募成本与长达两天的评估周期,均构成了方法学上的显著障碍。
常用场景
经典使用场景
在文学翻译质量评估领域,LAIT数据集为研究者提供了一个前所未有的读者中心化评测平台。该数据集聚焦于沉浸式阅读与细读两种生态效度极高的阅读场景,引导15位资深读者对法语、波兰语和日语源头的15部近期小说的人机翻译进行对比评价。通过30个摘录级比较和772个篇章级比较,数据集中包含了读者对翻译流畅性、沉浸感和文学性的主观偏好,以及超过1000条开放评论和7200个跨度级标注,为探索文学翻译中机器与人类表现的微妙差异奠定了坚实基础。
衍生相关工作
LAIT数据集催生了一系列围绕文学翻译质量感知与评价的开拓性工作。研究者们基于该数据的双阶段评价协议,发展出针对长篇文学文本的沉浸式评测流水线,将阅读体验中的叙事运输感纳入量化分析范畴。同时,数据集中读者偏好与自动指标之间的矛盾激发了大量关于大语言模型裁判偏好的校准研究,以及面向低资源语言对的文学翻译质量可控生成方法。此外,关于读者如何将特定语言特征误判为机器翻译痕迹的发现,直接启发了讲述写作风格与翻译者声音辨认的系统性研究,将翻译伦理与读者心理认知纳入统一框架。
数据集最近研究
最新研究方向
在文学翻译领域,前沿研究方向正聚焦于读者中心化的评估范式,以弥补传统自动指标与真实阅读体验之间的鸿沟。LAIT数据集应运而生,它通过沉浸式阅读与细读相结合的方法,系统对比了专业人工翻译与基于大语言模型的智能代理翻译在法语、波兰语和日语长篇虚构作品中的表现。该数据集不仅收录了逾千条读者评注、近两千组偏好判断和七千余个跨度级标注,还揭示了机翻虽具可读性且难辨真伪,但质量波动更显著,读者始终更青睐人工译文的流畅性与文学感染力。这一成果推动了机器翻译评估从片段级错误分析向以读者体验为锚点的系统性转型,为文学翻译质量评估树立了新的标杆。
相关研究论文
  • 1
    AI translation of literary texts is "fine", but readers still prefer human translations西蒙弗雷泽大学; 魁北克大学蒙特利尔分校; 微软 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务