LAIT
收藏资源简介:
LAIT(文学人工智能翻译)数据集是由西蒙弗雷泽大学、魁北克大学蒙特利尔分校与微软研究院联合构建的读者中心化评估语料库,专注于文学翻译质量的多维度评测。该数据集包含15部法文、波兰文和日文小说的英文开篇节选,涵盖约8千词规模的原文、人工翻译与智能体大语言模型流水线生成的机器翻译对齐文本,总计产生1千条读者评论、2千项判断与偏好评分以及7.2千个片段级标注。数据通过专业译者翻译与自动化预处理流程构建,结合沉浸式阅读与细粒度对比评估方法,旨在系统量化读者对文学翻译的感知差异,为机器翻译在文学领域的应用提供实证评估基准。
The LAIT (Literary AI Translation) dataset is a reader-centric evaluation corpus jointly constructed by Simon Fraser University, Université du Québec à Montréal, and Microsoft Research, focusing on multi-dimensional evaluation of literary translation quality. This dataset includes English opening excerpts from 15 novels originally written in French, Polish, and Japanese, with aligned text sets totaling approximately 8,000 words covering source texts, human translations, and machine translations generated via AI agent pipelines powered by large language models. It encompasses 1,000 reader comments, 2,000 judgment and preference ratings, and 7,200 segment-level annotations. Developed through professional translator work and automated preprocessing workflows, the dataset integrates immersive reading and fine-grained comparative evaluation methodologies, with its core aim to systematically quantify readers' perceived differences in literary translation and provide an empirical evaluation benchmark for the application of machine translation in the literary domain.
数据集概述:LAIT(Literary AI Translation)
LAIT 是一个关于文学文本人工翻译与机器翻译质量的读者研究数据集,由西蒙菲莎大学、魁北克大学蒙特利尔分校和微软的研究人员创建。
研究目标
- 评估读者对文学文本人工翻译(HT)与机器翻译(MT)的偏好与质量感知。
- 探究读者能否准确识别AI翻译。
数据规模
- 15 名 深度阅读型读者
- 15 部 近期出版的小说(原文为法语、波兰语、日语)
- 所有翻译目标语言:英语
- 总读者评论数:952 条
- 总高亮标注数:7,234 个(读者在逐段对比时标记为“好”或“差”的措辞)
研究流程
- 沉浸式阅读阶段:
- 每位读者阅读两篇完整的约 8,000 词的英译小说摘录(一次阅读HT,一次阅读MT)。
- 对每篇翻译进行评分(5分量表,评估四项质量指标)和评论。
- 对比两种翻译版本,给出相对评分、偏好判断及理由。
- 盲测:读者不知道哪篇是人工翻译,哪篇是机器翻译,且阅读顺序平衡。
- 数据量:30 次摘录对比,60 次单次阅读。
- 细粒度对比阶段:
- 经过 24 小时休整后,读者将约 300 词的短句段(共 386 个句段)并排对比。
- 高亮标记措辞为“好”或“差”。
- 选择更好的版本并解释原因。
- 数据量:772 次句段对比。
主要发现
- 读者总体上偏好人工翻译:无论是整篇摘录还是短句段对比,人工翻译的得分均高于机器翻译。在句段级对比中,偏好更明显。
- 人工翻译质量更稳定:人工翻译质量在整部小说中相对稳定,而机器翻译质量句段间波动更大。
- 读者无法可靠识别机器翻译:AI 检测准确率在两种评估阶段均较低。
- 高分亮点分布:人工翻译获得显著更多的“好”高亮标注。
数据集内容与获取
- 数据集包含:读者对人工和机器翻译质量的全部 952 条评论(按主题、翻译版本、源语言、读者、书籍等筛选查看)和 7,234 个高亮标注示例。评论涵盖读者对译本优劣的评价、偏好理由、AI识别判断理由等。
- 不包含:人工翻译原文或源文本原文。
- 获取方式:研究人员需通过申请(Research Purposes Only)获取完整数据集: Apply for dataset access →

- 1AI translation of literary texts is "fine", but readers still prefer human translations西蒙弗雷泽大学; 魁北克大学蒙特利尔分校; 微软 · 2026年



