遇见数据集

Dream of the Red Chamber corpus

收藏
arXiv2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

该数据集名为“Dream of the Red Chamber corpus”,由上海交通大学与华东理工大学的研究团队联合构建,旨在系统探究文化负载翻译在机器翻译中的挑战。数据集内容基于中国古典文化代表作《红楼梦》构建,包含500个精心筛选的中日双语文化负载片段,均匀涵盖生态、宗教、物质、语言和社会五大文化类别,源文本平均长度约24词,目标文本约51词,数据来源于伊藤漱平翻译的权威中日双语版本。创建过程涉及四名中文研究生初步标注与四名日语研究生二次筛选,耗时20天完成分类与平衡处理。该数据集主要应用于跨文化机器翻译研究领域,着力解决大语言模型在文化负载表达翻译中的性能瓶颈,并为文化导向的翻译评估提供基准。

The dataset named "Dream of the Red Chamber corpus" was jointly constructed by the research teams from Shanghai Jiao Tong University and East China University of Science and Technology, with the goal of systematically investigating the challenges of culturally loaded translation in machine translation. The content of this dataset is constructed based on *Dream of the Red Chamber*, a representative masterpiece of classical Chinese culture, and contains 500 carefully selected Chinese-Japanese bilingual culturally loaded segments that evenly cover five major cultural categories: ecology, religion, material culture, language, and society. The average length of the source texts is approximately 24 words, while that of the target texts is about 51 words. The dataset is sourced from the authoritative Chinese-Japanese bilingual edition translated by Ito Shūhei. The construction process involved four graduate students majoring in Chinese conducting preliminary annotation, followed by secondary screening by four graduate students majoring in Japanese, and the classification and balancing work was completed within 20 days. This dataset is primarily applied in the field of cross-cultural machine translation research, aiming to address the performance bottlenecks of large language models (LLMs) in translating culturally loaded expressions, and to serve as a benchmark for culture-oriented translation evaluation.

创建时间:
2026-07-22
搜集汇总
数据集介绍
Dream of the Red Chamber corpus 数据集图片
构建方式
《红楼梦》作为中华古典文化的百科全书,以其深厚的文化底蕴与丰富的语言表达著称。为系统探究大语言模型在文化负载翻译中的表现,本研究以伊藤漱平的日译本为底本,依托《大中华文库》的中日双语对照版本,经由光学字符识别处理提取文本。四名中国研究生从全书一百二十回中每回选取四处文化负载片段,依据奈达的五分文化分类法(生态、宗教、物质、语言、社会)进行初步标注,再经四名日本研究生二次筛选与修订,最终构建了一个包含五百个代表性片段的平衡数据集,每类文化各占一百条。
使用方法
数据集适用于评估与诊断大语言模型在文化负载翻译中的表现。研究者可借助五百个标注片段,使用多维度质量评估框架(包括内容准确度、语言流畅度、文化适切性与母语可读性)对模型输出进行细粒度评价。配套的人类评估方案由十六位中日母语者(含学生与教授)对匿名译文进行打分,同时支持与BLEU、xCOMET及LLM-as-a-Judge等自动指标的对照分析。数据集亦可服务于翻译策略研究,用于归类模型在归化与异化策略间的选择偏好,从而揭示文化传递中的典型误译模式。
背景与挑战
背景概述
《红楼梦》被誉为中国古典文化的百科全书,其语言承载着深厚的社会文化意蕴。2026年,上海交通大学与华东理工大学的研究团队以该著作为文化透镜,构建了包含500个跨文化片段的汉日双语语料库《Dream of the Red Chamber corpus》。该数据集聚焦于文化负载词的机器翻译挑战,旨在系统探究大语言模型在传递文化内涵方面的能力边界。作为首个从任务本身、人工评估与自动评估三个维度剖析文化翻译困境的基准资源,该语料库为计算语言学与翻译学的交叉研究提供了崭新的实验平台,对推动文化敏感型机器翻译系统的演进具有重要学术价值。
当前挑战
该研究所揭示的核心挑战涵盖三个层面:首先,前沿大语言模型在文化负载翻译任务中表现参差不齐,尤其在语言学与社会文化类别上存在显著性能短板,且推理模型并未展现出系统性优势;其次,人工评估受评估者语言背景、学术资历与文化熟悉度影响,导致评分标准分化——如日籍教授更注重文学语体的妥帖性,而学生群体则偏向可读性;最后,主流自动评估指标如BLEU在样本级别几乎无法捕捉文化翻译质量的细微差异,xCOMET与LLM-as-a-Judge虽略有改善,但整体仍难以可靠替代人类判断。此外,语料构建过程中对五百个片段的精细标注与跨语言一致性校订亦构成实质性挑战。
常用场景
经典使用场景
《红楼梦》语料库最经典的使用场景在于探索文化负载词的机器翻译挑战。作为中国古典文学的百科全书,该语料库涵盖生态、宗教、物质、语言和社会五类文化范畴,为评估大语言模型在跨文化语境下的翻译能力提供了高度代表性的双语平行数据。研究者通过构建中日双语对照文本,系统考察前沿模型在文化意象保留、习语转化及社会礼仪表达等层面的表现,揭示了语言模型在处理深嵌于社会文化脉络中的语义时存在的显著能力鸿沟。
解决学术问题
该数据集系统性地揭示了文化负载翻译在计算语言学领域面临的三大核心学术难题:其一,即便最先进的大语言模型在文化负载内容翻译上仍与人类水平存在显著差距,且推理模型与非推理模型间并无系统性优势;其二,人工评估因评估者的文化背景与学术层级差异而产生显著分歧,源语与目标语母语者关注的文化维度截然不同;其三,主流自动评估指标在样本级别上完全无法可靠区分翻译质量优劣,凸显了开发文化感知型评估方法的迫切需求。
实际应用
在实际应用层面,该数据集为跨文化机器翻译系统的开发与迭代提供了宝贵的基准测试资源。面向东亚文化圈的文学翻译、文化旅游内容本地化、古典文献数字化以及跨国文化交流平台等场景,开发者可借助此语料库优化翻译模型对文化隐喻、历史典故和礼仪规范的适应能力。此外,数据集揭示的评估者背景差异性也对翻译质量保障体系的设计具有重要启示,推动建立更包容多元的跨文化翻译评价标准。
数据集最近研究
最新研究方向
当前,基于《红楼梦》语料库的前沿研究聚焦于文化负载机器翻译的系统性挑战,特别是在大语言模型(LLM)背景下。研究热点包括任务难度评估,揭示前沿LLM在文化负载内容翻译上的显著性能差距;人工评价的分歧,发现评估者的文化背景和专业水平导致判断不一致;以及自动评价的不可靠性,指出现有主流指标难以有效衡量此类翻译质量。这一方向的意义在于,它不仅深化了对机器翻译中文化保留与语言流畅性之间张力的理解,而且推动了跨文化NLP领域的发展,为构建更具文化敏感性的翻译系统提供了关键洞察。
相关研究论文
  • 1
    On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens上海交通大学·计算机学院; 华东理工大学·外语学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务