遇见数据集

短剧出海多语种翻译配音数据集

收藏
浙江省数据知识产权登记平台2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

本数据主要应用于短剧等数字内容的跨语言传播与本地化制作场景。数据集包含中文原文、多语种译文、字幕信息、角色信息及配音文本等内容,可用于英语、西班牙语、葡萄牙语、印尼语、泰语等多语种内容生产。除支撑内容出海发行、字幕制作和智能配音外,还可作为机器翻译、大语言模型、多语种字幕生成等人工智能模型的训练与评测数据资源。数据适用于内容制作机构、出海发行平台、AI企业及科研机构,具有较高的行业通用性、复用价值和产业应用价值,可为数字文化内容国际化传播提供数据支撑1.数据说明 本算法处理的数据源为短剧字幕、对白及剧情文本,包含中文原始文本及其对应的英文翻译文本。数据内容涵盖多种场景类型,如现代言情类、霸总剧情类等,同时包含情绪分类标签(如Authority、Indifference、Dominance)和置信度评分。所有数据在加工前已进行必要的数据清洗和预处理,确保数据质量和格式统一。 2.处理规则 数据处理采用自然语言处理(NLP)与人工校验相结合的混合处理架构。首先通过结构化解析提取上下文语义信息,并标注场景分类和情绪分类;随后基于神经机器翻译(NMT)模型和多语言预训练模型完成多语种翻译生成,通过上下文对齐机制保证语义一致性;结合规则引擎对专有名词、文化表达及敏感内容进行规范化适配;最后通过自动评估与人工审核相结合的方式进行质量优化。对于涉及个人数据和公共数据的内容,已进行必要的匿名化、去标识化处理,确保不可通过可逆模型或算法还原出原始数据。 3.数据内容描述 处理后的数据集包含完整的结构化信息,包括序号、原始语言、原始文本、目标语言、翻译文本、场景分类、情绪分类、情绪验证、配音文本(TTS指令)和配音音色等字段。数据内容涵盖多种场景和情绪表达,如"你以为我会爱上你这种人吗”(现代言情类-Indifference)、“合同签了,你就是我的人了”(霸总剧情类-Dominance)等典型文本。所有数据均经过严格的质量控制,确保在内容生产、模型训练、效果评测及行业研究等场景中的应用价值。

创建时间:
2026-05-08
搜集汇总
数据集介绍
短剧出海多语种翻译配音数据集 数据集图片
背景与挑战
背景概述
该数据集面向短剧等数字内容的跨语言传播与本地化制作,包含中文原文、多语种译文、字幕、角色及配音文本等结构化信息,覆盖英语、西班牙语、葡萄牙语、印尼语、泰语等多语种内容生产场景。数据通过自然语言处理与人工校验结合的方式处理,包含场景分类、情绪标签(如Authority、Indifference、Dominance)和置信度评分,并经过匿名化与去标识化处理,可用于机器翻译、大语言模型、多语种字幕生成等AI模型的训练与评测,适用于内容制作机构、出海平台、AI企业及科研机构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务