遇见数据集

UGTPHON

收藏
github2026-08-29 更新2026-08-31 收录
数据链接:
官方服务:

资源简介:

UGTPHON 是一个多语言字形到音素基准数据集,专为用户生成的文本设计,涵盖英语、越南语和韩语,包含18,373句带有IPA音标转录的句子。

UGTPHON is a multilingual grapheme-to-phoneme benchmark dataset designed specifically for user-generated text, covering English, Vietnamese and Korean, and containing 18,373 sentences with IPA phonetic transcriptions.

创建时间:
2026-08-26
原始信息汇总

数据集概述

UGTPHON 是一个面向用户生成文本(User-Generated Text, UGT)的多语言字素到音素(G2P)基准数据集,覆盖英语、越南语和韩语三种语言,总共包含 18,373 个句子(英语 5,029 / 越南语 10,847 / 韩语 2,497)。该数据集收录于 ACL 论文集 Findings of EMNLP 2026

核心特点

  • 聚焦非规范文本:针对社交媒体等网络上的“嘈杂”语言(如缩写、拼写变体),而非标准的词典词汇。
  • 三层对齐标注:每个句子都配有(1)黄金标准规范化文本(canonical),(2)该规范化文本的句子级 IPA 音标,(3)逐 token 的原始表面形式、规范形式、音标对齐,以及一个 9 类 A/B/C 分类法标签,用于标记每个非规范 token 的类型。
  • 多任务支持:由于各层对齐,该数据集可同时用于嘈杂文本 G2P、词汇规范化(句子级或 token 级)、非规范检测与分类,以及规范化和音素化之间交互关系的研究(如先规范化再音素化 vs. 直接 G2P)。

数据规模与划分

语言 训练集 开发集 测试集 总计
英语 3,329 600 1,100 5,029
越南语 8,597 1,129 1,121 10,847
韩语 1,976 246 275 2,497
合计 13,902 1,975 2,496 18,373

数据来源

UGTPHON 是衍生作品,数据来源如下:

来源 语言 样本数 描述
lexnorm2015 英语 4,854 LexNorm2015(W-NUT 2015 共享任务),经 MultiLexNorm 提供
vilexnorm 越南语 10,462 ViLexNorm(EACL 2024)
multilexnorm2026 韩语 2,020 MultiLexNorm++
dc_inside 韩语 477 韩国在线社区 UGT(DC Inside 评论,来自 KoMultiText)
augmented 英语 / 越南语 175 / 385 基于现有 UGT 模式人工整理的样本

数据格式

数据以纯 JSON 格式存储,无需特殊库即可加载。每个 {lang}/{split}.json 文件是一个样本对象数组,每个对象结构如下:

  • 句子级字段id(在 (lang, split) 文件内唯一)、langsourcesplittext(原始嘈杂文本)、canonical(黄金规范化文本)、phonemes(规范化文本的 IPA)。
  • token 级字段tokens 数组):每个 token 包含 text(表面形式)、canonical(规范化形式)、phoneme(IPA 音标)、is_nc(是否非规范)、nc_type(非规范类型,见下方分类法)。
  • 附带安全评分元数据moderation/ 目录提供按行对齐的句子级安全评分(rawnorm),标记是否触发不当内容标志及其类别。注意:该元数据为建议性信息,而非黄金标签,不应作为内容审核分类器的训练依据。

非规范 token 分类法

每个非规范 token 被分为三类九种:

组别 ID 类别 描述 示例
A: 重构 A1 元音省略 保留辅音,省略元音 pls → please, đc → được
A2 其他省略 从单个规范词中省略一个或多个字符(超出仅元音删除) bc → because, k → không
A3 短语(不可发音) 多词扩展,其发音无法直接从表面形式恢复 smh → shaking my head, mn → mọi người
B: 重复 B1 加长 重复字符表示强调,规范形式合并重复 soooo → so
B2 迭代 重复 token 或词,规范形式保留重复以供音素化 waitwait → wait wait, xem xem → xem xem
C: 直通 C1 视觉直拼 语音重拼,表面形式已体现目标发音 luv → love, zô → vô
C2 规则变体 规范词的标准变体 droppin → dropping
C3 俚语/青少年用语 词汇化的非标准形式,发音已确立 tho → though, hong → không
C4 短语(可发音) 多字母缩写,作为独立词发音 rofl, GATO

音素标注方法

音素并非由 G2P 模型生成。每个规范形式在专家整理的词汇表 IPA-Dict 中查找,并由母语标注者检查;词汇表未覆盖的形式则手工转写。三种语言的词汇表信息如下:

语言 方言 文件 词条数
英语 通用美式英语 data/en_US.txt 125,927
越南语 越南北部音 data/vi_N.txt 70,902
韩语 标准韩语 data/ko.txt 62,447

注意事项

  • ID 唯一性id 仅在 (lang, split) 文件内保证唯一。越南语 ID 在跨划分时并非全局唯一(如 vilexnorm_1 在 train、dev、test 中是不同的句子),因此应始终按划分进行合并连接,切勿按 ID 去重合并后的划分。
  • 逗号歧义canonical 字段中的逗号可能是变体分隔符,也可能是从表面 token 延续下来的字面标点。在英语和越南语中,标点占逗号出现的大部分(英语 1,039/1,044,越南语 2,943/3,109),而在韩语中真正变体列表占多数(687/732)。建议采用安全规则:按逗号分割,去除各部分的首尾标点,然后丢弃变为空的部分。
  • Unicode 规范化:越南语文本并非统一 NFC 规范化,33 个越南语句子在 text 和/或 canonical 中带有 NFD 序列。在进行精确字符串匹配、去重或词表统计前,应使用 unicodedata.normalize("NFC", s) 进行规范化。

许可协议

每种语言的子集拥有独立许可:

语言 许可 使用条款
英语 仅限研究使用 禁止商业用途;无明确来源许可(通过引用注明出处);每个句子的版权归其所有者
越南语 CC BY-NC-SA 4.0 仅限非商业用途;相同方式共享;需注明出处
韩语 Apache 2.0 允许修改、派生和商业使用

总结:英语和越南语子集为非商业用途,仅韩语子集允许商业使用。使用该数据集时,应引用论文、IPA-Dict 以及所使用语言的源语料库。

搜集汇总
数据集介绍
UGTPHON 数据集图片
构建方式
UGTPHON数据集以英语、越南语和韩语三种语言为对象,聚焦于社交网络等场景中不规范的用户生成文本(UGT)的注音问题。其构建基于已有的词汇规范化语料库,如LexNorm2015、ViLexNorm、KoMultiText和MultiLexNorm++,并补充了人工筛选的增强子集。每个句子均经过三层对齐标注:原始文本、黄金规范形式及对应的句级IPA音标;每个token则包含表面形式、规范化形式、音素及九类非规范编码(A/B/C分类法)。音素标注并非依赖G2P模型生成,而是通过查阅专家整理的IPA-Dict词典并由母语者校验,未覆盖的词汇由人工转写,从而保证了音标的高质量与一致性。
使用方法
UGTPHON以纯JSON格式存储,无需特定库即可加载。用户可按语言和分割加载数据,如使用Python的json模块读取train/dev/test文件。每条记录包含id、lang、source、text、canonical、phonemes及tokens等字段,其中tokens数组详细提供每个token的规范化与音素对应信息,能够直接用于训练或评估G2P模型、词汇规范化系统及非规范检测分类器。侧车moderation文件可按id逐行对齐,便于附加安全信息。使用时需注意合并多个分割时id的唯一性限制,以及越南语中NFC归一化问题。对于包含逗号的字段,需警惕逗号可能作为字面标点而非变体分隔符,建议采用指定规则进行拆分,以确保数据解析的准确性。
背景与挑战
背景概述
UGTPHON数据集由NAVER Cloud、汉阳大学、卡内基梅隆大学和佐治亚理工学院的研究者于2026年在EMNLP Findings上发表,旨在解决用户生成文本(UGT)的G2P(字形到音素转换)问题。该数据集覆盖英语、越南语和韩语,共包含18,373个句子,每个句子均标注了标准化的规范形式、IPA音素序列以及细粒度的非规范标记分类。UGTPHON的创建弥补了现有G2P资源仅处理规范书面语的不足,为嘈杂的社交媒体语言提供了首个多语言基准,推动了文本规范化与音素生成交叉领域的研究,对自然语言处理在真实世界场景中的应用具有重要影响。
当前挑战
UGTPHON面临的挑战包括:领域上,用户生成文本的非规范性导致传统G2P模型难以准确发音,需先恢复规范形式,而现有方法缺乏此类资源的支持;构建上,数据源自多个上游语料库,需跨语言进行精细标注,并处理越南语非NFC标准化、逗号的多重语义(如变体分隔符与标点)、以及不同语言间非规范类型的分布不均等问题。此外,数据伦理考量要求提供审核元数据,但需明确其仅为辅助信息,避免滥用。
常用场景
经典使用场景
UGTPHON作为首个面向网络用户生成内容的多语种字素到音素基准,其经典使用场景在于评估和提升G2P模型对非规范文本的鲁棒性。研究者可借助其三层对齐结构(原始文本、规范化形式、音素序列)直接训练或微调端到端的G2P系统,尤其适用于处理社交媒体中的缩写、重复字符和俚语等现象。该数据集覆盖英语、越南语和韩语,提供了丰富的非规范类型标注,使得跨语言的噪音文本音素化研究成为可能,为多语种语音合成和语音识别的前端处理提供了标准化的评测平台。
解决学术问题
该数据集解决了传统G2P资源因依赖干净词典词汇而无法处理真实网络文本的学术难题。通过引入九类非规范标注体系(A/B/C组),UGTPHON首次系统性地刻画了用户生成文本中的音素映射关系,揭示了规范化与音素化之间的内在交互。它为词汇规范化、非规范检测与分类、以及规范化-音素化联合建模等研究方向提供了统一的数据基础,推动了对噪音环境下语音处理理论的深入理解,并建立了跨语言比较的评估范式。
实际应用
在实际应用中,UGTPHON可用于改进语音助手、自动字幕生成和社交媒体的语音交互系统,通过准确处理非规范输入提升用户体验。在英语、越南语和韩语的语音合成系统中,该数据集支持对用户生成内容进行前置规范化,从而生成自然流畅的语音输出。此外,其附带的审核元数据为内容过滤和有害信息检测提供了辅助信息,尽管明确标注为建议性而非金标准,但仍能指导开发者在敏感场景中平衡可用性与安全性,适用于多语种社交平台的文本处理流程。
数据集最近研究
最新研究方向
UGTPHON作为首个面向用户生成文本的多语言字素到音素(G2P)基准,其前沿研究方向聚焦于处理社交媒体等非规范文本的语音合成与语音识别挑战。该数据集通过三对齐层结构(原始文本、规范化文本、音素标注)及九分类法,系统标注了英语、越南语和韩语中的非规范现象,如缩写、重复、俚语等,为G2P模型在嘈杂真实场景中的应用提供了基准。其研究影响在于推动文本规范化与音素化联合建模,探索规范化后音素化与直接音素化的性能差异,并促进跨语言非规范文本处理技术发展。该数据集还附带安全评分元数据,为内容审核提供辅助,但强调非金标准,体现了对社交媒体文本伦理问题的关注,为构建鲁棒、安全的语音技术奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务