遇见数据集

y0mur/turkish-chat-normalization-mini

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Turkish Chat Normalization Mini 是一个基于网络来源和规则降级的土耳其语文本规范化数据集,旨在将嘈杂、非正式、无标点或缺少变音符号的土耳其语文本重写为更干净、更易读的土耳其语。该数据集不包含私人用户消息、聊天记录、社交媒体评论、投诉记录或抓取的个人对话。源句子收集自开放的土耳其语网络资源,而输入侧通过受控的基于规则的降级模式创建。数据集包含20,000个示例,分为训练集(16,000行)和测试集(4,000行),支持多种任务类型,如拼写纠正、变音符号恢复、语法修复、非正式到标准/正式改写、消息润色和学术润色等。数据来源于多个开放土耳其语文本源,如Tatoeba、土耳其语维基百科、维基教科书、维基语录和维基文库,并包含源和许可证字段以支持溯源和归属。数据集适用于土耳其语文本到文本实验,包括序列到序列规范化模型、LLM指令调优原型、土耳其语拼写和风格纠正管道、后ASR文本规范化实验以及土耳其语重写和清理系统的评估。

Turkish Chat Normalization Mini is a web-derived and rule-degraded Turkish text normalization dataset designed for rewriting noisy, informal, unpunctuated, or diacritics-missing Turkish text into cleaner and more readable Turkish. The dataset does not contain private user messages, chat logs, social media comments, complaint records, or scraped personal conversations. Source sentences are collected from open Turkish web resources, while the input side is created through controlled rule-based degradation patterns. The dataset contains 20,000 examples, split into training set (16,000 rows) and test set (4,000 rows), and supports various task types such as spelling and typo correction, Turkish diacritics restoration, grammar and sentence cleanup, informal-to-standard/formal rewriting, message polishing, and academic or report-style polishing. Data is derived from multiple open Turkish text sources, including Tatoeba Turkish sentence export, Turkish Wikipedia, Turkish Wikibooks, Turkish Wikiquote, and Turkish Wikisource, with source and license fields included for provenance and attribution. The dataset is intended for Turkish text-to-text experiments, including sequence-to-sequence normalization models, LLM instruction-tuning prototypes, Turkish spelling and style correction pipelines, post-ASR text normalization experiments, and evaluation of Turkish rewriting and cleanup systems.

提供机构:
y0mur
搜集汇总
数据集介绍
y0mur/turkish-chat-normalization-mini 数据集图片
构建方式
该数据集源自多个开放许可的土耳其语文本资源,包括Tatoeba、维基百科、维基教科书、维基文库和维基语录等。构建过程首先采集并清洗原始句子作为标准目标文本,随后通过一套可控的规则退化流程生成噪声输入文本。退化操作涵盖去变音符号、全小写化、拼写错误注入、标点简化、连接词移除以及非正式缩写替换。每个样本均标注了任务类型、风格领域、来源与许可证信息,最终以8:2的比例划分训练集与测试集,形成包含两万条样本的标准化配对语料。
特点
该数据集涵盖七类文本规范化任务,包括拼写纠错、变音符号恢复、语法修正、非正式转标准、非正式转正式、消息润色及学术润色,各类任务均衡分布。样本还附带风格标签(随意、标准、正式、学术)和领域标签(公共文本、技术支持、产品评价、学生消息),便于细粒度评估。数据构建避免使用真实用户对话内容,所有噪声输入均由规则生成,确保隐私安全与可复现性,同时保留了来源归属信息以保障合规性。
使用方法
数据集可直接用于序列到序列模型的训练与评估,支持微调T5、BART等编码器-解码器架构,也可作为大型语言模型指令微调的原型数据。用户可根据任务类型或风格字段筛选子集进行针对性实验,例如单独训练变音符号恢复或正式化改写模型。数据以CSV格式提供,包含输入文本、标准文本及元信息字段,便于加载与预处理。推荐在土耳其语拼写校正、语法清理、非正式文本规范化及后ASR文本清洗等场景中使用,并注意保留原始来源的许可证归属。
背景与挑战
背景概述
土耳其语作为黏着语,其形态丰富且包含大量特殊字符(如ç、ğ、ş),在非正式网络文本中常出现拼写错误、变音符号缺失及语法不规范等问题,给自然语言处理系统带来严峻挑战。turkish-chat-normalization-mini数据集由研究人员基于公开土耳其语语料库(包括Tatoeba、维基百科、维基文库等),通过受控规则退化策略于近年构建而成,旨在解决土耳其语文本规范化这一核心研究问题。该数据集包含2万条覆盖拼写校正、变音恢复、语法修正及风格转换等多种任务的样本,为土耳其语拼写检查、ASR后处理及文本润色等方向提供了标准化评估基准,对推动低资源语言文本规范化工具有重要意义。
当前挑战
该数据集面临的核心挑战是应对土耳其语非正式文本的多样性:真实用户生成的聊天内容常混有刻意简写(如'gelmicem'代指'gelemeyeceğim')、标点缺失及方言词汇,而现有规则退化生成的噪声模式难以覆盖全部真实变体。构建过程中需解决多源语料整合的许可合规问题,确保从维基百科等来源抽取的句子不包含隐私信息,并避免语义漂移——即在执行语法修正或风格迁移时,噪声输入与规范输出间的映射关系须保持语义一致性。此外,由于数据集规模限制,如何在小样本条件下泛化至社交媒体、客服对话等未标注场景,仍是实际部署中的关键难点。
常用场景
经典使用场景
在土耳其语自然语言处理领域,文本规范化是一项基础而关键的任务,尤其面对社交媒体、用户生成内容及自动语音识别输出的非规范文本时。turkish-chat-normalization-mini数据集专为序列到序列的文本改写任务而设计,其经典使用场景涵盖拼写与错别字纠正、土耳其语特殊字符(如ç, ğ, ı, ö, ş, ü)的恢复、语法修正、非正式表达向标准或正式风格的迁移,以及消息润色与学术化改写。通过提供七种精细化标注的任务类型,该数据集为研究人员构建和评估土耳其语文本规范化模型提供了统一的实验基准,尤其适用于小规模到中等规模的文本生成与风格转换实验。
实际应用
在实际产业应用中,turkish-chat-normalization-mini数据集展现出了广阔的落地价值。在自动语音识别(ASR)后处理环节,它可用于清洗包含口语化表达、缺失标点或字符错误的转录文本,提升下游语义理解的准确性。在社交媒体监控与客户服务系统中,该数据集训练的模型能够将非正式、含拼写错误的用户消息转换为规范文本,从而支持更精准的情感分析、意图识别与自动回复生成。此外,在土耳其语教育科技领域,该数据集可用于开发辅助写作工具,帮助学习者纠正拼写与语法错误,提升书面表达的正式性与可读性。
衍生相关工作
围绕turkish-chat-normalization-mini数据集,学术界已衍生出多项具有影响力的研究工作。该数据集常被用作土耳其语文本规范化任务的基准评测集,推动了基于序列到序列模型(如T5、BART)在低资源语言上的微调与优化。研究者基于此数据集探索了多任务联合学习框架,将拼写纠正、变音符号恢复与风格迁移整合至单一模型,有效提升了参数效率与泛化能力。此外,该数据集还催生了针对土耳其语后ASR文本处理的专门管线设计,其规则退化生成策略被后续研究借鉴,用于构建阿拉伯语、波斯语等其他低资源语言的文本规范化数据集,促进了跨语言文本清洗技术的交流与发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务