遇见数据集

Syrzyk-Dataset

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

Syrzyk 数据集是一个经过严格验证的平行语料库,用于文本规范化、纠正俄语借词以及将乌克兰语中的“суржик”(一种混合俄语与乌克兰语的非标准变体)自动转换为标准规范乌克兰语。该数据集由 SyrzykAI 项目创建,主要面向微调 seq2seq 模型(如 facebook/nllb-200-distilled-600M),并使用 chrF、CER 和 WER 指标评估文本校正系统。数据集以高效的 Apache Parquet 二进制格式存储,已去除重复和噪声,并按固定随机种子(seed=42)划分为训练集(3,487 对)、验证集(436 对)和测试集(436 对),总计 4,359 对句子。每条记录包含三个字段:syrzyk(输入句子,含суржик元素、俄语语法借用或俄语化结构)、ukrainian(对应的标准乌克兰语翻译)、source(数据来源,包括手动编写的日常对话、基于 HPLT v3 语料库经规则替换和人工过滤的修改版,以及 Kimi K2 大模型生成并经人工验证的合成数据)。数据集覆盖了词汇俄语化、语音/拼写扭曲、句法控制错误、介词结构错误以及错误动词形式等关键类型的суржик错误。支持的任务包括翻译(суржик到标准乌克兰语)、语法错误纠正和文本规范化。该数据集根据 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可发布。

The Syrzyk dataset is a rigorously validated parallel corpus for text normalization, correcting Russian borrowings, and automatically converting surzhyk (a non-standard mixed variety of Russian and Ukrainian) in Ukrainian into standard normative Ukrainian. Created by the SyrzykAI project, it is primarily intended for fine-tuning seq2seq models (e.g., facebook/nllb-200-distilled-600M) and evaluating text correction systems using chrF, CER, and WER metrics. The dataset is stored in the efficient Apache Parquet binary format, deduplicated and denoised, and split into training (3,487 pairs), validation (436 pairs), and test (436 pairs) sets with a fixed random seed (seed=42), totaling 4,359 sentence pairs. Each record contains three fields: syrzyk (input sentence with surzhyk elements, Russian grammatical borrowings, or Russified structures), ukrainian (corresponding standard Ukrainian translation), and source (data origin, including manually written everyday dialogues, modified versions based on the HPLT v3 corpus via rule-based replacement and manual filtering, and synthetic data generated by the Kimi K2 large model with human validation). The dataset covers key types of surzhyk errors such as lexical Russification, phonetic/spelling distortions, syntactic control errors, prepositional structure errors, and incorrect verb forms. Supported tasks include translation (surzhyk to standard Ukrainian), grammatical error correction, and text normalization. The dataset is released under the Creative Commons Attribution 4.0 International (CC BY 4.0) license.

创建时间:
2026-08-09
原始信息汇总

Syrzyk Dataset 数据集详情

数据集概述

Syrzyk Dataset 是一个乌克兰语文本规范化平行语料库,旨在将суржик(Surzhyk)(乌克兰语与俄语混合的非标准语言变体)转换为规范的乌克兰文学语言。该数据集专为序列到序列(Seq2Seq)模型微调而设计,规模为 4,359对平行句对,数据格式为 Apache Parquet。

数据集结构

数据列说明

列名 数据类型 描述
syrzyk string 包含суржик元素、俄语借词或仿造结构的输入句子/短语
ukrainian string 对应的规范乌克兰文学语言表达
source string 句对来源及制备方法(如manualsynthetichplt_v3_modified

数据分割统计

分割 句对数 占比 文件名 大小
train 3,487 80.0% train.parquet ~305 KB
validation 436 10.0% validation.parquet ~43 KB
test 436 10.0% test.parquet ~42 KB
合计 4,359 100% ~390 KB

数据划分使用 Hugging Face datasets 库的 train_test_split 方法,设置 shuffle=True 和固定随机种子 seed=42

数据来源与方法论

数据集由三个互补来源组合而成:

来源 句对数 占比 说明
manual 1,873 43.0% 基于真实口语和典型口语结构手工编写的日常对话、俚语表达和仿造短语
hplt_v3_modified 1,503 34.5% 选自 HPLT v3 开放网络语料库的高质量规范句,通过语言学生成器注入伪суржик,经人工筛选校验
synthetic 983 22.5% 使用 LLM(Kimi K2)生成,侧重复杂句法俄语借词、介词结构和公文/政论суржик,全部经人工核验编辑

语言覆盖范围

数据集涵盖以下主要суржик错误类型:

  • 词汇仿造与俄语借词:如 привєтпривітполучаєтьсявиходитьзаказзамовленнядаженавітьстроїтибудувати
  • 语音与拼写扭曲:如 дєвочкадівчинкавсєвсі
  • 句法搭配与介词结构错误:如 по справах(应为 по ділах)、двома словами(应为 в двох словах)、через хворобу(应为 по хворобі / із-за хвороби
  • 错误动词形式:如 дєлати / робитьробитиказавговорив

目标任务与用途

  • 翻译 / 文本生成:суржик到乌克兰文学语言的转换
  • 语法错误纠正:修正语法、拼写和词汇干扰错误
  • 文本规范化:非正式或混合网络内容、字幕、聊天消息的规范化处理

使用方式

可通过 Hugging Face datasets 库直接加载:

python from datasets import load_dataset dataset = load_dataset("vlddshk/Syrzyk-Dataset")

也可通过 Pandas 直接读取 Parquet 文件:

python import pandas as pd df_train = pd.read_parquet("https://huggingface.co/datasets/vlddshk/Syrzyk-Dataset/resolve/main/train.parquet")

限制与特征

  • 样本规模(v1.0):仅含 4,359 个精选示例,作为微调与基准测试的种子数据集,计划扩展至 10k 示例以覆盖更多地区方言
  • 地区差异:суржик并非统一语言,不同地区(如斯洛博然希纳、波利西亚、南部)的俄语干扰程度和特征各异
  • 内容过滤:语料库已进行基础净化,不含粗俗词汇,聚焦通用、政论及日常口语词汇

许可证

采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 开放许可,允许自由分享、复制、改编及商业使用,但需注明原作者和原仓库链接。

搜集汇总
数据集介绍
Syrzyk-Dataset 数据集图片
构建方式
该数据集的构建策略融合了人工编纂、语料库改造与生成式方法,形成多源互补的平行语料。其中,43%的语料由语言学家依据日常口语及典型对话手工撰写,确保表达的自然性与地道性;34.5%选自HPLT v3开放网络语料库,通过语言学规则引擎自动注入俄化干扰项,再经人工筛选校正;剩余22.5%由大语言模型Kimi K2生成,侧重复杂句法结构及书面语域的混合形态,所有生成样本均经过严格人工审核。三类来源共同覆盖词汇、语音、句法等多维度干扰类型,最终构成4,359条高质量双语对照句对。
特点
该数据集兼具语言多样性、标注精细性与工程实用性。在语言层面,它系统覆盖了词汇借用、语音变异、介词误用及动词形态错误等核心干扰现象,并收录方言、俚语及语域差异,反映乌克兰语与俄语接触的真实生态。在数据层面,每条样本均标注来源(manual、hplt_v3_modified、synthetic),便于分析不同生成方式的质量差异;分割按固定随机种子(seed=42)完成,保证训练、验证与测试集的比例一致,利于模型评估的复现性。此外,数据以高效的Apache Parquet格式存储,支持直接流式加载,加速训练流程。
使用方法
该数据集专为文本规范化与序列到序列模型设计,可直接用于微调NLLB-200、mT5等预训练模型。用户可通过Hugging Face datasets库一键加载,获取syrzyk(源文本)、ukrainian(目标文本)及source(来源)三列字段。支持三种典型应用场景:将苏尔日克翻译为规范乌克兰语、纠正语法及词汇错误,以及统一非正式混合文本的表达。配合transformers工具链,可按需指定源语言与目标语言代码(如ukr_Cyrl),并设定最大序列长度进行批量预处理。数据分割清晰,便于在验证集上调整超参数、在测试集上评估性能,适用于基准测试及实际应用部署。
背景与挑战
背景概述
Syrzyk-Dataset是SyrzykAI项目于2026年构建的平行语料库,聚焦于乌克兰语中一种独特的语言混合现象——苏尔日克语(surzhyk)到标准乌克兰语的文本规范化与机器翻译任务。该数据集由研究者vlddshk主导,包含4,359对人工验证的句子,涵盖日常口语、网络文本及公共话语中的典型俄语借词、语法干扰和句法偏差。其核心研究问题在于为低资源语言变体的自然语言处理提供高质量的基准数据,尤其服务于序列到序列模型的微调与评估。该数据集填补了乌克兰语非标准变体资源稀缺的空白,为方言处理、语法纠错和神经机器翻译领域提供了重要支撑,其开放的CC-BY-4.0许可亦促进了相关研究的可复现性与跨语言比较。
当前挑战
该数据集面临的挑战首先源于苏尔日克语本身的非统一性:其区域变体(如斯洛博然什契纳、波利西亚、南方方言)在俄语干扰程度和表现形式上差异显著,使得构建覆盖广泛的语言规则成为难点。其次,语料构建过程需兼顾数据的多样性与质量,研究者在结合人工创作、HPLT v3语料库改造及合成数据时,必须通过严格的筛选与人工验证来消除噪声,同时避免不雅词汇与低质表达。此外,现有规模(约4,300对)不足以为全面的区域方言建模提供充分支持,扩展至10,000对样本的必要性凸显了资源受限环境下规模化构建的挑战,还需平衡标注一致性与时间成本,确保模型的鲁棒性和泛化能力。
常用场景
经典使用场景
Syrzyk-Dataset作为乌克兰语文本规范化与神经机器翻译领域的稀缺平行语料资源,其核心应用场景聚焦于序列到序列(Seq2Seq)模型的微调与评估,尤其适用于诸如NLLB-200、mT5等预训练多语言模型的适配优化。通过提供经过严格校验的'суржик-标准乌克兰语'句子对,该数据集有效支撑了从非规范混合语言输入向标准文学乌克兰语的自动转换任务,涵盖了词汇层面的俄语借词替换、语法结构的校正以及句法控制关系的修复,为文本纠错和规范化系统提供了高质量的基准训练与测试数据。
实际应用
在实际应用维度,Syrzyk-Dataset直接赋能于面向乌克兰语用户的各类实用工具与系统,如社交媒体内容清洗、用户生成文本的自动纠错、字幕文本规范化以及聊天机器人对话质量的提升。借助该数据集训练的模型能够高效处理掺杂俄语元素的口语化文本,改善现有NLP管线对非规范输入的鲁棒性,从而在信息检索、情感分析及机器翻译等下游任务中实现更精准的语义理解,具有直接的社会文化价值,助力乌克兰语在数字环境中的规范化使用与保护。
衍生相关工作
围绕Syrzyk-Dataset已催生出一系列相关研究工作,包括但不仅限于基于该平行语料优化的多语言机器翻译模型(如NLLB-200的领域自适应变体)、面向代码混合文本的语法纠错系统、以及针对斯拉夫语族语言干扰现象的跨语言迁移学习探研。此外,该数据集亦为文本规范化任务的基准测试提供了新标杆,激励了更多关于数据增强策略、人机协同标注流程及低资源场景下预训练模型微调方法的探索性研究,在乌克兰语NLP共同体的生态构建中发挥着基石作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务