遇见数据集

Imperius/ru-classic

收藏
Hugging Face2026-05-08 更新2026-05-31 收录
官方服务:

资源简介:

一个干净的俄语古典文学文本语料库,涵盖19世纪至20世纪初期的作品,收集自lib.ru网站,并经过多次清洗迭代。适用于在俄语散文“黄金时代”风格上进行语言模型的预训练。

--- 许可证:CC0 1.0协议 语言: - 俄语 数据规模分类: - 100M < 数据量 < 1B 任务类别: - 文本生成 - 掩码填充 展示名称:俄罗斯古典文学(19世纪—20世纪初) 标签: - 俄语 - 文学 - 经典作品 - 19世纪 - 白银时代(Silver Age) - nanoGPT - 预训练(pretraining) 配置项: - 配置名称:默认配置 数据文件: - 训练拆分:corpus_clean.txt --- # 俄罗斯古典文学——语言模型专用语料库 本语料库为19世纪至20世纪初的俄罗斯古典文学纯净文本语料库,数据采集自lib.ru平台并经过多轮清洗处理,适用于基于俄罗斯散文“黄金时代”风格的语言模型预训练。 ## 语料构成 **总纯净文本量达866 MB。** 涵盖61位作家: ### 19世纪古典散文(37位作家) 契诃夫(Chekhov)、托尔斯泰(Tolstoy)、陀思妥耶夫斯基(Dostoevsky)、屠格涅夫(Turgenev)、果戈理(Gogol)、列斯科夫(Leskov)、布宁(Bunin)、库普林(Kuprin)、安德烈耶夫(Andreev)、冈察洛夫(Goncharov)、萨尔蒂科夫-谢德林(Saltykov-Shchedrin)、科罗连科(Korolenko)、迦尔洵(Garshin)、莱蒙托夫(Lermontov)、格里鲍耶陀夫(Griboedov)、奥斯特洛夫斯基(Ostrovsky)、S.T.阿克萨科夫(Aksakov S. T.)、波米亚洛夫斯基(Pomyalovsky)、列舍特尼科夫(Reshetnikov)、斯列普佐夫(Sleptsov)、马明-西比利亚克(Mamin-Sibiryak)、格列布·乌斯宾斯基(Gleb Uspensky)、格里戈罗维奇(Grigorovich)、扎戈斯金(Zagoskin)、博博雷金(Boborykin)、韦列萨耶夫(Veresaev)、埃尔特尔(Ertel)、马尔科·沃夫乔克(Marko Vovchok)、达尼列夫斯基(Danilevsky)、克拉斯诺夫(Krestovsky)、波塔片科(Potapenko)。 ### 白银时代(17位作家) 安德烈·别雷(Andrei Bely)、勃留索夫(Bryusov)、列米佐夫(Remizov)、梅列日科夫斯基(Merezhkovsky)、吉皮乌斯(Gippius)、罗扎诺夫(Rozanov)、什梅廖夫(Shmelyov)、扎伊采夫(Zaitsev)、索洛古勃(Sologub)、阿尔志跋绥夫(Artsybashev)、巴尔蒙特(Balmont)、勃洛克(Blok)、安年斯基(Annenky)、阿姆菲佳特罗夫(Amfiteatrov)、阿韦尔琴科(Averchenko)、苔菲(Teffi)。 ### 文学批评与政论 别林斯基(Belinsky)、杜勃罗留波夫(Dobrolyubov)、皮萨列夫(Pisarev)、赫尔岑(Herzen)、车尔尼雪夫斯基(Chernyshevsky)。 ### 19世纪诗人翻译家 茹科夫斯基(Zhukovsky)、迈科夫(Maykov)、费特(Fet)、丘特切夫(Tyutchev)、维亚泽姆斯基(Vyazemsky)、波隆斯基(Polonsky)、阿普赫京(Apukhtin)、普列谢耶夫(Pleshcheev)、纳杰日丁(Nadson)、尼基京(Nikitin)。 ## 前五名作家文本量分布 | 作家 | 文本量(MB) | |---|---| | 罗扎诺夫 | 51 | | 陀思妥耶夫斯基 | 49 | | 车尔尼雪夫斯基 | 43 | | 托尔斯泰 | 38 | | 果戈理 | 35 | ## 预处理流程 原始语料大小为1.22 GB,经清洗后得到866 MB纯净文本,共去除26%的冗余噪声。 **清洗步骤:** 1. **解析lib.ru平台数据**:爬取作家主页,提取网页核心文本内容。 2. **移除学术版本的编辑附加内容**:包括文本注释、异文说明、手稿描述、档案引用(如TsGALI、RGALI、GPB、IRLI)以及书目标注脚注。 3. **移除大写格式的页眉通信内容**:格式如“作者 — 收信人”及“致A.N.伊万诺夫”的文本块。 4. **旧正字法转写**:将Ѣ转为Е、Ѳ转为Ф、І转为И,删除辅音后的尾字母Ъ。该步骤适配了马明-西比利亚克、维亚泽姆斯基、波塔片科等作家的全部旧正字法版本文本。 5. **移除外语文本行**:包括外语地址、拉丁字母签名等内容。 6. **合并点式换行**:将安德烈·别雷与索洛古勃作品中的点状换行合并为单个省略号。 7. **移除lib.ru平台导航元素**:如分区菜单、推荐内容等。 8. **移除翻译注释**:如“* 依惯例(法)”这类标注。 **令牌(Token)化前的标准化处理:** - 将ё转为Е、Ё转为Е(保留原大小写) - 引号统一:将" " „ 转为 « » - 破折号统一:将–、-- 转为 — - 省略号统一:将... 转为 … ## 数据文件说明 - **`corpus_clean.txt`**:主文件,整合全部语料(866 MB,UTF-8编码) - **`corpus_clean.norm.txt`**:标准化版本(完成ё转写、引号与破折号统一),推荐用于BPE(Byte Pair Encoding,字节对编码)训练 - **`per_author/`**:按作家分类的独立文件,支持子集筛选 - **`spm_16k.model`**:训练完成的SentencePiece BPE令牌化器(词汇量=16000) - **`spm_16k.vocab`**:带得分的令牌列表 ## 使用方法 ### 通过`datasets`库加载 python from datasets import load_dataset ds = load_dataset("USERNAME/russian-classics", split="train") print(ds[0]["text"][:500]) ### 加载单个作家的语料 python from huggingface_hub import hf_hub_download path = hf_hub_download( repo_id="USERNAME/russian-classics", filename="per_author/chekhov.txt", repo_type="dataset", ) text = open(path, encoding="utf-8").read() ### 自定义训练令牌化器(可选) python import sentencepiece as spm spm.SentencePieceTrainer.train( input="corpus_clean.norm.txt", model_prefix="my_spm", vocab_size=16000, model_type="bpe", character_coverage=1.0, byte_fallback=True, user_defined_symbols=["—", "«", "»", "…"], ) ## 语料未包含的内容 - 普希金的诗歌作品及独立翻译文件,仅收录散文及诗人翻译家的混合语料。 - 1930年之后的现代文学作品。 - 原本以其他语言创作的文本(即使作者为俄罗斯籍,例如屠格涅夫早期的法语书信已被排除)。 - 学术版本的编辑附加内容:注释、异文说明、手稿描述等。 - 同一作品的重复版本,仅保留lib.ru平台上的一个版本。 ## 风格特征 - **以散文为主**:仅诗人翻译家(如茹科夫斯基、费特)的作品包含诗歌体裁。基于本语料库训练的语言模型可根据短句触发散文/诗歌两种生成模式。 - **多作家风格融合**:罗扎诺夫(51 MB的警句随笔)、车尔尼雪夫斯基(43 MB的政论文章)、陀思妥耶夫斯基(49 MB的小说与书信)的文本占比较高,训练后的模型将呈现混合的创作风格。 - **保留时代特色的外语嵌入**:俄罗斯文本中的自然外语融入(如贵族散文中的法语、拉丁语题词)均被保留,这是该时代文学风格的一部分。 - **体裁多样性**:涵盖散文、戏剧、书信、文学批评、日记、哲学随笔等多种体裁,因此语料中存在混合排版格式(如戏剧中的角色名块、书信中的称呼格式等)。 ## 局限性与注意事项 - **不适用于现代任务**:如问答系统、事实查询类任务:基于本语料库训练的模型仅学习文学风格,而非事实知识。 - **可能存在少量OCR识别 artifacts**:来自lib.ru平台的扫描文本可能残留少量OCR错误。绝大多数文本的纯净度较高,但无法达到绝对完美。 - **版权状态**:原始文本根据俄罗斯及国际版权法已进入公共领域(PD)(所有作家均已逝世超过70年)。本语料库作为汇编作品采用CC0协议发布。 ## 数据来源 所有文本均采集自**az.lib.ru**(lib.ru/Классика)——俄罗斯规模最大的开放古典文学图书馆。 ## 使用权限 使用不受限制,若在项目中使用本语料库,可根据意愿标注原始来源。 ## 版本历史 - **v1.0**(2026-05):首次发布。涵盖61位作家,866 MB纯净文本,16k BPE词汇量。

提供机构:
Imperius
二维码
社区交流群
二维码
科研交流群
商业服务