verba — Ukrainian Proverbs Corpus
收藏资源简介:
这是一个规范、去重、来源可溯源的乌克兰谚语和格言语料库,统一自数字化历史资源。它经过丰富处理:每条条目包含现代拼写版本和1-3个主题类别。
This is a standardized, deduplicated, source-traceable corpus of Ukrainian proverbs and maxims, compiled from digitized historical resources. It has undergone comprehensive processing: each entry contains a modern orthographic version and 1 to 3 thematic categories.
数据集概述:ukr-proverbs-corpus (verba — 乌克兰语谚语语料库)
该数据集是一个经过规范化、去重、标注来源的乌克兰语谚语和格言语料库,整合自数字化历史文献,并进行了富化处理(每条记录包含现代拼写形式及1-3个主题类别)。
核心数据
- 总条目数: 48,787 条(100% 已分类)
- 数据格式: 源文件为
corpus.csv,另有corpus.json、corpus.jsonl、corpus.xml等格式的导出文件。 - 版本管理: 使用语义化版本进行数据发布,通过 GitHub Releases 发布,当前版本信息记录在
meta.json中。 - 许可证: 编译与富化部分采用 CC BY 4.0 许可;历史源文本属于公共领域;现代合集文本受其出版商权利保护。
数据模式 (corpus.csv)
| 列名 | 含义 |
|---|---|
id |
稳定标识符 (pNNNNNN) |
text |
逐字原文(保留1901年正字法,从不修改) |
normalized_text |
小写、去除标点后的匹配键 |
modern_text |
现代标准乌克兰语拼写 |
keyword |
词元/术语(来自Franko集) |
explanation |
学术注释(优先采用Franko集) |
category |
1-3个主题键,用 ; 分隔 |
sources |
来源引用键,用 ; 分隔 |
source_refs |
每个来源的参考文献,用 ; 分隔 |
variant_group |
关联可能方言变体的ID |
数据来源
- Franko 1901: 伊万·弗兰科《加利西亚-鲁塞尼亚民间谚语》,约30,906条,带注释。
- Nomis 1864: 马特维·诺米斯《乌克兰谚语、俗语及其他》(1864年,公共领域),9,785条。文本保留原始正字法,
modern_text为现代形式。最佳质量约75-80%,存在OCR字符错误。 - Bobkova: 博布科娃等编《乌克兰民间谚语与俗语》(现代乌克兰语),5,613条。
- Ilkevich 1841: 格里戈里·伊尔克维奇《加利西亚谚语与谜语》,2,702条。
- Mlodzynskyi 2009: 《实用俄乌谚语词典》,2,261条。
主题分类
共27个固定主题(见 enrich/taxonomy.csv):work_labor, poverty_wealth, food_hunger, drink_alcohol, family_kinship, marriage_gender, speech_lying, wisdom_folly, fate_luck, time_seasons, death_illness, religion_god, social_relations, class_power, justice_truth, animals, body_health, home_household, conflict_enmity, friendship_love, travel_distance, trade_money, ethnic_local, emotion_mood, nature_weather, appearance_reputation, idiom_expressive。
热门主题: emotion_mood, idiom_expressive, wisdom_folly, work_labor, animals。
数据富化
- 人工标注内容:
category(主题分类)、modern_text(现代转写)、explanation(注释)、variant_group(变体分组)均由LLM(Claude Code)生成。 - 质量审计: 现代转写可接受率约95%,主题标签可接受率约85%(主要标签更可靠)。
- 变体分组: 基于模糊相似度(
rapidfuzz token_set_ratio≥ 85)的非破坏性链接,共5,064个变体组。
已知限制
sources.csv仅包含引用键、标题、年份、作者,缺少BibTeX所需的完整元数据。- 变体分组仅提供链接,不合并记录,且超过8条的组会被解散。
- 分类为单次最佳努力结果,次要标签或非27个主题内的分类可能不准确。
引用
- 建议引用格式:Yemelianov, Dmytro (2026). verba — Ukrainian Proverbs Corpus (v1.0.0)。详见
CITATION.cff文件。
交互界面与API
- Web应用: 基于Cloudflare Worker的可搜索、离线可用的PWA(渐进式Web应用),地址为 https://verbacorpus.org。
- REST API: 版本化接口
/api/v1,支持JSON、JSONL、XML、CSV、TSV格式输出。可通过?format=参数或Accept头部协商。GET /api/v1/search(关键词搜索)GET /api/v1/semantic(语义搜索,基于嵌入向量)GET /api/v1/random(随机获取N条)GET /api/v1/query(灵活筛选)GET /api/v1/proverb/:id(单条记录及注释)GET /api/v1/export(批量导出)GET /api/v1/categories,GET /api/v1/meta,GET /api/v1/similar/:id
- 语义搜索: 由Workers AI的
@cf/baai/bge-m3嵌入模型和Cloudflare Vectorize索引驱动。为选择性加入功能(仅在线可用)。




