遇见数据集

RALS (Romanian Automatic Lexical Simplification)

收藏
arXiv2026-07-22 更新2026-07-24 收录
数据链接:
官方服务:

资源简介:

RALS是首个针对罗马尼亚语构建的综合性词汇简化数据集,由布加勒斯特大学研究团队创建,旨在填补该语言在词汇复杂性预测与简化任务中的资源空白。该数据集包含3,921个词汇-句子对样本,涵盖人工翻译、词汇级翻译及全新采样的三类子集,数据来源于维基百科、科普文章、文学作品及机构文档等多种文本类型,并经过精细的人工标注。其构建过程融合了多步骤人工翻译、机器辅助及众包标注方法,通过严格的配对排序与复杂性评分确保数据质量。该数据集主要应用于自然语言处理领域,特别是低资源语言的词汇简化与复杂性预测研究,致力于提升罗马尼亚语文本的可读性,服务于教育、医疗及公共信息传播等场景,以促进社会信息包容性。

RALS is the first comprehensive lexical simplification dataset constructed for the Romanian language, developed by the research team at the University of Bucharest, aiming to fill the resource gap in lexical complexity prediction and simplification tasks for this language. This dataset contains 3,921 lexical-sentence pair samples, covering three subsets: manual translation, word-level translation, and newly sampled ones. The data is sourced from diverse text types including Wikipedia, popular science articles, literary works, and institutional documents, and has undergone meticulous manual annotation. Its construction process integrates multi-step manual translation, machine-assisted methods, and crowdsourcing annotation, ensuring data quality through strict pair ranking and complexity scoring. This dataset is primarily applied in the field of natural language processing, particularly for lexical simplification and complexity prediction research on low-resource languages. It is committed to enhancing the readability of Romanian texts, serving scenarios such as education, healthcare, and public information dissemination, thereby promoting social information inclusiveness.

创建时间:
2026-07-22
原始信息汇总

数据集概述:RALS(罗马尼亚语自动词汇简化资源与基线)

项目地址https://github.com/senisioi/RALS

许可证:CC BY-NC-SA 4.0

相关论文RALS: Resources and Baselines for Romanian Automatic Lexical Simplification(EMNLP 2025)

贡献者:Fabian Anghel、Petru-Theodor Cristea、Claudiu Creangă、Sergiu Nisioi


一、数据集内容与构成

该数据集聚焦于罗马尼亚语的词汇复杂性预测(LCP)词汇简化(LS) 任务,共包含 3,921 个标注样本,分为三个子集:

  1. HT_from_english_MLSP(569 个样本)

    • 来自 2024 年多语言词汇简化管道(MLSP)共享任务的人为翻译数据。
    • 每个样本有 5 个标注,标注者一致性高。
  2. WT_original(1,765 个样本)

    • 从英语 MLSP 数据词汇翻译至罗马尼亚语,通过罗马尼亚语语料库检索包含该词的句子。
    • 利用词嵌入聚类选择距离质心远/近的句子,覆盖单词的不同含义和用法。
  3. RoLCP(1,587 个样本)

    • 由人工标注,每个样本有 10 个标注,标注一致性高。
    • 文本涵盖不同体裁,词汇选择基于词频库(wordfreq)。
  4. 额外文件:mt_from_MLSP.csv

    • 从所有语言机器翻译至罗马尼亚语的数据,已过滤无效目标词,不含人工 LCP 标注

二、数据统计摘要

子集 样本数 句子数 平均句长 句长标准差 平均复杂度 复杂度标准差
HT 569 190 24.46 8.62 0.13 0.25
WT 1,765 751 24.53 8.43 0.28 0.21
RoLCP 1,587 274 27.58 26.59 0.23 0.23
  • 数据存储于密码保护压缩包(密码:ralsresources),以防 LLM 污染。

三、词汇简化系统与基线评估

简化数据来源:基于 HT 子集构建,标注者提供同义词(不排序),通过成对简化判断与 Bradley–Terry 模型计算最终排名。

评估指标:MAP@1、MAP@5、Potential@5、ACC@1(top gold)

系统 MAP@1 MAP@5 Potential@5 ACC@1
Apertus-8B 0.21 0.10 0.33 0.11
RoLlama-8B 0.40 0.16 0.51 0.22
DexFlex 0.41 0.30 0.67 0.15
GPT-4o 0.28 0.15 0.51 0.16
BERT-Ro 0.27 0.15 0.48 0.14
  • DexFlex 在 MAP 与 Potential 指标上表现最佳,展示出稳健的同义词生成能力。
  • RoLlama 在 ACC@1(top gold)上略优,但整体排名与覆盖度逊于 DexFlex。
  • 混合方法(DexFlex)在小数据集上优于大型通用 LLM 或微调 BERT。

四、配套工具:DexFlex

DexFlex 是一个用于罗马尼亚语处理的 Python 包,基于 dexonline 词典数据,整合 spaCy 罗马尼亚语模型(ro_core_news_lg),功能包括:

  • 词形变化处理
  • 同义词推荐
  • 时态与语态转换

简化流程

  1. 使用 spaCy 识别词性及形态学特征
  2. 从 dexonline 词典获取同义词
  3. 利用上下文嵌入进行词义消歧
  4. 正确屈折同义词以匹配罗马尼亚语法
  5. 使用 LCP 分数对候选词排序

安装命令pip install dexflex


五、相关资源


六、引用建议

bibtex @inproceedings{anghel-etal-2025-rals, title = "{RALS}: Resources and Baselines for {R}omanian Automatic Lexical Simplification", author = "Anghel, Fabian and Petru-Theodor, Cristea and Creanga, Claudiu and Nisioi, Sergiu", booktitle = "Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing", month = nov, year = "2025", address = "Suzhou, China", publisher = "Association for Computational Linguistics", pages = "31469--31480" }

搜集汇总
数据集介绍
RALS (Romanian Automatic Lexical Simplification) 数据集图片
构建方式
在自然语言处理领域中,文本简化技术对于提升可读性和促进信息无障碍获取具有重要价值,然而罗马尼亚语在此方向上长期缺乏系统化的资源支撑。为填补这一空白,研究者基于MultiLS框架构建了RALS数据集。数据集的构建遵循多步骤策略:首先,从英语Wikibooks选取569个词-句样本,通过人工翻译形成HT子集;其次,从罗马尼亚代表性语料库中筛选1,765个包含相同词汇的样本,构成WT子集;最后,从维基百科、科普文献、文学作品等多样化罗马尼亚语文本中选取1,587个新词样本,形成RoLCP子集。所有样本均由90名母语为罗马尼亚语的年轻大学生依据Complex2.0指南进行词汇复杂度标注,将五级分类标签转换为[0,1]区间的数值并计算均值,每个词平均获得7.5次标注。此外,针对词汇简化任务,研究者又构建了RoLS子集,由两名标注者提供替换候选词,再经第三名标注者验证,最终通过基于Bradley-Terry模型的成对比较排序方法,从约3,000对句子中计算简化的排序结果。
特点
RALS数据集作为罗马尼亚语首个同时涵盖词汇复杂度预测与词汇简化注释的资源,呈现出鲜明而独特的特征。在数据多样性方面,其LCP子集包含3,921个标注样本,覆盖人工翻译、语料库采样与原生文本三个维度,词汇分布跨越从高频到低频的广泛区间,句子来源横跨维基百科、科普、文学、制度文件及议论文等多种文体,确保了语料生态的丰富性与代表性。在标注质量上,数据集虽因词汇复杂度的主观性导致Krippendorff’s α仅为0.37,但通过多标注者均值化处理有效缓解了个体偏差,且RoLCP子集在交叉验证中展现出最高的内部一致性(r=0.71)。尤为突出的是,RoLS子集采用成对句子比较替代传统的候选词频排序方法,使简化候选的排序结果更贴合真实的语用情境,评价指标的稳定性因此得到显著提升。此外,数据集的分布偏移现象值得关注:相较于英语数据中复杂度与Zipf频率的强负相关,罗马尼亚语子集呈现出更趋简单的标注倾向及其斜率较缓的频率-复杂度关联。
使用方法
RALS数据集为罗马尼亚语文本简化研究提供了标准化的训练与评估基准,其使用方法具有清晰的层次性。在词汇复杂度预测任务中,研究者推荐采用基于手工特征(包括Zipf频率、字符长度、音节数、句法依存子节点数及静态词向量等)的Ridge回归基线模型,并采用分组十折交叉验证以确保句子级独立性。模型跨数据集测试表明,WT与RoLCP子集间具有良好的迁移性能。在词汇简化任务中,DexFlex框架被证明为最优方案:用户首先通过spaCy识别目标词的词性及语法特征,继而利用dexonline词典和BERT上下文嵌入进行词义消歧与同义词检索,最后借助词典信息对候选词进行正确的屈折变形。该框架还可与LCP流水线结合,依据复杂度得分对候选同义词进行排序。对于追求更高性能的研究者,亦可通过设计英语提示语对Apertus-8B-Instruct或RoLlama3.1-8B等开源大模型进行零样本提示,或使用罗马尼亚语BERT进行交叉熵训练。评估方面,推荐采用MAP@N、Potential@N及Accuracy@N@top_gold_1三项指标全面衡量模型性能,并注意与同属低资源语言的基准结果进行对比。
背景与挑战
背景概述
文本简化技术旨在将复杂文本转化为更易于广泛受众理解的表达形式,在促进读写能力、推动有效沟通以及保障特殊需求群体平等获取信息方面具有深远意义。然而,尽管该领域在西班牙语、德语、荷兰语等高资源语言中已积累了一定数据与模型,东罗曼语支语言如罗马尼亚语却长期处于空白状态。为弥合这一资源鸿沟,布加勒斯特大学人类语言技术研究中心的Fabian Anghel、Petru Theodor Cristea、Claudiu Creangă及Sergiu Nisioi等人于2026年发布了RALS(Romanian Automatic Lexical Simplification)数据集。该数据集首次联合覆盖罗马尼亚语的词汇复杂度预测(LCP)与词汇简化(LS)两大任务,包含3,921个上下文中的单词复杂度人工标注,并提出了一种基于成对排序近似的简化候选排序方法。RALS的诞生不仅填补了罗马尼亚语文本简化研究的资源空缺,也为低资源语言的自动化简化工具开发提供了可借鉴的范式。
当前挑战
RALS数据集面临多方面的核心挑战。在领域问题层面,罗马尼亚语作为低资源语言,缺乏现成的词汇复杂度标注与简化数据,且跨语言迁移方法效果不佳——例如基于机器翻译的复杂度预测仅能达到r≈0.3的弱相关,而直接使用英语数据的分布迁移会扭曲复杂度信号。在构建过程中,研究者需应对三重困难:其一,需从多源文本(维基百科、通俗科学、文学、制度文档等)中选取代表性样本,并通过聚类与手工筛选确保语义覆盖的均衡性;其二,标注流程涉及90名母语为罗马尼亚语的年轻大学生,需在LCP标注、成对简化候选排序等多步骤中维持一致性(Krippendorff α仅为0.37和0.53),且约25%的目标词缺乏合适替换;其三,高昂的标注成本与仅10美元的总预算形成尖锐矛盾,迫使团队依赖志愿者贡献与混合策略。此外,基于提示的LLM方法虽效果好,但面临隐私泄露、幻觉与输出不可控等风险,而规则系统又受限于语言学资源质量。
常用场景
经典使用场景
在自然语言处理领域,文本简化技术正日益成为提升信息可及性的关键手段,尤其对于资源匮乏的语言而言,其研究进展尤为珍贵。RALS数据集作为首个面向罗马尼亚语的词汇复杂度预测与词汇简化联合资源,为研究者提供了涵盖人工翻译、词语级翻译及原生语料的三类标注子集,共计3921个上下文词汇样本。其经典使用场景聚焦于构建和评估词汇复杂度预测模型与词汇简化管道,通过手工特征与词典驱动的混合方法,在低资源设定下实现了与深层神经网络可比的预测性能,为罗马尼亚语的自动化文本简化奠定了基准。
解决学术问题
该数据集的核心学术贡献在于填补了东罗曼语支在文本简化研究领域的长期空白,解决了低资源语言中词汇复杂度标注与简化候选排序的双重挑战。通过引入基于Bradley-Terry模型的成对比较排序方法,RALS克服了传统基于频次排序的偏差,提供了更为稳健的简化候选顺序。此外,研究揭示了跨语言复杂度迁移不可靠的分布偏移现象,并证明基于手工特征与开源词典的混合系统在低资源情境下优于大型语言模型的提示式方法,为欠表征语言的NLP系统设计提供了重要的方法论启示。
衍生相关工作
围绕RALS数据集,研究社区已衍生出一系列富有影响力的工作。最显著的成果是DexFlex框架,一个融合词义消歧、形变屈折与词典检索的准规则简化系统,其在多个评估指标上持续超越通用大语言模型与微调BERT模型。此外,该工作催生了针对低资源语言的跨语言词汇复杂度预测研究,以及基于机器翻译的反向迁移实验。RALS还作为罗马尼亚语文本简化研究的基线资源,激发了后续关于多语言简化管道(如MultiLS框架)在罗曼语族中的扩展应用,并推动了词典整合至当代NLP管线的学术倡导。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务