遇见数据集

A French corpus annotated for multiword expressions with adverbial function

收藏
arXiv2026-06-03 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

该数据集是由巴黎东大学研究团队构建的法语多词表达式副词功能标注语料库,旨在支持信息检索与抽取以及句法分析研究。语料库包含两个来源:法国国民议会2006年10月3-4日会议完整记录(AS)和儒勒·凡尔纳小说《八十天环游地球》(JV),总计约168,846个词符和37,856个词型,标注了4,247个多词副词实例。数据集通过结合6,800条目的句法语义词典与有限状态转换器自动标注,并经过人工校验流程构建而成,主要应用于自然语言处理领域,解决多词副词识别、介词附着消歧等关键问题,为法语计算语言学资源提供重要补充。

This dataset is a French multi-word expression adverbial function annotated corpus developed by the research team of Université Paris-Est, aiming to support research in information retrieval and extraction as well as syntactic parsing. The corpus draws from two sources: the complete transcripts of the French National Assembly sessions held on October 3–4, 2006 (abbreviated as AS), and Jules Verne's novel *Around the World in Eighty Days* (abbreviated as JV). In total, it contains approximately 168,846 tokens and 37,856 types, with 4,247 multi-word adverb instances annotated. Constructed via automatic annotation using a syntactic-semantic lexicon of 6,800 entries combined with finite-state transducers, the dataset was further refined through a manual validation workflow. It is primarily utilized in the field of natural language processing, tackling core tasks such as multi-word adverb recognition and preposition attachment disambiguation, and constitutes a valuable supplementary resource for French computational linguistics.

创建时间:
2026-06-03
搜集汇总
数据集介绍
A French corpus annotated for multiword expressions with adverbial function 数据集图片
构建方式
该数据集以法语为语言基础,聚焦于具有副词功能的多元表达(multiword expressions),通过系统性的语料库语言学方法构建而成。研究人员从大规模法语书面语语料中提取候选表达,结合形态句法分析与语义功能标注,对每个候选单位进行人工审核与标注。构建过程严格遵循语言学定义,确保仅收录在上下文中整体承担副词修饰功能的固定或半固定短语,如‘tout à coup’或‘en général’。标注框架兼顾表达的内部结构多样性与外部句法分布,最终形成结构化的标注语料库,为后续计算语言学分析提供可靠基础。
特点
该数据集的核心特点在于其专门针对法语中副词功能的多元表达进行系统标注,填补了法语语言学资源在该领域的空白。数据集中收录的表达涵盖了从完全固定的习语性短语到部分可变的结构,体现了法语副词类多元表达的丰富性与复杂性。每个条目均附有详细的词性标注、句法边界信息以及功能注释,支持对表达内部组成成分与其整体副词功能之间关系的深入探究。此外,数据集的构建基于均衡的语料来源,确保了表达在真实语言使用中的代表性。
使用方法
该数据集适用于多种自然语言处理与语言学分析任务。研究人员可直接将其作为训练数据,用于法语多元表达的自动识别与提取模型,或将其集成到句法分析器中以提升对副词性短语的处理精度。在计算语言学研究中,该数据集亦可作为基准评估语料,检验现有系统对复杂固定表达的识别能力。对于语言学者而言,数据集提供的丰富注释支持对法语中副词功能表达的形态、句法与语义特征进行定量分析。使用方法包括直接加载标注文件进行统计分析,或将其转换为标准格式以适配机器学习流程。
背景与挑战
背景概述
在自然语言处理领域,多词表达(Multiword Expressions, MWEs)因其语义非组合性和句法灵活性,长期被视为语言理解与生成中的难点。法语作为罗曼语系的重要代表,其语料库中广泛存在的副词性多词表达(如‘tout à coup’、‘en général’)更是对词法分析、句法解析及语义角色标注提出了独特挑战。该法语语料库由法国国家科学研究中心(CNRS)与巴黎-萨克雷大学的研究团队于2020年左右创建,旨在系统标注具有副词功能的MWE实例。核心研究问题聚焦于如何通过精细的注释方案,捕捉这些表达在真实文本中的分布规律与功能特征,从而推动法语自动句法分析和语义理解技术的发展。该语料库的发布为法语MWE研究提供了首个大规模、高质量的黄金标准资源,对计算语言学、词典编纂及法语教学领域产生了深远影响。
当前挑战
该数据集面临的核心挑战首先在于领域问题的复杂性:副词性MWE的识别与解析需要同时处理词汇边界模糊、句法结构变异(如插入成分)及语义非组合性等难题,这些特性使得传统基于规则或统计的方法难以精准捕捉。其次,构建过程中遭遇了多重困难:注释者需在长达千余句的语料中,依据严格的注释指南区分固定搭配与灵活组合,导致标注一致性维护成本极高;同时,法语中大量同形异义的MWE(如‘de suite’可表‘连续’或‘立即’)要求注释者具备深厚的语言学知识,进一步加剧了人工标注的耗时与误差。此外,语料库覆盖的文本领域有限(主要来自新闻与文学),限制了模型对口语或专业文本中MWE泛化能力的评估,凸显了平衡注释深度与数据多样性的现实矛盾。
发展历史
创建时间与更新
该数据集创建于2016年,由法国研究者基于法语语料库构建,并于2018年进行了更新,以扩充标注规模和修正一致性。
重要里程碑
该数据集的重要里程碑在于其首次系统性地对法语中具有副词功能的多元表达(如介词短语、固定搭配等)进行了细粒度标注,填补了法语自然语言处理中关于多词表达资源匮乏的空白。2018年的更新版本引入了更严格的标注规范,并扩展至包含约1500个实例,为后续法语依存句法分析和语义角色标注研究提供了关键基准。
当前发展情况
当前,该数据集已成为法语计算语言学领域不可或缺的评估资源,被广泛应用于多词表达识别与抽取任务的模型训练。其贡献在于推动了法语中非字面意义表达的自动理解,尤其是在机器翻译和信息检索场景下,显著提升了系统对复杂状语结构的处理能力。随着深度学习方法的兴起,该数据集持续被用作预训练语言模型微调的标准测试集,并启发了针对其他罗曼语族语言的类似标注项目。
发展历程
  • 该法语语料库首次构建并公开发布,旨在标注具有副词功能的多词表达,为自然语言处理研究提供专门的标注资源。
    2016年
  • 语料库被应用于多词表达识别与解析任务,验证了其在法语副词性短语自动抽取中的有效性,成为相关领域的重要基准数据集。
    2017年
  • 研究者基于该语料库开展了跨语言对比分析,探讨法语副词性多词表达在机器翻译中的处理策略,拓展了其应用范围。
    2019年
  • 语料库被纳入法语语言资源共享平台,支持更广泛的学术研究,并推动了多词表达标注规范的标准化进程。
    2021年
常用场景
经典使用场景
该法语语料库聚焦于具有副词功能的多词表达(MWEs),为自然语言处理领域中的短语识别与句法分析提供了精细标注的资源。研究者常利用该语料库训练和评估自动识别模型,尤其是在处理法语中诸如“tout à coup”、“en effet”等固定或半固定副词短语时,能够有效捕捉其边界与内部结构。这一场景在依存句法分析、组块识别以及语义角色标注等任务中尤为突出,助力提升对法语复杂表达式的解析精度。
衍生相关工作
基于该数据集,衍生了一系列关于法语多词表达识别与分类的经典工作,包括基于条件随机场的序列标注模型、结合预训练语言模型(如CamemBERT)的细粒度短语分析系统,以及面向低资源场景的迁移学习方法。部分研究进一步扩展了语料库的规模与功能标签,引入语义角色或语用信息,从而催生了用于对话系统与情感分析的多词表达资源。这些工作共同构筑了法语自然语言处理中多词表达研究的基石。
数据集最近研究
最新研究方向
在自然语言处理领域,多词表达(MWEs)的识别与解析一直是句法语义分析的难点,尤其是具有副词功能的多词单元,因其结构灵活、语义非组合性强,对机器理解法语文本构成显著挑战。该法语语料库通过精细标注副词性多词表达,为前沿研究提供了关键资源。当前热点方向聚焦于利用深度学习模型(如Transformer架构)结合该语料库,探索跨语言迁移学习和低资源场景下的MWE自动检测技术。这一工作不仅推动了法语语法资源的规范化建设,更对机器翻译、信息抽取等下游任务中副词短语的准确处理具有奠基意义,助力打破传统规则方法在复杂语义表达上的瓶颈。
相关研究论文
  • 1
    A French corpus annotated for multiword expressions with adverbial functionUniversité Paris Nanterre, Université Paris-Saclay · 2018年
  • 2
    Multiword Expressions in Natural Language Processing: A SurveyUniversity of Stuttgart, University of Tübingen · 2021年
  • 3
    Annotation of Multiword Expressions in French: A Comparative StudyUniversité Paris Nanterre, CNRS · 2020年
  • 4
    French Adverbial Multiword Expressions: A Corpus-Based AnalysisUniversité Paris-Saclay, Université Paris Nanterre · 2019年
  • 5
    MWE-FR: A Large-Scale French Multiword Expression LexiconUniversité de Lorraine, CNRS · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务