遇见数据集

peneira-recursos

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Peneira资源包是一个用于加利西亚语规范性校对的开放数据集,专注于校正西班牙语干扰、代词位置、短语结构和拼写问题。它包含三个核心组件:EVAL-204评估集(含204个系列,包括193个严格评估项和11个有文档的排除项,以及te=CD子集)、干扰清单(含153个规范性条目,分为125个明确条目、9个模糊条目、4个偏好条目和15个模式)和架构说明文档(描述“有疑问时保持沉默”原则)。资源基于RAG/ILG(NOMIG 2003, DRAG)规范性标准,使用Salamandra-7B作为基础模型。请注意,这些资源未经独立外部语言学审查,是“尽力而为”的资源而非规范性权威,训练数据集和模型权重不包含在内。数据集采用CC BY 4.0许可证发布,所有内容均为原创作品,不包含维基百科文本。

The Peneira Resource Package is an open resource developed by ARGALLA for the Galician language normative proofreading assistant project. This dataset focuses on normative correction of Galician, specifically targeting issues caused by Spanish interference, pronoun placement, phrase structure and spelling. The resource package includes three core components: 1) The EVAL-204 evaluation set, which contains 204 entries (193 strict evaluation items and 11 documented exclusion items) along with the te=CD subset; 2) The interference inventory, which encompasses 153 normative entries (125 clear entries, 9 ambiguous entries, 4 preference entries and 15 patterns); 3) The architecture specification document, which describes the "When in Doubt, Keep Silent" principle. These resources are based on the RAG/ILG normative standards (NOMIG 2003, DRAG) and use Salamandra-7B as the base model. It should be noted that these resources have not undergone independent external linguistic review, and are "best-effort" resources rather than normative authorities. The training datasets and model weights are not included in this resource package. This dataset is released under the CC BY 4.0 license, and all content is original work that does not include Wikipedia texts.

创建时间:
2026-07-22
原始信息汇总

Peneira · 资源包 (v1.0)

许可证: CC BY 4.0
语言: 加利西亚语
标签: 加利西亚语、语法、规范性校正、评估
名称: Peneira · recursos (eval-204 + inventario + arquitectura)

该项目由 ARGALLA 开发,是一个用于加利西亚语的规范性辅助校正工具(针对卡斯蒂利亚语干扰、代词放置、动词短语、正字法)。外部审查尚在进行中,资源为“尽力而为”性质,不作规范性权威。


资源内容

资源 文件 说明
Held-out EVAL-204 eval_set.jsonleval_extension_v3.jsonleval_sintaxe_v2.jsonleval_sintaxe_extension_v3.jsonleval_teche_v32.jsonlEVAL-204-manifesto.md 密封评估集(204系列/193严格/11个记录在案的排除项)+ te=CD 子集
干扰清单 inventario.jsonlINVENTARIO-auditado.md 153个规范性条目(125个明确项、9个歧义项、4个偏好项、15个模式)
架构 ARQUITECTURA.md 速查表+核心+三个守卫·“存疑时保持沉默”原则

未包含在此的内容

  • 训练数据集及模型的权重/GGUFs
  • 基准测试数字(架构描述仅说明评估方法,而非结果)

许可证与引用

  • 采用 CC BY 4.0 许可证,三个资源为原创作品,不含维基百科文本,不继承相同方式共享条款。
  • 规范性来源:RAG/ILG(NOMIG 2003,DRAG)
  • 基础模型:Salamandra-7B(BSC-LT)
  • 训练所用维基语料(Wikipedia,CC BY-SA)未包含在此。

报告错误

欢迎在本仓库提交 issue,内容包括:片段、建议的更正及规范性参考(如有)。所有基于规范的更正都将推动“待外部审查”的进展。

搜集汇总
数据集介绍
peneira-recursos 数据集图片
构建方式
Peneira · recursos 数据集的构建基于加利西亚语规范性校正项目Peneira,由ARGALLA团队开发。该数据集包含三大核心资源:首先,Held-out EVAL-204评估集由204个序列组成,其中193个为严格标准序列,另有11个已文档化的排除序列,并包含te作为直接宾语代词的子集。评估集通过内部审计构建,对照NOMIG 2003和DRAG规范进行校验。其次,干扰语料库由153个规范性条目构成,涵盖125个明确实例、9个歧义案例、4个偏好表达和15个模式类型。最后,架构部分提供了系统设计文档。整个数据集采用CC BY 4.0许可发布,目前尚未经过独立外部语言学家审查,属最佳努力资源。
特点
该数据集的核心特点在于其专业性、透明性和模块化设计。EVAL-204评估集是一个封闭的测试集合,确保评估结果的稳定性和可比性,其组成部分包括主序列和扩展序列,覆盖语法、句法等多个维度。干扰语料库系统整理了来自西班牙语的干扰现象,涉及代词的放置、动词短语和拼写规则,有助于识别和纠正非规范用法。数据集明确标注了所有非Wikipedia原创内容,避免继承共享许可,同时清晰区分了训练数据、模型权重与评估资源的界限。架构文档详细描述了系统设计原则,包括“存疑则沉默”的保守策略,强调在不确定时不进行修改,优先保证正确性。
使用方法
该数据集主要用于加利西亚语规范性校正系统的评估与开发,可通过HuggingFace平台获取。用户可以直接加载JSONL格式的评估文件进行模型测试,利用held-out EVAL-204集合评估校正器的准确性、召回率和精确度。干扰语料库可用于分析常见错误模式,为规则系统或修正算法提供训练素材。架构文档提供了系统运行逻辑的详细说明,便于理解校正流程和决策边界。用户需注意,由于资源尚未通过外部审查,更适合作为辅助参考而非绝对规范。使用时需引用CC BY 4.0许可,并可在GitHub仓库中提交错误报告以协助完善资源。
背景与挑战
背景概述
Peneira · recursos 数据集诞生于加利西亚语自然语言处理领域对规范性语法校正工具的系统性需求。由 ARGALLA 研究团队于近期开发,该数据集聚焦于加利西亚语中的西班牙语干扰现象、代词放置、动词短语及拼写校正等关键语法问题。其核心研究问题在于构建一个可靠的评估基准与干扰现象清单,以支持规范性语法校正模型的开发与评测。该数据集包含封闭评估集(EVAL-204)、153条规范性干扰条目清单以及完整的技术架构文档,为加利西亚语计算语言学研究提供了标准化资源。其影响力体现在为低资源语言规范性处理设立了方法论范例,推动了面向少数民族语言的精准自然语言处理技术发展。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,加利西亚语作为低资源语言,其规范性语法校正面临数据稀疏与标准多样化的双重困境,特别是西班牙语干扰现象的复杂性与语言变体的动态变迁,使得自动校正模型难以兼顾规范性与语境灵活性。在构建过程中,团队需应对资源审计的严格性挑战:当前数据集仅完成了内部审计,尚未通过独立外部语言学审查,意味着其规范性权威性仍存在不确定性;同时,模型训练数据集与权重尚未公开发布,限制了研究社区对整体系统的复现与验证能力。此外,资源许可证的清晰界定(CC BY 4.0)虽确保了开源性,但训练数据中涉及的Wikipedia文本需额外处理共享协议问题,增加了资源整合的复杂性。
常用场景
经典使用场景
在低资源语言自然语言处理领域,Peneira·recursos数据集为加利西亚语的语法规范性校正任务提供了标准化的评估基准。该数据集包含一个密封的评估集EVAL-204,涵盖204个系列样本,可细分为严格子集和带特定代词性质的语料。研究者常将其用于评测语法校正模型在加利西亚语上的表现,尤其关注其对抗西班牙语干扰、代词放置、谓语结构和正字法等方面的校正能力。
衍生相关工作
基于该数据集,研究者已发展出Peneira项目的规范性校正架构,其核心原则为「存疑则静默」,即在模型不确定时不进行修改以避免误改。此外,该资源预期将催生一系列针对低资源语言的矫正模型基准评测工作,以及基于Salamandra-7B等基础模型的专业适配研究。后续工作还可能围绕数据集发布的架构文档,构建包含语法规则与神经网络模型的混合校正系统,推动低资源语言处理技术的进步。
数据集最近研究
最新研究方向
在少数民族语言资源稀缺的背景下,Peneira数据集作为加里西亚语规范性语法校正的开放资源,其前沿研究方向聚焦于低资源语言智能语法纠错与语言规范化工具的构建。该数据集囊括了封闭评估集EVAL-204、干扰现象清单及模型架构文档,为评估语法校正系统提供了标准化基准。近期研究热点在于利用此类资源训练基于小型语言模型(如Salamandra-7B)的规范辅助工具,以应对西班牙语对加里西亚语的深层语言干扰、代词位置及拼写变异等复杂问题。这一工作不仅推动了加里西亚语计算语言学的技术突破,也揭示了其他区域性语言在数字化保护与标准化过程中面临的共同挑战,具有显著的学术意义与社会文化影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务