遇见数据集

americasnlp_2025_guarani_analysis

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于文本转换与改写研究的语料库,核心包含源文本(Source)、目标文本(Target)以及描述两者间修改意图的变化描述(Change)。每个样本均具有唯一标识符(ID)。数据集的突出特点是其深度整合了针对多个主流大语言模型的分词分析数据。具体而言,它为源文本和目标文本分别预计算了超过20种不同大语言模型(包括Llama、Qwen、Gemma、DeepSeek、Mistral、GLM等系列模型)的分词结果(Tokenized_Source, Tokenized_Target)、对应的token数量(Source_Token_Count, Target_Token_Count)以及一个称为“繁殖力指标”(Fertility_Metric)的度量。此外,还提供了词数统计(Word_Count)和用于衡量源目标文本在分词层面差异的Token距离及其归一化值(Token_Distance, Token_Distance_Normalized),以及形态学分词信息(Morphological_Tokens)。数据集划分为训练集(178个样本)、开发集(79个样本)和测试集(364个样本)。该数据集适用于文本改写、风格迁移、机器翻译后编辑等任务的研究,尤其便于进行跨不同大语言模型分词器的对比分析、文本压缩效率评估、以及构建与具体模型分词器无关的文本转换基准测试。

This dataset is a corpus for text transformation and rewriting research, core components including source text (Source), target text (Target), and a change description (Change) that describes the modification intent between them. Each sample has a unique identifier (ID). The datasets standout feature is its deep integration of tokenization analysis data for multiple mainstream large language models. Specifically, it precomputes for both source and target texts the tokenization results (Tokenized_Source, Tokenized_Target), corresponding token counts (Source_Token_Count, Target_Token_Count), and a measure called the Fertility Metric for over 20 different large language models (including series such as Llama, Qwen, Gemma, DeepSeek, Mistral, GLM). Additionally, it provides word count statistics (Word_Count), token distance and its normalized value (Token_Distance, Token_Distance_Normalized) to measure differences at the tokenization level between source and target texts, as well as morphological token information (Morphological_Tokens). The dataset is divided into training set (178 samples), development set (79 samples), and test set (364 samples). It is suitable for research in text rewriting, style transfer, machine translation post-editing, and other tasks, particularly facilitating cross-model tokenizer comparative analysis, text compression efficiency evaluation, and the construction of model-agnostic text transformation benchmarks.

创建时间:
2026-05-30
原始信息汇总

数据集概述

数据集名称: americasnlp_2025_guarani_analysis

数据集地址: https://huggingface.co/datasets/thinkPy/americasnlp_2025_guarani_analysis

数据规模:

  • 总大小: 3,167,788 字节
  • 下载大小: 920,044 字节
  • 包含 621 个样本,分为三个子集:
    • 训练集 (train): 178 个样本,1,212,059 字节
    • 开发集 (dev): 79 个样本,483,815 字节
    • 测试集 (test): 364 个样本,1,471,914 字节

数据特征: 数据集包含以下字段:

  • ID (string): 样本唯一标识符
  • Source (string): 源文本
  • Change (string): 变更记录
  • Target (string): 目标文本
  • Tokenized_Source (struct): 29 个不同模型对源文本的分词结果
  • Tokenized_Target (struct): 29 个不同模型对目标文本的分词结果
  • Source_Word_Count (int64): 源文本词数
  • Target_Word_Count (int64): 目标文本词数
  • Source_Token_Count (struct): 29 个模型对源文本的分词数量
  • Target_Token_Count (struct): 29 个模型对目标文本的分词数量
  • Source_Fertility_Metric (struct): 29 个模型在源文本上的词汇丰富度指标
  • Target_Fertility_Metric (struct): 29 个模型在目标文本上的词汇丰富度指标
  • Token_Distance (struct): 29 个模型的词元距离
  • Token_Distance_Normalized (struct): 29 个模型的归一化词元距离
  • Morphological_Tokens_Source (list of string): 源文本形态学词元
  • Morphological_Tokens_Target (list of string): 目标文本形态学词元

涉及的模型(共 29 个):

  • HuggingFaceTB/SmolLM3-3B
  • LiquidAI/LFM2.5-350M
  • LiquidAI/LFM2.5-8B-A1B
  • MiniMaxAI/MiniMax-M2.7
  • Qwen/Qwen2.5-7B-Instruct
  • Qwen/Qwen3-0.6B
  • Qwen/Qwen3.5-397B-A17B
  • Qwen/Qwen3.5-4B
  • XiaomiMiMo/MiMo-V2.5-Pro
  • deepseek-ai/DeepSeek-V3.2
  • deepseek-ai/DeepSeek-V4-Flash
  • google/gemma-2-2b-it
  • google/gemma-3-1b-it
  • google/gemma-3-27b-it
  • google/gemma-4-31B-it
  • meta-llama/Llama-3.1-8B-Instruct
  • meta-llama/Llama-3.2-3B-Instruct
  • meta-llama/Llama-3.3-70B-Instruct
  • microsoft/Phi-3-mini-4k-instruct
  • microsoft/Phi-4-mini-instruct
  • mistralai/Mistral-7B-Instruct-v0.3
  • mistralai/Mistral-Medium-3.5-128B
  • moonshotai/Kimi-K2.5
  • moonshotai/Kimi-K2.6
  • openai/gpt-oss-120b
  • openai/gpt-oss-20b
  • openbmb/MiniCPM5-1B
  • zai-org/GLM-4.6
  • zai-org/GLM-5.1

数据文件配置:

  • 默认配置名: default
  • 数据文件路径:
    • 训练集: data/train-*
    • 开发集: data/dev-*
    • 测试集: data/test-*
搜集汇总
数据集介绍
americasnlp_2025_guarani_analysis 数据集图片
构建方式
在自然语言处理领域中,低资源语言的语料积累与模型评估始终是学术探索的前沿挑战。该数据集聚焦于瓜拉尼语这一南美原住民语言,通过精心设计的多层次结构,系统性地整合了源语言与目标语言的文本对齐信息。构建过程首先从原始语料中提取句子级对齐数据,记录每个样本的标识符、来源及变更类型,随后利用29种不同的预训练分词器对源文本与目标文本分别执行分词操作,生成Tokenized_Source与Tokenized_Target字段。每个分词器对应的Token序列均被独立存储,同时计算了包括词数、令牌数、令牌距离及其归一化值在内的统计指标,并引入源语言与目标语言的形态标记序列,从而构建出一个多维度的平行语料分析基准。
使用方法
使用者可通过HuggingFace Datasets库便捷加载该数据集,只需指定数据集名称americasnlp_2025_guarani_analysis,并利用load_dataset函数即可获取按train、dev、test划分的数据分片。每条记录均以字典形式呈现,包含ID、Source、Target等基本信息,以及以模型名为键的嵌套字段。用户可根据研究需求提取特定的分词结果或统计指标,例如计算各模型在Token_Distance上的分布,或比较Source_Fertility_Metric与Target_Fertility_Metric的差异。数据集支持灵活的子集选取与指标计算,尤其适合用于评估多语言分词器在低资源语言上的鲁棒性,或作为机器翻译、语言模型微调等任务的预处理基准。
背景与挑战
背景概述
该数据集诞生于低资源语言自然语言处理研究蓬勃发展的背景下,旨在为瓜拉尼语(Guaraní)提供系统性的分析资源。瓜拉尼语作为南美洲广泛使用的原住民语言,在数字化进程中面临严重的数据匮乏困境。由AmericasNLP 2025相关研究团队构建,该数据集聚焦于跨语言词法分析与翻译质量评估,其核心目标在于量化不同大语言模型在处理瓜拉尼语形态丰富性时的表现差异。通过收录来自HuggingFaceTB、Qwen、DeepSeek、Google等多家机构的29种代表性模型的词元化结果,该数据集为探索模型在低资源语言上的泛化能力与词元化偏好提供了宝贵的标准化基准,对推动美洲原住民语言的技术赋能具有里程碑意义。
当前挑战
该数据集的构建面临多重挑战。在领域问题层面,低资源语言如瓜拉尼语缺乏大规模、高质量的平行语料,其黏着型形态特性导致词元化边界模糊,现有分词算法与多语言模型往往难以准确捕获其词素结构。在数据集构建过程中,首要挑战在于跨模型词元化结果的标准格式化存储,需为每一个样本对齐29种不同词元化器的输出。其次,生育率(fertility)与词元距离等评估指标的引入涉及复杂计算,要求同时处理源语言与目标语言的形态学特征。此外,数据规模较小(仅621个样本)虽利于精细分析,却也带来统计显著性不足的风险,不利于模型间差异的可靠推断。
常用场景
经典使用场景
该数据集聚焦于南美洲土著语言瓜拉尼语(Guaraní)的机器翻译与语言分析研究。在低资源语言处理领域,瓜拉尼语作为典型代表,长期面临语料匮乏、形态复杂等挑战。此数据集为评估各类大语言模型在瓜拉尼语上的翻译能力提供了标准化基准,涵盖了从轻量级模型(如LiquidAI/LFM2.5-350M)到千亿参数级模型(如Qwen/Qwen3.5-397B-A17B)的多元对比。研究通过标注源文与译文的形态学词元、计算词粒度和复杂度指标,使得模型在跨语言迁移中的表现得以量化考察,从而推动面向低资源语言的神经机器翻译技术发展。
解决学术问题
在学术层面,该数据集系统性地回应了低资源语言机器翻译中的若干核心难题。瓜拉尼语复杂的黏着形态结构导致词汇分割与对齐异常困难,传统基于统计的方法往往力不从心。通过提供多模型的词元化版本、词汇生育率(fertility metric)和词元距离(token distance)等细粒度指标,数据集揭示了不同分词策略与模型架构对翻译质量的影响机制。这一资源使研究者得以深入分析模型在形态丰富语言上的编码与解码能力,为解决低资源情境下数据稀疏、词表爆炸等问题提供了实证基础,具有重要的理论和方法论意义。
实际应用
在实际应用层面,该数据集为瓜拉尼语地区的语言复兴和跨文化沟通提供了技术支撑。瓜拉尼语在巴拉圭、玻利维亚和阿根廷等地拥有数百万使用者,但其数字化进程严重滞后。数据集支持的机器翻译系统可广泛应用于政府公文翻译、教育材料本地化以及医疗健康信息的跨语言传播。此外,针对不同规模模型(如轻量级Phi-3-mini到大规模DeepSeek-V4)的表现评估,为资源受限场景下的模型选型提供了参考指南,助力在移动设备或边缘计算环境中部署高效的翻译服务。
数据集最近研究
最新研究方向
该数据集聚焦于美洲原住民语言瓜拉尼语的机器翻译与形态分析,通过集成涵盖从轻量级到超大规模、横跨多个机构(如Google、Meta、DeepSeek、通义千问等)的30种前沿大语言模型,系统性评估不同分词策略对该低资源语言的翻译质量、词汇繁衍率及形态对齐的影响。研究热潮紧密围绕低资源语言的语言技术公平性这一全球热点,该数据集为量化大模型在形态丰富语言上的跨词与跨分词器行为差异提供了标准化评测基准,其贡献在于推动语言多样性保护与通用人工智能包容性发展的交汇点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务