遇见数据集

NYTK/alpaca_hu_2k

收藏
Hugging Face2024-02-22 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是斯坦福Alpaca提示的匈牙利语翻译子集,专为微调大型语言模型以遵循指令并回答匈牙利语问题而设计。它包含2000个翻译和100个本地化的提示,结构包括指令、输入、输出、标识符和类别标签。该数据集由HUN-REN匈牙利语言学研究中心语言技术研究小组创建,采用CC-BY-NC 4.0许可。

该数据集是斯坦福Alpaca提示的匈牙利语翻译子集,专为微调大型语言模型以遵循指令并回答匈牙利语问题而设计。它包含2000个翻译和100个本地化的提示,结构包括指令、输入、输出、标识符和类别标签。该数据集由HUN-REN匈牙利语言学研究中心语言技术研究小组创建,采用CC-BY-NC 4.0许可。

提供机构:
NYTK
原始信息汇总

数据集卡片 for Alpaca-Hu-2k

数据集详情

数据集描述

该数据集是首个用于微调大型语言模型的匈牙利语指令遵循语料库,由斯坦福Alpaca语料库的一部分翻译和本地化开发而成。它包含2000个翻译和100个本地化提示,旨在训练模型遵循指令的行为。语料库结构包括指令、输入和预期输出,辅以标识符和类别标签。该资源旨在提高语言模型在匈牙利语任务上的性能,对匈牙利计算语言学和LLM训练具有重要贡献。

用途

该数据集主要用于微调LLM,使其能够遵循指令和回答问题。此外,它还为研究人员和开发人员提供了宝贵的资源,旨在为匈牙利市场创建更具上下文和文化意识的AI应用。

数据集结构

我们的语料库遵循斯坦福Alpaca数据集的结构,并在原始字段(即id、instruction、input和output)的基础上增加了labels和meta字段,以实现全面的指令遵循模型。

  • id: 实例的唯一ID
  • instruction: 指令或问题
  • input: 输入数据或上下文,可选
  • output: 答案或解决方案
  • labels: 类别标签(见下表)
  • meta: 关于段落来源的信息:"Alpaca"或"localized"

在语料库中,每个段落都被分配了类别标签,以便轻松识别主题。这些标签及其描述如下,用于对内容进行分类,从计算和分类到代码解释和翻译。每个段落可以属于一个或多个类别,便于有针对性的分析和数据组织。

标签 描述
calc 计算
class 分类(包括情感分析)
code_exp 代码解释
code_gen 代码生成
code_konv 代码转换
corr 纠正
design 设计
fact_ans 事实回答
gen 表述
info_ext 信息提取
keywords 关键词提取
outline 概述
quest_gen 问题生成
recom 推荐
rephrase 改述
search 搜索
sum 总结/提取
trans 翻译

数据集创建

源数据

数据来自斯坦福Alpaca项目的52k提示。我们随机选择了2000个提示进行翻译。

注释

在注释指南中,我们优先考虑匈牙利语的流畅性和正确性,而不是严格忠实于原始英语文本,旨在提供适合语言模型训练的连贯和准确的翻译。主要关注提供有效、事实和相关的回答,而不是直接翻译,强调适应匈牙利语境和文化特定内容,并省略或部分翻译不可翻译的段落,如代码。此外,我们将高度专业化的提示保留下来,这些提示在翻译上存在挑战,并为每个提示添加类别标签,以便更好地分类和信息检索。

注释过程

英语提示翻译成匈牙利语的过程分为多个阶段,首先将总提示数分成每组一百个的小组。然后使用MemoQ翻译支持软件处理这些小组,该软件通过Google Cloud Translation API进行初步机器翻译。该软件确保了非可翻译元素(如标识符、标签和元数据)的一致性和准确性,这些元素存储在术语数据库中以进行质量控制。

后期编辑由Eötvös Loránd大学人文学院翻译和口译系的二年级硕士生进行,重点是达到接近人工翻译的标准,同时特别注意内容的准确性和文化相关性。每个学生的第一批翻译都由专业校对员进行审核,以确保质量和提供反馈。

后期编辑后,提示从MemoQ导回其原始格式,保持与源语言版本相同的布局。参与该项目的学生报告了积极的经验,指出该项目对他们的发展以及熟悉翻译支持软件的机会的贡献。然而,他们也强调了提示主题多样性带来的挑战,有时使得内容验证比语言审查更耗时。

注释者

后期编辑由Eötvös Loránd大学人文学院翻译和口译系的二年级硕士生进行。

引用

如果您使用此资源或其任何部分的文档,请引用:

Yang, Z. Gy. and Szlávik, Sz. and Ligeti-Nagy, N. (2024), Magyar nyelvű utasításkövető korpusz építése Stanford Alpaca promptok fordításával és lokalizálásával [Building a Hungarian instruct-following corpus by translating and localizing Stanford Alpaca prompts]. In: Berend., G. and Gosztolya, G. and Vincze, V. (eds), XX. Magyar Számítógépes Nyelvészeti Konferencia. Szeged, Szegedi Tudományegyetem. 243--255.

@inproceedings{yang-alpaca-promtps-hu, title = "{Magyar nyelvű utasításkövető korpusz építése Stanford Alpaca promptok fordításával és lokalizálásával [Building a Hungarian instruct-following corpus by translating and localizing Stanford Alpaca prompts]}", author = "Yang, Zijian Győző and Szlávik, Szilárd and Ligeti-Nagy, Noémi", booktitle = "XX. Magyar Számítógépes Nyelvészeti Konferencia.", year = "2024", address = "Szeged", publisher = "Szegedi Tudományegyetem", pages = "243--255" }

搜集汇总
数据集介绍
NYTK/alpaca_hu_2k 数据集图片
构建方式
该数据集源自斯坦福大学Alpaca项目中的52,000条英文指令,通过随机抽取2,000条并辅以100条本土化改写,构建了匈牙利语首个指令遵循语料库。构建流程采用多阶段翻译与后编辑策略:首先将提示分组,借助MemoQ翻译支持软件及Google Cloud Translation API进行机器初译,随后由罗兰大学翻译与口译系的硕士生进行人工后编辑,在确保译文流畅性与准确性的同时,着重于文化适配与内容本土化,对不可译元素(如代码)予以保留或部分翻译,并依据18个细分类别为每条数据赋予标签,以支持分类检索与信息提取。
使用方法
该数据集专用于微调大语言模型以增强其匈牙利语指令遵循能力,可直接通过Hugging Face Datasets库加载默认配置的'train'分片。使用时,用户需将'instruction'与可选的'input'字段拼接为模型输入,并以'output'作为监督信号进行训练;'labels'字段可用于实现多任务学习或按类别评估模型性能。研究者亦可依据'meta'字段区分翻译与本土化数据,以探究数据来源对模型表现的影响。该资源适用于构建面向匈牙利市场的上下文感知AI应用,如问答系统与语义理解工具。
背景与挑战
背景概述
在自然语言处理领域,指令微调(instruction fine-tuning)已成为提升大语言模型遵循人类指令能力的关键技术,而高质量的多语言指令语料库是推动该技术普惠化的重要基石。由匈牙利HUN-REN语言研究所语言技术研究组于2024年创建的NYTK/alpaca_hu_2k数据集,是首个专注于匈牙利语的指令遵循语料库,由Noémi Ligeti-Nagy和Zijian Győző Yang主导研发。该数据集以斯坦福Alpaca项目的52k条提示为基础,精心挑选并翻译了其中2000条提示,同时加入100条本地化实例,旨在弥合主流英语指令语料与低资源语言之间的鸿沟。其核心研究问题在于如何通过高质量的翻译与本地化,使大语言模型在匈牙利语任务中展现与英语相当的指令遵循能力,这一工作对匈牙利计算语言学和多语言大模型训练具有里程碑式的意义。
当前挑战
该数据集面临的挑战体现在两个层面。在领域问题层面,低资源语言(如匈牙利语)的指令语料极度匮乏,现有模型多以英语为中心,导致跨语言迁移时出现指令理解偏差与回答质量下降,尤其涉及文化特定内容(如本地化表达)时模型表现欠佳。在构建过程中,团队需解决翻译忠实度与本土化流畅性之间的平衡——严格直译可能丢失语义,过度本地化又可能偏离原始指令意图。此外,提示主题的多样性使得内容验证比语言审校更为耗时,专业术语(如代码片段)的不可译性要求设计特殊的处理策略,而标注员需同时具备语言能力和领域知识,这些均对数据质量保障构成严峻考验。
常用场景
经典使用场景
在自然语言处理与计算语言学领域,NYTK/alpaca_hu_2k 数据集的核心经典用途在于对大规模语言模型进行指令微调(instruction tuning),使其能够精准理解并执行匈牙利语指令。该数据集通过翻译与本地化斯坦福 Alpaca 语料库中的 2000 条英文提示,并额外注入 100 条本土化生成的提示,构建了首个匈牙利语指令跟随语料库。研究者通常将其作为训练数据,结合监督微调方法,引导模型学习从指令到预期输出的映射关系,从而显著提升模型在匈牙利语问答、文本生成、分类等下游任务中的表现。该语料库的结构化设计,包括指令、输入、输出及多类别标签,为指令微调提供了高质量的标注样本,是推动低资源语言模型能力提升的基础资源。
解决学术问题
该数据集精准回应了低资源语言在指令微调领域面临的核心学术挑战:缺乏高质量、结构化且文化适配的指令跟随训练语料。此前,匈牙利语等小语种在大语言模型研究中长期处于边缘地位,模型往往因训练数据不足而难以准确理解匈牙利语语义与句法,更无法完成复杂的指令任务。NYTK/alpaca_hu_2k 的诞生填补了这一空白,它通过系统化的翻译与本地化策略,解决了跨语言迁移中的语义失真与文化脱节问题。该数据集为研究者提供了评估与优化模型在匈牙利语环境下指令理解能力的标准基准,推动了多语言 NLP 研究从英语中心主义向语言多样性扩展,其意义在于验证了低资源语言亦可借助高质量微调语料实现模型性能的跃升。
实际应用
在实际应用层面,NYTK/alpaca_hu_2k 数据集直接服务于面向匈牙利语市场的智能语言技术产品开发。企业或机构可利用该数据集微调开源大语言模型,构建能够流畅处理匈牙利语客户咨询的智能客服系统、支持本土化内容生成的写作辅助工具,以及具备匈牙利语问答能力的教育辅导平台。由于数据集内包含代码生成、翻译、摘要抽取、分类等多类别标签,微调后的模型可灵活适配从技术文档翻译到情感分析等多元场景。此外,其本土化提示的设计确保了模型输出在文化语境上的恰当性,这对于面向匈牙利用户的医疗咨询、法律信息检索等敏感领域应用尤为重要,有效降低了因文化误读引发的风险。
数据集最近研究
最新研究方向
在当前大语言模型多语言适配与低资源语言指令微调的前沿浪潮中,NYTK/alpaca_hu_2k作为首个匈牙利语指令遵循语料库,填补了该语言在指令微调领域的空白。该数据集通过对斯坦福Alpaca语料进行翻译与本土化改造,构建了包含2000条翻译与100条本地化提示的精炼语料,并引入细粒度类别标签以支持多任务场景。其研究意义不仅在于提升了匈牙利语模型的指令遵循能力,更揭示了跨语言指令微调中文化适配与翻译质量之间的微妙平衡——通过优先确保匈牙利语流畅性与事实准确性而非逐字直译,为低资源语言的大模型微调提供了可复现的方法论范例。这一工作与当前多语言NLP领域对语言多样性和文化包容性的关注紧密呼应,预示着未来模型在非英语场景下将具备更精准的上下文理解与生成能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务