遇见数据集

oliverkinch/da-instruct-dynaword-hq

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个丹麦语指令微调数据集,通过从`danish-foundation-models/danish-dynaword`数据集的回译生成,并使用`danish-foundation-models/dynaword-annotations`进行高质量样本过滤。每一行数据都是一个(prompt, target)对,其中:**target**是来自DynaWord精选子集的真实丹麦语文本段落;**prompt**是通过回译方法生成的、能合理引导语言模型产生该文本的丹麦语用户指令。prompt由Qwen/Qwen3.5-397B-A17B模型生成,采用了特定领域(如政府、文学、学术、税务指导、新闻、演讲)的提示模板,以确保生成的指令与源文本的语体和体裁相匹配。

Danish instruction fine-tuning dataset generated via backtranslation from `danish-foundation-models/danish-dynaword`, filtered to high-quality samples using `danish-foundation-models/dynaword-annotations`. Each row is a `(prompt, target)` pair where: **`target`** is a passage of authentic Danish text drawn from a curated subset of DynaWord; **`prompt`** is a realistic Danish user instruction that would plausibly elicit that text from a language model. Prompts were generated by Qwen/Qwen3.5-397B-A17B using a backtranslation approach, with domain-specific prompt templates (government, literary, academic, tax guidance, news, speech) ensuring that the generated instructions match the register and genre of the source text.

提供机构:
oliverkinch
搜集汇总
数据集介绍
oliverkinch/da-instruct-dynaword-hq 数据集图片
构建方式
该数据集以丹麦语指令微调为使命,依托DynaWord语料库,经由反向翻译技术精心构建而成。构建过程始于对danish-dynaword语料库中5.66M样本的质量过滤,利用dynaword-annotations标注数据,严格筛选出内容完整、质量卓越、安全无害且不含个人身份信息的样本,最终随机抽样9,200个ID。随后,对长于400字符的文章进行分段处理,采用混合评分策略提取至多2,500字符的段落,并剔除OCR噪声、重复内容及文档题跋等低质片段。针对每一段落,借助Qwen3.5-397B-A17B模型,结合领域特定的提示模板(涵盖政府、文学、学术、税务、新闻、演讲六大领域),生成与原文风格匹配的丹麦语用户指令,经语言检测与规则验证后,最终产出10,660组高质量的指令-回复对。
使用方法
用户可通过HuggingFace Datasets库便捷加载,调用load_dataset函数即可获取训练集,其中包含10,660条指令-回复对。每条数据以字典形式存储,包含唯一标识符、prompt(用户指令)、target(模型回复)及详尽的元数据信息,如来源子集、段落索引、内容类型等,便于追溯与筛选。使用时可参考示例格式,将数据转换为对话模板,适用于监督式微调(SFT)场景。该数据集继承自DynaWord语料库的多种开放许可协议,而生成的prompt列则遵循CC-BY 4.0许可,允许广泛的学术研究与商业应用。
背景与挑战
背景概述
在自然语言处理领域,指令微调数据的稀缺性与语言多样性之间始终存在张力,尤其对于丹麦语等低资源语言,构建高质量、覆盖多领域的指令数据集成为提升大语言模型本地化能力的核心挑战。da-instruct-dynaword-hq数据集由Oliver Kinch等研究人员于近期创建,依托丹麦基础模型团队(danish-foundation-models)构建的DynaWord语料库,通过反向翻译技术生成指令对,并利用质量标注进行严格筛选。该数据集涵盖当代与历史丹麦语的40个子集,包括法律、政府、文学、新闻、税收指导等多领域文本,旨在为丹麦语大语言模型的监督微调提供可靠的指令数据。其创新性在于将自动生成指令与多维度质量过滤相结合,为低资源语言的指令数据构建提供了可复现的范式,对推动丹麦语自然语言处理研究具有重要影响力。
当前挑战
该数据集所解决的领域问题核心在于丹麦语指令数据的稀缺性与质量不可控性。传统人工标注成本高昂且难以覆盖法律、历史文献等专业领域,而自动生成方法则面临指令与目标文本领域风格不匹配、生成内容含噪声等挑战。在构建过程中,研究者需应对多重技术难题:首先,DynaWord原始语料包含大量OCR噪声、重复内容及元数据标记,需设计混合评分算法进行段落级质量过滤;其次,反向翻译提示需适配政府公文、文学散文等六类不同语体,要求模型精准识别源文本的语域特征;最后,生成指令需通过语言检测、用户意图判别、提示-目标内容重叠校验等规则过滤,确保生成结果符合丹麦语用户真实查询习惯,避免虚构或角色扮演型指令混入数据集。
常用场景
经典使用场景
在丹麦语自然语言处理领域,da-instruct-dynaword-hq 数据集最经典的用途在于对大型语言模型进行指令微调(Instruction Tuning),以提升模型理解和执行丹麦语用户指令的能力。该数据集通过反向翻译技术,从覆盖古今丹麦语的多源语料库中精心筛选出高质量文本片段,并为其生成与之匹配的真实用户指令。研究者常将其作为监督式微调(SFT)的核心训练数据,使模型能够学习将多样化的丹麦语请求(如法律查询、历史文献解读、新闻摘要等)转化为准确、连贯且符合语境的专业回复。这种面向指令的微调范式,为构建能够流畅处理丹麦语复杂任务的大语言模型奠定了坚实的数据基础。
解决学术问题
该数据集的构建直接回应了低资源语言指令微调数据匮乏这一学术难题。丹麦语作为使用人数较少的小语种,长期以来缺乏高质量、大规模且覆盖多领域(如法律、税收、卫生、文学、议会发言等)的指令数据。da-instruct-dynaword-hq 通过创新的反向翻译流水线与严格的质量过滤机制,从包含5.66M样本的DynaWord语料库中提取出10,660个精良的(提示词,回复)对,有效解决了低资源场景下指令数据人工标注成本高昂、覆盖面狭窄的问题。其意义在于为丹麦语大模型的领域适应、可控文本生成以及跨时代语言理解提供了可复现、可扩展的数据基础,推动了北欧小语种NLP研究从通用语言建模向指令遵循范式的跨越。
实际应用
在实际应用层面,该数据集赋能了一系列面向丹麦公民和机构的智能文本生成系统。例如,在政府公共服务领域,模型可以精准回应用户关于税务法规、环保政策或市政会议决议的咨询;在法律场景中,能够基于裁判文书或法律条文生成易懂的解答;在教育与新闻领域,可协助整理历史信件、学术文章或百科全书内容。由于数据集中包含了从当代到历史时期的多元语料,微调后的模型还能胜任丹麦文化遗产数字化工作,如自动转译古代公报或文学片段。此外,该数据集还适用于开发丹麦语聊天机器人、智能文档助手以及跨领域知识问答系统,显著提升了丹麦语AI应用的实际可用性和文化适应性。
数据集最近研究
最新研究方向
在低资源语言指令微调领域,该数据集开创性地融合了回译生成与多维度质量过滤策略,为丹麦语大型语言模型的细粒度对齐提供了高纯度训练资源。研究前沿聚焦于利用系统化的提示模板(覆盖政务、法律、文学、学术、税务、新闻、议会演讲等32个细分领域)实现指令与语域精准映射,这一方法论有效弥合了生成式指令与真实文本在语义和风格上的鸿沟。尤其值得关注的是,通过结合DynaWord语料库中对历史文献的深度覆盖,该数据集为跨时代丹麦语文本理解与生成任务奠定了坚实基础,推动了面向小语种的大模型在文化遗产数字化、智能政务解析等热点场景中的实际落地,其混合开源许可策略也为后续多源语料合规复用树立了范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务