遇见数据集

JohnTdi/polish-llm-sft-pl

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Polish LLM SFT Dataset是一个用于改进和训练波兰语大型语言模型(LLM)的数据集,旨在帮助各种LLM学习和提升波兰语能力。数据集包含38,781个样本,覆盖多种任务类型,包括文本生成、问答、多项选择等。数据格式为JSON,每个样本包含用户和助手角色的对话消息。数据集结构分为多个类别:code(Python编码任务)、empathy(情感支持对话)、handmade(手写混合数据)、history(波兰和世界历史问答)、idioms(波兰成语,包含277个成语的3种表达方式)、math(数学应用题)、mcq_8tags(新闻文章分类)、mcq_belebele(长段落阅读理解多项选择)、mcq_dyk(冷知识多项选择)、mcq_general(多领域多项选择)、mcq_polemo(情感分析多项选择)、mcq_ppc(释义分类多项选择)、mcq_psc(相同/不同文章分类)、mcq_rc(阅读理解多项选择)、rag(基于上下文的问答)、reasoning(链式思维推理)、translation(波兰语-英语翻译对)、trivia(波兰文化和地理常识)、wiki_qa(波兰维基百科问答)。数据集采用质量评分系统:q10表示手写并验证的数据,q9表示合成生成且约95%准确率,q8表示良好数据但有轻微问题。注意事项:合成数据可能包含事实错误,q8文件比q10有更高幻觉风险,部分文件来源混合且无精确追踪。许可证为Apache 2.0,但source_corpus/部分使用CC-BY-SA 4.0(基于波兰维基百科)。

Polish LLM SFT Dataset is a dataset prepared to help various LLMs learn and improve their Polish language capabilities. It contains 38,781 samples covering multiple task categories such as text generation, question-answering, and multiple-choice. Each sample is in JSON format with messages containing user and assistant roles. The dataset is structured into categories: code (Python coding tasks), empathy (emotional support dialogues), handmade (handwritten ground truth mix), history (Polish & world history QA), idioms (Polish idioms with 277 idioms in 3 phrasings), math (math word problems), mcq_8tags (news article category classification), mcq_belebele (long-passage reading comprehension MCQ), mcq_dyk (Did you know trivia MCQ), mcq_general (multi-domain MCQ), mcq_polemo (sentiment analysis MCQ), mcq_ppc (paraphrase classification MCQ), mcq_psc (same/different article classification), mcq_rc (reading comprehension MCQ), rag (context-grounded QA), reasoning (chain-of-thought reasoning), translation (PL↔EN translation pairs), trivia (Polish cultural & geo trivia), and wiki_qa (QA from Polish Wikipedia). A quality scale is used: q10 indicates handwritten and verified data, q9 indicates synthetically generated data with ~95% accuracy, and q8 indicates good data with minor issues. Caveats: Synthetic data may contain factual errors, q8 files carry higher hallucination risk than q10, and some files originate from mixed sources without per-sample provenance tracking. The license is Apache 2.0, except for the source_corpus/ part which is CC-BY-SA 4.0 (based on Polish Wikipedia).

提供机构:
JohnTdi
搜集汇总
数据集介绍
JohnTdi/polish-llm-sft-pl 数据集图片
构建方式
该数据集旨在提升大语言模型在波兰语环境下的表现,由38,781个高质量样本构成,覆盖代码、情感支持、手工编写、历史问答、波兰习语、数学推理、多选题、检索增强生成、逻辑推理、机器翻译、文化常识及维基百科问答等18个子领域。数据构建采用多层质量控制策略,依据来源和准确性分为q10(手工编写并基于Claude Opus 4.7验证)、q9(合成生成,准确率约95%)和q8(存在轻微问题)三个等级,等级信息直接编码于文件名中。同时,数据集还包含PL↔EN翻译对和源自波兰维基百科的问答数据,进一步增强了多语言与事实性内容的覆盖。
特点
数据集以统一的多轮对话格式组织,每条样本包含用户与助手的结构化消息对,便于直接应用于指令微调流程。其显著特点在于对波兰语文化特有现象(如习语、历史、地理冷知识)的深入覆盖,以及多类型推理任务的系统集成,包括数学、代码、链式思维和多选题。质量分级机制使研究者能够根据任务需求灵活筛选不同可靠程度的数据,例如对准确性要求高的场景优先使用q10样本。此外,部分无明确来源标签的文件提醒用户注意潜在幻觉风险,强化了数据使用的透明度。
使用方法
适用场景包括文本生成、问答、多选题推理等监督式微调任务。使用时可基于文件名中的质量等级标签(如 q10、q9、q8)筛选特定置信度的子集,或按目录名选取对应技能领域的数据。数据集以JSON格式存储,每条记录包含messages字段,需将其转化为模型所需的对话模板。对于合成数据部分,建议在部署前额外验证事实准确性,尤其是q8等级的样本;源自波兰维基百科的数据遵循CC-BY-SA 4.0协议,使用时需遵守相应的许可要求。
背景与挑战
背景概述
该数据集名为polish-llm-sft-pl,是一个面向波兰语大语言模型优化与教学的高质量指令微调数据集。该数据集由社区研究者在2024年左右创建,旨在弥补波兰语在大型语言模型训练数据中的稀缺性,核心研究问题在于如何通过精细化的多领域指令微调数据提升模型在波兰语环境下的表现。数据集涵盖了从代码生成、数学推理、情感支持到波兰历史问答、习语理解等近20个子领域,总计超过38,000条样本,其结构设计兼顾了多样性、文化适配性与任务复杂度。这一数据集的发布对于推动低资源语言大模型的发展具有显著意义,为波兰语自然语言处理研究提供了关键的训练资源,并促进了多语言基础模型的本地化适应。
当前挑战
该数据集所面对的领域挑战主要包括两个方面。其一,波兰语作为中低资源语言,在主流LLM训练语料中占比极低,导致模型在波兰语理解与生成任务上存在显著性能瓶颈,需要专门构造高质量的多任务指令数据以弥补这一失衡。其二,数据构建过程中的挑战尤为突出:大部分样本为合成生成或从混合来源整理,存在事实性错误与幻觉风险,特别是在质量评分较低(如q8级别)的样本中更易出现不可控的语义偏差;此外,部分文件缺乏明确的作者标注与样本来源追溯,增加了数据治理与可复现性的难度,要求研究者在使用时对数据质量进行额外评估与筛选。
常用场景
经典使用场景
polish-llm-sft-pl数据集专为提升大语言模型(LLM)在波兰语环境中的指令跟随能力而设计。其经典使用场景包括文本生成、问答系统和多项选择任务,通过涵盖代码编写、数学推理、常识问答及情感分析等多元子集,为模型提供丰富的波兰语训练样本。研究者常利用该数据集的指令微调(SFT)格式,结合其精致的质量评分体系(q10至q8),精选高保真样本以优化模型在波兰语上的生成质量与语义理解。这一设计使得该数据集成为构建和评估多语言LLM波兰语能力的基准工具,尤其适用于需要对波兰语用户提供可靠交互服务的场景。
解决学术问题
该数据集致力于解决波兰语资源稀缺导致的LLM性能不足问题,弥补了主流数据集多集中于英语的缺憾。在学术研究中,它有效缓解了波兰语模型在推理、知识问答和上下文理解等任务上的训练数据缺失困境。通过引入包括波兰历史、文化常识及成语在内的本土化样本,数据集帮助模型克服跨语言迁移中的文化偏差,提升了模型在处理波兰语特有表达和复杂语用场景时的鲁棒性。其结构化子集还支持细粒度性能评估,推动了对低资源语言模型泛化能力的系统研究,具有重要的学术价值。
衍生相关工作
基于polish-llm-sft-pl数据集,衍生出多项关键研究工作。其中,包含波兰语指令微调模型的训练实验,验证了该数据集在提升模型波兰语能力上的有效性;结合belebele阅读理解子集的评测基准,推动了多语言LLM在复杂文本理解任务上的评估标准化。另有研究者利用其MCQ子集进行跨语言知识蒸馏,或通过推理子集探索链式思维(CoT)在波兰语中的迁移适应性。该数据集还启发了针对波兰语特有的成语和俗语的建模工作,促进了语言模型对地方性文化的理解。这些衍生工作共同丰富了低资源语言NLP的研究体系,为后续数据集的构建提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务