遇见数据集

JohnTdi/polish-llm-sft-en

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个英语子集的数据集,旨在帮助各种大型语言模型学习和提升波兰语能力。数据集包含4,884个样本,采用JSON格式,涵盖数学应用题、多领域多选题、阅读理解多选题和链式推理等类别,每个样本由用户和助手消息对组成。数据质量分为三个等级:q10为手工编写并验证,q9为合成生成且准确率约95%,q8为存在小问题。合成数据可能包含事实错误,q8文件比q10文件有更高的幻觉风险。

许可证:Apache 2.0 语言: - 英语 任务类别: - 文本生成 - 问答 - 多项选择 标签: - 英语 - 监督微调(Supervised Fine-Tuning,SFT) - 指令微调 - 多项选择题(Multiple-Choice Question,MCQ) - 推理 - 数学 - 代码 样本规模: - 1K<n<10K # 波兰语大语言模型(Large Language Model,LLM)监督微调数据集——英语子集 **英文说明** | 本数据集为辅助各类大语言模型学习并提升波兰语能力而构建的英语子集,配套[波兰语版本仓库](https://huggingface.co/datasets/JohnTdi/polish-llm-sft-pl)。 **波兰语说明** | 本数据集为辅助各类大语言模型学习并提升波兰语能力而构建的英语子集,配套[波兰语版本仓库](https://huggingface.co/datasets/JohnTdi/polish-llm-sft-pl)。 共计4884条样本 · 许可证:Apache 2.0 · 语言:英语 --- ## 数据格式 json {"messages": [ {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ]} --- ## 数据集结构 | 目录 | 描述 | 样本数 | |:---|:---|---:| | `math/` | 数学应用题 | 267 | | `mcq_general/` | 多领域多项选择题 | 1937 | | `mcq_rc/` | 阅读理解类多项选择题 | 75 | | `reasoning/` | 思维链推理 | 2605 | --- ## 质量评级标准 | 评级分数 | 含义 | |:---:|:---| | q10 | 由Claude Opus 4.7手写生成并经过验证 | | q9 | 合成生成,准确率约95% | | q8 | 数据质量良好,仅存在少量小问题 | 评级信息编码于文件名中,命名格式为`*_q10_*`、`*_q9_*`、`*_q8_*`。 --- ## 注意事项 合成数据可能包含事实性错误。`*_q8_*`文件相比`*_q10_*`文件存在更高的幻觉生成风险。 --- ## 许可证 Apache 2.0

提供机构:
JohnTdi
搜集汇总
数据集介绍
构建方式
该数据集是Polish LLM SFT Dataset的英文子集,旨在辅助各类大语言模型提升波兰语能力。构建过程中,数据来源涵盖数学应用题、多领域多项选择题、阅读理解多选题及链式推理任务四大类别,共计4884个样本。其中,部分样本由Claude Opus 4.7手工编写并经过严格验证,其余样本通过合成生成,并依据准确率划分为q10(人工验证)、q9(约95%准确率)和q8(存在轻微问题)三个质量等级,编码于文件名中以便识别。
特点
数据集以ChatML格式存储,每条记录包含交替的user和assistant角色对话,支持文本生成、问答及多项选择等任务。其核心特色在于多层次质量体系:q10级别数据经由人工精校,可靠性高;q9和q8级别数据虽为合成,但亦标注了置信度,便于用户根据任务需求筛选。此外,数据集覆盖数学推理、常识问答和阅读理解等场景,兼具广度与深度,特别适用于指令微调场景下模型推理能力的强化。
使用方法
用户可通过Hugging Face Datasets库直接加载该数据集,利用其`messages`字段提取结构化的对话序列。针对不同质量等级,建议优先采用q10样本进行关键任务微调,而将q8样本用于数据扩充或噪声鲁棒性训练。数学与推理子目录中的链式思维样本尤其适合训练模型的逐步推理能力,多项选择题则可用于评估模型在限定选项下的决策准确性。同时,需注意合成数据可能存在事实偏差,使用前宜结合领域验证。
背景与挑战
背景概述
在大型语言模型(LLM)的快速发展浪潮中,多语言能力的增强与指令微调(Instruction Tuning)成为提升模型泛化性能的关键路径。该数据集由John Tdi于2024年创建,旨在通过高质量的英文指令微调样本,辅助各类LLM在学习和改进波兰语能力的过程中的跨语言迁移。作为配套项目中波兰语子集的英文对照版本,数据集包含4,884条样本,覆盖数学文字题、多领域选择题、阅读理解选择题及思维链推理等任务,为跨语言指令微调研究提供了结构化、多类型的训练资源。其基于Claude Opus 4.7人工验证与合成生成相结合的质量控制体系,显著提升了数据可靠性,对推动多语言LLM的指令跟随与推理能力发展具有重要参考价值。
当前挑战
该数据集所应对的领域核心挑战在于,当前多语言LLM在非英语语种(尤其是波兰语)的指令遵循与推理表现上存在显著短板,亟需高质量的跨语言微调数据来弥合语言间的能力差距。在构建过程中,主要面临两大挑战:一是合成数据中固有的事实错误与幻觉风险,特别是质量等级为q8的样本可能承载较高的噪声比例,对模型微调效果构成隐患;二是如何平衡数学、推理、选择题等异构任务间的数据分布差异,以确保模型在不同认知维度上的均衡学习,避免因数据偏斜导致的泛化性能下降。
常用场景
经典使用场景
在自然语言处理与大型语言模型的研究领域中,指令微调(Instruction Tuning)已经成为推动模型对齐人类意图的核心范式。polish-llm-sft-en数据集正是为这一目的精心构建的英文子集,涵盖数学推理、多领域多项选择、阅读理解及链式思维推理四大类别,共4,884条样本。其经典使用场景在于作为监督式微调素材,通过格式统一的人机对话结构,引导语言模型学习精准遵循指令、执行复杂推理任务,并提升在多选题与数学问题上的表现。该数据集特别适用于需要强化模型泛化能力的实验设置。
实际应用
在实际部署中,polish-llm-sft-en数据集为构建面向波兰语用户的多语言智能助手提供了关键的英文微调支撑。借助该数据集训练的语言模型,能够在客服问答、教育辅导、代码生成及多语言文本理解等场景下表现出更可靠的指令遵循能力。例如,数学子集可用于开发自动解题系统,多选题子集适合构建知识测验与评估工具,而推理样本则助力于对话式AI的逻辑性提升。其Apache 2.0许可协议也降低了商业应用的门槛,推动了开源大模型在波兰及英语市场的落地。
衍生相关工作
围绕polish-llm-sft-en数据集,衍生出一系列与多语言指令微调相关的前沿工作。研究者可基于其质量分层机制,探索噪声数据对模型微调效果的影响规律,或将此数据集与波兰语版本联合使用,开展跨语言迁移学习研究。此外,该数据集中的数学与推理子集常被用作基准,验证新型注意力机制或解码策略在复杂任务上的改进效果。其结构化的对话格式也为后续构建更大规模的合成数据生成管道提供了范本,推动了像Claude Opus等高级模型在数据蒸馏领域的应用探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务