遇见数据集

nanochat-jp-sft

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

nanochat-jp-sft 是一个用于日语监督微调(SFT)的数据集,专为 nanochat-jp(nanochat 的日语分支)设计。该数据集以 JSONL 格式分发,每行表示一个对话,格式为包含 role 和 content 字段的 JSON 数组,对话以 user 开场并以 assistant 结束。数据集由两部分组成:1)来自公开数据集 llm-jp/llm-jp-4-thinking-sft-data 的子集,移除了编码和数学相关数据;2)通过 self-chat 方法生成的多轮日语对话,生成过程利用 nvidia/Nemotron-Personas-Japan 中的人物角色(包括文化背景、技能、兴趣、职业、性别、婚姻状况、学历、居住地等)进行条件设置,并控制对话起始方式(咨询、提问、闲聊、自由)和语气。同一模型分别扮演用户和助手角色,生成最多 4 轮对话,随后转换为 nanochat SFT 格式,并经过基于 n-gram 重复、跨轮重复、消息重复、表格行重复和压缩率的规则过滤。使用的教师模型包括:openai/gpt-oss-120b、google/gemma-4-31B-it(NVFP4 量化)、nvidia/NVIDIA-Nemotron-3-Super-120B-A12B(NVFP4 量化)、Qwen/Qwen3.5-122B-A10B(NVFP4 量化,两批不同采样设置)以及 llm-jp/llm-jp-4-32b-a3b-thinking。该数据集适用于文本生成任务,特别是日语对话模型的监督微调。许可方面,数据集整体为混合许可(other),各文件继承原数据的许可:公开数据部分遵循 llm-jp/llm-jp-4-thinking-sft-data 的许可;self-chat 部分中,人物角色采用 CC BY 4.0,对话文本则需遵循各教师模型的许可(多数为 Apache-2.0,NVIDIA-Nemotron-3-Super 为 NVIDIA Open Model License)。注意:所有 self-chat 对话均由 LLM 生成,不保证事实性,且可能包含不适当内容或错误信息;人物角色均为合成数据,不代表真实人物。

nanochat-jp-sft is a dataset for Japanese supervised fine-tuning (SFT) designed for nanochat-jp (the Japanese branch of nanochat). It is distributed in JSONL format, where each line represents a conversation as a JSON array with fields role and content, starting with user and ending with assistant. The dataset consists of two parts: 1) a subset of the public dataset llm-jp/llm-jp-4-thinking-sft-data, with coding and math-related data removed; 2) multi-turn Japanese conversations generated via self-chat, conditioned on personas from nvidia/Nemotron-Personas-Japan (including cultural background, skills, interests, occupation, gender, marital status, education, residence, etc.), with control over conversation start type (consultation, question, chitchat, free) and tone. The same model plays both user and assistant roles, generating up to 4 turns, then converted to nanochat SFT format and filtered by rules based on n-gram repetition, cross-turn repetition, message repetition, table row repetition, and compression ratio. Teacher models used include: openai/gpt-oss-120b, google/gemma-4-31B-it (NVFP4 quantized), nvidia/NVIDIA-Nemotron-3-Super-120B-A12B (NVFP4 quantized), Qwen/Qwen3.5-122B-A10B (NVFP4 quantized, two batches with different sampling settings), and llm-jp/llm-jp-4-32b-a3b-thinking. The dataset is suitable for text generation tasks, especially supervised fine-tuning of Japanese dialogue models. Licensing: overall dataset is under a mixed license (other), with each file inheriting the license of its source data: the public data part follows the license of llm-jp/llm-jp-4-thinking-sft-data; for the self-chat part, personas are under CC BY 4.0, and conversation texts follow the licenses of the respective teacher models (mostly Apache-2.0, NVIDIA-Nemotron-3-Super under NVIDIA Open Model License). Note: all self-chat conversations are generated by LLMs, factual accuracy is not guaranteed, and they may contain inappropriate content or errors; personas are synthetic and do not represent real people.

提供机构:
tohoku-nlp
创建时间:
2026-08-16
原始信息汇总

nanochat-jp-sft 数据集详情

数据集简介

nanochat-jp-sft 是 nanochat 日语分支(nanochat-jp)所使用的SFT(监督微调)日语数据集。该数据集混合了公开的日语指令数据以及基于人格条件生成的日语多轮对话(self-chat),并以 nanochat 的 SFT 数据加载器可直接读取的 JSONL 格式发布。

语言与任务

  • 语言:日语(ja)
  • 任务类别:文本生成(text-generation)

数据格式

数据集中每一行代表一个对话,每行是一个 messages 的 JSON 数组,呈现从 user 开始、以 assistant 结束的交替序列:

json [{"role": "user", "content": "..."}, {"role": "assistant", "content": "..."}]

v1/ 目录下的文件放置在 $NANOCHAT_BASE_DIR/datasets/nanochat-jp-sft/v1/ 下,nanochat-jp 的 scripts/chat_sft.py 会将其作为默认混合内容读取,具体训练文件组合请参考该脚本。

数据构成

1. 公开数据来源

该部分为 llm-jp/llm-jp-4-thinking-sft-data 的子集,移除了其中与编码和数学相关的数据。

2. self-chat 数据

self_chat_*.nanochat_sft.chat_filtered.jsonl 是按以下流程新生成的日语多轮对话数据:

  1. 人格条件设定:将 nvidia/Nemotron-Personas-Japan 中各人格(文化背景、技能、爱好、职业、性别、婚姻状况、学历、职业、都道府县)与对话切入方式(咨询、提问、闲聊、自由)及语气嵌入提示词中。
  2. self-chat 生成:使用同一模型分别扮演用户角色(作为人格本人)和助手角色,生成最多 4 轮的对话。
  3. 格式转换:在 user/assistant 交替性被破坏时截断对话,仅保留以 assistant 结尾的前缀,转换为 nanochat SFT 格式。
  4. 质量过滤:基于 n-gram 重复、跨轮重复、消息重复、表格行重复及压缩率进行规则过滤。

教师模型一览

文件 教师模型
self_chat_gpt_oss.* openai/gpt-oss-120b
self_chat_gemma4.* google/gemma-4-31B-it(使用 NVFP4 量化版)
self_chat_nemotron.* nvidia/NVIDIA-Nemotron-3-Super-120B-A12B(使用 NVFP4 量化版)
self_chat_qwen3.*self_chat_qwen3_v0.* Qwen/Qwen3.5-122B-A10B(使用 NVFP4 量化版,含采样设置不同的两个批次)
self_chat_llm_jp_v4.* llm-jp/llm-jp-4-32b-a3b-thinking

许可证

由于混合了多种具有不同许可证的数据,该数据集整体未设置单一许可证(标注为 other)。各文件沿用其原始数据的许可证及使用条件:

构成要素 许可证
公开数据来源部分 遵循 llm-jp/llm-jp-4-thinking-sft-data 的许可证
self-chat(self_chat_*.jsonl 人格数据采用 CC BY 4.0(nvidia/Nemotron-Personas-Japan);对话正文为上述教师模型生成物,使用时需遵循各模型的许可证与使用条款(gpt-oss-120b、gemma-4-31B-it、Qwen3.5-122B-A10B、llm-jp-4-32b-a3b-thinking 为 Apache-2.0,NVIDIA-Nemotron-3-Super 为 NVIDIA Open Model License)

注意事项

  • self-chat 对话均为 LLM 生成物,不保证事实准确性,且会继承教师模型的回答倾向和措辞习惯。
  • 人格数据为合成数据,不涉及真实人物。
  • 即使经过过滤,仍可能包含不当内容或错误信息。

致谢

数据集构建过程中,感谢公开指令数据的 LLM-jp 团队,以及为项目推进提供多方协助的 Tohoku NLP Group 成员。

搜集汇总
数据集介绍
nanochat-jp-sft 数据集图片
构建方式
面向日语大模型监督微调的实际需求,nanochat-jp-sft 采用公开数据筛选与合成对话生成相结合的双轨构建路径。其公开数据部分取自 llm-jp/llm-jp-4-thinking-sft-data,并系统性地剔除其中的编程与数学相关样本,以保持语料在通用对话场景中的纯粹性。合成部分则以 nvidia/Nemotron-Personas-Japan 所提供的虚构人物画像为条件,将文化背景、职业、学历、地域等属性连同会话类型与语体风格一并注入提示词,由同一模型分别扮演用户与助手进行至多四轮的自对话生成,随后将角色交替关系发生断裂的位置截断,仅保留以助手回复收尾的完整前缀,并经 n-gram 重复、跨轮重复、消息重复、表格行重复及压缩率等规则化过滤后,转换为 nanochat 训练管线可直接载入的 JSONL 格式。
特点
该数据集在结构与来源上均体现出鲜明的工程化特征。每条样本以单行 JSON 数组的形式承载一段完整会话,消息序列严格遵循用户与助手交替出现、以助手回复终结的约束,天然契合自回归模型的训练目标。语料来源的多元性同样值得关注,其合成对话部分由 gpt-oss-120b、gemma-4-31B-it、Nemotron-3-Super-120B、Qwen3.5-122B-A10B 与 llm-jp-4-32b-a3b-thinking 等多个大模型分别生成,覆盖不同采样配置与表述偏好。人物画像条件的引入使对话呈现出口吻、话题取向与交互方式的丰富变化,而合成内容的非事实性、模型倾向的继承性以及可能残留的不当信息,也构成使用者需要审慎对待的固有属性。
使用方法
使用层面,该数据集与 nanochat-jp 的训练流程高度耦合。将 v1/ 目录下的文件放置于 $NANOCHAT_BASE_DIR/datasets/nanochat-jp-sft/v1/ 后,scripts/chat_sft.py 即可按脚本内既定的混合策略自动读取,具体文件组合需参照该脚本的配置说明。由于数据集混合了来源与许可各异的多个组成部分,整体未设定单一许可,使用者在选用特定文件时应分别核查对应原始数据的授权条款:公开数据部分遵从 llm-jp 系列数据集的使用条件,人物画像遵循 CC BY 4.0,而各合成对话则需依据相应教师模型的许可证与使用政策,例如 Apache-2.0 或 NVIDIA Open Model License,从而确保合规应用。
背景与挑战
背景概述
在大语言模型轻量化与本地化部署浪潮的推动下,面向特定语种的指令微调数据成为制约模型能力落地的关键瓶颈。nanochat-jp-sft由东北大学自然语言处理研究组于nanochat日语分支nanochat-jp开发过程中构建,旨在为轻量级对话模型提供可直接载入训练管线的日文监督微调语料。该数据集以公开指令数据的筛选子集为基础,并借助多款大模型在人格条件约束下合成多轮对话,缓解了日文高质量多轮交互数据稀缺的困境,为日文开源对话模型的监督微调提供了兼具规模与结构规整性的资源支撑。
当前挑战
该数据集所面向的核心领域问题在于日文监督微调语料在多轮对话结构完整性、人格一致性与事实可靠性之间的平衡。构建过程中的挑战体现于多重维度:公开指令数据须剔除代码与数学内容以适配轻量对话场景,合成对话依赖人格设定与口吻提示来诱导多样化交互,却可能因教师模型的生成偏向而引入重复、跑题或角色错位;对话格式须严格维持用户与助手交替且以助手结尾,一旦结构破裂即须截断,导致有效轮次缩减;规则化质量过滤虽能抑制n-gram重复与消息冗余,却难以彻底清除不实信息与不当内容,从而使数据质量与模型安全面临持续考验。
常用场景
经典使用场景
在日语大语言模型监督微调领域,nanochat-jp-sft数据集扮演着关键的角色,其最经典的使用场景在于为nanochat-jp框架提供标准化、即用型的日语指令微调语料。该数据集以JSONL格式封装,每行对应一段以user起始、assistant终结的多轮对话,可直接被nanochat的SFT数据加载器读取。研究者将其部署于指定目录后,即可借助scripts/chat_sft.py脚本开展默认混合策略下的模型微调。其中公开数据子集覆盖通用指令跟随能力,self-chat部分则通过人格条件化生成涵盖咨询、提问、闲谈与自由对话的多元日语多轮交互,二者协同构成覆盖广度与对话深度的语料组合,有效支撑日语对话模型的监督微调实验。
衍生相关工作
围绕nanochat-jp-sft数据集,已衍生出一系列相互关联的经典工作。nanochat-jp本身作为karpathy所提出nanochat的日语分支,构成了该数据集的直接承载框架,其SFT训练脚本与数据加载器为该数据集提供了工程基础。llm-jp-4-thinking-sft-data作为公开数据来源,为数据集提供了通用指令跟随语料基底。nvidia/Nemotron-Personas-Japan为self-chat生成提供人格条件,使对话具备文化背景与职业多样性。多个教师模型如gpt-oss-120b、gemma-4-31B-it、NVIDIA-Nemotron-3-Super-120B-A12B、Qwen3.5-122B-A10B与llm-jp-4-32b-a3b-thinking的生成结果共同构成self-chat语料,形成了多教师模型蒸馏与数据混合的衍生研究脉络,为后续日语对话数据构建与模型微调工作提供了可借鉴的技术路线。
数据集最近研究
最新研究方向
在日语大语言模型低资源适配的浪潮中,nanochat-jp-sft所代表的轻量化监督微调路径正成为前沿探索的焦点。该数据集依托Karpathy的nanochat框架构建日语分支,融合公开指令数据与基于Nemotron-Personas-Japan合成人格的多轮自对话生成语料,覆盖gpt-oss-120b、gemma-4-31B-it、Qwen3.5-122B-A10B等多种教师模型的蒸馏信号。近期研究围绕人格条件化对话生成、跨模型风格迁移与质量过滤机制展开,旨在以极低算力代价提升日语指令遵循与多轮交互能力。其影响在于为中小规模日语模型提供了可复现的SFT配方,同时以混合许可模式推动了开源社区在数据合规与合成数据治理方面的讨论,对日语NLP生态的民主化具有切实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务