遇见数据集

nanochat-jp-pretrain

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

nanochat-jp-pretrain 是一个用于日语语言模型预训练的语料库,专为 nanochat-jp 项目设计。该数据集混合了四个来源的日语文本:llm-jp-corpus-v4 的 ja_fineweb-2 子集(经过额外清洗)、llm-jp-corpus-midtraining-v2 的两个子集(ja_general 和 ja_reasoning),以及 llm-jp/scaling-data-constrained-llms 的 ja_instruct_63b 子集。其中 ja_fineweb-2 子集经过了额外的数据清洗,包括基于教育价值的筛选、LLM 对文本的清理(将导航、广告等去除并转换为 Markdown 格式)、基于域名的过滤(移除成人或数学内容)以及规则基础的过滤(如文档长度、换行率、字符比例等)。全部数据被混合并随机打乱后以 parquet 格式提供。该数据集适用于文本生成任务,特别是日语 LLM 的预训练。注意:由于部分数据经过 LLM 改写,表达可能与原文不同,且不保证事实性;尽管经过过滤,仍可能包含不适当内容或错误信息。

nanochat-jp-pretrain is a corpus for pre-training Japanese language models, specifically designed for the nanochat-jp project. This dataset mixes Japanese texts from four sources: the ja_fineweb-2 subset of llm-jp-corpus-v4 (with additional cleaning), two subsets of llm-jp-corpus-midtraining-v2 (ja_general and ja_reasoning), and the ja_instruct_63b subset of llm-jp/scaling-data-constrained-llms. The ja_fineweb-2 subset underwent extra data cleaning, including education-based filtering, LLM-based text cleaning (removing navigation, ads, etc., and converting to Markdown), domain-based filtering (removing adult or math content), and rule-based filtering (e.g., document length, newline rate, character ratio). All data is mixed, randomly shuffled, and provided in parquet format. This dataset is suitable for text generation tasks, especially pre-training of Japanese LLMs. Note: As some data is rewritten by LLMs, expressions may differ from the original and factual accuracy is not guaranteed; despite filtering, inappropriate content or errors may still be present.

提供机构:
tohoku-nlp
创建时间:
2026-08-16
原始信息汇总

nanochat-jp-pretrain 数据集详情

基本信息

  • 用途:用于 nanochat 的日语分支 nanochat-jp 的事前学习用日语语料库
  • 任务类别:文本生成
  • 语言:日语
  • 许可协议:混合来源许可证(other
  • 配置:v3 版本,数据文件为 v3/data_*.parquet

数据集构成

数据集包含以下四种来源,已进行整体混洗:

  1. llm-jp-corpus-v4ja_fineweb-2 子集(已应用额外的数据清洗处理)
  2. llm-jp-corpus-midtraining-v2 中的 ja/llm-jp-IPT_v0.3.2/ja_general.jsonl.gz
  3. llm-jp-corpus-midtraining-v2 中的 ja/llm-jp-IPT_v0.3.2/ja_reasoning.jsonl.gz
  4. llm-jp/scaling-data-constrained-llmsdata/ja_instruct_63b 的子集

对 ja_fineweb-2 的额外数据清洗

  1. 基于教育价值进行筛选:使用基于日语 ModernBERT 的分类器为每篇文档标注 0~5 的教育程度评分,排除评分不足 3 分的文档
  2. LLM 清洗:使用 Qwen3.6-35B-A3B 模型去除导航、广告、固定页眉等内容,并将正文按语义段落整理为 Markdown 格式(保留原文内容与风格)
  3. 领域过滤:使用从 LLM 的领域分类标签蒸馏而来的 fastText 分类器,去除成人及数学类文档
  4. 基于规则的过滤:依据文档长度、换行率、数字/字母比例、标点是否缺失、n-gram 重复、压缩率及日语自然度进行质量过滤

许可证信息

由于混合了多种不同许可的语料库,本数据集整体不设单一许可证,每篇文档继承原始语料库的许可与使用条件:

来源 许可证
llm-jp-corpus-v4 ja_fineweb-2(原典:HuggingFaceFW/fineweb-2) ODC-By 1.0(同时需遵守 Common Crawl 使用条款)
llm-jp-corpus-midtraining-v2 ja_general.jsonl.gz 多种许可(Apache-2.0、CC BY 4.0、CC BY-SA 3.0、CC BY-SA 4.0)
llm-jp-corpus-midtraining-v2 ja_reasoning.jsonl.gz 多种许可(Apache-2.0、CC BY-SA 4.0)
llm-jp/scaling-data-constrained-llms data/ja_instruct_63b CC BY 4.0

注意事项

  • 源于 ja_fineweb-2 的文档经过 LLM 改写为 Markdown,与原文表述存在差异,且不保证事实准确性
  • 由于内容源自网络,虽经过过滤仍可能包含不当内容或错误信息
搜集汇总
数据集介绍
nanochat-jp-pretrain 数据集图片
构建方式
nanochat-jp-pretrain数据集是专为日语语言模型预训练精心构建的综合性语料库。其构建策略融合了多个高质量源头:采用LLM清洗后的网络文本,整合llm-jp公开语料库,并借助nanochat的数据加载器以parquet格式无缝分发。具体而言,该数据集混合了llm-jp-corpus-v4的ja_fineweb-2子集(经过额外清洗)、llm-jp-corpus-midtraining-v2的通用与推理文本,以及llm-jp/scaling-data-constrained-llms的部分指令数据。所有来源经充分混合与全局随机打乱,确保了语料的多样性与均衡性。
特点
该数据集的核心特征在于其多重清洗与筛选机制。针对ja_fineweb-2子集,通过基于现代BERT的教育价值分类器筛选低于阈值文档;利用大型语言模型Qwen3.6-35B-A3B进行内容重构,去除导航、广告等干扰,保留核心文本并格式化为Markdown;同时借助fastText域分类器剔除成人及数学类内容;并实施基于规则的质量过滤,覆盖文档长度、语句重复率、字符比例及语言自然度等多维指标。这种严苛的清洗流程确保了语料的高纯净度与教育价值。
使用方法
数据集按v3配置提供,使用parquet格式存储,可直接集成至nanochat数据加载流程。使用时需注意其混合来源导致的许可证复杂性,各文档遵循原始语料库的授权条款。用户可通过HuggingFace datasets库加载,并依据具体任务需求进行下游处理。鉴于网络文本固有特性,即便经过清洗,仍可能残留不当内容或虚构信息,应用时应结合领域需求进行适当微调或过滤。
背景与挑战
背景概述
nanochat-jp-pretrain数据集由日本东北大学NLP实验室与LLM-jp项目合作构建,于2025年发布,旨在为日语大规模语言模型的预训练提供高质量语料。该数据集融合了llm-jp-corpus-v4的ja_fineweb-2子集、llm-jp-corpus-midtraining-v2的通用与推理语料,以及llm-jp/scaling-data-constrained-llms的部分数据,经深度清洗与格式统一,以parquet格式适配nanochat框架。其核心研究问题在于解决日语预训练语料稀缺与质量参差不齐的困境,通过教育价值筛选、LLM清洗及多级过滤提升数据质量,对日语NLP社区尤其是资源受限场景下的模型预训练具有重要推动作用。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。领域层面,日语网络文本存在噪声多、教育价值分布不均、领域偏斜等问题,需在保留语言多样性的同时剔除低质内容,平衡数据规模与质量。构建过程中,多源语料许可不一致(如ODC-By、Apache-2.0、CC BY等)导致整体授权复杂,无法统一;LLM清洗可能引入事实性偏差或风格改变;规则过滤(如n-gram重复、压缩率)需精细调参以避免误删;此外,混合数据的去重与全局混洗也考验算力与算法效率。这些挑战共同决定了后续版本迭代中需持续优化清洗流程与许可合规性。
常用场景
经典使用场景
nanochat-jp-pretrain 是一个专为日语文本生成任务设计的大规模预训练语料库,其核心使用场景在于为日语大语言模型(LLM)提供高质量的训练数据。该数据集融合了多个来源的日语文本,包括经过额外清洁处理的 Web 语料和学术研究导向的推理文本,并以统一的 parquet 格式呈现,可直接适配 nanochat 的数据加载器。这一特性使其成为研究人员从头训练或继续预训练日语 LLM 的首选资源,尤其在资源受限的环境下,能够高效支撑模型的语言建模能力、知识获取和推理基础的构建。
衍生相关工作
围绕该数据集,衍生了一系列相关工作,包括对 llm-jp-corpus 系列子集的深度清洗流程的优化、基于 ModernBERT 的教育价值分类器的训练与评估,以及利用 Qwen 模型进行文档结构化重写的技术探索。这些工作不仅提升了语料本身的可用性,也催生了关于日语语料筛选标准、多源数据混合策略和低资源预训练数据质量控制的学术讨论。同时,该数据集作为 nanochat 项目的关键组件,促进了轻量级日语模型训练的实证研究,为后续模型压缩、知识蒸馏和数据效率研究提供了基础资源。
数据集最近研究
最新研究方向
nanochat-jp-pretrain数据集聚焦于构建高质量、多源融合的日语预训练语料,其前沿研究方向主要体现在数据清洗与质量筛选的精细化策略上。该数据集融合了llm-jp-corpus-v4、midtraining-v2以及scaling-data-constrained-llms等多个来源,并引入基于ModernBERT的教育价值分类器、Qwen3.6-35B-A3B的LLM清洗、fastText领域过滤及规则基质量评估等复合手段,旨在提升语料的纯净度与训练效率。这一做法响应了当前大语言模型领域对数据质量日益增长的关注,尤其在小规模高效训练(如nanochat)的背景下,高质量数据筛选成为平衡性能与资源消耗的关键。该数据集通过混合不同许可的语料并保留文档级追溯,为日语LLM研究提供了灵活且合规的资源,推动了多语言模型在数据受限环境下的性能优化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务