nanochat-jp-pretrain
收藏资源简介:
nanochat-jp-pretrain 是一个用于日语语言模型预训练的语料库,专为 nanochat-jp 项目设计。该数据集混合了四个来源的日语文本:llm-jp-corpus-v4 的 ja_fineweb-2 子集(经过额外清洗)、llm-jp-corpus-midtraining-v2 的两个子集(ja_general 和 ja_reasoning),以及 llm-jp/scaling-data-constrained-llms 的 ja_instruct_63b 子集。其中 ja_fineweb-2 子集经过了额外的数据清洗,包括基于教育价值的筛选、LLM 对文本的清理(将导航、广告等去除并转换为 Markdown 格式)、基于域名的过滤(移除成人或数学内容)以及规则基础的过滤(如文档长度、换行率、字符比例等)。全部数据被混合并随机打乱后以 parquet 格式提供。该数据集适用于文本生成任务,特别是日语 LLM 的预训练。注意:由于部分数据经过 LLM 改写,表达可能与原文不同,且不保证事实性;尽管经过过滤,仍可能包含不适当内容或错误信息。
nanochat-jp-pretrain is a corpus for pre-training Japanese language models, specifically designed for the nanochat-jp project. This dataset mixes Japanese texts from four sources: the ja_fineweb-2 subset of llm-jp-corpus-v4 (with additional cleaning), two subsets of llm-jp-corpus-midtraining-v2 (ja_general and ja_reasoning), and the ja_instruct_63b subset of llm-jp/scaling-data-constrained-llms. The ja_fineweb-2 subset underwent extra data cleaning, including education-based filtering, LLM-based text cleaning (removing navigation, ads, etc., and converting to Markdown), domain-based filtering (removing adult or math content), and rule-based filtering (e.g., document length, newline rate, character ratio). All data is mixed, randomly shuffled, and provided in parquet format. This dataset is suitable for text generation tasks, especially pre-training of Japanese LLMs. Note: As some data is rewritten by LLMs, expressions may differ from the original and factual accuracy is not guaranteed; despite filtering, inappropriate content or errors may still be present.
nanochat-jp-pretrain 数据集详情
基本信息
- 用途:用于 nanochat 的日语分支 nanochat-jp 的事前学习用日语语料库
- 任务类别:文本生成
- 语言:日语
- 许可协议:混合来源许可证(
other) - 配置:v3 版本,数据文件为
v3/data_*.parquet
数据集构成
数据集包含以下四种来源,已进行整体混洗:
- llm-jp-corpus-v4 的
ja_fineweb-2子集(已应用额外的数据清洗处理) - llm-jp-corpus-midtraining-v2 中的
ja/llm-jp-IPT_v0.3.2/ja_general.jsonl.gz - llm-jp-corpus-midtraining-v2 中的
ja/llm-jp-IPT_v0.3.2/ja_reasoning.jsonl.gz - llm-jp/scaling-data-constrained-llms 中
data/ja_instruct_63b的子集
对 ja_fineweb-2 的额外数据清洗
- 基于教育价值进行筛选:使用基于日语 ModernBERT 的分类器为每篇文档标注 0~5 的教育程度评分,排除评分不足 3 分的文档
- LLM 清洗:使用 Qwen3.6-35B-A3B 模型去除导航、广告、固定页眉等内容,并将正文按语义段落整理为 Markdown 格式(保留原文内容与风格)
- 领域过滤:使用从 LLM 的领域分类标签蒸馏而来的 fastText 分类器,去除成人及数学类文档
- 基于规则的过滤:依据文档长度、换行率、数字/字母比例、标点是否缺失、n-gram 重复、压缩率及日语自然度进行质量过滤
许可证信息
由于混合了多种不同许可的语料库,本数据集整体不设单一许可证,每篇文档继承原始语料库的许可与使用条件:
| 来源 | 许可证 |
|---|---|
llm-jp-corpus-v4 ja_fineweb-2(原典:HuggingFaceFW/fineweb-2) |
ODC-By 1.0(同时需遵守 Common Crawl 使用条款) |
llm-jp-corpus-midtraining-v2 ja_general.jsonl.gz |
多种许可(Apache-2.0、CC BY 4.0、CC BY-SA 3.0、CC BY-SA 4.0) |
llm-jp-corpus-midtraining-v2 ja_reasoning.jsonl.gz |
多种许可(Apache-2.0、CC BY-SA 4.0) |
llm-jp/scaling-data-constrained-llms data/ja_instruct_63b |
CC BY 4.0 |
注意事项
- 源于
ja_fineweb-2的文档经过 LLM 改写为 Markdown,与原文表述存在差异,且不保证事实准确性 - 由于内容源自网络,虽经过过滤仍可能包含不当内容或错误信息




