遇见数据集

abeja-cc-ja-filtered

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集是大型日语预训练语料库 ABEJA-CC-JA 的过滤版本。原始数据集来源于 Common Crawl 网络爬取数据,由 ABEJA 公司整理发布。本数据集通过复制原始数据并进行过滤而创建,过滤条件为:使用 KenLM 模型(具体为 lighttransport/japanese-scoring-model)计算每篇文档的加权平均困惑度(perplexity),仅保留困惑度严格低于 40 的文本,剔除困惑度大于等于 40 的文本。数据集的每条记录包含三个字段:URL(来源网址)、content(提取的文本内容)和 perplexity(文档的困惑度分数)。数据以 Parquet 格式存储,按目录组织(例如 common_crawl_0 目录下包含多个 parquet 文件)。该数据集适用于日语语言模型的预训练或微调等文本生成任务。许可证遵循 Common Crawl 使用条款。

This dataset is a filtered version of the large Japanese pre-training corpus ABEJA-CC-JA. The original dataset is derived from Common Crawl web crawl data, released by ABEJA Inc. This dataset was created by copying the original data and applying filtering based on the weighted average perplexity of each document, computed using the KenLM model (specifically lighttransport/japanese-scoring-model). Only texts with perplexity strictly below 40 are retained, while those with perplexity >= 40 are removed. Each record contains three fields: URL (source URL), content (extracted text), and perplexity (perplexity score of the document). The data is stored in Parquet format, organized by directories (e.g., the common_crawl_0 directory contains multiple parquet files). This dataset is suitable for pre-training or fine-tuning Japanese language models, such as text generation tasks. The license follows the Common Crawl terms of use.

创建时间:
2026-08-07
原始信息汇总

数据集概述

Filtered ABEJA-CC-JA 是一个经过过滤处理的日语预训练语料库,源自大规模日语预训练数据集 abeja-cc-ja。该数据集通过剔除高困惑度(perplexity)文本,提取高质量日语文本数据,以支持语言模型的训练。

数据结构

数据字段

每条数据包含以下属性:

  • url:抓取数据的来源 URL。
  • content:提取的文本正文内容。
  • perplexity:使用 KenLM 计算出的整篇文档的加权平均困惑度分数。

目录结构

数据集以 Parquet 格式提供,目录结构示例如下: text /data/commom_crawl_0/ ├── common_crawl_0_filtered_0000.parquet ├── common_crawl_0_filtered_0001.parquet └── ...

数据过滤处理

过滤过程采用以下逻辑:

原始数据集信息

  • 原始来源(AWS):https://registry.opendata.aws/abeja-cc-ja/
  • 原始来源(HuggingFace):https://huggingface.co/datasets/kajuma/ABEJA-CC-JA
  • 详细描述ABEJA Tech Blog: abeja-cc-ja-202409

许可协议

数据集的许可证严格遵循原始数据集的许可条款:

该数据可供任何人根据 Common Crawl 使用条款使用。

搜集汇总
数据集介绍
abeja-cc-ja-filtered 数据集图片
构建方式
本数据集源自日本大规模预训练语料库ABEJA-CC-JA,通过精细化的文本过滤流程构建而成。在保留原始数据架构的基础上,利用KenLM语言模型(具体为lighttransport/japanese-scoring-model)对每篇文档计算加权平均困惑度(perplexity),并依据预设阈值(严格低于40)进行筛选,剔除高困惑度样本,从而提炼出高质量日语文本子集。数据以Parquet格式存储,按Common Crawl分片组织,每条记录包含来源URL、正文内容及困惑度评分,确保了数据可追溯性与质量评估的透明度。
使用方法
此数据集适用于日语文本生成任务,可直接用于预训练或微调自回归语言模型。用户可通过HuggingFace Datasets库加载Parquet文件,读取每条样本的'content'字段作为训练文本,并可利用'perplexity'字段进一步自定义过滤阈值。推荐将数据集与日本语Tokenizer配合使用,并建议采用流式加载方式以应对大规模数据。此外,数据集的URL字段为溯源提供了便利,但使用时需注意遵守Common Crawl的相关条款。
背景与挑战
背景概述
随着大规模语言模型(LLM)在自然语言处理领域的迅猛发展,高质量预训练语料库的构建成为提升模型性能的关键环节。日本作为非英语国家,其语言资源相对稀缺,构建大规模、高质量的日语预训练语料尤为迫切。在此背景下,日本科技企业ABEJA于2024年推出了abeja-cc-ja数据集,基于Common Crawl大规模网页抓取数据,通过精细预处理构建了首个面向日语的开源预训练语料。该数据集由ABEJA研究团队主导,旨在解决日语语言模型训练数据不足的问题,其发布填补了日语大规模语料库的空白,对推动日语NLP研究与应用具有重要影响力。随后,为进一步提升语料质量,研究者基于abeja-cc-ja进行了过滤处理,形成了abeja-cc-ja-filtered,该版本通过排除低质量文本,为日语语言模型训练提供了更优质的数据基础。
当前挑战
abeja-cc-ja-filtered数据集所面临的挑战主要源于日语语料的独特性和构建过程的复杂性。在领域问题层面,日语文本的书写系统融合了汉字、平假名、片假名及罗马字,且缺乏明确的词边界,这给文本清洗和过滤带来了巨大困难。此外,Common Crawl中噪声极多,包含大量非自然语言内容(如导航栏、广告、模板代码)以及低质量机器翻译痕迹,单纯依赖启发式规则难以有效识别。在构建过程中,研究者选用KenLM语言模型计算困惑度(perplexity)作为质量指标,阈值设定为40,但该阈值需经过大量实验验证以保证过滤效果。同时,处理海量网页数据需要极高的计算资源和存储开销,如何在保证质量的前提下高效完成过滤,并对原始数据保持许可合规性,也是构建过程中的重要挑战。
常用场景
经典使用场景
在自然语言处理与预训练语言模型的研究领域中,语料库的质量直接决定了模型性能的上限。abeja-cc-ja-filtered数据集作为大规模日语预训练语料库abeja-cc-ja的精炼版本,其核心应用场景在于为日语语言模型的训练提供高质量、低噪声的文本数据。通过基于KenLM困惑度分数的严格过滤,该数据集剔除了低质量文本,保留了语义连贯、语法规范的语料,从而成为训练日语GPT、BERT等架构模型的首选数据源。研究者常将其用于从零开始预训练日语基础模型,或作为领域自适应预训练的语料基础,以提升模型在日语下游任务中的泛化能力。
解决学术问题
该数据集有效解决了日语预训练语料中普遍存在的噪声干扰与质量不均问题。原始爬取的网络文本常包含模板化内容、机器翻译痕迹或非自然语言片段,这些低质量数据会显著拉低语言模型的训练效率与输出质量。通过困惑度阈值过滤,数据集在保留文本多样性的前提下,大幅提升了语料的平均质量,为学术研究提供了可复现、可控的基准语料。其意义在于,它使得研究者能够更精确地探究数据质量对模型性能的影响机制,并为构建高质量日语语料库提供了方法论参考,推动了低资源语言预训练技术的进步。
实际应用
在实际应用中,该数据集直接服务于各类日语自然语言处理产品的研发。例如,企业可利用此数据集微调或预训练日语对话系统、智能客服机器人及文本生成工具,确保其输出文本的流畅性与准确性。同时,该数据集也为学术机构的日语语言模型研究提供了标准化的训练资源,支撑了机器翻译、文本摘要、情感分析等应用模型的落地。其过滤后的语料在降低计算成本的同时提升了模型效果,使得中小型团队也能参与高质量的日语模型开发,促进了日语AI生态的繁荣。
数据集最近研究
最新研究方向
在日语自然语言处理领域,大规模预训练语料库的质量优化已成为提升语言模型性能的关键路径。abeja-cc-ja-filtered数据集通过采用KenLM困惑度筛选策略,对原始ABEJA-CC-JA语料进行精炼,剔除了高困惑度文本,从而显著提高了数据的语义连贯性与训练效率。此数据集的前沿研究方向聚焦于基于质量过滤的语料构建方法,其与当前大语言模型训练中数据清洗、数据增强等热点议题紧密相关。通过净化训练数据,该数据集有助于缓解模型在低质量文本上的过拟合现象,从而增强其泛化能力与生成文本的流畅性,对推动日语LLM的发展具有重要的实践意义与学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务