遇见数据集

ardauzunoglu/c4-lowq-200m2b

收藏
Hugging Face2026-05-12 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于文本质量评估的英文数据集,包含801,260个训练样本。每个样本包括文本内容、标记计数、低质量概率、质量分数、低质量标签和来源URL等特征,旨在支持自然语言处理任务中的文本过滤或质量分析。数据总大小约845MB,下载大小约495MB。

This dataset is an English dataset for text quality assessment, containing 801,260 training samples. Each sample includes features such as text content, token count, low-quality probability, quality score, low-quality label, and source URL, designed to support text filtering or quality analysis in natural language processing tasks. The total dataset size is approximately 845MB, with a download size of about 495MB.

提供机构:
ardauzunoglu
二维码
社区交流群
二维码
科研交流群
商业服务