遇见数据集

marketeam/FineWeb-Marketing

收藏
Hugging Face2026-07-12 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为FineWeb-Marketing Annotations,包含495,116个从FineWeb采样的文档,每个文档由Gemma-3-27B-it模型根据营销内容质量在0-5分范围内进行评分。这些注释数据用于支持marketeam/Fineweb-Classifier-Marketing分类器的训练。每个文档通过三次独立提示Gemma模型获得原始评分,并聚合为最终分数:如果三次样本中至少两次一致,则采用多数投票结果;否则取三次评分的平均值。数据集分为训练集(445,128行)和验证集(49,988行),与分类器的训练和评估分割完全匹配。数据字段包括:文档ID、完整文本、来源Common Crawl转储、URL、三次原始评分列表、聚合分数、整数化分数(四舍五入并裁剪到0-5)以及数据分割标识。注释方法基于FineWeb-Edu的流程,并采用JQL研究验证的改进方法,包括从FineWeb的sample-350BT子集中采样500,000个文档,使用Gemma-3-27B-it作为注释模型(因其在人类基准测试中表现出最高的Spearman相关性),通过特定提示要求模型基于五个标准(相关性、专业性、专业性、专家级和卓越性)进行推理并给出评分,最后过滤掉少于两次成功解析评分的文档。数据集适用于训练营销质量分类器、预训练语料库筛选研究以及LLM作为评判者的研究(如样本间一致性分析)。文本来源为FineWeb数据集,采用ODC-By 1.0许可证;注释模型为Gemma-3-27B-it。局限性包括:评分基于Gemma模型的主观判断、仅限英语内容、分数分布左偏(高分文档较少)以及使用单一注释模型。

Each row is one document sampled from FineWeb, scored on a 0–5 marketing-quality scale by prompting Gemma-3-27B-it three independent times and aggregating the results. This is the annotation data behind marketeam/Fineweb-Classifier-Marketing. The dataset ships as two splits, matching exactly what marketeam/Fineweb-Classifier-Marketing was trained and evaluated on: train (445,128 rows) and validation (49,988 rows). Annotation methodology mirrors the FineWeb-Edu process, adapted to the marketing domain with refinements validated by JQL research, including sampling from FineWebs sample-350BT subset, using Gemma-3-27B-it as the annotator model, evaluating documents with a G-Eval-style prompt based on five rubric criteria, and filtering documents with fewer than two successfully parsed scores. Applications include training quality classifiers, pretraining corpus curation research, and LLM-as-judge studies. Source text is from FineWeb under ODC-By 1.0 license; annotation model is Gemma-3-27B-it. Limitations: scores reflect Gemmas judgment, English-only content, left-skewed distribution, and single-annotator-model labels.

提供机构:
marketeam
搜集汇总
数据集介绍
marketeam/FineWeb-Marketing 数据集图片
构建方式
FineWeb-Marketing数据集以HuggingFaceFW/fineweb的sample-350BT子集为样本源,通过可重现的随机洗牌流程(缓存大小100,000,种子42)抽取500,000个文档。采用Gemma-3-27B-it作为标注模型,基于JQL研究(Ali et al., 2025)验证其在营销质量标注任务中与人类判断的斯皮尔曼相关系数最高。对每个文档进行三次独立推理,使用G-Eval风格提示词,要求模型依次评估五项准则(相关性、能力、专业性、专家性、卓越性)后输出0-5分。通过多数投票聚合三次得分,若全不一致则取均值,最终保留至少两次有效解析的495,116个文档,按训练集(445,128条)和验证集(49,988条)划分。
特点
该数据集包含495,116条来自FineWeb的英文文档及其营销质量标注,每个样本存储原始三次得分(raw_scores)、聚合得分(score)及整数化得分(int_score)。标注覆盖48个Common Crawl快照,时间跨度广泛。其评分分布呈左偏态,高分样本稀少,真实反映网络爬取数据的自然分布。数据集与marketeam/Fineweb-Classifier-Marketing分类器完全对齐,提供已划分的训练/验证分割,并保留所有原始标注细节以支持标注噪声研究、校准分析及聚合策略复现,为营销领域数据筛选提供高质量基准。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,使用`load_dataset('marketeam/FineWeb-Marketing', split='train')`获取445,128条训练样本,或指定`split='validation'`获取49,988条验证样本。数据集主要用于训练营销质量回归分类器,例如基于Snowflake/snowflake-arctic-embed-m-v2.0冻结编码器的模型。也可用于预训练语料筛选研究,通过设置不同百分位或阈值过滤低质量营销内容。此外,raw_scores列支持LLM-as-judge相关研究,可分析三次标注间的一致性、标注器校准及不同聚合策略的效果。数据集遵循ODC-By 1.0许可,确保合规使用。
背景与挑战
背景概述
FineWeb-Marketing数据集由市场团队于2025年创建,源自HuggingFace社区广泛使用的FineWeb语料库,专注于营销领域的数据筛选与质量评估。该数据集的核心研究问题在于如何系统性地从海量网络文本中识别和标注高质量的营销内容,以支持营销专用语言模型的预训练。研究团队借鉴了FineWeb-Edu的成功经验,将教育领域的标注方法论迁移至营销领域,并采用Gemma-3-27B-it作为标注模型,通过三次独立采样与多数投票机制降低噪声。该数据集直接驱动了Fineweb-Classifier-Marketing分类器的训练,为营销数据策展提供了标准化基准,在文本分类与数据过滤领域产生了重要影响。
当前挑战
FineWeb-Marketing面临的挑战首先体现在领域问题的复杂性:营销内容质量评估远超出简单的文本分类范畴,需要综合考量知识深度、推理逻辑、创意生成、分析严谨性和运营可执行性五个维度,且高价值营销内容在自然网络文本中分布稀疏,导致数据呈现明显的左偏分布,高质量样本稀缺。在数据集构建过程中,主要挑战包括:1)标注噪声控制,单一LLM的随机采样结果存在波动,需通过三次独立采样与多数投票机制降低方差;2)标注成本高昂,对50万文档进行三次推理总计消耗约360M输出token;3)跨领域一致性保障,需设计精细的评分规则(如C1-C5五级标准)和少样本锚定示例以维持标注稳定性;4)文本去重与分割对齐,约0.01%的文档因文本相同导致训练-验证分割存在歧义。
常用场景
经典使用场景
在自然语言处理与数据质量评估领域,FineWeb-Marketing数据集被广泛用作营销内容质量评分的基准资源。该数据集由近五十万条从FineWeb语料库中抽样得到的网页文本构成,每一条文本均经由Gemma-3-27B-it大语言模型按照精心设计的五维评估标准(相关性、专业性、权威性、深度与卓越性)进行独立三次评分并聚合,最终得到0至5分的营销质量标签。这种多层次、多维度的标注框架使得研究人员能够系统性地训练和验证营销文本质量分类器,探究不同阈值和百分位过滤策略对语料筛选效果的影响。数据集的分割设计(训练集与验证集)和丰富的元数据字段(如原始分数、URL来源等)为文本分类、质量评估及数据筛选方向的实验提供了标准化的测试平台,是推动营销领域内容理解研究不可或缺的基础设施。
衍生相关工作
FineWeb-Marketing数据集的诞生催生了一系列富有影响力的衍生工作。最直接的代表是基于该标注集训练的marketeam/Fineweb-Classifier-Marketing分类器,该模型通过在冻结的文本编码器(Snowflake/snowflake-arctic-embed-m-v2.0)上回归预测营销质量分数,成为了营销语料筛选的实用工具。在方法论层面,该数据集推动了JQL(Ali et al., 2025)研究的深入,后者系统评估了多种大语言模型作为标注器的可靠性,为自动标注管线的设计提供了实验依据。同时,受FineWeb-Edu基于评分探索数据筛选策略的做法启发,研究者利用该数据集开展了营销领域语料过滤策略的对比研究,如探讨不同阈值对下游模型性能的影响。此外,原始评分字段的存在也激发了面向标注一致性、模型校准与聚合策略的研究,拓展了LLM-as-Judge方向的理论探索。
数据集最近研究
最新研究方向
FineWeb-Marketing数据集聚焦于大语言模型预训练语料中营销领域内容的质量筛选与标注,其研究前沿在于利用Gemma-3-27B-it等先进LLM作为标注器,结合JQL等受控实验验证的G-Eval式多维度评分体系(涵盖知识、推理、生成、分析与运营五大维度),对海量网络文本进行0-5分的营销质量分级。该工作直接关联当前AI训练数据治理的热点——如何高效从通用爬取数据中提炼专业化、高质量的子领域语料,从而支撑垂直领域模型的微调与能力增强。通过提供近50万条标注样本及原始多轮评分,该数据集不仅为训练营销内容分类器奠定了基石,更为研究LLM标注者的一致性、噪声控制及聚合策略提供了宝贵的研究素材,对推动面向营销智能的预训练数据工程具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务