遇见数据集

marketing-instruct-4k

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

marketing-instruct-4k 是一个精心策划的指令微调数据集,包含约4,300个营销文案示例,专为AutoScientist Challenge 2026(市场营销类别)设计,用于微调Marketing-Mixtral-8x7B模型。该数据集的关键发现表明,其自然规模(约4,300条)经过精心策划后,在任务性能上优于通过自动扩增得到的12,000条版本,证明了对于此任务,数据质量和平衡性比数据量更为重要。数据集涵盖五个核心营销文案任务类型:广告/社交媒体文案(约1,200例)、电子邮件营销(约900例)、产品描述(约800例)、品牌声音重写(约700例)以及表格到洞察总结(约500例)。每个示例遵循统一的指令微调格式,包含instruction(任务指令)、input(可选的结构化上下文,如属性列表或表格)和output(目标营销文案)三个字段。数据来源于三个方面:经过AdaptData平台质量筛选的公共营销数据集、为填补空白而手动设计的涵盖40多种品牌声音风格和15个以上行业的合成示例,以及从公共邮件分类数据集中筛选出的促销类真实邮件。数据处理包括基于输出文本哈希的去重、移除少于10词的示例、清除占位符变量和非UTF-8编码的伪影,并进行跨任务类型的平衡采样以确保代表性。数据集明确聚焦于文案生成,排除了营销策略、竞争分析或市场研究等任务。所有示例均为英文,不包含个人或敏感信息,其中引用的业务名称和产品属性均为泛化、虚构或基于公开可用的产品列表,仅作说明之用。数据集存在一定的局限性,包括偏向西方英语营销惯例、品牌声音示例未能穷尽全球风格、合成示例可能携带辅助生成语言模型的风格模式,且产品信息未经真实验证。建议基于此数据集训练的模型,其输出(尤其是事实性产品声明)在发布前应由人类营销人员审核。

marketing-instruct-4k is a carefully curated instruction-tuning dataset containing approximately 4,300 marketing copy examples, designed specifically for the AutoScientist Challenge 2026 (Marketing Track) and intended for fine-tuning the Marketing-Mixtral-8x7B model. A key finding of this dataset is that its naturally curated scale (approximately 4,300 instances) outperforms the 12,000-instance version generated via automatic data augmentation on task performance, demonstrating that data quality and balance are more critical than data volume for this task. The dataset covers five core marketing copy task categories: advertising/social media copy (approximately 1,200 instances), email marketing (approximately 900 instances), product descriptions (approximately 800 instances), brand voice rewriting (approximately 700 instances), and table-to-insight summarization (approximately 500 instances). Each instance follows a unified instruction-tuning format, consisting of three fields: instruction (task directive), input (optional structured context such as attribute lists or tables), and output (target marketing copy). The dataset is sourced from three aspects: public marketing datasets filtered for quality via the AdaptData platform, synthetic examples manually designed to fill gaps covering over 40 brand voice styles and more than 15 industries, and promotional real emails screened from public email classification datasets. Data processing steps include deduplication based on output text hashing, removal of instances with fewer than 10 words, elimination of placeholder variables and non-UTF-8 encoded artifacts, and balanced cross-task sampling to ensure representativeness. The dataset explicitly focuses on copy generation, excluding tasks such as marketing strategy, competitive analysis, or market research. All instances are in English and do not contain personal or sensitive information; the business names and product attributes cited are generalized, fictional, or based on publicly available product lists for illustrative purposes only. The dataset has certain limitations, including a bias towards Western English marketing conventions, brand voice examples that do not exhaust global styles, synthetic instances that may carry stylistic patterns from the auxiliary large language models used for generation, and product information that has not been verified for authenticity. It is recommended that outputs from models trained on this dataset, especially factual product statements, be reviewed by human marketing personnel before deployment.

创建时间:
2026-06-15
原始信息汇总

数据集概述

  • 数据集名称:marketing-instruct-4k
  • 许可证:Apache 2.0
  • 语言:英语
  • 标签:营销、指令微调、文案写作、广告、电子邮件营销、产品描述、品牌语调、AutoScientist
  • 任务类别:文本生成
  • 数据规模:约 4,300 条样本(1K < n < 10K)

数据集详情

描述

该数据集是专为 2026 年 AutoScientist 挑战赛(营销类别)构建的指令微调数据集,包含约 4,300 条营销文案示例,涵盖五种任务类型。用于微调 Marketing-Mixtral-8x7B 模型。关键发现:精心策划的原始大小数据集(4,300 条)在性能上优于通过自动扩充扩展至 12,000 行的版本(对基础模型的胜率分别为 80% 和 58%),表明在该任务中数据质量和平衡性比数量更重要。

  • 策划者:Sue Huynh
  • 语言:英语
  • 许可证:Apache 2.0

数据来源

用途

直接用途

用于营销文案生成模型的指令微调,涵盖以下领域:广告/社交媒体文案、电子邮件营销、产品描述、品牌语调改写、以及营销活动数据到洞察的摘要生成。

超出范围的使用

  • 不适用于营销策略、竞争分析或市场调研生成任务——这些在策划过程中被明确排除,以保持数据集专注于文案生成
  • 未经翻译和重新验证,不适用于非英语营销内容
  • 不应用作真实产品信息的来源;示例中使用的产品属性仅用于说明,并非经过验证的真实产品规格

数据集结构

每条样本遵循统一的指令微调格式:

字段 类型 描述
instruction 字符串 任务说明,包括格式和约束条件
input 字符串 可选的结构化上下文(如属性列表、表格);如不适用则为空字符串
output 字符串 目标营销文案

任务类型分布

任务类型 大约样本数 描述
广告/社交媒体文案 ~1,200 针对特定平台的广告和社交媒体帖子文案
电子邮件营销 ~900 营销活动及生命周期电子邮件(主题行/预览/正文)
产品描述 ~800 基于属性的产品描述
品牌语调改写 ~700 将中性文案改写为指定语调
表格到洞察 ~500 将营销活动绩效数据总结为洞察

(具体数量为近似值,详见数据查看器。)

数据集创建

策划理由

旨在微调一个覆盖营销团队日常核心产出的开源营销文案模型,同时明确排除策略/分析任务(如 SWOT 分析、竞争对手对比表、仪表盘),使模型专注于文案生成而非业务咨询。一个特定的设计目标是属性忠实性:产品描述示例经过筛选,确保输出中的声明可追溯到提供的输入属性,减少 LLM 虚构产品特征或规格的倾向。

源数据

数据收集与处理

数据集结合了三个来源:

  1. 公开营销数据集(HuggingFace),通过 Adaption Labs 的 AdaptData 平台进行适配和质量过滤,包括广告文案和产品描述来源
  2. 合成示例,手工设计了 40 多种品牌语调风格、15 个以上行业及多种表格/洞察场景,用于填补公开数据稀疏或质量低下的领域(电子邮件营销、品牌语调、表格到洞察)
  3. 经过筛选的真实促销电子邮件数据,选自一个公开的电子邮件分类数据集,仅过滤出“促销”类别,并通过长度阈值排除交易/垃圾内容

处理步骤:

  • 基于输出文本哈希的去重
  • 移除少于 10 个单词的示例(训练信号不足)
  • 移除包含未填充占位变量(如 {time}{items} 标记)的内容
  • 移除编码错误和非 UTF-8 伪影
  • 跨任务类型的平衡采样,避免单一任务过度代表

源数据生产者是谁

包括 HuggingFace 上原始数据集作者(参见各源数据集卡片)、AdaptData 的自动适配系统,以及为此项目手工编写的合成数据。

个人与敏感信息

该数据集不包含个人、敏感或隐私信息。示例中提及的所有商业名称(如本地企业类型、产品名称)均为泛化、虚构或基于公开产品列表及制造商规格。

偏见、风险与局限

  • 倾向于西方英语营销惯例以及美国营销中常见的消费者/B2B SaaS 语境
  • 品牌语调示例虽风格多样,但未涵盖全球营销语调的全部惯例
  • 合成示例可能带有用于辅助生成的模型的风格模式
  • 示例中的产品属性数据仅用于说明,不应视为经过验证的真实产品信息

建议

基于该数据集训练的模型在发布前,其输出应由人工营销人员审核,特别是涉及事实性产品声明的内容。将本数据集扩展到其他语言或市场的用户,应验证品牌语调和语气示例的文化与语言适宜性。

引用

BibTeX: bibtex @misc{huynh2026marketinginstruct, author = {Huynh, Sue}, title = {marketing-instruct-4k: A Curated Marketing Copywriting Instruction Dataset}, year = {2026}, publisher = {HuggingFace}, howpublished = {url{https://huggingface.co/datasets/suehuynh/marketing-instruct-4k}}, note = {AutoScientist Challenge 2026 — Marketing Category} }

数据集卡片作者

Sue Huynh — 布朗大学数据科学硕士

数据集卡片联系方式

HuggingFace: suehuynh

搜集汇总
数据集介绍
marketing-instruct-4k 数据集图片
构建方式
marketing-instruct-4k数据集由Sue Huynh精心构建,专为2026年AutoScientist营销挑战而设计。其构建融合三种来源:从HuggingFace公开营销数据集中筛选高质量样本,借助AdaptData平台完成适配与质量过滤;针对公共数据稀疏或质量欠佳的领域(如电子邮件营销、品牌语调改写和表格到洞察),手工设计涵盖40余种品牌语调风格、15个行业及多样化表格场景的合成样本;另从公开电子邮件分类数据集中筛选促销类内容,经长度阈值过滤及去除非广告性质内容。处理流程包括输出文本哈希去重、剔除不足10词的短样本、移除未填充占位符及编码损坏内容,并通过平衡采样确保五类任务(广告社交文案、电子邮件营销、产品描述、品牌语调改写、表格到洞察)的合理分布,最终形成约4300条高质量指令调优样本。
特点
该数据集最显著的特点在于其质量优先于数量的设计哲学。实验表明,该精心策划的约4300条数据集在营销文案生成任务中表现优于通过自动化增强扩展至1.2万条的版本(对基础模型的胜率分别为80%与58%),有力佐证了数据质量与任务平衡的关键作用。数据集中产品描述示例经过严格筛选,确保输出内容可追溯至输入属性,显著减少大语言模型虚构产品特性的倾向。此外,数据集明确排除了战略分析类任务(如SWOT分析、竞品对比),专注于广告社交文案、电子邮件营销、产品描述、品牌语调改写及营销数据洞察五大核心交付物,使模型精于文案生成而非商业咨询,有效规避任务漂移风险。
使用方法
该数据集适用于营销文案生成模型的指令微调,可直接用于广告/社交文案、电子邮件营销、产品描述、品牌语调改写及活动数据洞察等任务。使用时需注意其局限性:数据集偏向西方英语营销习惯与消费者/B2B SaaS上下文,品牌语调示例虽风格多样但并非全球营销惯例的完全覆盖,合成样本可能带有辅助创建语言模型的风格特征。产品属性数据仅为示意,不应视为真实产品信息。建议用户将模型输出交予人工审核后再发布,尤其是在涉及事实性产品声明时。如需扩展至其他语言或市场,应验证品牌语调与风格的文化和语言适用性。数据集采用Apache 2.0许可,结构为统一的指令调优格式,包含指令、可选输入字段和目标输出字段。
背景与挑战
背景概述
在自然语言处理与生成式人工智能的交叉领域中,指令微调(instruction-tuning)已成为提升大语言模型在特定垂直任务上表现的关键范式。2026年,由Sue Huynh在Adaption Labs主导的AutoScientist Challenge背景下,marketing-instruct-4k数据集应运而生,专注于解决营销文案生成这一高端应用场景。该数据集包含约4300条精心策划的英文示例,覆盖广告、社交媒体、电子邮件营销、产品描述、品牌语调改写及数据洞察摘要五大任务类型,旨在为开放营销文案生成模型提供高质量微调基础。其核心研究发现,数据质量与任务平衡性远比简单扩增数据量更为关键:该自然规模的数据集在超越基准模型方面取得了80%的胜率,而通过自动化增强扩展至12000行版本后,胜率降至58%,这一结论对数据集设计理念产生了深远影响。数据集衍生自公开营销语料、合成示例及过滤后的真实促销邮件,经过去重、长度阈值筛选及任务平衡采样等严格处理,最终训练出HuggingFace上的Marketing-Mixtral-8x7B模型,为营销自动化领域提供了可靠的研究基准。
当前挑战
生成式营销文案面临的核心挑战在于如何平衡创造性与事实一致性,尤其是产品描述中的属性忠实度(attribute faithfulness),即模型输出需严格可追溯至输入属性,以避免幻觉(hallucination)问题。marketing-instruct-4k通过精心过滤示例以减少这一倾向,但构建过程中亦暴露了多重困难:公开数据集中广告与产品描述类示例充足,而电子邮件营销、品牌语调改写及表格到洞察等任务则数据稀疏且质量参差不齐,因此不得不通过手工设计覆盖40余种品牌语调风格、15个行业的合成示例来填补缺口。此外,数据清洗面临技术挑战,包括去除占位符变量(如未填充的`{time}`令牌)、损坏编码及非UTF8字符,同时需在去重后确保各任务类型间的均衡分布,避免某一类任务过度代表性。最终,数据集偏向于西方英语营销惯例与消费类B2B SaaS语境,限制了其在全球多元文化背景下的适用性,模型的输出仍需人类营销人员审核方可发布。
常用场景
经典使用场景
在营销文案自动生成领域,marketing-instruct-4k数据集被广泛用于指令微调(instruction tuning)任务,旨在提升大语言模型在广告文案、社交媒体帖子、电子邮件营销、产品描述、品牌语调改写以及营销数据洞察摘要等五大核心场景中的文本生成能力。该数据集精心筛选了约4300条高质量示例,覆盖了营销团队日常所需的核心文案产出类型,尤其强调属性忠实度,即要求模型生成的文案内容严格基于所提供的输入属性,有效抑制大型语言模型在生成过程中常见的幻觉现象。其典型用法是通过监督式微调,使模型学会根据具体指令和可选上下文输入,精准输出符合格式要求和品牌规范的营销文案。
衍生相关工作
围绕marketing-instruct-4k衍生出一系列具有影响力的工作,最直接的是基于该数据集微调的Marketing-Mixtral-8x7B模型,其在AutoScientist Challenge 2026营销类别中展现了卓越的文案生成能力。该数据集的构建过程也催生了对指令微调数据质量控制方法的深入研究,特别是AdaptData平台所采用的自动化适应与过滤技术。学术界和实践者进一步借鉴其任务类型平衡设计和属性忠实度过滤策略,开展了针对特定行业(如金融、医疗)营销文案生成的数据集构建工作,并探索了在不同语言和文化背景下迁移应用该数据集的可行方案,推动了营销领域专用语言模型的标准化发展。
数据集最近研究
最新研究方向
在营销文案生成领域,数据质量与任务平衡性正取代数据规模成为微调效果的核心驱动力。marketing-instruct-4k数据集针对AutoScientist 2026挑战赛构建,通过严格筛选仅4千条涵盖广告文案、邮件营销、产品描述、品牌语调改写及表格洞察五大任务的高质量指令样本,验证了精炼数据集在属性忠实度与生成效果上显著优于自动扩增的万级版本。这一发现呼应了业界对大模型微调范式从“量变追求质变”的转向,尤其为资源受限场景下的垂直领域模型优化提供了可复现的范式——通过任务平衡采样与输入属性可追溯性过滤,在无需海量数据的前提下实现80%胜率的模型性能提升,对推动营销自动化中可控生成与事实一致性研究具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务