marketing-instruct-4k
收藏资源简介:
marketing-instruct-4k 是一个精心策划的指令微调数据集,包含约4,300个营销文案示例,专为AutoScientist Challenge 2026(市场营销类别)设计,用于微调Marketing-Mixtral-8x7B模型。该数据集的关键发现表明,其自然规模(约4,300条)经过精心策划后,在任务性能上优于通过自动扩增得到的12,000条版本,证明了对于此任务,数据质量和平衡性比数据量更为重要。数据集涵盖五个核心营销文案任务类型:广告/社交媒体文案(约1,200例)、电子邮件营销(约900例)、产品描述(约800例)、品牌声音重写(约700例)以及表格到洞察总结(约500例)。每个示例遵循统一的指令微调格式,包含instruction(任务指令)、input(可选的结构化上下文,如属性列表或表格)和output(目标营销文案)三个字段。数据来源于三个方面:经过AdaptData平台质量筛选的公共营销数据集、为填补空白而手动设计的涵盖40多种品牌声音风格和15个以上行业的合成示例,以及从公共邮件分类数据集中筛选出的促销类真实邮件。数据处理包括基于输出文本哈希的去重、移除少于10词的示例、清除占位符变量和非UTF-8编码的伪影,并进行跨任务类型的平衡采样以确保代表性。数据集明确聚焦于文案生成,排除了营销策略、竞争分析或市场研究等任务。所有示例均为英文,不包含个人或敏感信息,其中引用的业务名称和产品属性均为泛化、虚构或基于公开可用的产品列表,仅作说明之用。数据集存在一定的局限性,包括偏向西方英语营销惯例、品牌声音示例未能穷尽全球风格、合成示例可能携带辅助生成语言模型的风格模式,且产品信息未经真实验证。建议基于此数据集训练的模型,其输出(尤其是事实性产品声明)在发布前应由人类营销人员审核。
marketing-instruct-4k is a carefully curated instruction-tuning dataset containing approximately 4,300 marketing copy examples, designed specifically for the AutoScientist Challenge 2026 (Marketing Track) and intended for fine-tuning the Marketing-Mixtral-8x7B model. A key finding of this dataset is that its naturally curated scale (approximately 4,300 instances) outperforms the 12,000-instance version generated via automatic data augmentation on task performance, demonstrating that data quality and balance are more critical than data volume for this task. The dataset covers five core marketing copy task categories: advertising/social media copy (approximately 1,200 instances), email marketing (approximately 900 instances), product descriptions (approximately 800 instances), brand voice rewriting (approximately 700 instances), and table-to-insight summarization (approximately 500 instances). Each instance follows a unified instruction-tuning format, consisting of three fields: instruction (task directive), input (optional structured context such as attribute lists or tables), and output (target marketing copy). The dataset is sourced from three aspects: public marketing datasets filtered for quality via the AdaptData platform, synthetic examples manually designed to fill gaps covering over 40 brand voice styles and more than 15 industries, and promotional real emails screened from public email classification datasets. Data processing steps include deduplication based on output text hashing, removal of instances with fewer than 10 words, elimination of placeholder variables and non-UTF-8 encoded artifacts, and balanced cross-task sampling to ensure representativeness. The dataset explicitly focuses on copy generation, excluding tasks such as marketing strategy, competitive analysis, or market research. All instances are in English and do not contain personal or sensitive information; the business names and product attributes cited are generalized, fictional, or based on publicly available product lists for illustrative purposes only. The dataset has certain limitations, including a bias towards Western English marketing conventions, brand voice examples that do not exhaust global styles, synthetic instances that may carry stylistic patterns from the auxiliary large language models used for generation, and product information that has not been verified for authenticity. It is recommended that outputs from models trained on this dataset, especially factual product statements, be reviewed by human marketing personnel before deployment.
数据集概述
- 数据集名称:marketing-instruct-4k
- 许可证:Apache 2.0
- 语言:英语
- 标签:营销、指令微调、文案写作、广告、电子邮件营销、产品描述、品牌语调、AutoScientist
- 任务类别:文本生成
- 数据规模:约 4,300 条样本(1K < n < 10K)
数据集详情
描述
该数据集是专为 2026 年 AutoScientist 挑战赛(营销类别)构建的指令微调数据集,包含约 4,300 条营销文案示例,涵盖五种任务类型。用于微调 Marketing-Mixtral-8x7B 模型。关键发现:精心策划的原始大小数据集(4,300 条)在性能上优于通过自动扩充扩展至 12,000 行的版本(对基础模型的胜率分别为 80% 和 58%),表明在该任务中数据质量和平衡性比数量更重要。
- 策划者:Sue Huynh
- 语言:英语
- 许可证:Apache 2.0
数据来源
- 基于此数据训练的模型:suehuynh/Marketing-Mixtral-8x7B
- 挑战赛:AutoScientist Challenge 2026 — adaptionlabs.ai
用途
直接用途
用于营销文案生成模型的指令微调,涵盖以下领域:广告/社交媒体文案、电子邮件营销、产品描述、品牌语调改写、以及营销活动数据到洞察的摘要生成。
超出范围的使用
- 不适用于营销策略、竞争分析或市场调研生成任务——这些在策划过程中被明确排除,以保持数据集专注于文案生成
- 未经翻译和重新验证,不适用于非英语营销内容
- 不应用作真实产品信息的来源;示例中使用的产品属性仅用于说明,并非经过验证的真实产品规格
数据集结构
每条样本遵循统一的指令微调格式:
| 字段 | 类型 | 描述 |
|---|---|---|
| instruction | 字符串 | 任务说明,包括格式和约束条件 |
| input | 字符串 | 可选的结构化上下文(如属性列表、表格);如不适用则为空字符串 |
| output | 字符串 | 目标营销文案 |
任务类型分布
| 任务类型 | 大约样本数 | 描述 |
|---|---|---|
| 广告/社交媒体文案 | ~1,200 | 针对特定平台的广告和社交媒体帖子文案 |
| 电子邮件营销 | ~900 | 营销活动及生命周期电子邮件(主题行/预览/正文) |
| 产品描述 | ~800 | 基于属性的产品描述 |
| 品牌语调改写 | ~700 | 将中性文案改写为指定语调 |
| 表格到洞察 | ~500 | 将营销活动绩效数据总结为洞察 |
(具体数量为近似值,详见数据查看器。)
数据集创建
策划理由
旨在微调一个覆盖营销团队日常核心产出的开源营销文案模型,同时明确排除策略/分析任务(如 SWOT 分析、竞争对手对比表、仪表盘),使模型专注于文案生成而非业务咨询。一个特定的设计目标是属性忠实性:产品描述示例经过筛选,确保输出中的声明可追溯到提供的输入属性,减少 LLM 虚构产品特征或规格的倾向。
源数据
数据收集与处理
数据集结合了三个来源:
- 公开营销数据集(HuggingFace),通过 Adaption Labs 的 AdaptData 平台进行适配和质量过滤,包括广告文案和产品描述来源
- 合成示例,手工设计了 40 多种品牌语调风格、15 个以上行业及多种表格/洞察场景,用于填补公开数据稀疏或质量低下的领域(电子邮件营销、品牌语调、表格到洞察)
- 经过筛选的真实促销电子邮件数据,选自一个公开的电子邮件分类数据集,仅过滤出“促销”类别,并通过长度阈值排除交易/垃圾内容
处理步骤:
- 基于输出文本哈希的去重
- 移除少于 10 个单词的示例(训练信号不足)
- 移除包含未填充占位变量(如
{time}、{items}标记)的内容 - 移除编码错误和非 UTF-8 伪影
- 跨任务类型的平衡采样,避免单一任务过度代表
源数据生产者是谁
包括 HuggingFace 上原始数据集作者(参见各源数据集卡片)、AdaptData 的自动适配系统,以及为此项目手工编写的合成数据。
个人与敏感信息
该数据集不包含个人、敏感或隐私信息。示例中提及的所有商业名称(如本地企业类型、产品名称)均为泛化、虚构或基于公开产品列表及制造商规格。
偏见、风险与局限
- 倾向于西方英语营销惯例以及美国营销中常见的消费者/B2B SaaS 语境
- 品牌语调示例虽风格多样,但未涵盖全球营销语调的全部惯例
- 合成示例可能带有用于辅助生成的模型的风格模式
- 示例中的产品属性数据仅用于说明,不应视为经过验证的真实产品信息
建议
基于该数据集训练的模型在发布前,其输出应由人工营销人员审核,特别是涉及事实性产品声明的内容。将本数据集扩展到其他语言或市场的用户,应验证品牌语调和语气示例的文化与语言适宜性。
引用
BibTeX: bibtex @misc{huynh2026marketinginstruct, author = {Huynh, Sue}, title = {marketing-instruct-4k: A Curated Marketing Copywriting Instruction Dataset}, year = {2026}, publisher = {HuggingFace}, howpublished = {url{https://huggingface.co/datasets/suehuynh/marketing-instruct-4k}}, note = {AutoScientist Challenge 2026 — Marketing Category} }
数据集卡片作者
Sue Huynh — 布朗大学数据科学硕士
数据集卡片联系方式
HuggingFace: suehuynh




