遇见数据集

brandvoice-marketing-briefs

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

BrandVoice Marketing Briefs 是一个旨在训练AI模型学习并模仿真实品牌写作风格的营销文案数据集。其核心目标是解决通用AI写作机械的问题,使其能够生成符合特定品牌声音的文案。数据集包含6,403条唯一数据行,其中6,339条是从Stripe、Liquid Death、Ramp、Duolingo等83个真实品牌的公开营销页面抓取的实际文案,另外64条是从已发表的营销说服力和文案研究中提炼出的营销原则。所有文案均无模板或填充内容。该数据集的核心创新在于v3版本为每条数据附带了完整的“品牌声纹指纹”,这是一个包含15个字段的元数据集合,用于详细描述品牌声音的特征,如品牌名称、语气、正式度、幽默感等。这使得模型不仅能学习品牌“说了什么”,更能理解品牌“听起来如何”,从而生成具有相同声音风格的新文案。数据集适用于微调大语言模型以生成品牌风格营销文案、品牌声音风格迁移、训练文案写作助手等任务,并可用于研究83个品牌跨7个不同垂直领域的真实声音差异。数据集为纯英文,采用CC0-1.0许可,可自由使用。数据收集自公开页面,并经过去重和转化处理,声纹指纹是基于真实文案的分析推断,并非品牌官方标注。数据在品牌间分布不均,且偏向于短文案格式如标题和标语。

BrandVoice Marketing Briefs is a marketing copy dataset designed to train AI models to learn and mimic the writing styles of real brands. Its core goal is to solve the problem of mechanical generic AI writing, enabling models to generate copy that conforms to specific brand voices. The dataset contains 6,403 unique data rows, among which 6,339 are actual marketing copies scraped from public marketing pages of 83 real brands including Stripe, Liquid Death, Ramp, Duolingo, etc. The remaining 64 entries are marketing principles extracted from published marketing persuasion and copywriting research. All copies contain no templates or filler content. The core innovation of this dataset lies in its v3 version, which attaches a complete "brand voice fingerprint" to each data entry. This is a metadata set consisting of 15 fields used to comprehensively describe the characteristics of brand voices, such as brand name, tone, formality, sense of humor, and so on. This allows models not only to learn what brands "say", but also to understand how brands "sound", thereby generating new copy with the same vocal style. This dataset is applicable to tasks such as fine-tuning large language models (LLMs) to generate brand-style marketing copy, brand voice style transfer, training copywriting assistants, etc. It can also be used to study the real voice differences of 83 brands across 7 different vertical sectors. The dataset is entirely in English, licensed under CC0-1.0 for free use. The data was collected from public web pages, deduplicated and transformed. The brand voice fingerprints are inferred based on analysis of real copies, rather than official brand annotations. The data distribution is uneven across different brands, and it is biased towards short copy formats such as headlines and slogans.

创建时间:
2026-06-07
原始信息汇总

数据集概述:BrandVoice Marketing Dataset

  • 名称: BrandVoice Marketing Dataset
  • 许可证: CC0-1.0(公有领域,可自由使用)
  • 语言: 英语(English)
  • 任务类别: 文本生成(text-generation)
  • 标签: 营销、品牌声音、文案创作、广告、指令微调(marketing, brand-voice, copywriting, advertising, instruction-tuning)
  • 数据规模: 1,300 条记录(1K < n < 10K)

数据内容

数据集包含品牌营销文案的指令-完成对,每条记录包含一个简短的创意简报和对应的完整文案。具体组成如下:

  • 1,004 条品牌文案示例,覆盖 83 个真实品牌(如 Stripe、Notion、Liquid Death、Duolingo 等)
  • 296 条营销技巧课程,基于说服与文案写作研究
  • 完成部分平均 48 词(范围 20–63 词),提示部分平均 16 词
  • 品牌声音从公开营销材料中分析得出,文案以相应声音生成,非逐字复制

数据列说明

列名 说明
prompt 创意简报:写什么、针对哪个渠道、达到什么目标
completion 实际的品牌文案,或技巧课程答案
brand 文案对应的品牌(技巧行为 General marketing
category 品牌垂直领域:消费、开发工具、AI、游戏、金融科技、SaaS、B2B
channel 格式:X 帖子、LinkedIn、邮件、着陆页、推送、广告、更新日志等
tone 品牌声音的情感基调
personality 声音的若干个性特征
voice_summary 品牌声音的单行摘要
task write(品牌文案)或 principle(技巧课程)

使用建议

数据集适合用于指令微调,可将提示和完成映射为问答对,并将品牌、类别、渠道、基调、个性、声音摘要等作为上下文传递。推荐配置: json { "prompt": "prompt", "completion": "completion", "context": ["brand", "category", "channel", "tone", "personality", "voice_summary"] }

任务列(task)不映射。支持去重(deduplication)和提示重述(prompt_rephrase)等处理流程。

快速示例

python import pandas as pd df = pd.read_csv("hf://datasets/manifesta/brandvoice-marketing-briefs/brandvoice_briefs.csv")

查看 Liquid Death 品牌文案

df[(df.brand == "Liquid Death") & (df.task == "write")][["channel", "completion"]].head()

来源与许可

数据为混合数据集:品牌声音来自公开营销材料的分析(真实信号),文案在该声音下生成(生成表面),技巧课程从公开营销研究中提炼(非直接复制)。数据集以 CC0 许可发布,允许任何人自由构建。由 MANIFESTA(Aivaras Navardauskas)为 AutoScientist Challenge 营销赛道构建。

搜集汇总
数据集介绍
brandvoice-marketing-briefs 数据集图片
构建方式
BrandVoice Marketing Briefs数据集由MANIFESTA团队为AutoScientist Challenge精心构建。其构建方式独具匠心,采用混合策略:首先从83个真实品牌的公开营销材料中提取品牌声音特征,涵盖从Stripe、Notion到Liquid Death、Duolingo等多元品牌;随后基于这些声音特征,结合说服科学与文案写作研究,生成完整的品牌文案与营销技巧。数据集包含1,004条品牌文案示例与296条营销技巧条目,每条提示与回答均为独立创作,而非简单摘录。文案长度控制精妙,平均48词,提示平均16词,确保模型能够学习实质性写作而非碎片复述。这种真实声音分析与人工生成相结合的方法,既保证了数据可靠性,又提供了丰富的训练信号。
特点
该数据集的核心特质在于其专业性与实用性并重。首先,它覆盖83个真实品牌的声音,涵盖消费者、开发者工具、AI、游戏、金融科技、SaaS及B2B等多个垂直领域,为模型提供了广泛的品牌语调学习资源。每条样本均包含品牌、类别、渠道、语调、个性及声音摘要等丰富元数据,形成多维度的语音指纹系统。其次,数据集混合了两种任务类型:'write'任务训练模型生成品牌文案,'principle'任务则传授营销技巧,使模型既能产出内容又能理解策略。文案格式多样,涵盖社交媒体帖子、邮件、落地页、广告、更新日志等现实营销场景。此外,采用CC0许可协议发布,完全开放,允许任何学术或商业用途的二次开发。
使用方法
数据集采用标准的指令-回答对格式,便于接入各类微调框架。使用时可将'prompt'字段映射为输入指令,'completion'字段映射为期望输出,同时可将'brand'、'category'、'channel'等元数据字段作为上下文特征传递给模型,以增强品牌声音的感知能力。推荐启用去重与提示重述等数据预处理方案。快速上手只需一行代码即可载入数据:使用Pandas读取HuggingFace上的CSV文件,随后可按品牌和任务类型进行灵活筛选,例如提取'Liquid Death'品牌的'write'任务样本进行针对性训练。数据集中无需对'task'字段进行映射,建议保持其原始状态。这种设计使研究人员能够快速构建品牌声音可控的文案生成模型。
背景与挑战
背景概述
在数字营销领域,品牌一致性的表达是建立用户认知与信任的核心,然而通用人工智能模型生成的文案往往缺乏品牌个性,难以满足精细化营销需求。为填补这一空白,MANIFESTA团队(由Aivaras Navardauskas主导)于近期构建了BrandVoice Marketing Briefs数据集,旨在通过真实品牌语料训练模型习得品牌特质的文案撰写能力。该数据集包含1,300条独特的提示-完成对,涵盖Stripe、Notion、Liquid Death等83个真实品牌的1,004条品牌文案示例,以及296条基于学术研究的营销技巧指导。作为AutoScientist Challenge营销赛项产物,该数据集以CC0协议发布,为指令微调与品牌文案生成领域提供了专业化训练资源,推动了AI从“机器人式写作”向“品牌式表达”的跨越。
当前挑战
数据集面临多重挑战。首先需解决领域核心问题:如何使生成式AI摆脱通用模板化输出,精准捕捉并复现不同品牌独特的语调、人格与情感基调,避免文案风格趋同。构建过程中,挑战尤为突出:需从公开营销素材中分析抽象的品牌声音特征,构建无歧义的量化描述(如tone与personality),并确保生成的文案既忠于品牌个性,又保持内容原创性;同时需平衡1,300条数据的规模与多样性,覆盖8个垂直领域及多种渠道(社交媒体、邮件、落地页等),并确保每对prompt-completion在语义和风格上唯一且具教学价值。
常用场景
经典使用场景
BrandVoice Marketing Dataset 的核心设计初衷,在于为文本生成模型提供真实的品牌语料训练素材。该数据集包含1300条独特的指令-完成对,跨越83个知名品牌的1004个品牌文案实例,以及296条源自出版研究的营销技巧课程。每条样本不仅包含营销简报(prompt)和目标文案(completion),还附有品牌、品类、渠道、语气、个性特征及声音摘要等多维度元信息。这种结构使得该数据集特别适用于监督微调(SFT)和指令微调场景,让模型能够学习不同品牌在不同营销渠道上的独特表达方式,从而生成符合特定品牌调性的高质量营销文案,而非泛化的机器人式文本。
衍生相关工作
该数据集衍生了一系列具有影响力的相关工作。在方法论上,它推动了‘混合数据集’设计理念的普及,即结合真实品牌声音分析(信号)与生成式文案(表面)的复合式构建策略。在模型层面,基于该数据集的微调工作探索了将品牌声音指纹作为上下文信息进行条件生成的方法,并验证了在适配任务中映射 prompt 与 completion 且保留品牌、品类、渠道等元数据的有效性。此外,该数据集也为 AutoScientist Challenge 提供了标准化测评基准,催生了品牌语音识别、风格一致性评估、跨品牌归纳学习等新的研究分支。
数据集最近研究
最新研究方向
在当前大语言模型文本生成同质化严重的背景下,BrandVoice Marketing Briefs数据集聚焦于品牌语调模仿与营销文案生成的精细化指令微调。该数据集包含1,300条独特的高质量文案对,覆盖83个真实品牌(如Stripe、Liquid Death等)和六大行业类别,并通过写入角色、语气、人格等元数据实现品牌声音的精准指纹化。其研究前沿在于突破传统AI文案的机械感,通过将品牌个性与营销技巧(296条说服性写作课程)深度融合,推动模型从简单的片段复述转向具备品牌辨识度的长篇写作能力。这一方向直接呼应了当前营销领域对“千人千面”乃至“千品牌千面”的内容需求,为基于LLM的品牌内容自动化生成开辟了可复现、可评估的基准路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务