遇见数据集

caramelo-dataset

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

Caramelo风格校正对数据集是一个包含414个指令-响应对的数据集,专门设计用于训练语言模型,使其能够模仿巴西作者Guilherme Favaron的独特写作风格进行回应。该风格特点包括:直接切入主题、使用数据和示例进行论证、采用巴西葡萄牙语、避免夸张表达和表情符号。数据集通过多阶段流程构建:首先在8个商业和技术领域(如增长与获客、管理与领导力、营销与传播等)生成多样化的日常提问作为指令;然后使用Gemma 3 4B基础模型生成回答草稿;接着基于作者真实通讯文本,通过LLM子代理将草稿重写为目标风格;最后根据客观风格标记(如无表情符号、无破折号分割句子、无特定句式、数据/示例密度)进行过滤。每个样本以JSONL格式存储,包含instruction(指令/问题)、response(风格化回答)和dominio(所属领域)三个字段。该数据集旨在微调小型语言模型的综合与沟通能力,其核心假设是沟通形式是模型性能的一部分。实验表明,基于此数据集训练的模型在盲测质量评估中优于原始基础模型。但需注意,回答反映了作者的个人风格和观点,可能包含基础模型的事实性错误,且主题范围限于巴西葡萄牙语的商业和技术领域的中短篇回答。

The Caramelo style correction pair dataset contains 414 instruction-response pairs designed to train language models to respond in the unique writing style of Brazilian author Guilherme Favaron. This style is characterized by directness to the point, use of data and examples for argumentation, employment of Brazilian Portuguese, and avoidance of exaggerated expressions and emojis. The dataset is constructed through a multi-stage process: first, generating diverse daily questions as instructions across eight business/technical domains (such as growth and acquisition, management and leadership, marketing and communication, etc.); then using the Gemma 3 4B base model to generate response drafts; subsequently rewriting the drafts into the target style based on the authors real communication texts via LLM sub-agents; and finally filtering based on objective style markers (e.g., no emojis, no dashes to split sentences, no specific sentence patterns, data/example density). Each sample is stored in JSONL format with three fields: instruction (the question/command), response (the stylized answer), and dominio (the domain). The dataset is specifically intended for fine-tuning small language models for synthesis and communication skills, with the core hypothesis that communication form is part of model performance. Experiments show that models trained on this dataset outperform the original base model in blind quality assessments. However, it should be noted that the responses reflect the authors personal style and opinions, may contain factual errors from the base model, and the topic scope is limited to medium-to-short answers in Brazilian Portuguese within business and technical fields.

创建时间:
2026-06-26
原始信息汇总

数据集概述:Caramelo — pares de correção de estilo (voz do Gui)

该数据集是一个用于葡萄牙语(巴西)文本风格迁移和指令微调的高质量配对数据集,旨在教导语言模型以特定作者风格进行回应。

核心信息

  • 数据集名称: Caramelo — pares de correção de estilo (voz do Gui)
  • 规模: 414 个 指令 → 回答 配对 (n<1K)
  • 语言: 葡萄牙语 (pt, 巴西)
  • 许可证: Gemma 许可协议
  • 数据集配置: default,数据文件为 caramelo_style_pairs.jsonl

数据集构建方法 (风格修正)

数据集通过一个四步流程构建,以解决“学习文章格式而非回答问题”的问题:

  1. 提示生成: 在 8 个商业/技术领域生成多样化、日常化的问题提示。
  2. 草稿生成: 使用 Gemma 3 4B 基础模型为每个提示生成回答草稿。
  3. 风格改写: 由 LLM 子代理基于新闻通讯 IA Aplicada 中约 229 篇真实文本片段,将草稿改写为作者 Guilherme Favaron 的风格(直接、以数据和实例论证)。
  4. 过滤: 应用客观风格标记(无表情符号、无句中破折号、无“不是X是Y”结构、数据/示例密度)进行过滤。

数据格式 (JSONL)

每条记录包含三个字段:

字段 类型 描述
instruction string 用户提问/请求 (中位数约 88 字符)
response string 以 Gui 风格撰写的回答 (中位数约 1,300 字符)
dominio string 所属领域 (共 8 个)

数据示例: json { "instruction": "vale a pena investir em TikTok Ads pra um SaaS B2B ou tá queimando dinheiro?", "response": "Depende muito do que você vende e pra quem. TikTok hoje tem mais de 1 bilhão de usuários ativos, e o perfil está mudando...", "dominio": "growth e aquisição" }

领域分布 (共 414 对,较均衡)

配对数量 领域
55 gestão, liderança e times (管理、领导力与团队)
53 marketing e comunicação (营销与传播)
52 produto e product management (产品与产品管理)
52 carreira e desenvolvimento pessoal (职业与个人发展)
52 dados e analytics (数据与分析)
50 growth e aquisição (增长与获客)
50 IA aplicada a negócios (应用于商业的AI)
50 startups e empreendedorismo (初创企业与创业)

预期用途

  • 主要用于对小型语言模型进行合成与沟通能力的微调。
  • 使用 QLoRA (r=16, alpha=32, 3 epochs) 进行训练。
  • 在盲测评估中,基于该数据集训练的模型 caramelo 3.4.2 以 66-70% 的胜率击败 google/gemma-3-4b-itcaramelo 4.4.1 以 95-100% 的胜率击败 google/gemma-4-E4B-it。在 ENEM 测试中,caramelo 3.4.2 得分为 57.5%。

局限性与偏差

  • 回答风格和观点完全反映作者 Guilherme Favaron 的个人风格,并非客观真理。
  • 草稿源自 Gemma 3 4B 基础模型,即使经过改写,仍可能包含该模型的事实不准确性。请勿用作事实来源。
  • 数据集范围仅限于巴西葡萄牙语的商业/技术领域,且为短到中等长度的回答。

相关资源与作者

搜集汇总
数据集介绍
caramelo-dataset 数据集图片
构建方式
该数据集的构建源于对文本生成模型在风格迁移与指令微调上的深度探索。开发者首先在八个商业与技术领域内设计了多样化的真实感提示,引导Gemma 3 4B基座模型生成初始回答草稿。随后,借助子代理语言模型,以新闻通讯专栏中近229篇真实文本为风格锚点,将每份草稿重写为符合作者Guilherme Favaron独特写作风格的回复。最终,通过一套客观的风格标记进行严格筛选,剔除包含表情符号、特定句式结构等不符合既定风格标准的样本,从而精炼出最终的414对指令-响应对。
特点
此数据集最显著的特征在于其精心塑造的、高度一致的写作风格,追求直击要害、数据与例证并重的巴西葡萄牙语表达,摒弃浮夸与装饰。它不仅覆盖了管理、产品、数据科学等八个关键领域,实现了较好的领域平衡,更以中位约88字符的指令与约1300字符的深度回复构成紧凑而丰富的对话对。尤为独特的是,该数据集的训练效果已在盲审评估中得到验证,微调后的模型在沟通质量上显著超越了原始基座模型,证明了表达风格本身即是一种关键的性能维度。
使用方法
本数据集专为小型语言模型的沟通能力与风格合成微调而设计,其核心理念在于训练模型掌握清晰、简洁且具感染力的表达方式。推荐采用QLoRA技术,以秩为16、Alpha为32的超参数配置,在基座模型上进行三轮训练。目标在于将数据集中蕴含的作者独特写作风格迁移至模型,而非注入新的事实性知识,因此使用时应搭配拥有充足领域覆盖的基座模型。需要注意的是,数据集内容反映的是个人风格与见解,并非绝对事实,且对话范围限于葡语商业与技术领域的中短篇幅回复。
背景与挑战
背景概述
在自然语言处理领域,指令微调数据集的构建通常聚焦于知识注入与任务执行能力的提升,却鲜有针对模型输出风格与沟通效能进行系统性优化。由研究者Guilherme Favaron于近期创建的caramelo-dataset数据集,旨在弥合这一空白。该数据集由414对葡萄牙语(巴西方言)的指令-回答对构成,核心研究问题在于探索将特定作者的写作风格——即直接、基于数据与例证、避免浮夸与表情符号的沟通方式——注入小型语言模型能否实质性地提升其任务表现。基于此数据集微调的Caramelo系列模型(如Gemma 3 4B + LoRA)在盲测中取得了显著胜率,揭示了沟通风格作为模型性能关键组成部分的潜力,对高效人机交互的研究具有重要的启发意义。
当前挑战
该数据集面临的核心挑战在于精准传递复杂的写作风格而非简单的格式模仿。早期版本曾使模型学会输出文章格式而非进行实质性对话,为此,研究者设计了一套多阶段构建流程:利用Gemma 3 4B基座模型生成面向8个商业与技术领域的多样化草稿,再由LLM子代理依据真实新闻简报(约229篇)进行风格重写,最后通过客观的文体标记过滤。这一过程本身也带来了挑战,即如何确保重写忠实于作者声音且不引入模型自身的偏见与事实性错误。此外,数据集在领域覆盖上局限于商业与科技文本,且风格高度个人化,其泛化能力与知识可靠性仍有待验证。
常用场景
经典使用场景
在自然语言处理与文本生成领域,caramelo-dataset 最经典的使用场景在于对小型语言模型进行微调,使其习得一种高度凝练且富有数据论证色彩的巴西葡语写作风格。该数据集包含414个精心构建的指令-响应对,覆盖了从增长策略、产品管理到数据分析和创业等八个商业与技术领域。通过将模型输出转化为类似作者Guilherme Favaron那样的直白、严谨且去浮夸的沟通模式,这一微调过程旨在提升生成文本的清晰度与说服力,而非扩展模型的事实知识。因此,该数据集成为了一种风格迁移与指令微调相结合的独特范例,专注于优化模型在特定沟通语境下的表达效率。
实际应用
该数据集的实际应用场景主要集中于需要对大量报告、分析或客服回复进行清晰、高效写作的商业环境中。例如,为初创公司或咨询机构定制一个能够以简洁直白、数据驱动的口吻生成市场分析或产品建议的小型AI助手。由于数据集专精于巴西葡语和商业技术领域,它可以被用于本地化写作辅助工具中,帮助非专业人士快速产出具有专家风格、论点扎实的专业文本。此外,该数据集在构建能模拟特定作者或品牌沟通语态的数字代理人方面也有着直接的应用价值,通过小而精的微调,实现风格的一致性与感染力。
衍生相关工作
源自caramelo-dataset的经典工作主要体现在其直接训练出的两个模型系列:Caramelo 3.4.2与Caramelo 4.4.1。这些模型以Google的Gemma系列为基座,通过QLoRA技术进行参数高效微调,在盲测评估中展现出对官方指令微调版本的显著优势,胜率高达66%至100%。相关工作进而探索了“风格即性能”这一假设的边界,即在保留基座模型推理能力的同时,如何通过有标注的风格数据来提升模型在特定任务上的用户感知质量。这一系列的实践为后续研究提供了方法论参考,即利用小规模、高质量的沟通数据来撬动大型语言模型的行为模式,为构建高表达效率的行业专用模型开辟了路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务