遇见数据集

Pradheep1647/tweet-style-dataset

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Tweet Style Dataset 是一个用于训练小型语言模型(SLM)的数据集,旨在通过基于策略的蒸馏方法,让模型学习模仿作者风格起草X/Twitter帖子。数据集基于作者@pradheepraop的Twitter档案导出(2025年9月至2026年5月),并通过DeepSeek v4(OpenRouter)生成的合成数据进行了丰富。它包括真实推文(经过丰富处理)、合成内容(从原始RL/ML笔记生成推文)和风格变体(对真实推文进行简洁和技术性重写),总计1,138条条目,分为训练集(967条)、验证集(85条)和测试集(86条)。数据模式包括instruction(任务提示,如将笔记转换为推文)和response(作者风格的推文响应)。数据集适用于监督微调(SFT)、基于策略的蒸馏(使用反向KL散度)和起草任务,帮助模型根据粗略笔记或主题生成具有作者随意/技术性声音的推文。

Tweet Style Dataset is a dataset for training a Small Language Model (SLM) to draft X/Twitter posts in the authors voice using on-policy distillation. It is built from a Twitter archive export of @pradheepraop (September 2025 – May 2026), enriched with synthetic data generated via DeepSeek v4 (OpenRouter). The dataset includes real tweets (enriched with prompts), synthetic content (generated from raw RL/ML notes to tweets), and style variants (concise and technical rewrites of real tweets), totaling 1,138 entries split into train (967 rows), validation (85 rows), and test (86 rows). The schema consists of instruction (task prompts such as converting notes to tweets) and response (tweet in the authors voice). It is intended for supervised fine-tuning (SFT), on-policy distillation with reverse-KL, and drafting tasks to generate tweets in the authors casual/technical style from rough notes or topics.

提供机构:
Pradheep1647
搜集汇总
数据集介绍
Pradheep1647/tweet-style-dataset 数据集图片
构建方式
该数据集源自X平台用户@pradheepraop在2025年9月至2026年5月期间的推特档案导出,经由DeepSeek v4模型通过OpenRouter接口进行数据增强,构建了一个用于小型语言模型风格微调与策略蒸馏的高质量语料库。数据集共包含1138个条目,其中315条源自真实推文并经DeepSeek增强生成话题提示与原始笔记版本,500条为合成内容转推文,122条为真实推文的简洁与技术改写版本。最终按85/7.5/7.5比例划分为训练集、验证集和测试集,分别包含967、85和86个样本。
特点
数据集采用统一的指令-响应格式,指令字段涵盖笔记转推文、话题转推文、回复等多种任务提示,响应字段则为作者风格的推文文本。所有样本均被剥离了来源与格式元数据,确保了数据的一致性。其核心优势在于融合了真实推文与合成数据,既保留了原作者的语用习惯与口吻,又通过风格变体增加了数据的多样性,特别适合用于训练小型语言模型模仿特定作者的随意技术性写作风格,并服务于基于逆向KL散度的在线策略蒸馏任务。
使用方法
该数据集的主要应用场景包括:超级vised微调(SFT),用于训练Qwen 2.5 1.5B等小型语言模型以匹配作者推文风格;在线策略蒸馏,通过学生模型生成推文、教师模型DeepSeek v4评分对数概率、计算优势值并利用重要性采样进行训练;以及推文草稿生成,给定粗略笔记或话题,模型可自动生成符合作者休闲技术风格的推文。数据集以标准格式发布,支持直接用于训练和评估流程,适用于社交媒体的个人化内容生成研究与开发。
背景与挑战
背景概述
在社交媒体的蓬勃发展背景下,用户生成内容(UGC)已成为信息传播的核心载体,其中Twitter(现称为X)作为主流公共对话平台,其内容创作风格与个人身份紧密关联,催生了对个性化文本生成的需求。然而,现有语言模型在处理特定作者风格的任务时,常因缺乏高质量、低噪声的细粒度训练数据而表现不佳。该数据集创建于2025年9月至2026年5月,由研究人员@pradheepraop基于其个人Twitter存档构建,并采用DeepSeek v4作为教师模型进行数据增强与合成,旨在解决小语言模型(SLM)在零样本风格模仿中的领域漂移问题。通过结合真实推文与合成数据,该数据集为强化学习中的在策略蒸馏(on-policy distillation)方法提供了关键基准,推动了轻量级模型在社交媒介个性化内容辅写领域的发展。
当前挑战
该数据集面临的领域中核心挑战在于如何使小型语言模型在零样本情况下捕捉并复现特定作者的写作风格,尤其是在缺乏大量标注数据时,现有模型常因风格泛化能力不足而产生雷同或偏离原有人设的文本。构建过程中,主要难题包括:从非结构化的Twitter存档(tweets.js)中准确提取并清洗低信噪比的原始推文,并借助DeepSeek v4生成符合用户语气的合成数据,同时避免模型在蒸馏过程中产生过拟合或风格坍塌。此外,通过反向KL散度进行在策略蒸馏时,需谨慎平衡学生模型的探索与利用,防止在295个真实样本和500条合成数据构成的有限数据集上出现多样性匮乏,以及处理价值损失不收敛等训练稳定性问题。
常用场景
经典使用场景
tweet-style-dataset 的核心用途在于训练小型语言模型(SLM)以模仿特定用户的推特发文风格。该数据集由真实推特存档与 DeepSeek v4 合成的数据构成,覆盖了从笔记到推文、话题到推文以及风格变体等多种指令-响应对。研究者利用其进行监督微调(SFT)和同策略蒸馏(on-policy distillation),使小模型如 Qwen 2.5 1.5B 能够生成与用户个人口吻高度一致的社交媒内容。这一应用在个性化内容生成、社交媒体自动化以及个人品牌维护等领域具有重要价值,为小模型在资源受限环境下实现风格化文本生成提供了可靠的数据基础。
实际应用
tweet-style-dataset 的实际应用集中在社交媒体内容自动生成领域,帮助用户批量起草符合个人语音的推文。例如,研究者或从业者可将零散的笔记或话题输入模型,快速获得风格匹配的草案,适用于个人博主、企业营销账号以及内容策展工具。此外,该数据集还可部署于聊天机器人或虚拟助手,使其在与用户互动时保持一致的表达风格。在内容审核与舆情模拟中也存在潜力,通过模拟特定用户风格来测试系统响应。这种数据驱动的风格复制技术降低了手动撰写的时间成本,同时提升了社交账号的活跃度与品牌辨识度。
衍生相关工作
基于 tweet-style-dataset,衍生了一系列关于小模型风格习得与知识蒸馏的研究工作。其中,同策略蒸馏方法作为核心框架,启发了后续将教师模型评分纳入学生训练损失的设计,例如使用反向 KL 散度进行优势加权。相关工作还包括对比不同基座模型(如 Qwen 2.5、Phi)在相同数据上的性能,以及探究合成数据比例对风格保真度的影响。此外,该数据集也促进了多任务指令微调的研究,比如将笔记转推文与风格变异联合建模。这些工作共同构建了从数据构建到模型部署的完整 pipeline,推动了低成本、高保真个性化内容生成技术的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务