遇见数据集

Feng-Chat

收藏
github2026-09-03 更新2026-09-08 收录
官方服务:

资源简介:

Feng-Chat 是一批中文 conversational SFT 数据,重点是还原峰哥原本的语气、用词和多轮互动节奏。

Feng-Chat is a collection of Chinese conversational Supervised Fine-Tuning (SFT) datasets, focusing on faithfully restoring Fengge's original tone, wording and multi-turn interaction rhythm.

创建时间:
2026-09-03
原始信息汇总

Feng-Chat 是一批中文对话式 SFT 数据集,旨在保留“峰哥”特有的语气、用词与多轮互动节奏。数据抽取、筛选与结构化过程中不依赖其他模型改写回答,最终以标准 messages 格式发布,可直接用于训练与分析。

数据规模

  • 发布记录:33,468 条
  • QA 轮次:40,645 轮
  • 多轮记录:3,952 条(占 11.81%)
  • 单条最多轮次:30 次
  • Assistant loss tokens:4,806,476
  • 安全审查:所有发布记录及 assistant turns 均判为 Safe

处理流程

  • 数据先经过去重、assistant-only PPL、message-level Guard 与主题分类。
  • 44,757 条通过 PPL 的记录进入 Guard,最终发布 33,468 条,保留率为 74.78%。
  • PPL 仅计算 assistant loss;Guard 会参考此前对话并对当前回答进行逐条判断。流程只筛选,不重构回答口径。

主题与统计

  • 最终数据覆盖 21 个主主题。
  • 最长 10% 的记录集中了 28.60% 的 assistant tokens。
  • 详细统计与字段定义见 Hugging Face Dataset Card。

使用方式

python from datasets import load_dataset

dataset = load_dataset("xfalcon9/Feng-Chat", split="train")

for message in dataset[0]["messages"]: print(message["role"], message["content"])

该数据适合中文对话 SFT、多轮风格建模,以及基于 PPL、长度、主题等的数据筛选分析。但并非事实百科全书、权威引文库,也不构成医疗、法律或投资建议。

声明

本项目仅用于学术研究与模型开发,与“峰哥”本人无官方关联。数据内观点不代表本人或维护者立场,且不得用于冒充本人、作为真实引文或从事违法活动。数据按“现状”提供,使用者需自行遵守法律、平台规则并承担相关责任。

如需引用,请参考:

@misc{fengchat2026, title = {Feng-Chat: Chinese Multi-turn Conversations in Feng-ges Original Voice}, author = {xfalcon9}, year = {2026}, howpublished = {Hugging Face dataset}, url = {https://huggingface.co/datasets/xfalcon9/Feng-Chat} }

搜集汇总
数据集介绍
Feng-Chat 数据集图片
构建方式
Feng-Chat数据集的构建根植于对自然对话的高度忠实,其核心流程摒弃了模型重写,纯粹通过抽取、筛选与结构化操作实现。首先从原始语料中抽取QA对,随后依次执行去重、基于assistant-only困惑度的评估、消息级安全审查以及主题分类。此过程不仅确保了数据的纯净度,更维持了峰哥原有的语气、用词与多轮互动节奏。最终,44,757条记录经过严格的安全审查,以74.78%的通过率保留了33,468条高质量样本,总计包含40,645轮问答,单条对话最长可达30轮,充分展示了其多轮结构上的丰富性。
特点
Feng-Chat数据集的卓越特点在于其对话风格的高度还原与结构的严谨性。它精心保留了峰哥的原声表达,跨越21个主主题,内容多元且贴近生活。统计数据显示,最长的10%记录集中了28.60%的assistant tokens,凸显了对话中长尾分布的深度与信息密度。所有发布记录及其assistant轮次均通过安全审查,确保内容无害。此外,数据集提供了明确的字段定义与筛选口径,以及详尽的PPL、长度和主题分布分析,为研究者提供了可解释的洞察,使其成为中文对话SFT及风格建模的理想基石。
使用方法
Feng-Chat数据集的使用便捷而直观,专为聊天式微调与风格建模设计。用户可通过Hugging Face的datasets库直接加载,示例代码清晰展示了如何访问多轮消息结构。数据以标准messages格式组织,适合直接输入到基于transformers的SFT训练管道中。它支持多轮对话系统的上下文学习,亦可用于量化评估语言模型的风格一致性。研究者亦可利用其丰富的元数据,执行基于PPL、响应长度或主题分布的data selection实验。需要强调的是,该数据集定位为学术研究资源,不适用于事实查询、权威引文或专业建议场景,使用时需遵守相关法律与伦理规范。
背景与挑战
背景概述
Feng-Chat数据集由研究者xfalcon9于2026年构建并发布,旨在提供一批高质量的中文对话式监督微调(SFT)数据,核心目标在于精准还原特定人物(峰哥)的原始语气、用词习惯及多轮互动节奏。该数据集通过构建精细的数据处理流水线,从海量对话中抽取、筛选并结构化数据,全程不依赖其他模型改写回答,确保了数据内容的原真性与一致性。最终发布包含33,468条记录,涵盖40,645轮问答,其中多轮记录占比11.81%,单条最大轮次达30轮,并经过严格的安全审查,所有记录均标记为安全。Feng-Chat的推出为中文对话系统研究提供了宝贵的语料资源,尤其适用于多轮风格建模和对话数据选择分析,对个性化对话生成及语言风格迁移等研究领域具有显著的推动作用。
当前挑战
Feng-Chat数据集在构建过程中面临多重挑战。首要挑战在于领域问题,即如何在对话式SFT中有效保留个体化的语言风格和多轮互动规律,这要求数据不仅具备高内容质量,还需在语气、用词和对话节奏上实现精准模拟。构建过程中的挑战尤为突出:数据来源的多样性导致格式杂乱,需经过复杂的清洗与去重流程;采用仅基于困惑度(PPL)的筛选机制,虽避免了模型改写带来的风格偏移,但需权衡数据长度与质量,如最长的10%记录虽占据28.60%的assistant tokens,却可能引入主题偏差。此外,内容安全审查需在保持原声与合规性之间取得平衡,最终仅74.78%的通过率反映了严格筛选的压力。多轮对话的结构化处理、主题分布不均(覆盖21个主题)以及数据规模的扩展性,均对pipeline的设计与可复现性构成了实际困难。
常用场景
经典使用场景
Feng-Chat数据集的核心用途聚焦于中文对话式监督微调(SFT)与多轮风格建模。其结构化messages格式可直接输入至各类预训练语言模型进行参数高效微调或全量训练,旨在增强模型在特定人格化对话中的语气一致性、词汇选择及互动节奏模拟能力。此外,该数据集凭借细粒度的assistant tokens标注及主题分布,亦成为数据选择策略研究的理想测试平台,研究者可据此探索PPL过滤、长度控制及主题平衡对下游对话系统性能的影响。
解决学术问题
该数据集有效回应了中文对话领域内个性化风格迁移数据稀缺的问题,为学术社区提供了首个大规模、高质量且经安全审查的“原声”多轮对话资源。通过严格的PPL筛选与message级Guard流程,Feng-Chat缓解了无约束网络语料中常见的毒性及不一致性问题,使得风格保真与安全可控得以兼顾。其发布促使学者重新审视SFT数据质量指标,尤其是assistant-targeted偏差度量,并推动了对“回复长度分布不均”及“长尾主题覆盖”等经典困境的实证探讨。
衍生相关工作
自Feng-Chat开源后,衍生出一系列围绕“人格化SFT数据构建”与“生成质量评估”的后续研究。例如,有工作借鉴其管道设计,针对其他名人或虚构角色构建低毒性、高风格一致性的对话集。另有学者使用该数据集作为基准,对比不同采样策略(如基于PPL或多样性)对微调模型在角色扮演任务上的泛化影响;部分研究更将其整合进多任务学习框架,联合优化风格控制与知识对话能力,从而将角色化模拟推向更实用、更安全的境地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务