Feng-Chat
收藏资源简介:
Feng-Chat 是一批中文 conversational SFT 数据,重点是还原峰哥原本的语气、用词和多轮互动节奏。
Feng-Chat is a collection of Chinese conversational Supervised Fine-Tuning (SFT) datasets, focusing on faithfully restoring Fengge's original tone, wording and multi-turn interaction rhythm.
Feng-Chat 是一批中文对话式 SFT 数据集,旨在保留“峰哥”特有的语气、用词与多轮互动节奏。数据抽取、筛选与结构化过程中不依赖其他模型改写回答,最终以标准 messages 格式发布,可直接用于训练与分析。
数据规模
- 发布记录:33,468 条
- QA 轮次:40,645 轮
- 多轮记录:3,952 条(占 11.81%)
- 单条最多轮次:30 次
- Assistant loss tokens:4,806,476
- 安全审查:所有发布记录及 assistant turns 均判为 Safe
处理流程
- 数据先经过去重、assistant-only PPL、message-level Guard 与主题分类。
- 44,757 条通过 PPL 的记录进入 Guard,最终发布 33,468 条,保留率为 74.78%。
- PPL 仅计算 assistant loss;Guard 会参考此前对话并对当前回答进行逐条判断。流程只筛选,不重构回答口径。
主题与统计
- 最终数据覆盖 21 个主主题。
- 最长 10% 的记录集中了 28.60% 的 assistant tokens。
- 详细统计与字段定义见 Hugging Face Dataset Card。
使用方式
python from datasets import load_dataset
dataset = load_dataset("xfalcon9/Feng-Chat", split="train")
for message in dataset[0]["messages"]: print(message["role"], message["content"])
该数据适合中文对话 SFT、多轮风格建模,以及基于 PPL、长度、主题等的数据筛选分析。但并非事实百科全书、权威引文库,也不构成医疗、法律或投资建议。
声明
本项目仅用于学术研究与模型开发,与“峰哥”本人无官方关联。数据内观点不代表本人或维护者立场,且不得用于冒充本人、作为真实引文或从事违法活动。数据按“现状”提供,使用者需自行遵守法律、平台规则并承担相关责任。
如需引用,请参考:
@misc{fengchat2026, title = {Feng-Chat: Chinese Multi-turn Conversations in Feng-ges Original Voice}, author = {xfalcon9}, year = {2026}, howpublished = {Hugging Face dataset}, url = {https://huggingface.co/datasets/xfalcon9/Feng-Chat} }





