SuperWriter-LM
收藏资源简介:
SuperWriter-LM数据集是一个用于训练大型语言模型进行长文本生成的数据集,由新加坡科技设计与设计大学和清华大学的研究团队创建。该数据集包含12000条高质量的训练数据,分为三个阶段:规划、写作和修改。数据集的设计旨在模拟人类写作过程,通过引入中间思维步骤来提高生成文本的流畅性、一致性和逻辑性。数据集的应用领域包括长文本生成、写作辅助等,旨在解决现有大型语言模型在生成长文本时存在的连贯性和逻辑性不足的问题。
The SuperWriter-LM dataset is a dataset for training large language models (LLMs) to perform long-text generation, created by a research team from the Singapore University of Technology and Design and Tsinghua University. This dataset contains 12,000 high-quality training samples, divided into three stages: planning, writing, and revising. It is designed to simulate the human writing process by introducing intermediate thinking steps to enhance the fluency, coherence, and logicality of generated texts. The applicable fields of this dataset include long-text generation, writing assistance and other scenarios, aiming to solve the problem of insufficient coherence and logicality in existing large language models when generating long texts.
SuperWriter数据集概述
基本信息
- 名称: SuperWriter
- 类型: 长文本生成框架
- 语言: 支持英文和中文
- 模型规模: 7B参数
- 论文地址: arXiv:2506.04180
- 模型地址: HuggingFace (即将发布)
核心方法
三阶段生成流程
-
规划阶段(Plan)
- 角色: AI评论员↔作者
- 功能: 提炼主题结构,生成段落级大纲
- 关键技术: 故事工作坊对话、字数预算、一致性检查
-
写作阶段(Write)
- 角色: 思考者→作者
- 功能: 起草每个章节,保持章节连贯性
- 关键技术: 想法逻辑列举、上下文写作
-
优化阶段(Refine)
- 角色: 检查者→编辑
- 功能: 润色草稿,改进语言和逻辑
- 关键技术: 薄弱段落定位、针对性重写/合并
分层DPO训练
- 采用蒙特卡洛树搜索构建三层树结构(Plan_i, Draft_j, Refine_k)
- 叶子节点评分离散化为+2...-2
- 自底向上平均创建偏好对,使用单一DPO损失训练
实验结果
主要成果
- WritingBench评分: 8.51分(总体排名第二,仅次于671B的DeepSeek-R1)
- 优势领域: 学术与工程、金融与商业、政治与法律、教育
- 同规模模型排名: 第一
用户查询胜率
- 评估标准: 胜=1,平=0.5,负=0
- 在7B规模模型中表现突出,与更大规模模型保持竞争力
代码指南
数据生成
Agent/Super_write_agent.py: 生成英文三阶段SFT数据Agent/Super_write_agent_cn.py: 生成中文三阶段SFT数据Agent/SFT-Process.py: 清理原始代理输出,生成统一JSONL文件
DPO数据构建
- 部署SFT模型评估服务
DPO/MCTS_inference.py: 通过MCTS探索组合DPO/Step_1_query_evaluation_stand.py: 创建每查询评估标准DPO/Step_2_LLM_judge.py: 评分所有MCTS叶子DPO/create_dpo_pair.ipynb: 选择样本形成最终DPO对
推理流程
- 使用
Inference/superwrite_gen.py中的模板依次运行三个提示
训练
引用
bibtex @misc{wu2025superwriterreflectiondrivenlongformgeneration, title={SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models}, author={Yuhao Wu and Yushi Bai and Zhiqiang Hu and Juanzi Li and Roy Ka-Wei Lee}, year={2025}, eprint={2506.04180}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2506.04180}, }

- 1SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models新加坡科技设计与设计大学, 新加坡 清华大学, 北京, 中国 · 2025年



