遇见数据集

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training (CPT Corpus)

收藏
arXiv2026-08-26 更新2026-08-28 收录
官方服务:

资源简介:

本数据集名为Unfolding科学论文多轮生成轨迹数据集,由字节跳动等机构联合构建。该数据集包含约180万条从arXiv论文中解构得到的多轮生成轨迹,总token数达57-600亿,原始论文文本来源约300亿token。数据创建过程采用逆向重构方法,通过大语言模型为每篇论文生成写作请求、全局规划及章节预写作思索,同时保留原文段落与摘要。该数据集适用于大语言模型的持续预训练,旨在提升模型在学术写作、长文档理解及结构化文本生成方面的能力,同时保持通用推理性能不受损。

This dataset, named the Unfolding Scientific Paper Multi-turn Generation Trajectory Dataset, was co-constructed by ByteDance and other institutions. It contains approximately 1.8 million multi-turn generation trajectories deconstructed from arXiv papers, with a total token count ranging from 5.7 billion to 60 billion, while the raw source academic paper corpus totals approximately 30 billion tokens. The dataset was developed using a reverse reconstruction methodology, where large language models (LLMs) are employed to generate writing prompts, global planning schemes, and pre-writing reflections for each paper, while retaining the original paragraphs and abstracts of the source papers. This dataset is suitable for continuous pre-training of large language models, aiming to enhance the models' capabilities in academic writing, long document comprehension, and structured text generation, while preserving their general reasoning performance without degradation.

创建时间:
2026-08-26
搜集汇总
数据集介绍
Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training (CPT Corpus) 数据集图片
构建方式
该数据集基于大规模arXiv论文库构建,通过一套精细的流水线将每篇论文展开为多轮生成轨迹。轨迹由写作请求、全局计划、各章节写作前的思考以及原文内容交织而成,其中章节文本与摘要严格保留原文,而思考性内容则由不同规模的Qwen3.5系列模型逆向重建。整个流程涵盖摘要生成、请求推导、计划制定及逐节审思,最终将30B token的论文语料扩展为约60B token的训练数据,显著提升了训练文档的长度与结构完整性。
特点
数据集的核心特色在于其逆向重构思想,即固定真实文本为最终输出,反向合成产生该文本的潜在思维过程,从而突破了传统合成数据仅重写表层内容的局限。轨迹结构完整映射了学术写作的认知流程,从宏观规划到微观推敲,赋予模型可学习的写作思维范式。同时,该数据集提供了多尺寸生成器(4B、9B、27B)的版本,其输出在词汇风格与信息密度上呈现差异化分布,为训练数据的选择提供了弹性。此外,相同构建框架可延伸至指令数据与评估基准,实现了数据产品的多元统一。
使用方法
该数据集专为继续预训练(CPT)阶段设计,使用时将轨迹数据与通用语料(如FineWeb-Edu)按比例混合,以平衡领域适应性与通用能力保持。实验表明,在CPT阶段采用该数据后,再配合下游SFT(如DeepWriting-20k),能在学术写作基准(PAW-Bench、WritingBench)上取得显著提升,且不损害通用推理能力,并增强长文档理解。用户可根据计算资源选择合适的生成器版本,其中较小模型(4B)在性价比上更具优势,而较大模型(27B)在长上下文任务中表现更佳。
背景与挑战
背景概述
随着高质量人类语料的日益枯竭,合成数据在大语言模型训练中的作用愈发关键。2026年,由字节跳动Seed团队联合南京大学及Evolvent AI的研究人员构建了CPT Corpus数据集,旨在通过‘逆向重构’学术论文的写作过程,将静态文本转化为多轮生成的轨迹数据。该数据集基于约180万篇arXiv论文,利用Qwen3.5系列模型(4B/9B/27B)将30B token的论文文本展开为约60B token的连续预训练语料,显著拓宽了模型对长文档结构的理解。其核心贡献在于将文本重建从短网页段落提升至整篇文档层面,开创了学术写作过程建模的新范式,并衍生出SFT数据集与PAW-Bench评测基准,对学术写作能力提升与评估产生了深远影响。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。首先,现有合成数据研究多聚焦于短文本,难以捕捉整篇文档的全局规划与章节间逻辑,且重建过程机械、缺乏结构,导致模型难以从平面文本中习得深层推理。其次,构建过程中需处理海量论文的清洗与过滤,确保数据质量与领域平衡,同时需设计高效的逆向生成流程,在成本可控下还原写作意图、计划及章节推敲。此外,还需防范数据泄漏,并保证生成轨迹的多样性与真实性,避免模型陷入格式雷同或内容失真。这些挑战在实验中通过严格的过滤规则、多模型生成及质量审查得以部分解决,但如何平衡数量与质量、提升重建的保真度仍是持续课题。
常用场景
经典使用场景
该数据集在学术写作与语言模型训练领域开辟了崭新的应用维度。其核心价值在于将科研论文解构为多轮生成轨迹,重现从写作意图到章节草拟的完整认知过程。研究者借助这一语料,能够在持续预训练阶段为模型注入结构化的写作思维,使其超越对文本表面的模仿,掌握学术论述的内在逻辑。这一数据集尤其适用于提升模型的长文写作能力,通过将每篇论文膨胀为包含全局规划、章节前置思考与摘要凝练的多轮序列,训练样本的中位长度从原始文本的11K词元跃升至29K词元,为模型学习跨章节的连贯性布局提供了前所未有的素材。
衍生相关工作
该数据集所衍生的相关工作勾勒出一条从数据构造到模型优化的清晰脉络。在预训练方向,它启发了将文档解构为多轮生成轨迹的通用范式,不同于既往的网页改写或插入式思维注释,为长文训练数据设计提供了新思路。在指令学习方向,其逆向推导问答对的方法与指令反向翻译研究形成呼应,并催生了融合规划信息的写作SFT数据集。在评估方向,PAW-Bench作为论文锚定基准,填补了学术写作评测中缺乏事实依据与可核查细则的空白。这些衍生工作共同推动了合成数据从内容改写向认知过程重建的范式转变。
数据集最近研究
最新研究方向
该数据集聚焦于将科学论文解构为多轮生成轨迹,以重构学术写作的完整认知过程,进而推动大型语言模型在持续预训练、指令微调与写作评估领域的范式革新。其前沿研究方向体现在三个层面:其一,通过逆向合成写作请求、全局规划及逐节预写思考,将原始论文文本转化为包含深层推理过程的训练语料,显著提升模型在学术写作、长文档理解与推理能力上的表现;其二,将同一逆向构造框架延伸至指令数据与基准测试,衍生出以真实论文为答案锚点的SFT数据集与基于未纳入训练范围论文的PAW-Bench评估套件,为学术写作能力提供了兼具可解释性与事实约束的评测标准;其三,探究生成器规模与训练动态对数据效用的影响,揭示较小模型生成的高熵轨迹反而更能增强下游写作性能,为合成数据在预训练阶段的规模法则与效率优化提供了新视角。该数据集不仅在方法上弥合了文本表面与潜在认知过程间的鸿沟,更在实际应用中验证了其对写作能力、推理保持及长上下文处理的综合增益,为应对高质量人类文本日益枯竭的挑战提供了规模化、结构化的数据基础。
相关研究论文
  • 1
    Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training字节跳动 Seed; 南京大学; Evolvent AI · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务