遇见数据集

cqa-creative-writing-expert-cot-preview

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

CQA(Creative Quality Alignment)创意写作专家链式思维预览数据集(v2版)是一个专注于创意写作质量对齐的研究级后训练数据集。其核心目标是将创意写作专家的判断过程转化为结构化、可追溯、可重用的数据,以捕捉普通文本数据中缺失的创作决策信号,例如人物困境的构建、情节线索的合理性以及跨题材的叙事原则迁移。数据源自由两位资深中文创意写作专家(拥有知识工程、媒体写作、科普视频及小说创作经验)围绕具体创作问题进行的面对面语音对话。本公开预览版本包含4个经过深度清洗与标注的样本(完整采集包含104个样本)。数据以中文为源语言,并提供AI辅助的英文阅读译文。v2版本采用了更精确的schema,将数据拆分为可独立寻址的组件:聚焦后的创作问题(prompt)、按稳定轮次切分的源对话(source_dialogue)、与具体对话轮次关联的推理事件(reasoning_events,标识了如建立语境、比较解释、抽象原则等认知工作),以及从对话整理出的单一声音最终答案(final_answer)。此外,还包含来源追溯、质量审阅状态和发布元数据。数据集提供了多种数据视图,当前主要支持三种基于中文源数据的派生任务视图:1) 最终答案监督微调(Prompt → Final Answer);2) 推理链监督微调(Prompt → 推理事件轨迹 → Final Answer);3) 对话到判断归纳(Source Dialogue → Final Answer)。该数据旨在用于文本生成模型的监督微调,特别是提升模型在创意写作中的推理、原则抽象和高质量内容生成能力。需要注意的是,本仓库为公开预览版,仅包含4个样本供研究评估。完整语料、模型训练、商业使用及再分发需要单独书面授权。

The CQA (Creative Quality Alignment) Creative Writing Expert Chain-of-Thought Preview Dataset (v2) is a research-grade post-training dataset focused on creative writing quality alignment. Its core objective is to transform the judgment process of creative writing experts into structured, traceable, and reusable data, capturing creative decision signals missing in ordinary text data, such as the construction of character dilemmas, the rationality of plot clues, and the transfer of narrative principles across genres. The data source consists of face-to-face voice dialogues between two senior Chinese creative writing experts (with experience in knowledge engineering, media writing, science communication videos, and novel creation) around specific creative problems. This public preview version includes 4 deeply cleaned and annotated samples (the full collection contains 104 samples). The data is in Chinese as the source language, with AI-assisted English reading translations provided. The v2 version adopts a more precise schema, splitting the data into independently addressable components: the focused creative problem (prompt), the source dialogue segmented by stable rounds (source_dialogue), reasoning events associated with specific dialogue rounds (reasoning_events, identifying cognitive work such as context establishment, comparative explanation, and principle abstraction), and the single-voice final answer compiled from the dialogue (final_answer). Additionally, it includes source tracing, quality review status, and release metadata. The dataset offers multiple data views, currently supporting three derived task views based on the Chinese source data: 1) Final Answer Supervised Fine-Tuning (Prompt → Final Answer); 2) Reasoning Chain Supervised Fine-Tuning (Prompt → Reasoning Event Trajectory → Final Answer); 3) Dialogue-to-Judgment Summarization (Source Dialogue → Final Answer). This data is intended for supervised fine-tuning of text generation models, particularly to enhance reasoning, principle abstraction, and high-quality content generation capabilities in creative writing. Note that this repository is a public preview version, containing only 4 samples for research evaluation. Full corpus, model training, commercial use, and redistribution require separate written authorization.

创建时间:
2026-07-21
原始信息汇总

CQA: Creative Quality Alignment — 创意写作专家思维链数据预览

数据集概述

  • 发布方:Bread Studio
  • 数据集名称:CQA: Creative Quality Alignment — Research-Grade Schema v2 (Preview)
  • 语言:中文(源语言)、英文(AI辅助阅读译文)
  • 数据规模:n<1K(包含4条公开预览样本;完整语料共104条,不在本仓库公开)
  • 许可证:其他(公开预览样本可阅读、评估,但训练、商业使用、再分发需单独书面授权)
  • 任务类别:文本生成(text-generation)
  • 标签:sft、reasoning、expert-annotations、human-annotations、creative-writing、chain-of-thought、post-training

数据来源与构建方法

  • 源材料来自两位中文母语创意写作专家的面对面语音对谈,围绕具体创作问题展开。
  • 参与者背景:长期从事知识工程、新闻媒体写作、科学内容写作,拥有十余年科普短视频创作经验;其中一位另有25年小说创作经验,发表过商业小说并获多个平台小说奖项。
  • 数据不是众包标注,也非合成对话,而是从真实专家对谈中整理出的判断样本。
  • 清洗流程包括:修正ASR转写错误、错别字和口癖;按论述完整性切分对谈;拟定聚焦问题;保存完整对话;整理单一声音回答;识别并标注推理事件;专家修订中文推理事件摘要;必要处进行有限脱敏。

版本信息

版本 说明
v1.0 聚焦问题 + 完整双专家对话(位于<think>内)+ 最终回答
v2.0 同一批样本表示为源对话turn、可追溯推理事件、最终回答、来源与审阅状态、任务派生视图
  • 稳定sample_id连接两个版本;当前main分支为v2,v1表示保留在提交1de7d0118756213c0861f7fe6d8052cf5a1d856b

数据配置

数据集提供以下配置(均为train split):

配置名 数据文件 说明
public_zh(默认) data/public_preview.zh.jsonl 展平中文检查视图
public_en data/public_preview.en.jsonl 展平英文阅读视图
master_zh data/cqa_master_preview.zh.jsonl 完整中文研究级母数据
master_en data/cqa_master_preview.en.jsonl 完整英文母数据
final_answer_sft_zh data/views/final_answer_sft.zh.jsonl 最终回答SFT派生视图
reasoning_sft_zh data/views/reasoning_sft.zh.jsonl 推理SFT派生视图
dialogue_to_judgment_zh data/views/dialogue_to_judgment.zh.jsonl 对谈归纳/判断提取视图

母数据结构

中文和英文分别保存为独立记录,通过相同ID对应。核心字段包括:

  • sample_id:与v1一致的稳定标识符
  • schema_version:当前实验Schema版本
  • language / language_role:语言及角色(中文源记录或英文阅读译文)
  • prompt:聚焦后的创作问题
  • source_dialogue:按稳定turn切分的公开清洗对话
  • reasoning_events:与具体turn相连的派生认知事件
  • final_answer:单一声音的最终回答
  • provenance:采集方法、源版本、路径和哈希
  • quality:各语义层审阅状态
  • publication:公开预览和技术可用状态
  • derived_view_suitability:支持的派生任务视图及状态

推理事件(Reasoning Events)

推理事件不是对话的缩短复述,而是标识该部分讨论完成的认知工作,如建立语境、比较因果解释、构造机制、抽象原则等。每条样本按实际对话结构标注,事件类型和数量可以不同。

四条样本的认知结构

样本ID 主要认知结构
cqa_preview_001 语境建立 → 假设探索 → 跨案例比较 → 原则抽象
cqa_preview_002 手法引入 → 对比评价 → 对照案例 → 原则收束
cqa_preview_003 模式框定 → 两条人物功能因果链 → 原则抽象
cqa_preview_004 约束识别 → 机制构造 → 原则抽象 → 跨题材迁移

派生视图

中文源记录支持三种派生视图:

  1. 最终回答SFTprompt → final_answer
  2. 推理SFTprompt → 专家修订推理事件轨迹 → final_answer
  3. 对话到判断source dialogue → final_answer

本数据集不包含preference、judge或process-supervision数据,因现有材料不包含所需的候选对或专家步骤级标签。

相关论文

  • BC Protocol: Structured Dual-Expert Dialogue for Eliciting High-Quality Chain-of-Thought Post-Training Data(arXiv:2605.25549)——双专家对谈方法背景
  • Calibrated Surprise: An Information-Theoretic Account of Creative Quality(arXiv:2604.26269)——Creative Quality Alignment理论背景

审阅状态与使用限制

  • 中文源对话和最终回答继承v1的人工审阅;中文推理事件注释已经专家修订。
  • 英文为AI辅助阅读译文,尚未完成独立的翻译层复核。
  • 数据字段中training_ready仅描述技术和语义审阅状态,不授予训练许可
  • 公开样本可用于阅读、评估和合作前理解;完整语料、训练权、商业使用权和再分发权不随本仓库开放。
  • 模型训练/微调、使用完整语料或定制生产更多数据需单独书面授权。
  • 联系邮箱:bo@BreadMedia.com
搜集汇总
数据集介绍
cqa-creative-writing-expert-cot-preview 数据集图片
构建方式
该数据集源于两位中文母语创作专家围绕具体创意写作问题展开的面对面语音对谈,而非众包标注或合成对话。源材料经过自动语音转写、人工修正转录错误与口癖、依据论述完整性切分对话轮次、为每段讨论拟定聚焦问题,并从中提取单一声音的最终回答。更重要的是,专家进一步从对话中识别出推理事件,标注其认知功能(如建立语境、比较因果解释、抽象原则),并对中文推理事件摘要进行专业修订。整个构建过程以v2数据模式呈现,将源对话、推理事件、最终回答及来源元数据分离存储,并通过稳定的样本ID实现版本间追溯。
特点
数据集最显著的特点在于其深度结构化与认知可追溯性。每个样本包含聚焦提示词、按稳定ID切分的源对话、与具体轮次精确链接的推理事件、单一声音的最终回答,以及来源、审阅与任务视图元数据。推理事件并非对话的简单压缩,而是标明了每段讨论所完成的特定认知工作。当前公开预览包含4条样本,中文为源语言,英文为AI辅助阅读译文。数据集支持三种派生视图:最终回答监督微调、推理监督微调以及对话到判断提取,为不同训练目标提供灵活的数据组织形式。
使用方法
用户可通过HuggingFace Datasets库加载不同配置版本。加载当前中文公开检查视图时,使用配置名'public_zh'与主分支;若需获取原始v1表示,则指定修订版本哈希值。数据集中的每条样本均包含清晰的字段定义,用户可根据训练需求选择使用完整母数据记录或特定派生视图,例如将'prompt'与'final_answer'配对用于标准监督微调,或将推理事件链作为思维链训练输入。需注意,公开预览样本仅可用于阅读、评估与合作前理解,完整的训练与商业使用权需另行书面授权。
背景与挑战
背景概述
创意写作作为自然语言生成领域的前沿方向,长期面临自动化评价与可控生成的瓶颈:传统质量评估体系依赖简单偏好分数或二元标签,难以捕捉创作决策中的因果关系、约束权衡与原则迁移等深层认知过程。在此背景下,Bread Studio于2025年发布了CQA(Creative Quality Alignment)预览数据集v2版本,由两位分别拥有十余年知识工程与小说创作经验的中文专家,通过面对面语音对谈形式,围绕具体创意写作问题进行知识采集。该数据集以结构化专家链式推理为核心,构建了从语境建立、假设探索、跨案例比较到原则抽象的完整认知轨迹,为后训练阶段的质量对齐提供了可追溯的高质量判断信号。这一开创性工作重新定义了创意写作数据的价值:不再仅呈现成品,而是将专家判断转化为可复用、可复核的结构化学习资源,对GPT、Llama等大语言模型在创造性表达与审美判别能力的提升具有重要潜在影响。
当前挑战
该领域面临的挑战首先是创意写作质量的本质性困难——传统偏好学习或奖励模型无法完整容纳专家判断中依赖复杂语境与细微取舍的决策过程,二元信号会抹除创作原则的迁移性与条件的多样性,导致模型无法真正理解为何一种意境优于另一种。其次是构建过程中的高成本约束:需从专家自然对谈中精准提取认知事件并标注推理类型,但对话的即兴性与隐喻性增加了转录清洗与事件切分的难度,34条完整样本的采集需经转录、翻译、专家修订多层工序,而当前公开预览仅包含4条深度整理样本,100条核心语料未开放,限制了规模化训练与跨领域迁移研究的推进。此外,英文版本作为AI辅助阅读译文尚未完成独立审阅,双语对齐的语义一致性验证同样构成技术瓶颈。
常用场景
经典使用场景
在创意写作与自然语言生成领域,该数据集最经典的使用场景是作为指令微调与推理链训练的高质量监督微调数据。具体而言,研究者可利用其提供的聚焦问题、专家修订后的推理事件轨迹以及最终回答,构建从提示到最终答案的生成任务,或从提示经专家认知链到答案的推理增强型微调任务。数据集蕴含的四种典型认知结构——如语境建立、跨案例比较与原则抽象——使其成为训练模型掌握创造性决策逻辑的理想素材,尤其适用于需要模拟专家级创作判断的文本生成场景。
解决学术问题
该数据集着力解决了创意写作质量对齐中的一个核心学术难题:如何将隐性的专家创作判断转化为可追溯、可复用的结构化训练信号。传统文本数据仅呈现成品,掩盖了创作过程中的决策逻辑与取舍条件;而CQA通过双专家对谈与推理事件标注,首次将创意写作中的因果解释、机制构造与原则抽象等高级认知活动显式编码为可监督学习的信号。这为突破当前偏好学习与奖励模型在处理非标量创意质量时的局限性提供了替代路径,推动了从‘结果对齐’向‘过程理解’的学术范式转变。
衍生相关工作
该数据集衍生了两项关键的学术成果:其一是《BC协议:结构化双专家对谈用于提取高质量思维链后训练数据》,系统阐述了通过双专家面对面语音对谈采集专家推理链的方法论,为高质量SFT数据的构建提供了可复现的采集与清洗框架;其二是《校准惊喜:创意质量的信息论解释》,从信息论视角论证了创意写作质量无法被简单偏好分数充分表达的理论根基,为超越标量奖励的创造性对齐研究奠定了理论基础。这些工作共同构成了面向创意领域的高阶认知对齐研究框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务