遇见数据集

vintage-sft-robustness

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

Vintage SFT Robustness 是一个用于增强预-1930年代对话模型鲁棒性的监督微调数据集。该数据集包含 7,338 个样本,横跨五个路由:conversation_qa(3,500行,处理问候、告别、感谢等社交对话)、unparseable_qa(2,000行,处理乱码和截断句子)、typo_qa(1,200行,处理一个单词严重拼写错误的情况)、era_qa(220行,处理年份、时代错位、身份、地点等问答)、conversation_multiturn(418行,处理真正的双人对话,共2,044个回合)。单轮样本包含 question 和 answer 字段,多轮样本包含 conversations 列表(交替的 role 和 content)。所有样本均带有 score: 100,表示它们是构造的而非评分得到的。数据来源分为三类:语料库逐字提取(来自988MB的预-1930年摘录语料库)、程序生成(随机字符串和机械变形)和人工编写(115个用时代口吻手写的字符串)。数据集提供了详细的规模统计(总行数、每路由行数、中间token数、总token数约14.2万),并包含重要的时代错位风险警告,如语料库可能包含过时的古语、对话多轮倾向于维多利亚时期、方言保留在用户端等。该数据集旨在与训练时的输入噪声配合使用,以提升模型对非标准输入的鲁棒性。

Vintage SFT Robustness is a supervised fine-tuning dataset designed to enhance the robustness of pre-1930s dialogue models. It contains 7,338 samples spanning five routes: conversation_qa (3,500 rows, handling social dialogues such as greetings, farewells, and thanks), unparseable_qa (2,000 rows, handling garbled and truncated sentences), typo_qa (1,200 rows, handling cases of severe spelling errors in a single word), era_qa (220 rows, handling questions and answers about years, anachronisms, identities, places, etc.), and conversation_multiturn (418 rows, handling genuine two-person dialogues with 2,044 turns). Single-turn samples include question and answer fields, while multi-turn samples include a conversations list (alternating role and content). All samples have a score of 100, indicating they are constructed rather than rated. Data sources are divided into three categories: verbatim extraction from a corpus (988MB of pre-1930 excerpt corpus), programmatic generation (random strings and mechanical transformations), and manual writing (115 strings written in period style). The dataset provides detailed size statistics (total rows, rows per route, median tokens, approximately 142K total tokens) and includes important anachronism risk warnings, such as the corpus possibly containing outdated archaic language, multi-turn dialogues tending toward the Victorian era, and dialect preserved in the user side. The dataset is intended to be used with input noise during training to improve the models robustness to non-standard inputs.

创建时间:
2026-08-13
原始信息汇总

数据集概述

Vintage SFT Robustness 是一个用于增强 1930 年前对话模型鲁棒性的监督微调(SFT)数据集,包含 7,338 行数据,分布在五条不同的“路线”(routes)中,专为补充预训练于前 1930 年书籍的对话模型而设计。

许可证:cc-by-4.0
语言:英语
规模:1K < n < 10K
标签:vintage、historical、pre-1930、sft、robustness


设计动机

该数据集解决的典型问题:模型在输入不再像“问题”时(如问候、乱码、无问号句子、拼写错误、时间错位问题、多轮对话),会偏离微调分布,退回基础语料的小说式生成行为,直到耗尽 token 预算。

输入示例 观察到的失败 对应路线
Hello 生成大段叙述 conversation_qa
xakhavjba 同上 unparseable_qa
去掉问号的问题 同上 训练时噪声(另设)
What is a nedle? 答非所问 typo_qa
What year is it? 回答错误或回避 era_qa
多轮对话 无轮次概念 conversation_multiturn

基础数据集因 region_quality 指标偏好长句,导致对话类文本(短句)无法通过 0.70 的保留阈值,因此 SFT 数据约 98% 为叙述文本,缺乏真实对话样本。


数据内容与结构

路线 行数 中位 token/行 覆盖内容
conversation_qa 3,500 15 问候、告别、感谢、承认、奇特开场(如 Praise God!)、模糊指代(如 Does he so?
unparseable_qa 2,000 18 乱码与截断句子(含 fragment 655、multi_token 365、single_nonword 349、consonant_run 193、long_run 99、alnum_noise 93、micro 73、mixed_case 69、keyboard_mash 64、repeated_char 32、bare_punctuation 8)
typo_qa 1,200 30 单个词严重拼错 → 模型应反问确认(如 You mean needle, I take it?
era_qa 220 17 年份(147)、时代错误(31)、身份(25)、地点(17)
conversation_multiturn 418 86 真实双人对话,共 2,044 轮
总计 7,338 约 142k token/遍

数据格式:单轮路线使用 question / answerconversation_multiturn 使用 conversations 列表(交替 {role, content})。所有行均带 score: 100,因为是构造数据而非评分数据。

重要提示:数据行数占比(3.4%)与 token 占比(0.6%)差异悬殊,训练时应按 token 而非行数评估数据体量。


数据来源

分三类来源,仅一类存在时代错误风险:

1. Corpus-verbatim(语料逐字)——取自 988 MB 前 1930 年语料库(452,591 个片段):

  • 90 条社交回避从句(仅在上下文无关时保留)
  • 5,000 个完整句子,在随机词边界截断为片段
  • 4,000 条短独立话语,用作奇特开场
  • 全部 conversation_multiturn 轮次,来自 croqaz/vintage-conversations(古腾堡小说,逐字核对)

2. Procedural(程序生成)——随机字符串与机械式篡改(乱码类别、五种拼写操作:删、换、双写、QWERTY 相邻键、谐音),无时代错误风险。

3. Authored(手写)——115 条按年代语气手写的字符串,是唯一的时代错误风险面:

  • 32 条对话开场(如 What brings you
  • 12 条代词特定询问
  • 12 条年份回答(如 Nineteen hundred and thirty.
  • 10 条拼写确认(You mean {word}, I take it?
  • 9 条回退承认、9 条身份回答、8 条结束语、7 条好奇尾句、6 条通用询问、5 条自然回答、5 条地点回答

这 115 条字符串在 7,338 行中高频重复,建议训练前通读。


时代错误风险警告

  1. 语料逐字无法防止古语化——语料跨越多个世纪,good morrow 是最常见问候、adieu 是第二常见告别,均不适用于 1930 年语境。按出版年份过滤无效(1900 年代书籍中 good morrow 更频繁),需人工策展,黑名单必然不完整。

  2. 频率不等于适用性——come again 虽高频,但时代义为“回来”而非“再说一遍”,已入黑名单,其他类似词语可能幸存。

  3. conversation_multiturn 偏向维多利亚时期——来源为狄更斯、艾略特、托尔斯泰译作,早于 1930 年,但与预训练语料的主流年代(1850–1910)一致。

  4. 方言保留在用户轮次——语音方言(如 Knowd it yesday aftnoon at tea-time)仅从助手回答中剔除,用户轮次保留,基于“访客可能输入任何内容,但模型不应以此方式回答”。

  5. 上游对话集的说话人归属不保证——机械过滤只能捕捉结构断裂,无法捕捉语义断裂,部分交换可能不连贯。

  6. 用户端刻意现代化——hiheywhats upok 等输入是故意的,只有回答需要保持年代语气。

  7. 构造回答未经语料验证——115 条手写字符串虽符合年代语气,但无任何年代书籍包含这些句子,未经过时代错误过滤。


配套:训练时输入噪声(不在本数据集内)

与数据集配套设计的训练时噪声方案,对全课程的用户轮次施加 16 种操作、五大类变换:标点(含双感叹号)、大小写、间距、字符(换位、删/双字母、QWERTY 相邻键)、词级(删、重复、去撇号)。按 epoch 播种,同一行在不同训练轮次中以清洁或受损状态出现。答案轮次永不改动——理由:损坏的问题是模型读取的上下文,损坏的答案是模型学习复现的目标。

typo_qa 的区分:噪声是轻损伤、保留答案;typo_qa 是对单个关键词的重损伤,此场景下猜测是错的、询问是对的。二者分离可防止模型对轻微拼写错误过度提问。

警告:字符级操作模拟 OCR 伪影,与源语料可能已清理的损坏类别相同,若模型在答案中再现 OCR 式拼写错误,应首先怀疑此环节。


复现方法

给定 (count, seed) 可确定性复现,默认 seed 为 1930:

bash python -m synth.robustness.mine --scan-bytes 0 # 挖掘从句池(慢) python -m synth.robustness.mine --fragments 2500 # 句子池 python -m synth.robustness.mine --utterances 4000 # 话语池 python -m synth.robustness.build --dry-run # 仅统计 python -m synth.robustness.build # 构建并推送

数据布局:rows/<route>/part-*.jsonl

搜集汇总
数据集介绍
vintage-sft-robustness 数据集图片
构建方式
该数据集的构建匠心独运,分为语料直引、程序生成与手工撰写三源并蓄。语料直引部分源自988MB的前1930年文本语料库,精选452,591篇摘录中的语境无关社交用语、整句片段及短促独白;程序生成则通过随机字符串与机械性错别字操作(如丢失、交换、重复、键盘邻近键及语音学替换)制造乱码与拼写错误样本;手工撰写部分由115条以时代语感精心雕琢的应答串构成,覆盖问候、年份回应、打字确认等场景。多轮对话数据则源自Gutenberg小说,逐字核对确保忠实原文。三类来源分别承载不同风险层次,构建时辅以去重与比例调控,确保数据纯净与平衡。
特点
该数据集的核心特征在于其针对性极强的鲁棒性强化设计。七千余行数据覆盖五条路径,直击模型在非标准输入下的失灵痛点:如无标点问题、乱码输入、拼写错漏、跨时代问答以及多轮对话缺失。单轮样本携带‘问题/答案’字段,多轮样本则采用角色交替的对话列表结构,均标以满分分数以示构造性质。数据集中尤为独特的是其分离式设计——与评分严格的合成数据集泾渭分明,避免混合污染。此外,构建过程深度考量了时代语言风险,如‘good morrow’等古语误用,通过手动屏蔽与审慎筛选确保应答语感契合1930年代语境。多轮对话虽偏向维多利亚时期风格,却与预训练语料的时代中位数相符,形成内在一致性。
使用方法
使用者可将此数据集作为辅助训练材料,融入整体课程体系。鉴于其行数与Token权重的显著差异——行数占比3.4%却仅贡献0.6%的Token——建议按Token剂量而非行数多寡进行调配,以平衡梯度信号。单轮数据可直接用于问答微调,多轮数据适用于对话生成训练。与训练时输入噪声策略配套使用效果更佳:对用户输入实施16种扰动操作,而应答保持纯净,旨在教会模型穿透噪声进行准确回答。对于‘typo_qa’路径,则刻意诱导模型在遭遇重损关键词时采取询问策略而非盲目猜测。训练前务必审阅115条手工字符串,因其重复率极高,潜在偏差可能放大。
背景与挑战
背景概述
该数据集名为Vintage SFT Robustness,由相关研究团队于近期构建,旨在解决预训练于1930年前文学作品的语言模型在监督微调(SFT)后出现的分布外退化问题。研究核心在于,当输入偏离标准问答格式时,模型会回退至基座语料库的散文生成行为,导致无休止的叙事输出。该数据集通过精心设计的7,338条对话样本,覆盖问候、无意义输入、拼写错误、时代错置及多轮对话等五类场景,补足传统SFT数据中缺失的对话模式,增强模型对异常输入的鲁棒性。其影响力体现在为历史语料模型提供了一套可复现的鲁棒性训练方案,并为后续研究提供了针对古语风格与时代一致性的精细控制范例。
当前挑战
该数据集面临的挑战多维且复杂。领域层面,需克服模型在非标准输入下回退至散文生成的根本缺陷,尤其是缺乏端到端标记的问题,导致输出无界延伸。构建过程中,挑战包括:语料库来源横跨数世纪,需人工筛除过时语词(如'good morrow')以匹配1930年代语域;对话数据因评分指标偏好长句而系统性缺失,需人工补充;程序生成的噪声类目(如键盘乱敲)值空间有限,容易去重饱和;极少量人工撰写的时代风格回答(115条)可能反复出现,带来一致性风险。此外,需谨慎处理方言保留、说话者归属不准及故意现代化的用户输入,确保模型回答保持时代语域,同时不被噪声误导。
常用场景
经典使用场景
该数据集专为提升预-1930年代对话模型在非典型输入下的鲁棒性而生,其核心使用场景聚焦于弥补模型在微调分布外输入(如无问号疑问句、拼写错误、无意义字符串及多轮对话)上的性能崩塌。通过精心构造的7,338条监督微调(SFT)数据,覆盖五种关键路由,该数据集为模型提供了应对真实世界交互中不可避免的噪声与非常规表达的校准样本,有效维系了模型在偏离标准问答范式时的对话连贯性与时代语域一致性。
衍生相关工作
该数据集衍生出多条研究路径。一方面,其提出的训练期输入噪声增强策略(涵盖16种操作、五大家族)已超越独立数据集范畴,成为可复用的训练方法,启发后续关于输入扰动对模型输出影响的研究。另一方面,对语料来源的精细划分(语料逐字、程序生成、人工撰写)为构建历史对话数据提供了可借鉴的溯源与风控框架,影响后续工作对时代错置、方言留存及说话人归属等问题的处理。此外,其关于对话轮次在散文质量评分中系统偏差的发现,已引发对现有多轮对话数据构建准则的反思。
数据集最近研究
最新研究方向
针对预训练于1930年前文献的对话模型在非标准输入下的鲁棒性退化问题,该数据集聚焦于补足监督微调阶段在短对话、拼写错误、乱码输入及多轮交互等场景下的训练样本缺口。其构建策略凸显了语料年代与对话规约间的内在张力,通过程序化生成与人工撰写的混合手段,在规避时代错置风险的同时,强化模型对噪声输入的容忍度与语境适应力。此研究路径揭示了历史语料微调中鲜被审视的分布偏移现象,为复古风格AI助手的可靠性优化提供了关键基准,并推动了跨时代语言模型在真实交互中的稳定性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务