wassname/ultrachat_200k_ultraclean
收藏资源简介:
ultrachat_200k_ultraclean 是一个经过奉承过滤的数据集子集,基于 wassname/ultrachat_200k_filtered(后者是 HuggingFaceH4/ultrachat_200k 的拒绝过滤衍生版本)。该数据集旨在作为清洁的监督微调(SFT)基础,用于研究减少奉承行为的方法(如DPO、反极LoRA等)。其核心过滤机制是移除任何对话中助手回复开头(前约150个字符)包含特定奉承或道歉模式的对话,例如以youre right、great question、I agree等模式开头的回复。过滤后,训练集(train_sft)从117,773个对话中移除了1,100个,保留了116,673个,过滤率为0.93%。数据集结构保持与源数据集相同,每个行包含消息列表(角色为user或assistant)。已知限制包括:仅过滤开头位置(不处理中段奉承)、基于正则表达式(可能错过未匹配模式的表达)以及继承了源数据集的偏见。该数据集通过单CPU流程构建,无模型介入,主要用于奉承减少研究的SFT基础,例如用于训练下游DPO实验的模型。
ultrachat_200k_ultraclean is a sycophancy-filtered subset of wassname/ultrachat_200k_filtered (itself a refusal-filtered derivative of HuggingFaceH4/ultrachat_200k). Built as a clean SFT base for studying sycophancy-reduction methods (DPO, antipodal LoRA, etc.), it filters out any conversation where an assistant turn opens (within the first ~150 characters) with specific patterns of reflexive validation or apology, such as youre right, great question, I agree, etc. After filtering, the train_sft split contains 116,673 conversations out of 117,773 seen, with a drop rate of 0.93%. The dataset schema matches the source, with each row containing a messages list of user and assistant roles. Known limitations include start-position-only filtering (mid-response sycophancy is not caught), regex-based filtering (missing paraphrases), and inherited source biases. It was created via a single CPU pass without model intervention and is intended for use as an SFT base in sycophancy-reduction research, e.g., for training models for downstream DPO experiments.




