遇见数据集

humanizer-artifacts

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是“humanizer”研究项目的一部分,旨在通过分布微调(DFT)工作流训练模型,使AI生成的文本在风格和分布上更接近人类写作。数据集由文本对组成,每个对包含“人类原始文本”和由AI模型(如Qwen或Codex风格模型)生成的“朴素改写”文本,训练方向是“AI改写 -> 人类原始”,即学习将AI改写文本还原为更自然的人类写作风格,同时严格保留原文的事实、数字、引用、格式(如LaTeX、代码、JSON、方程式)和结构。人类原始文本来源于真实人类写作,包括Project Gutenberg的散文、2023年之前的Europe PMC科学文本(含摘要和全文节选)、2022年的arXiv学术论文(多学科)、Project Gutenberg的小说文本,以及2022年及之前的英文维基百科文章/修订版,经过多阶段清理流程确保质量。数据规模包括关键语料库“human_reference_2022_v1”,包含1000个清洁文本文件(400篇arXiv论文约494,499词、200篇Gutenberg文本约101,575词、400篇维基百科文章约204,839词,每个文件最小词数约250词),以及对应的AI改写文本(如使用GPT-5.4-mini和GPT-5.5模型生成),用于DFT训练循环(涉及采样、多维度比较和训练LoRA模型)。数据集严格区分训练数据和保留的测试数据,适用于自然语言生成(NLG)研究,特别是文本风格迁移、AI文本人性化和分布微调方法探索。

This dataset is part of the "humanizer" research project, which aims to train models via a Distribution Fine-Tuning (DFT) workflow to make AI-generated text closer to human writing in terms of style and distribution. The dataset consists of text pairs, each containing a "human-originated original text" and a "naively paraphrased text" generated by AI models (such as Qwen or Codex-style models). The training objective is "AI paraphrased text -> human-originated original text", i.e., learning to restore AI-paraphrased text to a more natural human writing style while strictly preserving the original facts, numbers, citations, formats (such as LaTeX, code, JSON, mathematical equations) and structure. The human-originated original texts are sourced from authentic human writing, including essays from Project Gutenberg, scientific texts from Europe PMC (including abstracts and full-text excerpts) prior to 2023, multi-disciplinary academic papers from arXiv in 2022, fictional texts from Project Gutenberg, and English Wikipedia articles/revisions from 2022 or earlier. The texts have undergone a multi-stage cleaning process to ensure quality. The dataset includes the core corpus "human_reference_2022_v1", which contains 1000 cleaned text files: 400 arXiv papers with approximately 494,499 words, 200 Project Gutenberg texts with approximately 101,575 words, and 400 Wikipedia articles with approximately 204,839 words, with each file containing a minimum of ~250 words. Corresponding AI-paraphrased texts generated using models such as GPT-5.4-mini and GPT-5.5 are also included, which are used for DFT training loops involving sampling, multi-dimensional comparison, and LoRA model training. The dataset strictly distinguishes between training data and reserved test data, and is applicable to natural language generation (NLG) research, particularly for text style transfer, AI text humanization, and exploration of distribution fine-tuning methods.

创建时间:
2026-05-27
原始信息汇总

数据集概述:humanizer

  • 数据集名称:humanizer
  • 数据集地址:https://huggingface.co/datasets/oof-baroomf/humanizer-artifacts
  • 数据集性质:这是一个用于研究AI输出人性化(humanizers)的实验性工作空间,采用开放的Rosmine风格分布式微调(Distribution Fine-Tuning, DFT)工作流。不包含生产级数据,且保留的test / testoutput文件禁止用于训练或手动编辑。

数据集目标与方法

  • 训练方向AI改写 -> 人类原文。目标是将AI改写后的文本还原为人类原创风格。
  • 人类参考标准:必须使用真实的人类写作,而非合成的人造“人类”示例。
  • AI改写来源:使用Qwen/Codex风格的模型进行简单的改写/复述,保留原文的事实、数字、引用和格式。
  • 微调方法(DFT循环):
    1. 从当前模型在训练提示分布上的输出中采样。
    2. 将模型输出与人类参考进行对比,比较指标包括:token/n-gram残差、嵌入风格残差、质量/安全检查、以及self-BLEU/过度使用报告。
    3. 使用带有SFT锚点及残差权重的LoRA进行训练。
    4. 禁止使用短语类别技巧、确定性的“垃圾”删除或针对检测器的编辑。

数据来源与构建过程

  • 参考语料库(2022年人类参考语料库human_reference_2022_v1
    • 规模:1000条经过清洁的文本。
    • 来源
      • 400篇arXiv论文(2022年,涵盖多个学科)
      • 200篇Project Gutenberg小说
      • 400篇英文维基百科文章/修订版本(不晚于2022年)
    • 清洁流程:包括从PDF提取、确定性清洁(去除前/后页、引用、图表残留等)和仅删除的LLM清洁(确保输出是确定性文本的子序列并保留足够长度)。
    • 最终清洁结果:所有1000个文件通过检查,最小文件词数为250。
  • AI改写数据生成
    • 使用openai-codex/gpt-5.5openai-codex/gpt-5.4-mini对1000个清洁参考文件进行整文件改写,生成2000条改写记录。
    • 改写过程仅使用“plain rewrite”提示。

数据集目录结构与存储

  • 主仓库:数据集存储在oof-baroomf/humanizer-artifacts
  • 构件存储:所有中间产物和备份均上传至Hugging Face,位于runs/目录下,例如:
    • runs/2026-05-25-reference-corpus-2022/human_reference_2022_v1/:包含原始、提取、确定性清洁、LLM清洁、脚本等所有阶段的文件(共6676个文件,2.4 GB)。
    • runs/2026-05-26-whole-reference-rewrites/whole_reference_rewrites_2026-05-26/:包含2000条改写数据、输入、提示、原始响应、审计日志等。

训练与实验历程

  • 关键检查点
    • v4:使用真实来源(Project Gutenberg和PubMed Central)训练,通过保留验证,成为后续比较基准。
    • v5:因使用了保留测试集(CAD-bench)的检测器反馈进行特定优化,被认为污染且无效,已被回滚。
    • v6 (residual-v6):基于v4重建,未使用测试集。
    • v7:使用OpenPangram评分过滤人类参考(human_reference_score <= 0.1),保留了173/320条Qwen记录和57/183条HRM记录。
  • 训练硬件与配置:在Mac mini(16 GB统一内存)上训练,使用小型LoRA/PEFT。
    • Qwen模型:如Qwen3.5-4B,训练迭代240次,峰值内存5.97 GB;Qwen v4训练180次,峰值10.47 GB。
    • HRM模型:训练较为保守,存在复制提示和遗漏事实的问题。

使用与重要约束

  • 硬性门控
    • 手动数据检查
    • 保留评估
    • 无提示泄露
    • 无事实/格式丢失
    • 长上下文烟雾测试
    • 路径防护:检测器和训练脚本拒绝访问test / testoutput路径。
  • 访问令牌:访问数据集、模型和检测器所需的HF_ACCESS_TOKEN存储在~/.zshrc中,数据集上传使用.env文件中的HF_TOKEN
  • 后续步骤:使用human_reference_2022_v1作为下一轮DFT数据构建的参考池。在训练前,需手动采样所有三种来源的记录,并避免任何涉及保留testtestoutput的检测器/测试反馈循环。
搜集汇总
数据集介绍
humanizer-artifacts 数据集图片
构建方式
该数据集以对抗AI输出人工作品的检测器为目标,采用逆数据构建策略,将人类原创文本与AI改写文本配对,引导模型从AI风格向人类风格迁移。人类参考源取自2022年以前的真实语料,涵盖Project Gutenberg的散文、Europe PMC的科学全文及摘要,以及arXiv论文、维基百科条目,总计1000篇精选文本。构建流程包括格式保护、段落分块以适配16k上下文窗口,并引入鲁棒性验证器以剔除合成样本与检测器反馈污染。训练采用分布微调(DFT)框架,通过LoRA适配器在保留事实、数字与引用的前提下优化残差,严格禁用对测试集的直接编辑或针对性调整。
特点
数据集的显著特色在于其严格的污染控制与多维度质量过滤机制。所有训练数据均源自2022年前的真实人类写作,经OpenPangram检测器筛选后保留低AI得分样本,确保参考集的天然性。架构上采用结构化保护流程,分离LaTeX、代码、JSON等格式元素与可改写文本,在改写过程中维持原文面貌与事实完整性。此外,数据集内置了令牌级残差分析、自BLEU评估与过采样检测等多层验证,结合人工抽检与长上下文烟雾测试,形成对输出质量与安全性的复合保障,有效抵御检测器针对性修改等数据泄露风险。
使用方法
使用者可通过HuggingFace平台直接访问oof-baroomf/humanizer-artifacts仓库获取该数据集。数据分为原始文件、提取文本、确定性清洗与LLM清洗后的纯净版本,以及配套的改写结果与运行日志。调用时需从zshrc配置文件加载HF_ACCESS_TOKEN以获取权限,并建议使用uv管理Python环境进行LoRA或PEFT微调。推荐在分布微调循环中提取当前模型输出,与人类参考进行令牌及嵌入层面的残差比较,结合质量与安全审查后训练适配器。需严格避免在测试集或测试输出上执行训练、编辑或基于检测器反馈的优化,以维持验证结果的客观性。
背景与挑战
背景概述
humanizer-artifacts数据集由研究团队于2026年创建,旨在解决AI生成文本与人类写作之间的可区分性问题。该数据集依托罗氏风格分布微调(Distribution Fine-Tuning)范式,专注于训练能够将AI改写文本还原为人类原创文本的模型。研究团队通过构建包含学术论文、文学作品及百科全书条目在内的多样化人类参考语料库,并搭配AI模型生成的改写版本,为探索文本去AI化提供了宝贵的数据基础。该数据集不仅服务于当前的人工智能文本检测与还原研究,还为理解AI与人类在语言生成上的差异,以及推动更加自然、无痕的人机交互界面技术发展做出了贡献。其实验性的研究路径和严谨的数据处理流程,使其在相关领域内具有较高的参考价值和影响力。
当前挑战
humanizer-artifacts数据集面临的核心挑战在于其目标问题的复杂性:即如何在保留事实、数字、引文等关键信息的前提下,将AI生成的文本风格成功转化为人类写作风格。具体挑战包括:1)领域问题层面,AI文本常带有重复模式、特定用词偏好和结构痕迹,使之容易被检测算法识别,而完全去除这些“人工智能痕迹”而不破坏文本的自然流畅度与信息完整性极为困难。2)构建过程中,团队需规避数据污染与反馈循环,防止模型基于检测器反馈进行针对性的伪优化(如V5版本因使用了保留测试集的检测器反馈而被视为无效)。同时,语料清理环节面临大规模PDF解析残留、格式损坏(如LaTeX、代码块、引用)以及保留原文实质内容与长度比例的严格验证,部分数学或排版瑕疵因需要插入或重写而无法彻底清除,构成持久性挑战。
常用场景
经典使用场景
humanizer-artifacts数据集的核心设计理念在于构建一个从AI生成文本到人类原始文本的逆向映射,其经典使用场景聚焦于文本人性化(Text Humanization)领域。研究者利用该数据集进行分布微调(Distribution Fine-Tuning, DFT)实验,通过配对AI改写文本与真实人类写作样本,训练模型学习如何将机器输出的刻板、冗余或模式化的语言特征转化为更自然、多样的表达。该数据集特别适合训练轻量级的LoRA适配器,在保持事实准确性和格式完整性的前提下,显著降低文本中可被检测系统识别的AI特征,为文本去机械化研究提供了高质量的基准训练资源。
解决学术问题
该数据集直面人工智能写作中一个核心矛盾:如何在不牺牲信息保真度和结构严谨性的前提下,消除AI文本特有的语言痕迹。传统方法往往依赖启发式规则或后处理过滤,效果有限且易破坏原始内容。humanizer-artifacts通过逆数据设计(Inverse Data Design),即使用真实人类撰写的学术论文、文学著作和百科全书条目作为参照,系统地解决了模型输出与人类自然写作之间的风格差距。这一范式推动了文本生成领域从简单的‘检测-规避’对抗向更加根本的‘分布对齐’方法论转变,为评估和改进AI文本的自然度提供了可量化、可复现的基准,深刻影响了文本质量评估与生成真实性研究的学术路径。
衍生相关工作
围绕humanizer-artifacts数据集核心理念,衍生出一系列开创性研究工作。最直接的继承是Rosmine报告的分布微调(DFT)框架,该工作首次系统地将残差加权思想引入文本风格迁移,通过比较模型输出与人类参照在n-gram、嵌入分布及自BLEU等指标上的差异,实现了对生成文本的细粒度优化。OpenPangram检测器的出现则为评估文本人性化效果提供了第三方评分工具,其基于RoBERTa-large架构的编辑透镜模型可以量化文本中残留的AI特征,促使研究者建立更严格的过滤标准。此外,该数据集驱动的跨领域语料库构建方法——整合arXiv学术论文、Gutenberg文学作品和Wikipedia百科全书条目——为多源、多风格的真实文本生成与评估设立了新范式,启发了后续在数学证明、法律文书等专业领域的文本人性化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务