遇见数据集

OpAI-Bench

收藏
arXiv2026-06-05 更新2026-06-08 收录
官方服务:

资源简介:

OpAI-Bench是由穆罕默德·本·扎耶德人工智能大学团队构建的渐进式人机协同文本编辑基准数据集,旨在研究多粒度AI文本检测问题。该数据集包含来自学生论文、新闻文章、政府报告和科学摘要四个领域的15,722篇源文档,通过累积编辑轨迹生成279,794个版本化样本,平均每文档19.3句、426.1个词元,完整保留了从纯人类写作到完全AI编辑的渐进转化过程。数据集采用确定性构建方法,通过五种编辑操作(润色、转述、风格重写、压缩、扩展)在九个预设AI覆盖率版本中生成有序修订轨迹,同时提供文档、句子、词元/片段级别的完整作者归属标注。该数据集主要应用于AI文本检测算法的评估与优化,能够系统分析编辑操作类型、领域差异、修订历史等因素对检测性能的影响,为解决现实场景中混合作者身份文本的识别难题提供标准化测试平台。

OpAI-Bench is a progressive human-AI collaborative text editing benchmark dataset developed by the team from Mohamed bin Zayed University of Artificial Intelligence, designed to investigate multi-granularity AI text detection tasks. This dataset contains 15,722 source documents across four domains: student essays, news articles, government reports, and scientific abstracts. It generates 279,794 versioned samples via cumulative editing trajectories, with an average of 19.3 sentences and 426.1 tokens per document, fully preserving the progressive transformation process from purely human-written text to fully AI-edited content. The dataset is constructed via a deterministic approach, generating ordered revision trajectories across nine pre-defined AI coverage levels using five editing operations: polishing, paraphrasing, style rewriting, compression, and expansion. It also provides complete author attribution annotations at the document, sentence, token/segment levels. This dataset is primarily used for the evaluation and optimization of AI text detection algorithms, enabling systematic analysis of the impacts of factors such as editing operation types, domain differences, revision history and other factors on detection performance, and providing a standardized testbed for addressing the challenge of identifying text with mixed author identities in real-world scenarios.

创建时间:
2026-06-05
原始信息汇总

数据集概述

OpAI-Bench 是一个用于评估在渐进式人机协作编辑场景下进行 AI 文本检测的基准测试。它通过操作引导,构建了从纯人类文本逐步过渡到由 AI 编辑的文本的轨迹。

背景与目标

现实世界的写作越来越多地涉及渐进式的人机协作编辑,即:人类初稿可能会经过 AI 助手的润色、改写、压缩、扩写或风格调整等多个轮次。然而,大多数现有的 AI 文本检测基准仅关注静态的端点文本,判断整篇文档是全由人类撰写还是全由 AI 生成。OpAI-Bench 通过构建操作引导的人到 AI 的修订轨迹来弥补这一不足。

核心方法:累积修订轨迹

OpAI-Bench 将 AI 辅助写作视为一个渐进式的修订轨迹,而非单一的端点分类。

  • 9个有序版本:每篇文档从 v0(纯人类撰写) 逐步扩展到 v8(全 AI 编辑)。
  • 受控的 AI 覆盖率:后续版本在预定义的句子比例上引入 AI 编辑。
  • 确定性选择:被编辑的句子是依据文档 ID 为种子生成的固定随机顺序来确定的。
  • 累积性编辑:一旦某个句子被选中进行 AI 编辑,它将在后续的所有版本中保持被编辑状态。
  • 多粒度溯源:在文档、句子、Token 和片段层面追踪 AI 的参与程度。

版本与操作对应关系

版本 编辑操作 AI 句子覆盖率
v0 0%
v1 润色 15%
v2 改写 25%
v3 风格重写 40%
v4 压缩 50%
v5 扩写 60%
v6 风格重写 75%
v7 改写 90%
v8 润色 100%

数据集规模与统计

OpAI-Bench 包含 15,722 篇人类撰写的源文档,扩展为 31,089 条特定生成器的修订轨迹,以及 279,794 个版本化样本,涵盖四个写作领域。

领域 源文档 (v0) 修订轨迹 版本化样本 (v0–v8) 平均句子数 平均Token数
学生论文 3,969 7,906 71,154 21.0 398.8
新闻文章 3,998 7,892 71,028 24.0 491.3
政府报告 3,993 8,000 72,000 20.6 563.7
科学摘要 3,762 7,291 65,612 11.0 234.3
总计 15,722 31,089 279,794 19.3 426.1

评估方法

OpAI-Bench 支持在文档、句子、Token 和片段粒度上进行评估,涵盖三种评估范式:

  1. 零样本检测器:在未接触 OpAI-Bench 的情况下评估。
  2. LLM作为检测器基线:通过提示来分类句子级作者身份。
  3. OpAI-Bench训练检测器:在训练集上微调,并在分布内和保留生成器上评估。

评估的检测器系列

  • 文档级:Desklib, DetectLLM, E5-Small, Fast-DetectGPT, OOD-LLM-Detect, RADAR, RoBERTa-OpenAI, GigaCheck
  • 句子级:AdaLoc, GenAI-Sentence, GL-CLiC, SeqXGPT, GPT-5.4, Gemini 3 Flash, Claude Haiku 4.5
  • Token / 片段级:DAMASHA, GigaCheck

主要发现

OpAI-Bench 揭示,AI 文本的可检测性并非随着 AI 覆盖率的增加而单调递增。混合作者身份的中间版本(特别是在 v4 版本,50% AI 覆盖率与压缩操作结合时)比纯人类或强 AI 编辑的端点文本更难检测。这强调了可靠的 AI 文本检测需要转向轨迹感知操作感知的评估方法。

获取数据集

搜集汇总
数据集介绍
OpAI-Bench 数据集图片
构建方式
OpAI-Bench的构建始于从学生作文、新闻文章、政府报告和科学摘要四个领域收集的人类撰写源文档,每篇文档均包含至少十个句子。对于每个源文档,研究团队定义了一个确定性的句子排序,并依据预定义的AI覆盖层级和五种代表性编辑操作(润色、释义、风格重写、压缩和扩展)构建了一个包含九个依次递进版本的修订轨迹。每个后续版本均基于前一版本进行累积性编辑,确保AI覆盖范围从0%单调递增至100%,同时保留文档、句子、词元和片段四个粒度的完整作者归属标注。这一设计使得每条修订轨迹都忠实记录了人类文本如何通过AI编辑逐步转化的过程。
使用方法
OpAI-Bench支持文档级、句子级以及词元/片段级三个粒度的AI文本检测评估。研究者可直接利用数据集提供的多粒度标注对现有检测器进行零样本评估,也可使用训练集对检测器进行微调后评估。数据集涵盖了来自主流前沿语言模型的多种生成器,并提供了固定的训练、开发和测试集划分。通过分析检测器在不同版本、领域和编辑操作下的性能变化,使用者能够系统性地探究AI辅助写作的可检测性何时、如何以及在何种条件下变得可靠,从而推动检测方法从简单的二分类终极判断向轨迹感知与操作感知的方向发展。
背景与挑战
背景概述
随着人工智能写作助手深度融入日常文本创作与修订流程,大量文档已不再是纯粹的人类书写或机器生成,而是人机协同渐进式编辑的产物。然而,现有AI文本检测基准大多聚焦于最终输出,对于AI authorship信号如何在修订过程中涌现、累积或消失缺乏系统性理解。为填补这一空白,穆罕默德·本·扎耶德人工智能大学的研究团队于2026年提出了OpAI-Bench,这是一个以编辑操作为导向的渐进式人机文本转换基准,旨在从文档、句子、词元和片段多个粒度研究AI文本的可检测性。该基准以人类撰写的原始文档为起点,按照预定义的AI覆盖层级和五种代表性编辑操作,为每个样本构建九个依次修订的版本,涵盖学生作文、新闻报道、政府报告和科学摘要四个领域,并保留了完整的创作归属信息。OpAI-Bench为分析渐进式编辑场景下AI辅助写作何时、以何种方式变得可检测提供了受控的实验平台。
当前挑战
OpAI-Bench所应对的核心挑战在于,AI文本的可检测性并非仅由AI编辑内容的比例决定,而是受到编辑操作类型、文本领域和累积修订历史的共同影响。实验表明,混合作者身份的中期版本往往比纯人类文本和高度AI编辑的端点版本更难检测,揭示了现有静态基准所忽视的非单调检测模式。在构建过程中,团队面临的主要挑战包括:如何设计真实的渐进式修订轨迹,确保每个版本在累积编辑的同时保留完整的创作溯源;如何定义并实现五种语义不同的编辑操作(润色、改写、风格转换、压缩和扩展),使其既可区分又保持事实一致性;以及如何在文档、句子、词元和片段四个粒度上精确标注AI编辑区域,为多粒度检测评估提供可靠的金标准。
常用场景
经典使用场景
在AI辅助写作日益融入真实编辑流程的背景下,大量文本不再纯粹由人类或AI独立完成,而是经历了渐进式的人机协同修订。OpAI-Bench作为首个操作引导的渐进式人机文本转换基准,其经典使用场景在于系统性地分析AI作者身份信号在文档从纯人类写作到完全AI编辑的演变过程中如何涌现、累积或消失。通过构建从原始人类文档出发、涵盖九版逐步修订的累计轨迹,并精确控制AI覆盖率和五种典型编辑操作(润色、释义、风格改写、压缩、扩展),该基准为研究多粒度(文档级、句子级、词元级和跨度级)AI文本检测提供了高度模拟现实修订场景的受控测试平台。
解决学术问题
该基准致力于弥合现有AI文本检测基准仅关注最终二元分类的鸿沟,深刻揭示了AI文本可检测性并非仅由AI编辑内容的比例决定,而是显著受编辑操作类型、领域、生成模型以及累积修订历史等多重因素交互影响。实验发现的非单调检测现象——混合作者身份的中间版本往往比纯人类或高度AI编辑的端点更难检测——颠覆了传统认知,为学术界提供了超越静态端点评估的全新研究范式,推动了理解何时、何种编辑操作以及如何导致AI可检测信号出现这一核心科学问题。
实际应用
OpAI-Bench的实际应用场景广泛且具有深远的社会价值。在教育领域,可用于开发更可靠的学术诚信检测工具,精准识别学生论文中经过AI局部润色或扩写的部分,避免误判。在新闻出版和学术评审中,可辅助追溯稿件的渐进式修改痕迹,提升内容透明度和问责制。此外,其多粒度标注特性使得检测系统从粗粒度的文档级判断迈向可解释的细粒度证据定位,有效降低因仅对微小部分进行AI编辑而引发的无根据指控风险。
数据集最近研究
最新研究方向
在人工智能辅助写作日益成为常态的当下,传统的二值化AI文本检测范式正面临根本性挑战。前沿研究聚焦于探索人机协同编辑过程中,AI作者身份信号如何随修改轨迹动态演化。OpAI-Bench作为该领域的代表性基准,突破了静态最终输出评估的局限,通过引入渐进式版本化轨迹与多粒度溯源标注,系统揭示了AI文本可检测性并非由AI覆盖率单一决定,而是深受编辑操作类型、领域特性及累积编辑历史的影响。尤为值得关注的是,混合作者身份的中间版本往往比纯人类或深度AI编辑的端点文本更具检测难度,这种非单调的检测模式颠覆了过往认知。该研究不仅推动了AI文本检测从终点分类向轨迹感知与操作感知范式的转变,还为构建更鲁棒的溯源工具提供了可控的实验平台,对学术诚信、新闻真实性和教育评估等领域具有深远意义。
相关研究论文
  • 1
    Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection穆罕默德·本·扎耶德人工智能大学; 伦敦大学学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务