OpAI-Bench
收藏资源简介:
OpAI-Bench是由穆罕默德·本·扎耶德人工智能大学团队构建的渐进式人机协同文本编辑基准数据集,旨在研究多粒度AI文本检测问题。该数据集包含来自学生论文、新闻文章、政府报告和科学摘要四个领域的15,722篇源文档,通过累积编辑轨迹生成279,794个版本化样本,平均每文档19.3句、426.1个词元,完整保留了从纯人类写作到完全AI编辑的渐进转化过程。数据集采用确定性构建方法,通过五种编辑操作(润色、转述、风格重写、压缩、扩展)在九个预设AI覆盖率版本中生成有序修订轨迹,同时提供文档、句子、词元/片段级别的完整作者归属标注。该数据集主要应用于AI文本检测算法的评估与优化,能够系统分析编辑操作类型、领域差异、修订历史等因素对检测性能的影响,为解决现实场景中混合作者身份文本的识别难题提供标准化测试平台。
OpAI-Bench is a progressive human-AI collaborative text editing benchmark dataset developed by the team from Mohamed bin Zayed University of Artificial Intelligence, designed to investigate multi-granularity AI text detection tasks. This dataset contains 15,722 source documents across four domains: student essays, news articles, government reports, and scientific abstracts. It generates 279,794 versioned samples via cumulative editing trajectories, with an average of 19.3 sentences and 426.1 tokens per document, fully preserving the progressive transformation process from purely human-written text to fully AI-edited content. The dataset is constructed via a deterministic approach, generating ordered revision trajectories across nine pre-defined AI coverage levels using five editing operations: polishing, paraphrasing, style rewriting, compression, and expansion. It also provides complete author attribution annotations at the document, sentence, token/segment levels. This dataset is primarily used for the evaluation and optimization of AI text detection algorithms, enabling systematic analysis of the impacts of factors such as editing operation types, domain differences, revision history and other factors on detection performance, and providing a standardized testbed for addressing the challenge of identifying text with mixed author identities in real-world scenarios.
数据集概述
OpAI-Bench 是一个用于评估在渐进式人机协作编辑场景下进行 AI 文本检测的基准测试。它通过操作引导,构建了从纯人类文本逐步过渡到由 AI 编辑的文本的轨迹。
背景与目标
现实世界的写作越来越多地涉及渐进式的人机协作编辑,即:人类初稿可能会经过 AI 助手的润色、改写、压缩、扩写或风格调整等多个轮次。然而,大多数现有的 AI 文本检测基准仅关注静态的端点文本,判断整篇文档是全由人类撰写还是全由 AI 生成。OpAI-Bench 通过构建操作引导的人到 AI 的修订轨迹来弥补这一不足。
核心方法:累积修订轨迹
OpAI-Bench 将 AI 辅助写作视为一个渐进式的修订轨迹,而非单一的端点分类。
- 9个有序版本:每篇文档从
v0(纯人类撰写) 逐步扩展到v8(全 AI 编辑)。 - 受控的 AI 覆盖率:后续版本在预定义的句子比例上引入 AI 编辑。
- 确定性选择:被编辑的句子是依据文档 ID 为种子生成的固定随机顺序来确定的。
- 累积性编辑:一旦某个句子被选中进行 AI 编辑,它将在后续的所有版本中保持被编辑状态。
- 多粒度溯源:在文档、句子、Token 和片段层面追踪 AI 的参与程度。
版本与操作对应关系:
| 版本 | 编辑操作 | AI 句子覆盖率 |
|---|---|---|
v0 |
无 | 0% |
v1 |
润色 | 15% |
v2 |
改写 | 25% |
v3 |
风格重写 | 40% |
v4 |
压缩 | 50% |
v5 |
扩写 | 60% |
v6 |
风格重写 | 75% |
v7 |
改写 | 90% |
v8 |
润色 | 100% |
数据集规模与统计
OpAI-Bench 包含 15,722 篇人类撰写的源文档,扩展为 31,089 条特定生成器的修订轨迹,以及 279,794 个版本化样本,涵盖四个写作领域。
| 领域 | 源文档 (v0) | 修订轨迹 | 版本化样本 (v0–v8) | 平均句子数 | 平均Token数 |
|---|---|---|---|---|---|
| 学生论文 | 3,969 | 7,906 | 71,154 | 21.0 | 398.8 |
| 新闻文章 | 3,998 | 7,892 | 71,028 | 24.0 | 491.3 |
| 政府报告 | 3,993 | 8,000 | 72,000 | 20.6 | 563.7 |
| 科学摘要 | 3,762 | 7,291 | 65,612 | 11.0 | 234.3 |
| 总计 | 15,722 | 31,089 | 279,794 | 19.3 | 426.1 |
评估方法
OpAI-Bench 支持在文档、句子、Token 和片段粒度上进行评估,涵盖三种评估范式:
- 零样本检测器:在未接触 OpAI-Bench 的情况下评估。
- LLM作为检测器基线:通过提示来分类句子级作者身份。
- OpAI-Bench训练检测器:在训练集上微调,并在分布内和保留生成器上评估。
评估的检测器系列:
- 文档级:Desklib, DetectLLM, E5-Small, Fast-DetectGPT, OOD-LLM-Detect, RADAR, RoBERTa-OpenAI, GigaCheck
- 句子级:AdaLoc, GenAI-Sentence, GL-CLiC, SeqXGPT, GPT-5.4, Gemini 3 Flash, Claude Haiku 4.5
- Token / 片段级:DAMASHA, GigaCheck
主要发现
OpAI-Bench 揭示,AI 文本的可检测性并非随着 AI 覆盖率的增加而单调递增。混合作者身份的中间版本(特别是在 v4 版本,50% AI 覆盖率与压缩操作结合时)比纯人类或强 AI 编辑的端点文本更难检测。这强调了可靠的 AI 文本检测需要转向轨迹感知和操作感知的评估方法。
获取数据集
- 数据集页面:🤗 Dataset - OpAI-Bench
- 论文地址:arXiv Paper
- 许可证:Apache-2.0

- 1Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection穆罕默德·本·扎耶德人工智能大学; 伦敦大学学院 · 2026年



