遇见数据集

OpAI-Bench

收藏
github2026-06-06 更新2026-06-08 收录
官方服务:

资源简介:

OpAI-Bench是一个用于评估渐进式人机协同编辑下AI文本检测的基准,其中AI修订逐步引入人类撰写文档的选定部分,并通过文档、句子、标记和跨度的来源进行跟踪。它通过构建操作引导的人到AI修订轨迹来扩展样本,每个样本从人类编写的源文档开始,扩展为从v0到v8的九个版本轨迹,AI编辑覆盖率逐步增加,同时应用不同的编辑操作。

OpAI-Bench is a benchmark for evaluating AI text detection under progressive human-AI collaborative editing. AI revisions in this benchmark gradually introduce selected segments of human-written documents, with their source origins tracked at the document, sentence, token, and span granularities. It expands the dataset samples by constructing operation-guided human-to-AI revision trajectories: each sample starts from a human-written source document and evolves into nine version trajectories ranging from v0 to v8, where the AI editing coverage increases progressively while a variety of editing operations are utilized.

创建时间:
2026-06-05
原始信息汇总

OpAI-Bench 数据集详情

数据集概述

OpAI-Bench(Operation-Guided Progressive Human-to-AI Text Transformation Benchmark)是一个用于评估渐进式人机协同编辑场景下AI文本检测能力的基准数据集。其核心设计是构建操作引导的人到AI文本转换轨迹,从纯人类撰写的源文档开始,通过多轮AI编辑操作逐步生成混合文本,并追踪文档级、句子级、词元级和跨度级的来源信息。

核心特性

  • 渐进式版本轨迹:每个文档从 v0 到 v8 共9个版本,AI覆盖率逐步增加。
  • 确定性选择机制:基于文档标识符的固定随机顺序选择句子进行编辑,确保可复现性。
  • 累积编辑:一旦句子被选中编辑,在后续版本中持续保留在AI编辑集合中。
  • 多粒度标注:支持文档级、句子级、词元级和跨度级的AI参与追踪。
  • 五种编辑操作:润色(Polish)、释义(Paraphrase)、风格改写(Style rewrite)、压缩(Compress)、扩写(Expand)。

累积修订轨迹

版本 编辑操作 AI句子覆盖率
v0 0%
v1 润色 15%
v2 释义 25%
v3 风格改写 40%
v4 压缩 50%
v5 扩写 60%
v6 风格改写 75%
v7 释义 90%
v8 润色 100%

数据集统计

领域 源文档(v0) 修订轨迹 版本化样本(v0–v8) 平均句子数 平均Token数
学生论文 3,969 7,906 71,154 21.0 398.8
新闻文章 3,998 7,892 71,028 24.0 491.3
政府报告 3,993 8,000 72,000 20.6 563.7
科学摘要 3,762 7,291 65,612 11.0 234.3
总计 15,722 31,089 279,794 19.3 426.1

注释:源文档为独立的纯人类撰写v0文本。修订轨迹是以v0为初始文本的生模型特定的编辑序列。版本化样本统计了从v0到v8完整修订路径中的发布文本数量。

生模型信息

主要基准分割使用 GPT-5.4GPT-5.4-nanoGemini 2.5 FlashQwen3-8B 作为留出生模型,用于跨生模型评估。

评估粒度与检测器

粒度 检测器
文档级 Desklib, DetectLLM, E5-Small, Fast-DetectGPT, OOD-LLM-Detect, RADAR, RoBERTa-OpenAI, GigaCheck
句子级 AdaLoc, GenAI-Sentence, GL-CLiC, SeqXGPT, GPT-5.4, Gemini 3 Flash, Claude Haiku 4.5
词元/跨度级 DAMASHA, GigaCheck

评估指标包括准确率AI类F1分数,按版本、领域、生模型和编辑操作分别报告。

关键发现

OpAI-Bench揭示出AI文本可检测性与AI覆盖率并非单调关系。混合作者的中等版本(特别是v4版本,50% AI覆盖率结合压缩操作)比纯人类文本和高度AI编辑的端点文本更难检测。这要求AI文本检测超越静态的人vs.AI端点分类,转向轨迹感知操作感知的评估。

数据访问与使用

  • 主页:https://github.com/VILA-Lab/OpAI-Bench
  • 论文:https://arxiv.org/abs/2606.06481
  • 数据集:https://huggingface.co/datasets/OpAI-Bench1/OpAI-Bench
  • 许可证:Apache-2.0

引用

bibtex @article{bsharat2026opaibench, title = {Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection}, author = {Bsharat, Sondos Mahmoud and Liu, Jiacheng and Zhao, Xiaohan and Yao, Tianjun and Shang, Xinyi and Tang, Yi and Cui, Jiacheng and Elhagry, Ahmed and Al Khatib, Salwa K. and Li, Hao and Khan, Salman and Shen, Zhiqiang}, journal = {arXiv preprint arXiv:XXXX.XXXXX}, year = {2026} }

搜集汇总
数据集介绍
OpAI-Bench 数据集图片
构建方式
OpAI-Bench的构建始于从学生论文、新闻文章、政府报告和科学摘要四个领域收集的15,722篇纯人工撰写文档,每篇文档被划分为句子序列,并以文档标识符为种子生成确定性打乱顺序。在从v0到v8的九个版本轨迹中,每个后续版本根据预设的句子级AI覆盖率(从15%递增至100%),从打乱顺序中累积选取前k%的句子,分别应用润色、释义、风格重写、压缩、扩展五种编辑操作生成AI修订版本,最终形成31,089条生成器特异性轨迹和279,794个带版本标记的样本。
特点
该数据集的核心特点在于其操作引导的渐进式人机共编范式,揭示了AI文本可检测性与AI覆盖率之间的非单调关系——在约50%AI覆盖率且伴随压缩操作的混合作者阶段(如v4版本),检测难度反而高于完全人工或高度AI编辑的端点文本。数据集追踪文档、句子、令牌和跨度四层级作者归属信息,支持多粒度检测评估,并预留Qwen3-8B作为跨生成器评估的保留模型,实现了从静态端点分类向轨迹感知与操作感知评估的范式转换。
使用方法
用户可通过Hugging Face Datasets库直接加载数据集(load_dataset("OpAI-Bench1/OpAI-Bench"))并导出为CSV格式。数据集提供基于Hydra配置的评估框架,支持在文档、句子、令牌、跨度粒度上对零样本检测器、LLM作为检测器基线以及基于训练集微调的检测器进行评测,可指定dev/test拆分、检测器类型(如e5-small、fast-detectgpt等)和采样数量。用户也可通过construction/build_opaibench.py脚本在自定义输入上生成新的修订轨迹,适配OpenAI、Gemini、DeepSeek等多种LLM提供商。
背景与挑战
背景概述
在人机协作日益成为主流的当下,文本创作正经历从纯粹的人类书写向渐进式人机协同编辑的深刻转变。为精准捕捉这一复杂生成过程中的多粒度作者归属特征,由 Mohamed bin Zayed University of Artificial Intelligence 等机构的研究者于2026年构建了 OpAI-Bench 基准数据集。该数据集创新性地设计了从完全人工撰写(v0)到完全人工智能编辑(v8)的九阶段渐进式转化轨迹,涵盖润色、释义、压缩等五种编辑操作,横跨学生作文、新闻等四大领域,累计包含约28万个版本化样本。OpAI-Bench 的核心研究问题在于探索混合作者文本中人工智能信号的涌现与消匿规律,其系统性设计为多粒度检测提供了标准化评估平台,显著推动了该领域的范式转变。
当前挑战
OpAI-Bench 所直面的领域核心挑战在于:传统的静态端点分类已无法胜任混合作者文本的鉴别任务,尤其是当人工智能覆盖率处于中等级别(如v4、50%覆盖率)且伴随压缩操作时,文本的可检测性呈现出非单调性,甚至比纯人工文本更难识别。在构建过程中,研究者需克服两大技术难题:一是如何确保每次编辑操作的精确执行与句式结构的自然保留,二是如何实现跨版本、跨生成器、跨领域的大规模文本轨迹的可复现性。此外,针对不同检测粒度(文档、句子、词元、跨度)的标注一致性,以及对未见生成器(如Qwen3-8B)的泛化评估,进一步增加了基准的构建复杂度与评价难度。
常用场景
经典使用场景
在自然语言处理与AI文本检测领域,OpAI-Bench基准数据集的核心经典使用场景在于评估检测器对渐进式人机协同编辑文本的识别能力。与仅处理静态全人工或全AI生成文本的传统基准不同,该数据集构建了从完全人工写作文本到逐步引入AI修改的九阶段版本轨迹(v0至v8),覆盖润色、释义、风格改写、压缩与扩展五种编辑操作。研究者可利用该数据集在文档级、句子级、词元级及跨度级四个粒度上,系统性地评测检测模型如何在不同AI覆盖率与编辑类型下感知作者身份信号的涌现与演变,从而更真实地模拟现代写作环境中文本产生的动态过程。
实际应用
在实际应用层面,OpAI-Bench所支撑的检测能力直接服务于愈发普遍的人机协作写作场景,包括学术诚信审查、新闻内容真实性验证、政府报告自动化审核及科学文献原创性评估。例如,在教育领域,评估学生论文中AI辅助润色与人工原创内容的边界,可帮助教学系统更公平地判断学术贡献;在新闻领域,可追踪一篇报道从记者初稿到AI修改的完整编辑链,辅助事实核查与来源追踪。该基准支持零样本检测器、大模型引导检测器以及在训练集上微调的专用模型,为不同部署条件下的实际系统选型提供了可复现的评测框架与基线性能参考。
衍生相关工作
围绕OpAI-Bench数据集的构建理念与实验发现,已催生了一系列方向性的衍生研究工作。其一,轨迹感知型检测器,旨在显式建模版本之间的编辑演化路径,而非仅对待检测文本进行孤立分类;其二,操作感知型检测方法,研究不同编辑操作(如压缩与扩展)对AI特征足迹的差异化影响,并据此设计更鲁棒的识别算法。此外,该基准为多粒度检测统一框架的提出奠定了基础,推动诸如GigaCheck与DAMASHA等方法在文档、句子、词元、跨度四个层次上实现联合判别。其公开的构建管线与代码仓库还鼓励社区贡献新的大模型生成器与跨域扩展版本,进一步延伸了其在开放环境下的评测与适应研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务