遇见数据集

AITDNA

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

AITDNA(AI-generated Text Detection: Notion-Agnostic)是一个用于AI生成文本检测的数据集,旨在支持论文《Your AI Text is not Mine: Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions》的研究。该数据集收集了来自用户研究的人机交互文本数据,完整记录了每篇文本的创作过程,包括原始用户编辑、模型建议和用户查询等信息。其核心特点是提供了多种基于不同AI生成文本定义(notions)的数据表示,包括文档级(基于词元比例)、句子级、词元级、边界级(最优分割)、片段级(字符级作者归属)、意图基于(基于用户查询规则)、内容基于(基于模型输出规则)和成员基于(基于N-gram在参考语料中的出现)。数据集包含9个配置,每个配置对应一种表示,其中original配置为原始编辑数据,其他配置为处理后的结构化数据。每个样本均以JSON格式存储,包含data(文本片段列表,每个片段有文本内容、作者和查询)和metadata(作者、是否为纯人工文本、模型名称、温度参数、设置和任务类型)两部分。数据集规模为362个样本(测试集),语言为英语,适用于评估和开发在不同现实假设下的AI生成文本检测模型。数据通过用户研究收集,参与者撰写了论证性、创意性和说明性文本,并已进行匿名化处理以保护隐私。

AITDNA (AI-generated Text Detection: Notion-Agnostic) is a dataset for AI-generated text detection, designed to support the research in the paper Your AI Text is not Mine: Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions. It collects human-AI interaction text data from user studies, fully documenting the creation process of each text, including original user edits, model suggestions, and user queries. The datasets core feature is providing multiple data representations based on different notions of AI-generated text, including document-level (based on token proportion), sentence-level, token-level, boundary-level (optimal segmentation), segment-level (character-level author attribution), intention-based (based on user query rules), content-based (based on model output rules), and membership-based (based on N-gram occurrence in reference corpora). The dataset includes 9 configurations, each corresponding to a representation, with the original configuration as raw edit data and others as processed structured data. Each sample is stored in JSON format, containing data (a list of text segments, each with text content, author, and query) and metadata (author, whether it is purely human text, model name, temperature parameter, settings, and task type). The dataset size is 362 samples (test set), the language is English, and it is suitable for evaluating and developing AI-generated text detection models under various realistic assumptions. Data was collected through user studies where participants wrote argumentative, creative, and expository texts, and has been anonymized to protect privacy.

创建时间:
2026-05-26
原始信息汇总

数据集概述:AITDNA(AI生成文本检测:概念无关)

数据集名称: AITDNA (AI-generated Text Detection: Notion-Agnostic)
语言: 英语
许可证: cc-by-sa-4.0(注:README中另标注gpl-2.0,以YAML定义为准)
配置数量: 9个(original、boundary、content、document、intent、membership、sentence、span、token)
默认配置: original
规模: 所有配置的每个split均含362个样本(n<1K)
仓库地址: https://github.com/UKPLab/arxiv2026-aitdna

数据集描述

AITDNA通过一系列用户研究收集人机交互数据,旨在为AI生成文本检测提供多种视角(概念)。数据集包含每个文本的完整创建信息(原始用户编辑、模型建议、用户查询等),并针对不同检测任务提供了多种标注层次。

配置(概念/Notions)

配置名称 标注粒度 说明 测试集大小(字节)
original - 原始用户编辑数据(JSON格式) 37,230,508
document 文档级 如果≥50%的token由AI生成,则标记为AI 980,943
sentence 句子级 如果≥50%的token由AI生成,则标记该句子为AI 1,227,927
token token级 每个token的归属标签 5,688,232
boundary 片段级 将文本分为N个最优分割部分(默认N=5) 1,028,554
span 跨度级 字符级别的相同作者连续片段 1,262,577
intent 意图级 基于用户查询类型规则(允许/禁止)的句子级标签 1,181,744
content 内容级 基于模型输出类型规则(允许/禁止)的句子级标签 1,206,051
membership 成员级 基于N-gram在人类参考语料库中出现情况的token级标签(默认N=2) 4,687,493

数据结构

通用结构(以sentence配置为例)

每个样本包含两个主要部分:datametadata

  • data:列表,每个元素包含:
    • text(字符串):文本片段
    • author(字符串):作者(User或Bot)
    • queries(字符串列表):用户查询(如有)
  • metadata:结构体,包含:
    • author(字符串):参与者化名
    • human_only(布尔):是否纯人类撰写
    • model(字符串):使用的AI模型(如gpt-5.2)
    • temperature(浮点数):生成温度
    • setting(字符串):实验设置(如standard)
    • task(字符串):写作任务类型(如Argumentative Writing)

original配置的数据结构

  • data:列表,每个元素为JSON对象,包含:
    • iddocumentIdoffsetoperationType(字符串,如insert)、spantextattributescreatedAtorderuser
  • metadata:与上述相同

数据来源与创建

  • 数据收集:通过用户研究收集,参与者包括学生、博士生和Prolific平台人员。每人撰写四篇文本:三篇借助LLM(论证、创意、说明各一),一篇纯人类撰写(类型重复前述之一)。
  • 任务主题:论证类和创意类文本提供两个选题供选择。
  • 隐私处理:已匿名化,用户名无对应真实姓名,无个人信息发布。

下载与使用

  • 总下载大小(所有配置总和):约254MB(original配置占254,075,203字节,其余配置共约30MB)
  • 使用示例(Python): python from datasets import load_dataset ds = load_dataset("UKPLab/AITDNA", name="sentence", split="test")

联系信息

marina.sakharova@stud.tu-darmstadt.de

搜集汇总
数据集介绍
AITDNA 数据集图片
构建方式
AITDNA数据集通过精心设计的用户研究收集而成,招募了学生、博士生及Prolific平台参与者。每位受试者需撰写四篇文本,其中三篇借助大语言模型完成,分别涵盖议论文、创意写作与说明文三种体裁,另有一篇为纯人工撰写的对照文本。议论文与创意写作为受试者提供了两个可选主题。数据采集过程完整记录了人类与AI的交互细节,包括原始用户编辑、模型建议及用户查询等信息,最终以匿名化形式发布,确保不泄露任何个人身份信息。
特点
该数据集最显著的特点在于其多维度注释体系,围绕“AI生成文本”这一概念提供了八种不同的定义视角:文档级、句子级、词元级、边界级、跨度级、意图级、内容级和成员级标签。每个样本均附带详尽的元数据,涵盖作者、模型、温度参数、任务类型及写作环境等信息。此外,数据集中还包含了原始编辑历史数据,为研究人类与AI协作创作过程提供了丰富的细粒度资源。
使用方法
用户可通过HuggingFace的datasets库便捷加载AITDNA,指定配置名称即可选择不同注释版本的子集,例如load_dataset("UKPLab/AITDNA", name="sentence", split="test")。每个样本包含data与metadata两个字段,其中data列表中的每个元素记录了文本片段、作者及查询信息,而metadata则存储了全局属性。研究者可根据特定任务需求灵活选用文档级、句子级或词元级等不同粒度的标签进行模型训练或评估。
背景与挑战
背景概述
AITDNA(AI-generated Text Detection: Notion-Agnostic)数据集由德国达姆施塔特工业大学UKP Lab的研究团队创建,旨在重新定义并评估现实场景下AI生成文本的检测任务。该数据集于2026年发布,通过精心设计的用户研究收集了人-机协同写作过程中的完整交互信息,包括原始编辑记录、模型建议及用户查询等。核心研究问题在于突破传统仅基于文本内容的检测范式,提出基于不同“概念”(如句子级、令牌级、意图级等)的多层次标注框架。目前包含了八个概念配置,覆盖从粒度的字符级到语义的意图级标注。该数据集为AI文本检测领域提供了更加贴近实际应用场景的基准,对于推动人机内容边界界定、版权归属分析及信息真实性评估具有重要学术价值与应用意义。
当前挑战
AITDNA数据集面临的核心挑战在于解决AI生成文本检测领域长期存在的概念模糊与评估不统一问题。传统检测方法通常以简单的二分类(人类vs.机器)为目标,但在现实人机协作写作中,文本往往是逐步编辑、混合创作的结果,使得“AI生成”本身成为一个难以精确定义的连续概念。该数据集为此提出了八种不同粒度和维度的标注概念,如边界级、跨度级、会员度级等,但这也带来了新的挑战:如何在不同概念间建立一致的评价标准?此外,数据集构建过程中,需要通过用户研究模拟真实创作环境,同时确保数据涵盖多种写作任务(议论文、创意文、说明文)和LLM参数设置,并在不泄露隐私的前提下提供详细的元数据(如模型类型、温度参数等),这对数据收集流程的规范性、样本多样性及匿名化处理均提出了较高要求。
常用场景
经典使用场景
AITDNA数据集专为细粒度AI生成文本检测任务而设计,其核心价值在于突破传统二元分类(完全由AI生成或完全由人类撰写)的局限,从多维度重新定义文本的“AI属性”。该数据集支持九种不同的标注粒度,包括文档级、句子级、词元级、边界级、跨度级、意图级、内容级、成员级以及原始编辑级。研究人员可基于这些精细标注,在文本中准确区分人类与AI的创作贡献,进而训练出能够在混合创作场景下识别AI生成成分的检测模型。这种多粒度、多视角的数据结构使其成为探索AI与人类协作写作模式下文本归属分析的理想基准。
实际应用
在实际应用中,AITDNA的数据结构直接服务于教育领域的学术诚信评估、内容平台的原创性审核以及新闻出版行业的真实性验证。例如,教育机构可利用其句子级或跨度级标注,精准识别学生在论文中是否过度依赖AI进行局部修改;内容创作平台可基于意图级或内容级规则,区分合理AI辅助(如语法修正)与不当代写行为。此外,其原始编辑链数据能还原文本的完整创作过程,为审计系统提供透明、可追溯的生成历史,从而在学术评审、专利申请等严肃场景中建立可信的AI使用界限。
衍生相关工作
基于AITDATA数据集,衍生出一系列推动AI生成文本检测领域发展的经典工作。核心贡献包括提出了“作者身份不可知”检测范式,挑战了传统基于模型指纹或统计特征的检测方法,促使研究者转向人机交互过程建模。后续工作围绕其多粒度标注体系,发展了跨粒度检测模型,如能够同时输出文档级与词元级预测结果的联合架构。还催生了针对特定AI定义(如意图级与内容级)的规则优化研究,以及利用成员级信息改进N-gram基准的增强方法。这些衍生工作共同构建了更全面、更严谨的AI生成文本检测评估生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务