遇见数据集

cc-re-2020-stat-train

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是一个尚在开发中的快速检测器数据集(Fastdetector dataset),目前仍在等待统计信息生成。数据集包含多个分片(shard_0至shard_13),每个分片仅有一个训练集分割,样本数约9700至9900条。每条样本包含以下字段:原始文本(original)、多轮对话提示(prompt,包含对话轮次列表、是否多轮标记、示例和元数据)、两个候选响应(response_0和response_1)、生成这些响应的模型信息(generator_model和generation_params)、最终响应(final_response),以及三个相似度指标(Jaccard相似度jaccard_1和jaccard_2、Levenshtein距离levenshtein、余弦距离cosdist)。该数据集可用于文本生成评估、模型响应比较、生成文本质量检测等任务,尤其适合需要多轮对话上下文和多种相似度度量的场景。

This dataset is a fast detector dataset under development, currently awaiting statistics generation. It contains multiple shards (shard_0 to shard_13), each with only a training set split, with approximately 9700 to 9900 samples per shard. Each sample includes the following fields: original text (original), multi-turn dialogue prompt (prompt, containing dialogue turn list, multi-turn flag, examples, and metadata), two candidate responses (response_0 and response_1), model information for generating these responses (generator_model and generation_params), final response (final_response), and three similarity metrics (Jaccard similarity jaccard_1 and jaccard_2, Levenshtein distance levenshtein, cosine distance cosdist). This dataset can be used for tasks such as text generation evaluation, model response comparison, and generated text quality detection, especially suitable for scenarios requiring multi-turn dialogue context and multiple similarity measures.

创建时间:
2026-09-06
原始信息汇总

数据集概述:cc-re-2020-stat-train

基本信息

  • 数据集名称G-reen/cc-re-2020-stat-train
  • 类型:自动生成的FastDetector数据集
  • 总数据规模:94,432行,数据分14个shard(shard_0至shard_13),每个shard包含约9,700–9,900个训练样本,平均每shard约120–143MB。

任务目的

用于AI生成文本检测。数据包含人类原始文本与AI生成响应,通过多种相似度指标与检测器结果,支持评估与训练检测模型。

数据字段说明

每条记录包含:

  • 原始文本original(人工撰写)
  • 提示信息prompt,内含多轮对话turns、是否多轮、元数据(PROMPT_TYPE)
  • 模型响应response_0response_1final_response(AI生成)
  • 生成模型信息generator_model与生成参数generation_params
  • 文本相似度指标:Jaccard相似度(两个版本)、Levenshtein距离、余弦距离(cosdist)
  • 检测器评分:基于EditLens Roberta-Large的评分与分桶,分别针对原始文本和最终响应

包含子集

  • 提示(Prompt)子集类型:4类:直接引用(direct_reference)、间接引用(indirect_reference)、修订(revise)、重写(rewrite)
  • 生成模型配置:12种组合,涵盖DeepSeek、Llama、Mistral、Qwen、gemma、granite等多个模型的变体,温度参数范围0.6至1.25
  • 检测器分类器:共13个,实际应用2个(EditLens Roberta-Large Score与Bucket),其余(困惑度、熵、Top-p、Top-k、FastDetectGPT、Binoculars等)在此数据集中被跳过

划分与过滤

  • 数据划分:总数94,432行;其中用于评估的为84,988行,另有9,444行用于验证(约10%验证比例)
  • 过滤条件:保留cosdist ≥ 0.03softngram ≥ 0.06的样本

检测结果亮点

  • 最佳分类器:EditLens Roberta-Large Score,AUROC达到0.9542,阈值0.6034,TPR 0.5827,FPR 0.0051,准确率0.7888,F1 0.7340
  • 最难的提示子集:rewrite,TPR仅0.4077
  • 最难的生成模型配置:Ornith-1.5-35B-A3B-NVFP4(Temp: 0.6),TPR为0.5976
搜集汇总
数据集介绍
cc-re-2020-stat-train 数据集图片
构建方式
该数据集源自自动生成的FastDetector检测框架,旨在捕捉2020年Common Crawl语料中人类与机器生成文本的细微差异。构建过程融合了多元提示子集,涵盖直接引用、间接引用、修订与重写等场景,并结合11种不同配置的开源大语言模型生成响应,以模拟真实世界中的AI改写行为。每条样本记录了原始人类文本、模型响应及详尽的生成参数,并附加了基于EditLens、Jaccard距离、余弦距离等多种统计量的评估指标,从而形成多维度的特征空间。数据被划分为14个分片,总计108,377行,其中90%用于评估,10%用于验证,确保模型检测能力的稳健性评估。
特点
该数据集的核心特色在于其丰富的标注体系和多维度的相似度评估。不仅提供了原始文本与生成响应的字符级编辑距离(Levenshtein)和分词级Jaccard指数,还引入了基于RoBERTa-Large的EditLens分数与分桶,用以精细刻画文本的编辑复杂度。此外,通过多个生成模型(如Llama-3.3、Mistral-Small等)在不同温度参数下的产出,数据集能够覆盖多样化的写作风格与改写策略,从而支持对检测算法泛化能力的深入探索。特别地,数据集中区分了‘原始’(人类撰写)与‘最终响应’(AI生成)列,为监督学习提供了清晰的目标标签。
使用方法
该数据集专为训练和评估AI文本检测器而设计。用户可直接将其用于监督学习任务,以‘original’列作为人类基准,以‘final_response’列作为AI生成样本,利用预计算的EditLens分数、Jaccard相似度等特征进行模型训练。鉴于数据已按提示类型和生成模型进行分片,研究人员可针对特定场景(如重写文本)定制训练子集,或评估不同生成策略下的检测鲁棒性。此外,数据集的HuggingFace结构支持便捷的加载与批处理,适合快速构建端到端的文本鉴别流水线。对于需要验证新指标的实验,该数据集提供了丰富的基线评估结果,可作参考基准。
背景与挑战
背景概述
该数据集由G-reen团队创建,名为cc-re-2020-stat-train,旨在系统性评估和检测大语言模型生成文本的自动化工具。数据集源于2020年Common Crawl语料库,通过多种生成模型(如Llama、Mistral等)和提示策略(如直接引用、间接引用、修改、重写)构建,包含超过十万个样本,涵盖人类原始文本与对应的AI改写版本。其核心研究问题是文本生成检测的鲁棒性和泛化能力,特别关注不同模型、温度参数及提示类型对检测性能的影响。该数据集为FastDetector项目的一部分,推动了基于编辑距离、困惑度等特征的检测器基准研究,对AI内容识别领域具有重要的参考价值。
当前挑战
该数据集面临的挑战包括:其一,领域内根本性难题——检测AI生成文本的泛化性,因为不同生成模型(如Ornith-1.5-35B)和提示类型(如重写)下,检测器的AUROC波动显著,最差的提示子集TPR仅0.24,表明对语义改写和低温度生成的内容难以准确识别。其二,构建过程中的挑战——需消除生成模型间的偏差,如过滤特定模型(DeepSeek)以避免数据泄露;同时,处理多源异构数据的标准化,包括文本长度、编辑距离等指标的异常值(如最大编辑距离达178023),以及缺失值的处理,均增加了数据集构建的复杂性。此外,评价指标的稳定性也构成挑战,部分分类器(如Perplexity等)因性能问题被跳过,凸显了特征选择和计算的难度。
常用场景
经典使用场景
该数据集主要用于文本生成领域的机器生成文本检测(Machine-Generated Text Detection)研究,是构建和评估检测器性能的核心资源。它汇聚了源自2020年Common Crawl语料库的人类撰写文本,并经由多种先进大语言模型在不同温度和提示策略下改写,从而形成规模宏大的双语对照样本库。研究者可基于此数据集训练、验证和测试各类检测算法,尤其是针对近年来快速演进的神经文本生成模型,探索在分布内和分布外场景下识别AI痕迹的有效途径。其结构化的字段设计为不同实验配置(如不同生成器、提示子集)提供了分层评估的可能。
衍生相关工作
围绕该数据集的构建与评测,衍生出了一系列相关研究工作。其本身作为FastDetector流程的产物,催生了对检测器评估框架的深入探讨,如如何设计公平的评测指标(AUROC、TPR等)和跨场景的验证方案。基于其揭示的难点——诸如rewrite提示子集和Ornith模型生成的低检测率文本——激发了针对对抗性改写和低熵文本检测新方法的研究,例如引入更精细的编辑轨迹分析或训练专用的鲁棒检测分类器。数据集中暴露的EditLens Roberta-Large评分与编辑距离等统计特征的相关性,也促进了无监督或弱监督检测信号的研究,进而影响到探测大模型水印、追踪内容溯源等多个新兴方向,形成从数据构建到检测性能剖析再到新型防御机制设计的完整研究链条。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型生成文本的机器检测前沿,针对AI文本难以与人类写作区分的痛点,构建了涵盖多种指令类型与生成配置的大规模语料。其最新研究方向在于利用编辑距离等细粒度特征及EditLens等深度分类器,提升检测的泛化能力与鲁棒性,尤其在面对重写等隐蔽性改写攻击时,探索更为精准的鉴别策略。该工作为防范AI内容滥用、维护信息真实性提供了关键评估基准,对推动检测技术从实验室迈向实际应用具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务