遇见数据集

cc-2021-stat

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

这是一个自动生成的FastDetector数据集,用于检测机器生成文本。数据集包含多个分片(shard_0至shard_6),每个分片包含约3300-3400个训练样本,总样本约23,700个。每个样本包含原始文本(original)、提示信息(prompt,包括多轮对话、是否使用多轮、示例和元数据)、两个候选响应(response_0, response_1)、最终选定的响应(final_response)、生成响应所使用的模型(generator_model)及其生成参数(generation_params)。此外,样本中还提供了丰富的文本相似度指标和机器生成文本检测指标,包括:Jaccard相似度、Levenshtein距离、n-gram软相似度、余弦距离、BERTScore(精确率、召回率、F1)、MoverScore、重排序器分数、基于RoBERTa-large的编辑距离桶和分数、基于LLaMA指令模型和基础模型的困惑度、熵、top-p异常值、top-k异常值、FastDetectGPT分数,以及Binoculars分数。该数据集适用于训练和评估AI生成文本检测器、文本相似度分析、以及生成模型对比研究。

This is an automatically generated FastDetector dataset for machine-generated text detection. The dataset comprises multiple shards (shard_0 to shard_6), with each shard containing approximately 3,300 to 3,400 training samples, resulting in a total of around 23,700 samples. Each sample contains the original text (original), prompt information (the prompt field includes multi-turn dialogues, whether multi-turn interaction is utilized, examples and metadata), two candidate responses (response_0, response_1), the final selected response (final_response), the model employed for response generation (generator_model) and its corresponding generation parameters (generation_params). Furthermore, the sample provides a comprehensive set of text similarity metrics and machine-generated text detection metrics, including: Jaccard similarity, Levenshtein distance, n-gram soft similarity, cosine distance, BERTScore (precision, recall, F1), MoverScore, re-ranker score, RoBERTa-large-based edit distance buckets and scores, perplexity and entropy calculated using the LLaMA instruction-tuned model and base LLaMA model, top-p outliers, top-k outliers, FastDetectGPT score, and Binoculars score. This dataset is applicable for training and evaluating AI-generated text detectors, conducting text similarity analysis, and performing comparative studies on generative models.

创建时间:
2026-08-01
原始信息汇总

数据集概述:G-reen/cc-2021-stat

数据集基本信息

  • 数据集名称: G-reen/cc-2021-stat
  • 数据集类型: Auto-Generated FastDetector Dataset(自动生成的FastDetector检测数据集)
  • 关联配置文件: config/globals.tomlconfig/analysis.toml

数据组织与规模

该数据集包含 7 个分片(shard),每个分片为一个独立的配置(config_name),每个分片均包含一个 train 分割。数据规模如下:

分片 样本数 数据集大小 下载大小
shard_0 3,395 35,615,546 字节 20,761,327 字节
shard_1 3,378 38,929,535 字节 21,741,495 字节
shard_2 3,410 41,532,150 字节 23,447,357 字节
shard_3 3,358 39,080,718 字节 22,987,320 字节
shard_4 3,371 40,970,441 字节 25,093,989 字节
shard_5 3,373 44,952,609 字节 28,924,292 字节
shard_6 3,431 34,996,260 字节 20,891,789 字节

总计样本数: 约 23,716 条

数据字段说明

每个样本包含以下核心字段:

文本内容字段

  • original: 原始文本(字符串)
  • prompt: 提示信息(结构体),包含 chat_turns(对话轮次列表)、use_multiturn(是否多轮,布尔值)、examples(示例,空值列表)和 metadata(元数据,含 PROMPT_TYPE 提示类型)
  • response_0 / response_1: 两个候选响应(字符串)
  • final_response: 最终响应(字符串)

生成信息字段

  • generator_model: 生成模型名称
  • generation_params: 生成参数

文本相似度指标字段(均为 float64 类型)

  • jaccard_1 / jaccard_2: Jaccard 相似度
  • levenshtein: 莱文斯坦距离
  • softngram: 软 n-gram 相似度
  • cosdist: 余弦距离
  • bertscore_precision / bertscore_recall / bertscore: BERTScore 指标
  • moverscore: MoverScore 指标
  • reranker: 重排序分数

编辑距离检测指标(基于 RoBERTa-large)

  • original_editlens_bucket_roberta_large / original_editlens_score_roberta_large: 原始文本编辑长度相关指标
  • final_response_editlens_bucket_roberta_large / final_response_editlens_score_roberta_large: 最终响应编辑长度相关指标

基于 LLaMA 的检测指标

针对 originalfinal_response 分别计算,涵盖 LLaMA-Instruct 和 LLaMA-Base 两种模型:

  • perplexity: 困惑度
  • entropy: 熵
  • topp_outlier: Top-p 离群值
  • topk_outlier: Top-k 离群值
  • fastdetectgpt: FastDetectGPT 分数

其他检测指标

  • original_binoculars / final_response_binoculars: Binoculars 检测分数

数据用途

该数据集为自动生成的 FastDetector 检测数据集,主要用于训练和评估 AI 生成文本检测模型,涵盖多种文本相似度指标和多模型检测分数,适用于文本生成检测相关的研究与实验场景。

搜集汇总
数据集介绍
cc-2021-stat 数据集图片
构建方式
该数据集源自2021年Common Crawl语料库,经系统化抽样与多维度分析构建而成。每条样本包含原始文本、多轮对话提示、双候选响应及最终响应,并附有生成模型标识与参数。数据按哈希分片为7个独立配置,每个配置约含3400条样本,总数据量逾2.3万条,全面覆盖不同来源的文本片段。
特点
该数据集的最大特色在于其丰富的统计特征与检测指标。除基础文本外,每条样本均配备了Jaccard、Levenshtein、BERTScore、MoverScore等文本相似度度量,以及基于Roberta-large的编辑距离评分、基于Llama系列模型的困惑度、熵、Top-p/Top-k异常值及FastDetectGPT得分,甚至包括Binoculars检测得分,为AI生成文本检测提供了多维度的量化基准。
使用方法
研究者可通过HuggingFace datasets库加载各分片,利用其中原始文本与检测指标训练或评估AI文本检测模型。数据集的提示字段支持多轮对话场景,便于微调对话模型。配合丰富的特征可开展可解释性分析,深入理解不同检测算法的优劣,推动内容鉴别技术的进步。
背景与挑战
背景概述
cc-2021-stat数据集由G-reen团队于2021年构建,旨在应对大规模语言模型生成文本检测的挑战。该数据集包含约23,700个样本,每个样本记录了原始文本、提示词、多个候选响应以及最终的生成响应,并通过一系列指标(如Jaccard相似度、Levenshtein距离、BERTScore等)对生成文本与原始文本的差异进行量化。数据集的创建源于对大语言模型(如LLaMA)生成内容进行自动检测的需求,其核心研究问题在于如何有效区分机器生成文本与人类写作,并评估不同检测方法的效能。该数据集为文本检测领域提供了基准,对后续研究具有重要参考价值。
当前挑战
该数据集面临的挑战主要体现在两个方面。一类是领域核心问题:随着大语言模型生成文本的日益逼真,传统的检测方法难以有效区分,需借助多维度特征(如困惑度、熵、编辑距离等)进行综合分析,但不同模型和方法的表现差异显著,如何选择或融合有效的检测指标成为关键。另一类是数据构建中的难题:构建过程中需确保提示词的多样性和代表性,同时平衡不同生成模型的参数设置,以保证样本的全面性。此外,各分片(shard)的数据分布需保持一致,避免引入偏差,这对数据质量控制和评估结果的可靠性提出了较高要求。
常用场景
经典使用场景
在人工智能与自然语言处理交汇的学术疆域中,cc-2021-stat数据集以其精心构筑的文本生成与检测基线,成为探究大语言模型输出特质与机器文本鉴别范式的基准平台。该数据集汇聚了多元生成模型在不同提示语下的响应样本,并附着了涵盖词法、句法、语义及模型感知层面的密集量化指标,为研究者提供了从文本相似度、编辑距离、困惑度到快速检测评分等多维度的特征视图。其经典应用聚焦于训练与评估AI生成文本检测器,通过对比原始文本与最终响应的统计画像,探寻机器书写与人类表达间的微妙分野,进而助力构建更为鲁棒的识别算法。
解决学术问题
该数据集的问世,有针对性地回应了自然语言处理领域内关于AI文本可鉴别性这一核心命题。长期以来,生成文本与人类写作的界限模糊,缺乏系统性带注释的大规模语料来支撑实证研究。cc-2021-stat通过提供成对的原始输入与生成输出,以及一组广泛覆盖从传统n-gram重叠到预训练模型语义距离的评估指标,使得研究者能够系统性地考察不同检测方法在不同生成策略(如温度采样、top-p截断)下的有效性。它不仅促进了对抗性检测技术的理论探索,也为评估生成模型的信息泄露风险与文本独特性提供了数据根基,深刻影响了神经网络文本水印、作者身份归属等子领域的发展。
衍生相关工作
基于cc-2021-stat数据集,学术界已孵化出一系列后续研究与衍生工具。其中,基于该数据集评测的FastDetector框架,其快速且轻量的检测机制启发了众多效率优先的变体算法,推动了对实时检测需求的响应。该数据集中丰富的特征统计量亦成为训练回归模型与元学习算法的素材,用以预测不同检测器在不同文本类型上的表现,进而催生了自适应检测策略的研究。此外,数据集中不同生成配置下的多方对比数据,为研究生成模型的可控性及其对检测鲁棒性的影响提供了实证基础,相关结论已延伸至提示工程与对抗样本生成等前沿课题,形成了围绕该数据集持续扩增的学术生态网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务