cc-re-2020-stat-train
收藏资源简介:
该数据集是一个尚在开发中的快速检测器数据集(Fastdetector dataset),目前仍在等待统计信息生成。数据集包含多个分片(shard_0至shard_13),每个分片仅有一个训练集分割,样本数约9700至9900条。每条样本包含以下字段:原始文本(original)、多轮对话提示(prompt,包含对话轮次列表、是否多轮标记、示例和元数据)、两个候选响应(response_0和response_1)、生成这些响应的模型信息(generator_model和generation_params)、最终响应(final_response),以及三个相似度指标(Jaccard相似度jaccard_1和jaccard_2、Levenshtein距离levenshtein、余弦距离cosdist)。该数据集可用于文本生成评估、模型响应比较、生成文本质量检测等任务,尤其适合需要多轮对话上下文和多种相似度度量的场景。
This dataset is a fast detector dataset under development, currently awaiting statistics generation. It contains multiple shards (shard_0 to shard_13), each with only a training set split, with approximately 9700 to 9900 samples per shard. Each sample includes the following fields: original text (original), multi-turn dialogue prompt (prompt, containing dialogue turn list, multi-turn flag, examples, and metadata), two candidate responses (response_0 and response_1), model information for generating these responses (generator_model and generation_params), final response (final_response), and three similarity metrics (Jaccard similarity jaccard_1 and jaccard_2, Levenshtein distance levenshtein, cosine distance cosdist). This dataset can be used for tasks such as text generation evaluation, model response comparison, and generated text quality detection, especially suitable for scenarios requiring multi-turn dialogue context and multiple similarity measures.
数据集概述:cc-re-2020-stat-train
基本信息
- 数据集名称:
G-reen/cc-re-2020-stat-train - 类型:自动生成的FastDetector数据集
- 总数据规模:94,432行,数据分14个shard(shard_0至shard_13),每个shard包含约9,700–9,900个训练样本,平均每shard约120–143MB。
任务目的
用于AI生成文本检测。数据包含人类原始文本与AI生成响应,通过多种相似度指标与检测器结果,支持评估与训练检测模型。
数据字段说明
每条记录包含:
- 原始文本:
original(人工撰写) - 提示信息:
prompt,内含多轮对话turns、是否多轮、元数据(PROMPT_TYPE) - 模型响应:
response_0、response_1及final_response(AI生成) - 生成模型信息:
generator_model与生成参数generation_params - 文本相似度指标:Jaccard相似度(两个版本)、Levenshtein距离、余弦距离(cosdist)
- 检测器评分:基于EditLens Roberta-Large的评分与分桶,分别针对原始文本和最终响应
包含子集
- 提示(Prompt)子集类型:4类:直接引用(direct_reference)、间接引用(indirect_reference)、修订(revise)、重写(rewrite)
- 生成模型配置:12种组合,涵盖DeepSeek、Llama、Mistral、Qwen、gemma、granite等多个模型的变体,温度参数范围0.6至1.25
- 检测器分类器:共13个,实际应用2个(EditLens Roberta-Large Score与Bucket),其余(困惑度、熵、Top-p、Top-k、FastDetectGPT、Binoculars等)在此数据集中被跳过
划分与过滤
- 数据划分:总数94,432行;其中用于评估的为84,988行,另有9,444行用于验证(约10%验证比例)
- 过滤条件:保留
cosdist ≥ 0.03或softngram ≥ 0.06的样本
检测结果亮点
- 最佳分类器:EditLens Roberta-Large Score,AUROC达到0.9542,阈值0.6034,TPR 0.5827,FPR 0.0051,准确率0.7888,F1 0.7340
- 最难的提示子集:rewrite,TPR仅0.4077
- 最难的生成模型配置:Ornith-1.5-35B-A3B-NVFP4(Temp: 0.6),TPR为0.5976




