遇见数据集

CHALLENGE-IT

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

CHALLENGE-IT是一个专门用于检测大型语言模型(LLM)生成文本的意大利语基准数据集,旨在为评估和提升AI生成文本检测模型在意大利语上的性能提供一个具有挑战性的测试平台。数据集包含总计360,438个文本样本,来源于四个意大利语语料库(CHANGE-IT, C4-IT, PaISà),并由14个不同的大型语言模型生成。数据集被划分为训练集(298,472个样本)、验证集(52,672个样本)以及一个特别设计的测试集(9,294个样本)。这个测试集是一个‘硬负例’子集,其样本对于基于RoBERTa和EuroBERT的分类器都同时难以区分,旨在模拟现实世界中最具挑战性的检测场景。在该测试集上,所有已评估系统的AUC得分在0.39到0.56之间,接近随机猜测水平,突显了其难度和作为严格基准的价值。该数据集适用于文本分类任务,特别是AI生成文本检测领域的研究和模型开发。

CHALLENGE-IT is a specialized benchmark dataset for detecting text generated by large language models (LLMs) in Italian. It aims to provide a challenging testing platform for evaluating and improving AI-generated text detection models in Italian. The dataset contains a total of 360,438 text samples, sourced from four Italian corpora (CHANGE-IT, C4-IT, PaISà) and generated by 14 different large language models. It is divided into a training set (298,472 samples), a validation set (52,672 samples), and a specially designed test set (9,294 samples). This test set is a hard negative subset where samples are simultaneously difficult to distinguish for classifiers based on RoBERTa and EuroBERT, designed to simulate the most challenging detection scenarios in the real world. On this test set, all evaluated systems achieve AUC scores between 0.39 and 0.56, close to random guessing, highlighting its difficulty and value as a rigorous benchmark. The dataset is suitable for text classification tasks, particularly in the field of AI-generated text detection research and model development.

创建时间:
2026-05-28
原始信息汇总

数据集概述:CHALLENGE-IT

  • 名称:CHALLENGE-IT(Italian Benchmark for LLM-Generated Text Detection)
  • 语言:意大利语
  • 许可证:CC-BY-4.0
  • 任务类别:文本分类
  • 大小规模:100K < n < 1M
  • 总样本数360,438 条
  • 构建方式:由来自四个意大利语语料库(CHANGE-IT、C4-IT、PaISà)的文本,经 14 个 LLM 生成后构建而成。

数据集划分

划分 样本数 说明
train 298,472 训练集
validation 52,672 验证集
test 9,294 硬负样本子集——对所有评估系统(AUC 0.39–0.56,接近随机猜测)均具有挑战性

用途

用于检测 LLM 生成的意大利语文本,特别强调硬负样本挖掘与基准评测。

引用

该数据集对应的论文正在审核中,拟发表于 CLiC-it 2026(2026年9月14–16日,意大利巴勒莫)。引用格式如下:

bibtex @inproceedings{pisent2026challengeit, title = {CHALLENGE-IT: A Multi-Source Italian Benchmark with Hard Negatives for LLM-Generated Text Detection}, author = {Pisent, Alessandro and Silvestri, Fabrizio}, booktitle = {Proceedings of the Twelfth Italian Conference on Computational Linguistics (CLiC-it 2026)}, year = {2026}, note = {Under review}, address = {Palermo, Italy} }

搜集汇总
数据集介绍
CHALLENGE-IT 数据集图片
构建方式
CHALLENGE-IT是一个面向意大利语的大型语言模型生成文本检测基准数据集,由来自CHANGE-IT、C4-IT和PaISà四个意大利语语料库的360,438个样本构成。这些样本经由14种不同的大型语言模型自动生成,涵盖了多样的生成策略与模型架构。值得关注的是,其测试集经过精心设计,仅包含9,294个硬负样本——这些样本是通过一个基于RoBERTa与一个基于EuroBERT的分类器联合筛选得到的,两者均对这些样本表现出高错误率,从而确保了测试集的挑战性与区分度。
特点
该数据集最显著的特点在于其硬负样本测试集的设计,所有被评估系统在该子集上的AUC值介于0.39至0.56之间,接近随机猜测水平,充分考验检测模型在边界案例上的判别能力。此外,数据集规模宏大,训练集包含298,472个样本,验证集含52,672个样本,并涵盖了多种语言模型来源与文本领域,为意大利语AI文本检测研究提供了全面且富有挑战性的评价基准。
使用方法
研究者可通过Hugging Face的datasets库便捷加载该数据集,执行`load_dataset("alessandropisent/CHALLENGE-IT")`即可获取完整的训练、验证与测试划分。其中测试集尤为适合评估检测模型在极端困难场景下的鲁棒性,推荐优先使用。该数据集基于CC-BY-4.0许可协议发布,支持文本分类任务,适用于对比不同检测算法在意大利语生成文本识别上的性能表现。
背景与挑战
背景概述
随着大型语言模型(LLM)在自然语言生成领域的迅猛发展,机器生成文本与人类撰写文本的界限日益模糊,对信息真实性、学术诚信及网络安全构成严峻挑战。在此背景下,Alessandro Pisent与Fabrizio Silvestri于2026年推出了CHALLENGE-IT数据集,该数据集专为意大利语的LLM生成文本检测任务而设计,涵盖了来自CHANGE-IT、C4-IT和PaISà四个意大利语语料库的360,438个样本,并由14种不同的LLM生成。作为CLiC-it 2026会议(将于意大利巴勒莫举行)的投稿论文核心资源,CHALLENGE-IT聚焦于构建高难度基准,其测试集特别筛选了9,294个对基于RoBERTa和EuroBERT的分类器均构成极大挑战的硬负样本,所有评估系统在该子集上的AUC仅为0.39–0.56,接近随机猜测水平,从而为相关领域设定了极具辨识度的评估标准。
当前挑战
CHALLENGE-IT数据集的构建与使用面临双重挑战。首先,在领域问题层面,LLM生成文本检测的核心难题在于现代语言模型输出的文本在语法、风格和语义上高度模仿人类,传统基于统计特征或简单分类器的方法难以有效区分,尤其在意大利语等非英语语言中,缺乏针对机器生成文本特性的高质量检测资源,导致泛化能力严重不足。其次,在构建过程中,如何从多源语料库中系统性地筛选出对现有先进检测模型(如RoBERTa和EuroBERT)均能造成困扰的硬负样本是一大技术挑战;研究者需通过迭代式评估,从海量数据中精准提取那些语义连贯、逻辑合理但实为机器生成的文本,以确保基准的挑战性与评测结果的区分度。此外,覆盖多种LLM生成策略及不同语域(如新闻、对话、学术文本)也增加了数据标注与平衡的复杂性。
常用场景
经典使用场景
CHALLENGE-IT数据集专为意大利语场景下的大语言模型生成文本检测任务而设计,其经典使用场景聚焦于构建和评估能够区分人类撰写文本与多种LLM生成文本的二分类模型。该数据集汇集了来自CHANGE-IT、C4-IT和PaISà四个意大利语语料库的超过36万条样本,覆盖14种不同LLM的输出。特别地,测试集由9,294条难负样本构成,这些样本对基于RoBERTa和EuroBERT的分类器均构成挑战,所有提交系统在该子集上的AUC值仅徘徊于0.39至0.56之间,接近随机水平。因此,研究者常以此数据集作为竞技场,测试最新检测算法在极端困难条件下的鲁棒性与泛化能力。
实际应用
在实际应用层面,CHALLENGE-IT助力构建意大利语内容审核与反信息滥用系统。随着LLM在新闻生成、社交评论及学术写作中的普及,准确识别AI生成文本成为维护信息生态健康的关键。金融、教育和出版行业可借助基于该数据集训练的模型,自动筛查自动生成的市场报告、学生作业或稿件,以减少抄袭和虚假信息传播。此外,媒体平台能够嵌入该检测能力,标记潜在由AI批量撰写的评论或文章,保护用户免受算法操纵。通过模拟真实世界中混杂多源生成文本的挑战,该数据集直接服务于需要高精度鲁棒检测的工业级应用。
衍生相关工作
CHALLENGE-IT的发布已衍生出一系列相关工作,包括基于其难负样本设计的新型检测架构研究。例如,若干工作探索了融合统计感知与语言学特征的两阶段检测管道,另一些则利用对比学习在难样本上强化判别边界。此外,该数据集的成功催生了针对其他低资源语言的类似难负样本基准构建方法,如为西班牙语和法语创建了具有可比挑战性的检测数据集。在模型层面,基于该基准的竞赛激励了集成学习、元学习以及超大语言模型自身作为检测器(如GPT-4驱动的判别)的效能研究。这些衍生工作共同推动AI生成文本检测领域从英语中心向多语言、多场景的稳健体系迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务