遇见数据集

symanto/autextification2023

收藏
Hugging Face2024-06-14 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-nc-sa-4.0 task_categories: - text-classification language: - en - es pretty_name: AuTexTification 2023 size_categories: - 10K<n<100K source_datasets: - multi_eurlex - xsum - csebuetnlp/xlsum - mlsum - amazon_polarity - https://sinai.ujaen.es/investigacion/recursos/coah - https://sinai.ujaen.es/investigacion/recursos/coar - carblacac/twitter-sentiment-analysis - cardiffnlp/tweet_sentiment_multilingual - https://www.kaggle.com/datasets/ricardomoya/tweets-poltica-espaa - wiki_lingua --- # Dataset Card for AuTexTification 2023 ## Dataset Description - **Homepage:** https://sites.google.com/view/autextification - **Repository:** https://github.com/autextification/AuTexTification-Overview - **Paper:** https://arxiv.org/abs/2309.11285 ### Dataset Summary AuTexTification 2023 @IberLEF2023 is a shared task focusing in Machine-Generated Text Detection and Model Attribution in English and Spanish. The dataset includes human and generated text in 5 domains: tweets, reviews, how-to articles, news, and legal documents. The generations are obtained using six language models: BLOOM-1B1, BLOOM-3B, BLOOM-7B1, Babbage, Curie, and text-davinci-003. For more information, please refer to our overview paper: https://arxiv.org/abs/2309.11285 ### Supported Tasks and Leaderboards - Machine-Generated Text Detection - Model Attribution ### Languages English and Spanish ## Dataset Structure ### Data Instances 163k instances of labeled text in total. ### Data Fields For MGT Detection: - id - prompt - text - label - model - domain For Model Attribution: - id - prompt - text - label - domain ### Data Splits - MGT Detection Data: | Language | Split | Human | Generated | Total | | -------- | ----- | ------ | --------- | ------ | | English | Train | 17.046 | 16.799 | 33.845 | | | Test | 10.642 | 11.190 | 21.832 | | | Total | 27.688 | 27.989 | 55.667 | | Spanish | Train | 15.787 | 16.275 | 32.062 | | | Test | 11.209 | 8.920 | 20.129 | | | Total | 26.996 | 25.195 | 52.191 | - Model Attribution Data: | | | BLOOM | | | GPT | | | | | -------- | ----- | ----- | ----- | ----- | ------- | ----- | ---------------- | ------ | | Language | Split | 1B7 | 3B | 7B | babbage | curie | text-davinci-003 | Total | | English | Train | 3.562 | 3.648 | 3.687 | 3.870 | 3.822 | 3.827 | 22.416 | | | Test | 887 | 875 | 952 | 924 | 979 | 988 | 5.605 | | | Total | 4.449 | 4.523 | 4.639 | 4.794 | 4.801 | 4.815 | 28.021 | | Spanish | Train | 3.422 | 3.514 | 3.575 | 3.788 | 3.770 | 3.866 | 21.935 | | | Test | 870 | 867 | 878 | 946 | 1.004 | 917 | 5.482 | | | Total | 4.292 | 4.381 | 4.453 | 4.734 | 4.774 | 4.783 | 27.417 | ## Dataset Creation ### Curation Rationale Human data was gathered and used to prompt language models, obtaining generated data. Specific decisions were made to ensure the data gathering process was carried out in an unbiased manner, making the final human and generated texts probable continuations of a given prefix. For more detailed information, please refer to the overview paper: https://arxiv.org/abs/2309.11285 ### Source Data The following datasets were used as human text: - multi_eurlex - xsum - csebuetnlp/xlsum - mlsum - amazon_polarity - https://sinai.ujaen.es/investigacion/recursos/coah - https://sinai.ujaen.es/investigacion/recursos/coar - carblacac/twitter-sentiment-analysis - cardiffnlp/tweet_sentiment_multilingual - https://www.kaggle.com/datasets/ricardomoya/tweets-poltica-espaa - wiki_lingua These datasets were only used as sources of human text. The labels of the datasets were not employed in any manner. ### Licensing Information CC-BY-NC-SA-4.0 ### Citation Information ``` @inproceedings{autextification2023, title = "Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple Domains", author = "Sarvazyan, Areg Mikael and Gonz{\'a}lez, Jos{\'e} {\'A}ngel and Franco-Salvador, Marc and Rangel, Francisco and Chulvi, Berta and Rosso, Paolo", month = sep, year = "2023", address = "Jaén, Spain", booktitle = "Procesamiento del Lenguaje Natural", } ```

--- license: CC-BY-NC-SA-4.0(知识共享署名-非商业性使用-相同方式共享4.0协议) task_categories: - 文本分类(text-classification) language: - 英语(en) - 西班牙语(es) pretty_name: AuTexTification 2023 size_categories: - 10K<n<100K source_datasets: - multi_eurlex - xsum - csebuetnlp/xlsum - mlsum - amazon_polarity - https://sinai.ujaen.es/investigacion/recursos/coah - https://sinai.ujaen.es/investigacion/recursos/coar - carblacac/twitter-sentiment-analysis - cardiffnlp/tweet_sentiment_multilingual - https://www.kaggle.com/datasets/ricardomoya/tweets-poltica-espaa - wiki_lingua --- # AuTexTification 2023 数据集卡片 ## 数据集说明 - **主页:** https://sites.google.com/view/autextification - **代码仓库:** https://github.com/autextification/AuTexTification-Overview - **相关论文:** https://arxiv.org/abs/2309.11285 ### 数据集概述 AuTexTification 2023 @IberLEF2023是一项聚焦于英语与西班牙语环境下机器生成文本检测与模型归属的共享任务。本数据集涵盖推文、商品评论、操作指南文章、新闻及法律文档共5个领域的人类撰写文本与机器生成文本。生成文本由6款大语言模型(Large Language Model,LLM)生成,分别为BLOOM-1B1、BLOOM-3B、BLOOM-7B1、Babbage、Curie及text-davinci-003。如需了解更多细节,请参阅本团队的概述论文:https://arxiv.org/abs/2309.11285 ### 支持任务与排行榜 - 机器生成文本检测 - 模型归属 ### 支持语言 英语与西班牙语 ## 数据集结构 ### 数据实例 总计包含163,000条带标注的文本实例。 ### 数据字段 针对机器生成文本检测任务: - id:数据唯一标识 - prompt:提示词 - text:目标文本 - label:标注标签 - model:生成所用模型 - domain:文本所属领域 针对模型归属任务: - id:数据唯一标识 - prompt:提示词 - text:目标文本 - label:生成模型归属标签 - domain:文本所属领域 ### 数据划分 - 机器生成文本检测数据集: | 语言 | 划分 | 人类文本 | 机器生成文本 | 总计 | | ------ | ------ | -------- | ------------ | ------ | | 英语 | 训练集 | 17,046 | 16,799 | 33,845 | | | 测试集 | 10,642 | 11,190 | 21,832 | | | 总计 | 27,688 | 27,989 | 55,667 | | 西班牙语 | 训练集 | 15,787 | 16,275 | 32,062 | | | 测试集 | 11,209 | 8,920 | 20,129 | | | 总计 | 26,996 | 25,195 | 52,191 | - 模型归属数据集: | | | BLOOM | | | GPT系列模型 | | | | | ------ | ------ | ----- | ----- | ----- | ------- | ----- | ---------------- | ------ | | 语言 | 划分 | 1B7 | 3B | 7B | babbage | curie | text-davinci-003 | 总计 | | 英语 | 训练集 | 3,562 | 3,648 | 3,687 | 3,870 | 3,822 | 3,827 | 22,416 | | | 测试集 | 887 | 875 | 952 | 924 | 979 | 988 | 5,605 | | | 总计 | 4,449 | 4,523 | 4,639 | 4,794 | 4,801 | 4,815 | 28,021 | | 西班牙语 | 训练集 | 3,422 | 3,514 | 3,575 | 3,788 | 3,770 | 3,866 | 21,935 | | | 测试集 | 870 | 867 | 878 | 946 | 1,004 | 917 | 5,482 | | | 总计 | 4,292 | 4,381 | 4,453 | 4,734 | 4,774 | 4,783 | 27,417 | ## 数据集构建 ### 数据遴选原则 研究团队首先收集人类撰写文本,将其作为提示词输入大语言模型以生成机器文本。为确保数据收集过程无偏倚,团队进行了针对性设计,保证最终的人类文本与机器生成文本均为给定提示前缀的合理续篇。如需了解更多细节,请参阅概述论文:https://arxiv.org/abs/2309.11285 ### 源数据 以下数据集被用作人类文本的来源: - multi_eurlex - xsum - csebuetnlp/xlsum - mlsum - amazon_polarity - https://sinai.ujaen.es/investigacion/recursos/coah - https://sinai.ujaen.es/investigacion/recursos/coar - carblacac/twitter-sentiment-analysis - cardiffnlp/tweet_sentiment_multilingual - https://www.kaggle.com/datasets/ricardomoya/tweets-poltica-espaa - wiki_lingua 上述数据集仅作为人类文本的来源,其自带的标签未被任何环节使用。 ### 授权信息 CC-BY-NC-SA-4.0(知识共享署名-非商业性使用-相同方式共享4.0协议) ### 引用信息 @inproceedings{autextification2023, title = "Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple Domains", author = "Sarvazyan, Areg Mikael and González, José Ángel and Franco-Salvador, Marc and Rangel, Francisco and Chulvi, Berta and Rosso, Paolo", month = sep, year = "2023", address = "Jaén, Spain", booktitle = "Procesamiento del Lenguaje Natural", }

提供机构:
symanto
原始信息汇总

数据集概述

  • 名称: AuTexTification 2023
  • 任务类别:
    • 文本分类
  • 语言:
    • 英语
    • 西班牙语
  • 大小: 10K<n<100K
  • 许可: CC-BY-NC-SA-4.0

数据集详细信息

  • 摘要: AuTexTification 2023 是一个专注于机器生成文本检测和模型归属的共享任务,涵盖英语和西班牙语。数据集包含5个领域的文本:推文、评论、操作指南、新闻和法律文档。
  • 支持的任务:
    • 机器生成文本检测
    • 模型归属
  • 数据结构:
    • 数据实例: 总计163,000个标记文本实例。
    • 数据字段:
      • 机器生成文本检测: id, prompt, text, label, model, domain
      • 模型归属: id, prompt, text, label, domain
  • 数据分割:
    • 机器生成文本检测:
      • 英语: 训练集33,845个实例,测试集21,832个实例
      • 西班牙语: 训练集32,062个实例,测试集20,129个实例
    • 模型归属:
      • 英语: 训练集14,767个实例,测试集3,638个实例
      • 西班牙语: 训练集14,299个实例,测试集3,561个实例

数据集创建

  • 源数据:

    • 用于获取人类文本的数据集: multi_eurlex, xsum, csebuetnlp/xlsum, mlsum, amazon_polarity, https://sinai.ujaen.es/investigacion/recursos/coah, https://sinai.ujaen.es/investigacion/recursos/coar, carblacac/twitter-sentiment-analysis, cardiffnlp/tweet_sentiment_multilingual, https://www.kaggle.com/datasets/ricardomoya/tweets-poltica-espaa, wiki_lingua
  • 许可信息: CC-BY-NC-SA-4.0

  • 引用信息:

    @inproceedings{autextification2023, title = "Overview of AuTexTification at IberLEF 2023: Detection and Attribution of Machine-Generated Text in Multiple Domains", author = "Sarvazyan, Areg Mikael and Gonz{a}lez, Jos{e} {A}ngel and Franco-Salvador, Marc and Rangel, Francisco and Chulvi, Berta and Rosso, Paolo", month = sep, year = "2023", address = "Jaén, Spain", booktitle = "Procesamiento del Lenguaje Natural", }

搜集汇总
数据集介绍
symanto/autextification2023 数据集图片
构建方式
AuTexTification 2023数据集专为机器生成文本检测与模型归属任务而构建,涵盖了英语和西班牙语两种语言。其构建过程首先从多个公开数据集中采集人类撰写的文本,这些数据集覆盖了推特、评论、指南文章、新闻和法律文档五个领域。随后,研究者利用六种不同的语言模型——包括BLOOM系列(1B1、3B、7B1)以及GPT系列(Babbage、Curie、text-davinci-003)——对人类文本进行提示生成,从而获得对应的机器生成文本。为确保数据收集的无偏性,所有生成文本均被设计为给定前缀的合理延续。最终数据集包含约16.3万个标注实例,每个实例均附有提示、文本、标签、模型来源及领域信息,为机器生成文本的检测与归因研究提供了坚实的基础。
特点
该数据集的核心特点在于其多维度、多层次的精细结构。首先,它支持两项任务:机器生成文本的二分类检测(区分人类与机器撰写)以及多类模型归属(识别生成文本源自六种语言模型中的哪一种)。其次,数据集在语言、领域和模型三个维度上实现了高度平衡,英语与西班牙语的样本量相近,每个领域均有足够覆盖,且六种模型的生成文本数量大致均匀。此外,数据集中人类文本与生成文本的分布接近1:1,有效避免了类别不平衡问题。每个样本还包含提示字段,便于研究者探究上下文对生成文本特征的影响。这种丰富的标注信息使得AuTexTification成为评估和提升机器文本检测算法鲁棒性的理想基准。
使用方法
使用AuTexTification数据集时,研究者可直接通过Hugging Face的`datasets`库加载,利用`load_dataset('symanto/autextification2023')`命令获取数据。数据集预设了训练集和测试集划分,且针对检测与归属任务分别提供了独立的数据子集。对于机器生成文本检测任务,可使用`label`字段作为目标,进行二分类模型训练;对于模型归属任务,则需将`label`字段中的六类模型标识作为分类目标。建议在预处理阶段利用`prompt`和`text`字段拼接输入序列,以保留上下文信息。评估时,可参照官方排行榜的指标(如准确率、F1分数)进行性能对比。研究者还可按语言或领域筛选子集,进行迁移学习或跨域泛化能力的分析。
背景与挑战
背景概述
AuTexTification 2023数据集由Areg Mikael Sarvazyan、José Ángel González、Marc Franco-Salvador等研究人员于2023年在IberLEF 2023共享任务中创建,旨在解决机器生成文本检测与模型归因这一新兴领域问题。随着大型语言模型如BLOOM和GPT系列的广泛部署,自动区分人类与机器生成的内容成为自然语言处理中的关键挑战。该数据集涵盖英语和西班牙语,包含推文、评论、教程、新闻和法律文档五个领域,共计超过16.3万条标注文本,为多语言、多领域的机器文本检测研究提供了标准化基准。其核心研究问题聚焦于如何鲁棒地识别来自不同语言模型(如BLOOM-1B1、text-davinci-003等)的生成文本,并对模型来源进行精准归因,对推动AI生成内容的可信度评估和反滥用技术具有重要意义。
当前挑战
该数据集面临的核心挑战包括:首先,机器生成文本检测领域本身存在模型泛化性难题——不同语言模型(如BLOOM与GPT系列)在生成风格、连贯性和错误模式上差异显著,导致单一检测器难以覆盖所有生成源;其次,数据集构建过程中需解决人类文本与机器文本在语义分布上的高度重叠问题,尤其当使用相同提示词(prompt)生成时,人工与自动续写内容可能难以区分。此外,跨领域(如法律文档与社交媒体)的文本特征差异进一步增加了检测难度,而双语(英语与西班牙语)设置则要求模型具备语言无关的鲁棒特征提取能力。最后,数据标注需确保无偏见性,避免因提示词选择或模型采样策略导致生成文本偏离真实应用场景,这对数据收集的流程设计和质量把控提出了严苛要求。
常用场景
经典使用场景
AuTexTification 2023 数据集专为机器生成文本检测和模型归因任务而设计,涵盖了英语和西班牙语两种语言,横跨推文、评论、教程、新闻和法律文档等五个领域。其经典使用场景在于训练和评估能够区分人类撰写文本与由 BLOOM、GPT 系列等六种大型语言模型生成文本的分类器,同时支持对生成文本来源模型的精确识别。该数据集包含约 16.3 万个标注实例,为文本二分类与多类归因研究提供了丰富的跨领域、跨语言基准,成为探究机器文本伪影和语言模型行为特性的重要资源。
实际应用
在实际应用层面,AuTexTification 2023 数据集为构建自动化的虚假信息监测系统、学术不端检测工具以及内容审核平台提供了关键支撑。社交媒体平台可利用基于该数据集训练的模型识别自动化机器人发布的虚假评论或误导性新闻;法律和新闻行业则能借助模型归因功能追溯争议文本的生成来源,辅助版权保护和事实核查。此外,该数据集还可用于开发教育领域的作业原创性检测系统,有效应对学生利用大语言模型完成作业的学术诚信挑战。
衍生相关工作
基于 AuTexTification 2023 数据集,研究者衍生出一系列经典工作,包括针对不同语言模型生成文本的对抗性检测方法、跨领域迁移学习框架以及基于对比学习的模型指纹提取技术。例如,部分工作探索了利用困惑度、突发度等统计特征增强检测鲁棒性,另一些则通过注意力可视化揭示模型生成偏好。该数据集还催生了多语言机器生成文本检测的共享任务和评测基准,如 IberLEF 2023 竞赛,推动了社区在统一框架下比较不同检测算法的性能,并启发了后续诸如 Deepfake 文本检测、生成文本风格聚类等前沿研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务