遇见数据集

danielfein/aihumanmerged

收藏
Hugging Face2026-04-26 更新2026-05-03 收录
官方服务:

资源简介:

aihumanmerged是一个组合的新词检测器配对数据集,专门用于AI文本检测任务。该数据集通过将人类撰写的文本与AI生成的文本进行配对构建,旨在训练和评估模型区分人类与AI生成内容的能力。数据集包含训练对(train_pairs.json)、保留对(holdout_pairs.json)和元数据(metadata.json)三个文件。其构造整合了多个来源:RAID数据集中独特人类文本与随机AI文本配对(其中500对作为保留集)、EditLens数据集中ai_generated与human_written的对比(测试集用作保留集),以及来自gsingh1-py/train、AlekseyKorshuk/ai-detection-gutenberg-human-formatted-ai-part2和coai/ai-text-detection-training的数据,每个来源均采用独特人类文本与随机AI文本配对的方式。该数据集适用于自然语言处理中的文本分类和检测研究。

--- pretty_name: 人机融合(aihumanmerged) license: MIT许可证 --- # 人机融合(aihumanmerged)数据集 本数据集为适配新术语检测器的配对组合数据集。 数据集内容: - `train_pairs.json` - `holdout_pairs.json` - `metadata.json` 数据集构建方式: - 将RAID独有人类文本与随机AI生成文本进行配对,预留500组RAID配对样本作为留出集。 - 采用EditLens标注的`ai_generated`(AI生成)与`human_written`(人类撰写)文本样本,以其内置测试集作为本次数据集的预留留出集。 - 数据源`gsingh1-py/train`:每组配对包含一段独有人类文本与一段随机AI生成文本。 - 数据源`AlekseyKorshuk/ai-detection-gutenberg-human-formatted-ai-part2`:每组配对包含一段独有人类文本与一段随机AI生成文本。 - 数据源`coai/ai-text-detection-training`:每组配对包含一段独有人类文本与一段随机AI生成文本。

提供机构:
danielfein
二维码
社区交流群
二维码
科研交流群
商业服务