遇见数据集

best-ai-humanizer-independent-benchmark

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 AI Humanizer Benchmark(AI 文本人性化工具基准测试)的公开记录,每月更新,旨在客观评估和排名不同 AI 人性化工具在绕过主流 AI 检测器(包括 GPTZero、Originality.ai、Copyleaks、Winston AI 和 ZeroGPT)的同时保持原始文本含义和可读性的能力。数据集包含每个测试周期的完整透明数据:源样本(输入文本)、每个工具的人性化输出、所有五个检测器对每个输出的判决、以及用于计算综合评分的冻结评分算法。每个周期还包括承诺-揭示机制(commit-reveal scheme)文件,用于验证提示的不可预测性。数据存储为 JSON 格式,位于 data/cycles/ 目录下,每个周期包含 samples.json、tests.json、detector-scores.json、scoring.js 等文件。此外,data/humanizers/ 目录下包含每个工具的历史记录和评分细节。数据集适用于 AI 检测规避、文本生成质量评估、基准测试以及可重现性验证等任务。

This dataset is a public record of the AI Humanizer Benchmark, updated monthly, designed to objectively evaluate and rank different AI humanization tools in their ability to bypass mainstream AI detectors (including GPTZero, Originality.ai, Copyleaks, Winston AI, and ZeroGPT) while preserving the original text meaning and readability. The dataset includes complete transparent data for each test cycle: source samples (input text), humanized outputs from each tool, judgments from all five detectors on each output, and frozen scoring algorithms used to compute composite scores. Each cycle also includes commit-reveal scheme files to verify the unpredictability of prompts. Data is stored in JSON format under the data/cycles/ directory, with each cycle containing files such as samples.json, tests.json, detector-scores.json, scoring.js, etc. Additionally, the data/humanizers/ directory contains historical records and scoring details for each tool. The dataset is suitable for tasks such as AI detection evasion, text generation quality assessment, benchmarking, and reproducibility verification.

创建时间:
2026-09-03
原始信息汇总

数据集概述

该数据集是一个独立基准测试的公开记录,旨在按月评估和排名各种AI人性化工具绕过主流AI检测器的能力。

评测范围与核心指标

  • 检测器覆盖:评测针对5款主流AI检测器,包括GPTZero、Originality.ai、Copyleaks、Winston AI和ZeroGPT。
  • 综合评分维度:总分100分,由四个子项加权构成:检测器绕过率(权重42%)、语义保留度(权重32%)、可读性(权重16%)、跨写作类别一致性(权重10%)。
  • 惩罚机制:工具在语义偏离、长度膨胀(>1.4×原文)、长度缩减(<0.6×原文)、拒绝输出及输出未修改等质量失败情况下会被扣分(每类别最高扣10分),扣分已反映在综合评分中。

评测方法与透明度

  • 操作方式:数据集的创建者自费购买每个工具的访问权限,并手动在工具宣传的“最不易检测”设置下运行每个工具,不涉及任何联盟合作或厂商提供数据。
  • 数据公开:每次评测的输入文本、每个工具的输出、每个检测器的判定结果以及评分代码均完整发布在存储库中,任何人可以从零开始复现排名结果。
  • 防篡改机制:采用“提交-揭示”方案,即周期开始前仅公开随机nonce的SHA-256哈希,周期结束后公布nonce本身,并运行5项独立校验(哈希承诺、算法重放、替换匹配、清单完整性、评分重放)以确保数据链条未被篡改。验证脚本已接入CI,任何对main分支的推送都会运行验证并将失败作为构建失败。

测试样本与类别

每个评测周期从7个写作类别(学术论文、申请文书、博客文章、商务邮件、讨论区帖子、营销文案、新闻文章)的11个提示模板中生成源样本,每个模板生成3个样本。

最近评测结果(2026年9月)

排名 工具 综合得分/100 绕过率 语义保留 可读性
1 GPTHuman AI 88.28 94% 77% 91%
2 Undetectable.ai 82.53 82% 87% 69%
3 WriteHuman 76.60 84% 66% 77%
4 NoteGPT 69.79 88% 60% 78%
5 ZeroGPT Humanizer 65.35 76% 66% 45%
6 UnAIMyText 60.64 72% 56% 42%
7 HIX Bypass 52.42 70% 47% 39%

数据文件结构

存储库包含两个主要目录:

  • data/cycles/:每个已发布周期的文件,包括透明性捆绑包(nonce、提示模板、价值库、选择算法等)和可复现性捆绑包(样本、测试输出、检测器评分、冻结的计分算法以及最终排行榜)。
  • data/humanizers/:每个工具跨周期的历史记录和现场笔记。

许可与争议处理

  • 许可证:验证代码、工作流和配置采用MIT许可证;data/目录下的周期数据采用CC BY 4.0许可证,允许在注明出处的情况下复制。
  • 勘误与争议:若发现周期评分错误、工具记录过期或验证失败等问题,可通过GitHub问题追踪器报告,维护者承诺在一个周期内回应。
搜集汇总
数据集介绍
best-ai-humanizer-independent-benchmark 数据集图片
构建方式
该数据集通过月度基准测试流程构建,旨在评估多种AI人性化改写工具规避主流AI检测器的能力。构建过程严谨且透明:每期生成源自11个提示模板、覆盖7种写作类别的样本,每个样本由不同工具以最不可检测的广告设置进行手工重写,并将所有输入、输出、检测器评分及评分代码公开。采用哈希承诺机制确保提示的不可预测性。评分聚合器冻结,基于检测器绕过、语义保留、可读性、一致性及惩罚项计算综合得分。
特点
数据集的核心特点在于全面的透明性和可复现性。它囊括了完整的审计记录,包括每个样本的原始文本、改写结果、多家AI检测器的裁定以及可验证的评分流程,允许独立研究者从头再推导排行榜。方法上强调独立公正,无供应商数据或联盟优惠。统计设计巧妙,使用中位数规避单一检测器宽松影响,并执行严格的质量惩罚。这使其不仅是排名基准,更是研究AI文本改写与检测对抗动态的宝贵资源。
使用方法
使用者可通过克隆数据仓库并运行验证脚本,核对每个周期的数据完整性和评分准确性,或按需验证单一周期。数据被组织成多个配置,如包含源样本、测试结果和检测器评分的JSON文件,便于按周期加载与独立分析。研究者能利用这些数据比较不同工具的文本改写策略,分析检测器漏洞,或开发改进的检测方法。仓库内附有文档记录方法变更与争议处理,为后续研究提供坚实基础。
背景与挑战
背景概述
该数据集名为“best-ai-humanizer-independent-benchmark”,由独立研究者于2026年创建,旨在系统评估AI人性化工具在规避主流AI检测器(如GPTZero、Originality.ai等)时的表现,同时保持文本的语义保真度和可读性。其核心研究问题在于,随着AI生成内容检测技术的进步,如何客观、可重复地衡量“人性化”改写工具的真实效能,以填补该领域缺乏独立第三方基准的空白。该数据集通过发布完整的输入、输出、检测器评分及评分代码,实现了排行榜的完全可复现性,对AI文本生成与检测的对抗性研究领域具有重要影响,为工具开发者、研究者和政策制定者提供了可信的评估参考。
当前挑战
该领域的主要挑战包括:AI检测器与人性化工具之间的持续对抗,导致工具性能快速变化,需频繁更新基准;确保评估的公平性与独立性,避免供应商影响或数据泄露;同时平衡检测规避率、语义保持、可读性等多维指标,难以单一分数全面反映工具优劣。在构建数据集时,挑战在于设计不可预测的测试提示(通过随机nonce和提交-揭示方案),防止工具针对固定提示进行优化;确保所有流程的透明性与可审计性,包括每个周期的数据完整性和评分算法冻结;此外,手动运行每个工具并保证多轮测试的一致性,耗时且需严格质量控制,以防止数据污染和评分偏差。
常用场景
经典使用场景
该数据集作为独立、公正的AI文本人性化工具评测基准,经典使用场景为对各类AI humanizer进行系统性的性能排名与验证。研究者可依托其公开的样本、输出、检测器评分及冻结的评分算法,复现月度排行榜,评估工具在绕过主流AI检测器(如GPTZero、Originality.ai等)时的有效性,同时兼顾语义保持度、可读性与跨类别一致性。其透明化的审计记录与可验证性设计,使之成为学术领域内评估文本去AI化技术优劣的基石性资源。
实际应用
在实际应用层面,该数据集的价值体现在多个维度。对于内容创作者与营销人员,其排名结果可指导选择高效的文本人性化服务,以规避AI检测风险并提升内容接纳度;对于AI检测器开发者,数据集中详尽的检测器反馈对优化模型鲁棒性构成挑战与启迪;对于平台运营方,评测体系所揭示的文本改写边界与质量瑕疵,有助于完善内容审核机制,防范不当利用,从而在技术应用与内容生态治理之间构建起客观的数据参照系。
衍生相关工作
该数据集的开创性设计催生了一系列衍生研究与实践。其提交-揭示(commit-reveal)机制与可验证审计流程,为后续构建去中心化、防篡改的算法评测平台提供了范式指引。围绕其评分框架,研究者可衍生出针对特定领域(如学术写作、商务沟通)的定制化评估子集或增强型指标。此外,发布的检测器响应语料库,亦成为训练更为鲁棒的AI文本检测器或探索文本对抗样本生成技术的宝贵资源,推动了AI可解释性与安全性的交叉研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务