遇见数据集

Modeltell

收藏
github2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

Modeltell是一个用于系统测量大型语言模型词汇和句法指纹的数据集。与词级AI检测器列表不同,该项目分析语法结构——包括句子结构、修辞模式和组合习惯,这些定义了每个模型的语言身份。数据集包含13个跟踪模型的原始输出和分析结果,支持多提供商API运行,并提供版本化的社区JSON数据集。

Modeltell is a dataset dedicated to systematically measuring the lexical and syntactic fingerprints of large language models. Unlike word-level AI detector lists, this project analyzes grammatical structures, including sentence structures, rhetorical patterns and compositional habits that define the linguistic identity of each individual model. The dataset contains raw outputs and analytical results from 13 tracked models, supports API operations across multiple providers, and provides a versioned community JSON dataset.

创建时间:
2026-06-07
原始信息汇总

Modeltell 数据集概述

Modeltell 是一个专注于计算语言学分析的数据集,用于系统性测量大语言模型在词汇和句法层面的特征指纹。

核心定位

与传统的基于单词级别的“AI检测器”不同,Modeltell 分析的是语法结构——即每个模型在句子结构、修辞模式和行文习惯上的独特语言身份。

数据集规模

维度 数量
追踪模型 13 个
句法模式 15 种
标准化提示 30 条

追踪模型列表

层级 模型
前沿模型 Claude Opus 4.8 / 4.7 / 4.6, GPT-5.5, Gemini 3.1 Pro
中端模型 Claude Sonnet 4.6, GPT-5.4 Mini, Gemini 3.5 Flash
开源模型 Llama 4 Maverick, DeepSeek V4 Pro / V3.2, Mistral Large (2512), Qwen3.7 Max

检测的句法模式

模式名称 检测内容 严重等级
Tricolon 三项并列结构(如“innovative, scalable, and transformative”)
Whether-Youre “Whether youre a startup or enterprise...” 句式 严重
Hedging Opener “Its worth noting that...” 模糊开场
Not-Just-But “not just a tool, but a partner” 转折结构
In-Todays-Landscape “In todays fast-paced digital landscape...” 陈词开场 严重
Em-Dash Pivot 破折号转折(如“one platform - endless possibilities”) 中等
Power Verb Stacking 动词堆叠(如“drive, boost, and accelerate”)
Future-Forward Closing “As we move forward...” 未来收尾
其他7种 详见 patterns/definitions.json

分析维度

  • 句法模式检测:三列并举频率、模糊修辞、伪包容性开场、破折号转折、强力动词堆叠等
  • 结构分析:开头/结尾分类、项目符号与正文比例、排版密度、句子长度方差
  • 跨模型指纹识别:雷达剖面图展示每个模型独特语言习惯组合
  • 演化追踪:不同模型版本间模式变化,模型间趋同或分化趋势

数据格式

  • 原始输出data/{run-id}/{model-id}.json
  • 词汇分析data/{run-id}/_lexical_analysis.json
  • 句法分析data/{run-id}/_syntactic_analysis.json

数据API结构

published/locales.json (语言发现:存在哪些语言) published/<locale>/index.json (入口文件,支持 en/de 等) published/<locale>/models/{model-id}.json (每个模型独立指纹文件) published/<locale>/watchlist/words.json (高频AI关联词汇) published/<locale>/watchlist/constructions.json (句法结构列表) published/<locale>/comparisons/tier-summary.json (层级平均数据:前沿/中端/开源) published/<locale>/comparisons/similarity-matrix.json (雷达相似度矩阵) published/<locale>/comparisons/delta-matrix.json (Burrowss Delta 矩阵) published/<locale>/validation/regex-precision.json (正则表达式精度审计,可选)

适用范围与限制

  • 非AI检测工具:描述模型输出的统计倾向,不用于判断单段文本是否由AI生成
  • 无人为对照基线:词汇分数衡量跨模型差异,未与人工写作对比
  • 部分模式检测经过验证:手动精度审计显示微平均精度约71%,部分模式表现优秀(not-just-but、强力动词),部分模式表现不佳(如parenthetical_aside0%tricolon/em_dash_pivot0.75
  • 显著性分析基于模式级别:每个频率携带95%自助置信区间和FDR校正置换检验
  • 任务/提示偏差:目前仅覆盖商业/营销文案领域,单一系统提示和默认解码设置

项目架构

  • prompts/catalog.json:30条标准化内容生成提示
  • patterns/definitions.json:15种句法模式定义及词汇监控清单
  • src/runner/:多提供商API运行器(每模型每提示运行3次)
  • src/analysis/:词汇分析(跨模型TF-IDF、Burrowss Delta)和句法分析(正则表达式模式)
  • src/publish/:分析结果转换为社区JSON数据集
  • src/cli/:零依赖内容检查器(支持中英文双语的AI模式标记工具)
  • frontend/:滚动式数据可视化(React + Vite + D3)

自动化运行

GitHub Action 每月自动运行完整流水线,并将结果提交至仓库,确保数据可再生性和透明度。

搜集汇总
数据集介绍
Modeltell 数据集图片
构建方式
Modeltell数据集通过系统化的计算语言学方法构建,旨在量化分析大型语言模型的词汇与句法特征。其核心流程包括:首先,利用30个标准化内容生成提示(prompts)对13个前沿及开源模型(如Claude、GPT、Gemini等)进行文本生成,每个提示执行3次以确保统计稳健性。随后,基于15种句法模式(如三联词结构、规避性开头、幂动词堆叠等)及词汇监控列表,通过正则表达式与TF-IDF、Burrows's Delta等跨模型分析方法,对生成的文本进行深层语法结构检测。此外,数据集支持多种语言(目前含英文与德文)的语料生成与分析,并通过自动化的GitHub Action每月更新运行结果,确保数据的时效性与可复现性。
特点
该数据集最显著的特征在于其超越传统词级检测的深层语法分析能力。与传统仅关注高频词汇(如'delve')的方法不同,Modeltell聚焦于句法模式与修辞习惯的识别,涵盖三联词频率、规避性构造、伪包容性开头、em破折号转折等15种模式,并构建跨模型的雷达指纹图谱,揭示各模型独特的语言风格组合。此外,数据集提供了版本演化追踪功能,可观察同一模型家族在不同版本间的语言特征漂移。其分析结果通过多维指标呈现,包括词汇区分度(TF-IDF)、句法模式显著性(含95%自助法置信区间与FDR校正置换检验),同时明确声明非用于文本来源判定,仅描述模型输出的聚合倾向性。
使用方法
使用者可通过两种方式调用数据集。其一,通过npm安装并配置OpenRouter API密钥后,运行'npm run run:all'命令对全量模型进行文本生成与分析,生成的数据存储在'data/'目录下;支持通过环境变量限定模型或运行次数进行快速测试。其二,提供零依赖的CLI工具'modeltell check',可对任意文本进行实时句法模式检测,并输出等级评分与详细报告,支持文件输入与标准输入流。公开的数据集以静态JSON格式发布在'published/'目录下,包含模型指纹、词汇监控列表、跨模型相似度矩阵等结构化数据,可直接通过GitHub Pages的静态API获取,方便二次开发与可视化呈现。
背景与挑战
背景概述
Modeltell数据集由Third Shift Lab于近期创建,专注于计算语言学视角下的大语言模型文本分析。该数据集的核心研究问题在于超越传统词汇层面的AI文本检测,深入探究不同语言模型在句法结构和修辞模式上的独特印记。通过系统测量13个前沿模型(涵盖Claude、GPT、Gemini及开源模型系列)在15种句法模式上的表现,Modeltell揭示了模型间鲜明的语言学指纹差异。其独创的句法模式检测,如三列结构、模糊开场白、破折号戏剧性转折等,为理解AI生成文本的语法习性提供了全新维度。该数据集及其配套的交互式可视化工具,已成为计算语言学和AI文本分析领域的重要基准资源。
当前挑战
Modeltell所面临的挑战具有多重维度。领域问题层面,其解决的核心挑战是AI文本的精确识别与模型风格量化,传统基于词汇频率的检测方法已无法应对日益复杂的生成文本。构建过程中的挑战尤为突出:首先,正则表达式启发式检测的精度参差不齐,手动审计显示微平均精度约为71%,个别模式如插入语旁白几乎完全失效,三列结构和破折号转折在长列表中亦存在过度计数问题。其次,任务和提示词偏差难以消除,单一的商业营销领域限制,以及默认解码参数设置,使得模型风格与任务风格相互纠缠。此外,缺乏对应的人类文本基线,使得跨模型TF-IDF分析只能衡量模型间的相对差异性,而非与人类写作的偏差。
常用场景
经典使用场景
Modeltell被设计用于剖析和量化大型语言模型在句法层面的独特指纹。与仅关注词汇层面的AI检测不同,该数据集通过捕捉模型在句法结构、修辞模式与构成习惯上的高频特征,如三分句法、条件限定开篇、破折号转折等十五种句法模式,为每一模型构建精细的句法轮廓雷达图。研究者可借助标准化提示生成的多模型语料,系统性地对比前沿模型、中等性能模型及开源模型在句法分布上的异同,并追踪同一模型家族在版本更迭中语言习惯的演化轨迹。
解决学术问题
该数据集有力地回应了自然语言生成领域对模型风格特征量化研究的重要需求。长期以来,AI生成文本的研究多囿于高频词汇的统计,而忽视了模型在句法编织层面呈现的实质性差异。Modeltell通过跨模型的TF-IDF与Burrows's Delta分析,结合详细的句法模式匹配,为计算语言学提供了从语法结构出发理解模型语言习性的新方法。它不仅揭示了不同模型在修辞选择上的系统性偏差,还打开了探究模型语言行为趋同或分化演变趋势的研究窗口,对理解大型语言模型的内在工作机制具有重要学术价值。
衍生相关工作
Modeltell催生了一系列具有代表性的衍生研究与工具迭代。在数据驱动的研究范式下,其公开的版本化社区数据集支持跨模型相似度矩阵与雷达图相似度分析,直接启发了模型风格迁移与可控文本生成中语言模式调控算法的研究。此外,基于其对句法模式的精确标注与严重度分级,后续工作涌现出针对特定句法模式(如三分句法、权力动词堆叠)的去AI化改写工具,以及面向多语言场景的AI文本特征探测方法,进一步拓展了计算语言学在模型行为分析领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务