Modeltell
收藏资源简介:
Modeltell是一个用于系统测量大型语言模型词汇和句法指纹的数据集。与词级AI检测器列表不同,该项目分析语法结构——包括句子结构、修辞模式和组合习惯,这些定义了每个模型的语言身份。数据集包含13个跟踪模型的原始输出和分析结果,支持多提供商API运行,并提供版本化的社区JSON数据集。
Modeltell is a dataset dedicated to systematically measuring the lexical and syntactic fingerprints of large language models. Unlike word-level AI detector lists, this project analyzes grammatical structures, including sentence structures, rhetorical patterns and compositional habits that define the linguistic identity of each individual model. The dataset contains raw outputs and analytical results from 13 tracked models, supports API operations across multiple providers, and provides a versioned community JSON dataset.
Modeltell 数据集概述
Modeltell 是一个专注于计算语言学分析的数据集,用于系统性测量大语言模型在词汇和句法层面的特征指纹。
核心定位
与传统的基于单词级别的“AI检测器”不同,Modeltell 分析的是语法结构——即每个模型在句子结构、修辞模式和行文习惯上的独特语言身份。
数据集规模
| 维度 | 数量 |
|---|---|
| 追踪模型 | 13 个 |
| 句法模式 | 15 种 |
| 标准化提示 | 30 条 |
追踪模型列表
| 层级 | 模型 |
|---|---|
| 前沿模型 | Claude Opus 4.8 / 4.7 / 4.6, GPT-5.5, Gemini 3.1 Pro |
| 中端模型 | Claude Sonnet 4.6, GPT-5.4 Mini, Gemini 3.5 Flash |
| 开源模型 | Llama 4 Maverick, DeepSeek V4 Pro / V3.2, Mistral Large (2512), Qwen3.7 Max |
检测的句法模式
| 模式名称 | 检测内容 | 严重等级 |
|---|---|---|
| Tricolon | 三项并列结构(如“innovative, scalable, and transformative”) | 高 |
| Whether-Youre | “Whether youre a startup or enterprise...” 句式 | 严重 |
| Hedging Opener | “Its worth noting that...” 模糊开场 | 高 |
| Not-Just-But | “not just a tool, but a partner” 转折结构 | 高 |
| In-Todays-Landscape | “In todays fast-paced digital landscape...” 陈词开场 | 严重 |
| Em-Dash Pivot | 破折号转折(如“one platform - endless possibilities”) | 中等 |
| Power Verb Stacking | 动词堆叠(如“drive, boost, and accelerate”) | 高 |
| Future-Forward Closing | “As we move forward...” 未来收尾 | 高 |
| 其他7种 | 详见 patterns/definitions.json |
分析维度
- 句法模式检测:三列并举频率、模糊修辞、伪包容性开场、破折号转折、强力动词堆叠等
- 结构分析:开头/结尾分类、项目符号与正文比例、排版密度、句子长度方差
- 跨模型指纹识别:雷达剖面图展示每个模型独特语言习惯组合
- 演化追踪:不同模型版本间模式变化,模型间趋同或分化趋势
数据格式
- 原始输出:
data/{run-id}/{model-id}.json - 词汇分析:
data/{run-id}/_lexical_analysis.json - 句法分析:
data/{run-id}/_syntactic_analysis.json
数据API结构
published/locales.json (语言发现:存在哪些语言) published/<locale>/index.json (入口文件,支持 en/de 等) published/<locale>/models/{model-id}.json (每个模型独立指纹文件) published/<locale>/watchlist/words.json (高频AI关联词汇) published/<locale>/watchlist/constructions.json (句法结构列表) published/<locale>/comparisons/tier-summary.json (层级平均数据:前沿/中端/开源) published/<locale>/comparisons/similarity-matrix.json (雷达相似度矩阵) published/<locale>/comparisons/delta-matrix.json (Burrowss Delta 矩阵) published/<locale>/validation/regex-precision.json (正则表达式精度审计,可选)
适用范围与限制
- 非AI检测工具:描述模型输出的统计倾向,不用于判断单段文本是否由AI生成
- 无人为对照基线:词汇分数衡量跨模型差异,未与人工写作对比
- 部分模式检测经过验证:手动精度审计显示微平均精度约71%,部分模式表现优秀(not-just-but、强力动词),部分模式表现不佳(如
parenthetical_aside约0%,tricolon/em_dash_pivot约0.75) - 显著性分析基于模式级别:每个频率携带95%自助置信区间和FDR校正置换检验
- 任务/提示偏差:目前仅覆盖商业/营销文案领域,单一系统提示和默认解码设置
项目架构
prompts/catalog.json:30条标准化内容生成提示patterns/definitions.json:15种句法模式定义及词汇监控清单src/runner/:多提供商API运行器(每模型每提示运行3次)src/analysis/:词汇分析(跨模型TF-IDF、Burrowss Delta)和句法分析(正则表达式模式)src/publish/:分析结果转换为社区JSON数据集src/cli/:零依赖内容检查器(支持中英文双语的AI模式标记工具)frontend/:滚动式数据可视化(React + Vite + D3)
自动化运行
GitHub Action 每月自动运行完整流水线,并将结果提交至仓库,确保数据可再生性和透明度。




