遇见数据集

claudeisms

收藏
github2026-07-17 更新2026-07-21 收录
官方服务:

资源简介:

该数据集是一个词语列表,记录了Claude Code(AI助手)在对话中过度使用的词汇。数据集基于用户与Claude Code的聊天记录,通过词频分析生成,并与Stack Overflow评论数据集进行对比,以量化这些词汇的相对使用频率。数据集包含144个词汇及其频率比率,旨在展示Claude Code的语言使用特征。

This dataset is a word list documenting the overused vocabulary of Claude Code, an AI assistant, during its conversational interactions with users. Generated via word frequency analysis based on chat logs of user-Claude Code conversations, it is compared with the Stack Overflow comment dataset to quantify the relative usage frequencies of these words. Containing 144 words along with their respective frequency ratios, this dataset aims to demonstrate the language usage characteristics of Claude Code.

创建时间:
2026-07-17
原始信息汇总

数据集概述:A List of Claudeisms

该数据集收录了作者在使用 Claude Code 过程中总结的、Claude 模型频繁使用的特定词汇(Claudeisms),并通过词频分析量化了这些词汇相对于人类(Stack Overflow 评论)的使用频率差异。

数据来源

  • Claude Code 会话记录:来自本地存储的会话文本,文件位于 ~/.claude/projects/**/*.jsonl,共计 175 个文件,总大小 140MB,覆盖约 5 周 的使用数据。
  • 筛选条件
    • 仅包含 Opus 4.7/4.8 模型会话(排除 Haiku 等其他模型)。
    • 仅统计发送给用户的 agent 响应消息(排除工具调用或子代理消息)。

分析方法

  • 词频统计:对 Claude Code 会话文本进行词频分析。
  • 对比基准
    1. 作者自身的输入(因包含大量日志/机器生成文本,效果不佳)。
    2. 通用互联网(使用 wordfreq 数据集,包含维基百科、Reddit、书籍、字幕、新闻等,数据截止于2021年前)。
    3. Stack Overflow 评论(BigQuery 公共数据集,包含 2008-2020 年间 17.2 亿词 的评论数据),此为用户最终选定的对比基准。

核心发现:高频 Claudeisms 词汇列表

词汇按词频比率(Claude 每百万词出现次数 / Stack Overflow 评论每百万词出现次数)排序,共 144 个词汇 的比率在 20 倍及以上,完整列表见 claudeisms.csv

前 12 个最高频 Claudeisms

词汇 Claude 每百万词次数 Stack Overflow 每百万词次数 比率
load-bearing 87 <0.012 >7,500x
gating 123 0.16 762x
dedup 102 0.16 649x
decisive 108 0.17 639x
verdict 200 0.32 633x
scaffolds 118 0.21 572x
settles 143 0.33 435x
handoff 113 0.31 360x
prod 2,516 9.14 275x
pr 2,552 9.34 273x
gated 133 0.51 263x
genuinely 328 1.46 224x

其他值得关注的 Claudeisms(比率 >20x 的部分示例)

词汇 Claude 每百万词次数 Stack Overflow 每百万词次数 比率
scaffolded 87 0.42 205x
blocker 241 1.30 185x
pre-existing 559 3.04 184x
drift 323 1.76 184x
surfaced 77 0.43 181x
stale 892 6.57 136x
end-to-end 225 2.06 110x
scaffold 282 2.75 102x
parity 179 2.45 73x
idempotent 128 3.11 41x
canonical 292 11 27x
fallback 323 14 23x
surface 374 18 21x

注意事项

  • 所有分析均使用 Claude Code 完成,代码未经过仔细审查。
  • 结果高度偏向作者本人的使用场景和工作内容。
  • 作者曾安装过 caveman 工具,可能影响词频分布。
  • load-bearing 一词据称出现在 Claude Code 的系统提示中(提示内容:“give brief updates when you find something load-bearing”)。
  • 分析 未进行词干提取,例如 scaffoldscaffoldsgatinggated 作为独立词汇统计。
搜集汇总
数据集介绍
claudeisms 数据集图片
构建方式
该数据集的构建源于开发者Archie Wood对Claude Code聊天记录中高频词汇现象的量化探索。数据集基础来源于本地存储的Claude Code会话文本,涵盖了约五周内175个JSONL文件、总计140MB的对话数据。分析聚焦于Opus 4.7/4.8版本的智能体回复消息,剔除了工具调用和子智能体内容,同时排除了用户自身粘贴的日志等机器生成文本的干扰。通过词频统计分析,以Stack Overflow评论数据集(涵盖2008-2020年间17.2亿词汇)为人类代码写作的参照基线,经过词频比率排序并剔除与开发者个人工作相关的专有名词后,最终筛选出144个高频词汇,形成CSV格式的语料清单。
特点
该数据集最具特色的价值在于其以实证方式揭示了大型语言模型在特定语境下的词汇偏好模式。词频对比结果呈现出惊人的差异幅度,例如像'load-bearing'一词在Claude中的使用频率超过Stack Overflow评论的7500倍以上,'gating'、'dedup'、'decisive'等词汇的频次比率也高达数百倍。这些被归类为'Claudeisms'的词汇涵盖了编程术语、抽象表达及特定修饰词,如'gating'、'scaffolded'、'pre-existing'、'idempotent'等,展现了AI模型在代码交互场景中独特的语言生成风格。数据集虽受限于单一开发者工作场景,但其通过跨域对比方法准确勾勒出了AI语言区别于人类技术交流的鲜明特征。
使用方法
数据集以简洁的CSV文件形式呈现,包含词汇、在Claude中每百万词的出现频率、在Stack Overflow评论中每百万词的出现频率以及两者比率等字段,便于研究者直接进行量化分析与可视化展示。用户可通过访问GitHub仓库直接获取完整数据文件,并利用标准的数据处理工具如Python的pandas或R语言进行词频排序、筛选与深度挖掘。数据集的构建代码同样公开,允许研究者复现或改进分析方法,例如调整参照语料库、引入词干提取技术或分领域对比。这一资源为探究大型语言模型的语言习惯、生成风格差异以及AI与人类沟通模式的对比研究提供了生动的数据基础。
背景与挑战
背景概述
在大型语言模型日益渗透软件工程实践的背景下,研究人员与开发者开始关注模型输出中存在的语言模式固化和词汇偏好现象。2025年,数据科学家Archie Wood基于自身与Claude Code长达数月的交互记录,创建了claudeisms数据集,旨在系统性地量化并揭示Claude模型在代码生成对话中高频使用的独特词汇集合。该数据集通过分析约140MB的本地会话日志,将Claude的词汇使用频率与Stack Overflow评论语料库(包含17.2亿词)进行对比,筛选出使用频率超过人类开发者20倍以上的144个词汇,如'load-bearing'、'gating'、'dedup'等。这一数据集不仅为理解大语言模型的输出风格提供了量化依据,更引发了关于模型语言多样性、可解释性及人机交互体验优化的深入讨论。
当前挑战
该研究面临的核心挑战可归纳为三个方面:首先,领域认知层面,如何将LLM特有的词汇偏好现象从主观感知转化为可验证的实证研究——现有评估体系多关注模型准确性,而对其语言风格的同质化问题缺乏系统性度量标准。其次,数据集构建过程中存在多重干扰因素:用户自身编程习惯的词汇偏好难以完全剥离,模型版本差异(如Opus与Haiku的词汇使用不同)、第三方工具集成(如caveman插件)对词频的潜在影响,以及日志文本中混杂的大量机器生成内容(如'requestid'等JSON键名)均需审慎过滤。最后,对比基准的选取构成方法论挑战:直接对比通用网络语料会引入大量非编程语境噪声,而Stack Overflow评论区虽为编程语言场景,但其时间跨度(2008-2020年)与当前LLM训练数据存在时代差异,导致部分技术词汇的本底频率偏低,可能放大相对比值。
常用场景
经典使用场景
在大语言模型与人类交互行为的差异分析中,claudeisms数据集为研究者提供了一种独特的词汇偏好量化工具。该数据集通过收集使用者与Claude模型长达数周的对话记录,运用词频分析方法,系统性地识别出模型在生成文本时过度使用的特定词汇集合。经典使用场景包括对比分析模型语言特征与人类自然语言表达的差异,以及在不同模型版本(如Opus和Haiku)间进行词汇使用模式的比较研究。研究者可以利用该数据集的词频排名和比率数据,深入探究大语言模型在工程化语言风格上的统计规律。
解决学术问题
该数据集聚焦于解决大语言模型输出语言风格特异性的识别与量化这一关键学术问题。传统研究多关注模型的语义能力和安全性,而忽视了模型语言使用中存在的系统化词汇偏好现象。claudeisms数据集通过引人注目的统计证据,首次以实证方式揭示了AI模型在工程对话中高频使用如「load-bearing」「gating」「decisive」等词汇的显著倾向,其使用频率可超过人类同等场景数千倍。这一发现有力地推动了计算语言学领域对模型语言行为偏移特征的研究,为理解AI模型语料训练偏差及其表达模式的固化提供了重要的数据支撑和理论启发。
衍生相关工作
claudeisms数据集催生了一系列在大语言模型语言风格分析与AI文本检测领域具有启发性的相关工作。该数据集首创的对比研究方法——将模型输出与Stack Overflow评论、通用互联网语料进行词频比率比较——为后续研究者提供了可复现的分析框架。基于此,衍生出了针对不同模型家族(如GPT、Gemini、Llama)词汇偏好的比较研究,以及模型语言风格随时间演变的纵向追踪分析。部分工作还进一步探索了模型词汇选择与训练数据分布之间的关联,甚至开发了利用这些词汇偏好特征进行机器生成文本检测的新型技术路线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务