遇见数据集

enabling-independent-research

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是 Anthropic Insights 试点项目的一部分,旨在支持独立研究机构分析用户如何与 Claude 交互。数据集包含四个子集,分别对应斯坦福大学、牛津大学和 METR 的研究:斯坦福大学研究人类与 AI 的协作方式;牛津大学研究用户使用 Claude 的体验及其与 Claude 行为的关系;METR 研究编码代理的实际生产力提升及其随模型代际的变化。每个子集大约包含 2026 年 4 月至 5 月期间采集的 250,000 条 Claude.ai 或 Claude Code 对话的聚合聚类数据。数据不包含原始对话,仅包含隐私保护的聚类信息(如聚类名称、描述、记录数、组织数、比例等),以及跨刻面交叉表列。数据集结构为 CSV 文件,每行代表一个聚类,包含基本列(cluster_id, facet_id, cluster_name, cluster_description, level, num_records, num_orgs, ratio, ratio_95ci_lower, ratio_95ci_upper, mean_val, sum_val)和跨刻面列。使用前需注意聚类名称和描述由 Claude 生成,不代表客观测量,且样本仅来自 Free、Pro 和 Max 用户,不包含 Team、Enterprise 或 API 客户数据。数据集遵循 CC BY 4.0 许可。

This dataset is part of the Anthropic Insights pilot project, aimed at supporting independent research institutions in analyzing how users interact with Claude. The dataset contains four subsets corresponding to studies from Stanford University, the University of Oxford, and METR: Stanford studies human-AI collaboration; Oxford studies user experience with Claude and its relationship to Claudes behavior; METR studies actual productivity gains from coding agents and how they vary across model generations. Each subset contains approximately 250,000 aggregated clusters of conversations from Claude.ai or Claude Code collected between April and May 2026. The data does not include raw conversations, only privacy-preserving cluster information (e.g., cluster name, description, number of records, number of organizations, ratio, etc.) and cross-facet cross-tabulation columns. The dataset is structured as CSV files, with each row representing a cluster, containing basic columns (cluster_id, facet_id, cluster_name, cluster_description, level, num_records, num_orgs, ratio, ratio_95ci_lower, ratio_95ci_upper, mean_val, sum_val) and cross-facet columns. Note that cluster names and descriptions are generated by Claude and do not represent objective measurements; the sample only includes Free, Pro, and Max users, excluding Team, Enterprise, or API customers. The dataset is licensed under CC BY 4.0.

提供机构:
Anthropic
创建时间:
2026-08-26
原始信息汇总

数据集概述:Anthropic Insights Pilot: Partner Cluster Data

基本信息

  • 数据集名称:Anthropic Insights Pilot: Partner Cluster Data
  • 发布机构:Anthropic
  • 语言:英语
  • 许可证:CC BY 4.0
  • 标签:anthropic、claude、usage-analysis

数据集背景

该数据集是Anthropic与三家外部研究机构合作项目的一部分,旨在支持独立研究用户如何使用Claude。项目详情可参考Anthropic的博客文章相关论文。每项研究分析了2026年4月至5月期间约25万条Claude.ai或Claude Code对话,所有数据收集由Anthropic代为执行,各研究团队独立开展分析。

合作研究机构

  1. 斯坦福大学(Stanford University) :研究人类如何与AI协作,包括工作类型、人类承担的角色及协作失效场景。
  2. 牛津大学(University of Oxford) :研究用户使用Claude时的体验及其与Claude行为的关系。
  3. METR:非营利组织,评估前沿AI模型,研究编码代理的实际生产力增益及跨模型代际的变化。

数据内容与结构

数据集包含四个配置(config),每个配置对应一个CSV文件,分别是:斯坦福(stanford)、牛津(oxford)、METR(metr)及METR后续补充运行(metr_addendum)。其中metr_addendum基于新样本,采用了更严格的聚合最低阈值。

数据集中不包含原始对话,仅提供聚合后的、保护隐私的聚类数据。每一行代表一个聚类(cluster),即一组对研究者定义的问题(facet)回答方式相似的对话集合。

基础字段说明

  • cluster_id:聚类的唯一标识符
  • facet_id:该聚类所属的研究者问题
  • cluster_name:Claude生成的简短标签
  • cluster_description:Claude生成的较长描述
  • level:层级(0为最细粒度,级别1为更宽泛的父聚类)
  • num_records:聚类中的对话数量
  • num_orgs:聚类中涉及的不同组织数量
  • ratioratio_95ci_lowerratio_95ci_upper:聚类在样本中的占比及95%置信区间
  • mean_valsum_val:数值型facet的聚类级汇总统计量

此外,每个文件包含大量跨facet交叉列,将每个聚类与研究中的其他facet进行交叉制表,记录对应类别下的对话数量和比例。空白单元格表示该交叉未计算或低于隐私阈值。

隐私与审查

  • 研究人员从未接触原始对话数据、用户标识符或组织标识符,全部原始数据和计算均在Anthropic服务器上完成。
  • Anthropic工作人员在共享前对每个聚类名称和描述进行了人工审查,确保隐私、安全和研究质量。
  • 发布前,外部第三方审计员尝试在该数据中重新识别用户,未能成功。

使用限制与注意事项

  • 聚类名称和描述由Claude生成,应视作对底层对话的解读而非客观度量,不宜视为已验证结论或精确行为频率。
  • 对话样本仅来自Free、Pro和Max用户,不包含Team、Enterprise或API客户数据,不代表Anthropic全部用户群体。
  • Claude Code对话样本来自同意Anthropic使用其数据改进模型的消费者用户。
  • 每项研究为固定时间窗口(2026年4-5月)的一次性快照。
  • 牛津大学输出中有一个facet因疑似提示词措辞问题导致误导性聚类描述而被完全移除。
  • Anthropic Insights无法区分被安全机制阻止的尝试与成功的尝试,描述有害请求的聚类反映的是用户请求内容,而非Claude实际提供的内容。

联系方式

查询可发送邮件至kunal@anthropic.com,研究者可通过此表单表达对未来Societal Impacts外部研究者合作的兴趣。

搜集汇总
数据集介绍
enabling-independent-research 数据集图片
构建方式
该数据集源于Anthropic发起的合作研究计划,旨在支持外部独立研究团队探究人机交互与模型应用。Anthropic基于Claude.ai与Claude Code平台,在2026年4月至5月的固定时间窗口内,为斯坦福大学、牛津大学及METR三家机构分别抽取约25万条对话记录,并运用其Anthropic Insights分析系统进行隐私保护处理。原始对话与用户标识始终留存于Anthropic服务器,经聚类算法聚合为匿名集群数据,所有集群名称与描述均经人工审核后交付,确保数据安全与研究合规。
使用方法
使用前建议先阅读Anthropic相关博客与论文,充分理解数据生成背景与开放聚类解释指引,避免将聚类名称与描述误作客观事实或精确测量。研究者可通过Hugging Face平台加载指定配置文件,依据facet_id与level字段筛选目标面向及层级,利用ratio与num_records等指标进行定量分析,并结合跨面向列探究变量间关联。分析时应考量数据仅覆盖免费、专业与最高级消费者用户,非全量用户代表,且为单次快照,推断结论需保持审慎。
背景与挑战
背景概述
随着大语言模型日益嵌入人类工作与生活,理解人机交互的真实样态成为人工智能社会影响研究的核心议题。2026年,Anthropic研究团队发起“Anthropic Insights”试点计划,向斯坦福大学SALT实验室、牛津大学人类信息处理实验室及非营利评估机构METR三个外部研究组开放匿名化对话聚类数据,并于同年8月发布enabling-independent-research数据集。该数据集回应了前沿模型开发者与独立学术界之间数据壁垒这一结构性问题,以隐私保护的聚合聚类数据为中介,为协作研究、人机协作模式、用户体验与编码智能体生产力增益等议题提供了可复用的实证基础,亦为行业数据共享治理树立了方法论范式。
当前挑战
该数据集所面对的领域问题在于,如何在严格隐私约束下刻画大语言模型真实使用行为,其困难源于对话语义的开放性与人群抽样的非代表性——数据仅覆盖Free、Pro与Max消费者用户,且为2026年4月至5月的单次快照,难以外推至完整用户群。构建过程中的挑战同样显著:聚类标签与描述由模型生成,约3%对话未能被所属聚类清晰刻画,且标签倾向于强调引人忧虑的内容;跨面元交叉统计受隐私阈值限制而产生缺失值;牛津部分面元因提示措辞失当被整体剔除;此外,安全机制拦截与成功执行的请求无法区分,使聚类所反映的往往仅是用户诉求而非模型实际输出。
常用场景
经典使用场景
在人机协作与人工智能社会影响研究领域,该数据集最为经典的使用场景在于以聚类后的隐私保护数据为素材,系统刻画人类与Claude交互时的行为分布与协作模式。斯坦福大学SALT实验室借助其 facet 与 cross-facet 交叉结构,考察人们将何种工作任务托付给人工智能、人类在任务完成过程中保留何种角色,以及协作在何处发生断裂;牛津大学人类信息处理实验室则依托同一数据结构,探究用户使用Claude时的主观体验与模型行为之间的关联;METR 则聚焦编码智能体的现实生产力增益及其随模型代际更迭的变化。研究者由此无需接触原始对话,即可在聚合层面开展可复现的实证分析。
解决学术问题
长期以来,针对大语言模型真实使用情况的研究受制于数据获取壁垒与隐私合规约束,学术界难以在可验证的样本上回答人机协作分工、用户体验与模型行为之关联、以及智能体生产力效应等基础问题。该数据集以聚合聚类结果的形式向外部研究组开放精确输出,使研究者得以在统一的数据口径下开展独立分析,同时借助分层聚类与跨 facet 交叉表,缓解了开放式对话难以量化归类的难题。其意义在于为人工智能社会影响研究提供了一种可审计、可复制、且经隐私审查的实证范式,推动了从个案观察向规模化经验研究的转向。
实际应用
在产业与政策实践中,该数据集的应用体现为对真实交互样本的即时建模与评估。产品团队可借助 facet 层面的占比与置信区间,识别使用频次较高的任务类型与协作薄弱环节,从而优化交互设计与能力边界;模型评估机构可将编码智能体的生产力增益指标纳入基准体系,追踪不同代际模型在真实工作流中的表现差异;政策研究者则可依据经第三方审计确认无法重识别用户的数据,讨论人工智能对劳动分工与用户体验的实际影响。数据集仅覆盖 Free、Pro 与 Max 消费者样本,故其结论外推需保持审慎。
数据集最近研究
最新研究方向
伴随大语言模型深度嵌入日常生产实践,如何在不侵犯用户隐私的前提下开展独立、可复现的人机交互实证研究,已然成为AI社会影响评估领域的核心议题。该数据集源于Anthropic与斯坦福SALT实验室、牛津人类信息处理实验室及METR的三方协作,以聚合化的Claude Insights聚类数据为外部研究者提供约二十五万条对话的隐私保护快照,推动了人机协作角色分工、用户体验与模型行为关联、编码代理真实生产力增益等前沿方向的实证探索。其开放共享范式为人机交互、AI治理与模型评估交叉研究树立了可复用的方法论标杆,亦呼应了学界对透明、可审计AI生态的迫切诉求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务