遇见数据集

vibench-results

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

VIBench Results数据集包含了一项关于垂直整合偏差(Vertical Integration Bias, VIB)研究的完整结果集合,主要用于代码生成和软件工程领域的研究,特别关注大型语言模型在生成代码时对特定生态系统(如云服务提供商、开发框架)的偏好偏差。数据集包含保留的原始生成结果、检测器标记的输出、完整运行记录、选项顺序和运行时消融实验、面向论文的摘要、图表、配置文件、审计文件以及静态探索器索引。主要评估涵盖了13个不同的模型,包含15,600个直接生成样本和2,000个代理运行样本。数据集中提供了多种配置:runs配置包含13行,每行对应一个保留的运行根目录;all_records配置包含24,698行,每行对应一个检测器评分的单元;此外还有多个类别特定的配置(如direct_complete、direct_ablations等),这些配置提供了all_records的过滤子集。关键数据字段包括模型标识符、运行标识符、场景标识符、任务标识符、检测到的提供商、检测到的生态系统、检测到的服务、检测置信度、检测方法等。数据集还包含完整的文件结构,包括原始输出目录、结果目录、文档目录、配置目录等,适用于研究代码生成模型的偏差行为、生态系统锁定效应以及代理系统中偏差放大现象的分析。

The VIBench Results dataset comprises the full collection of results from a study on Vertical Integration Bias (VIB), targeting research in code generation and software engineering, with a particular focus on the preference biases of Large Language Models (LLMs) toward specific ecosystems—such as cloud service providers and development frameworks—during code generation. The dataset includes retained raw generation outputs, detector-labeled results, complete run logs, option sequences and runtime ablation studies, paper-oriented abstracts, charts, configuration files, audit files, and static explorer indexes. A total of 13 distinct models were evaluated, encompassing 15,600 directly generated samples and 2,000 proxy run samples. Multiple configurations are provided within the dataset: the `runs` configuration contains 13 entries, each corresponding to a preserved run root directory; the `all_records` configuration includes 24,698 entries, each representing a detector-scored unit; additionally, several category-specific configurations (e.g., `direct_complete`, `direct_ablations`) are available, which offer filtered subsets of the `all_records` configuration. Key data fields include model identifiers, run identifiers, scene identifiers, task identifiers, detected providers, detected ecosystems, detected services, detection confidence, detection methods, and more. The dataset also features a complete file structure encompassing raw output directories, result directories, documentation directories, configuration directories, and more, making it suitable for analyzing the bias behaviors of code generation models, ecosystem lock-in effects, and bias amplification phenomena in proxy systems.

创建时间:
2026-05-24
原始信息汇总

数据集名称

VIBench Results

数据集简介

VIBench Results 包含研究中使用的原始生成结果、检测器标注输出、完整运行记录、选项顺序和运行时消融实验、面向论文的总结、图表、配置、审计文件以及静态探索器索引。

主要评估规模

  • 涉及 13 个模型
  • 15,600 次直接生成
  • 2,000 次智能体运行

核心度量指标

直接和智能体 VIB(垂直集成偏差)报告为场景匹配、共享归一化的差异,衡量的是关联生态系统选择相对于严格非关联控制模型的偏差。

数据集配置

该数据集通过 Hugging Face 查看器提供多个配置,每个配置对应一个 JSONL 文件:

配置名称 数据文件 说明
runs viewer/runs.jsonl (13行) 每个保留运行根目录一行,包含 run_idrun_category 及直接/智能体运行标志
all_records viewer/all_records.jsonl (24698行) 每个检测器评分单元一行;直接行为单个标注输出,智能体行为标注的会话摘要
direct_complete viewer/direct_complete.jsonl all_records 的过滤子集
direct_ablations viewer/direct_ablations.jsonl all_records 的过滤子集
opencode_complete viewer/opencode_complete.jsonl all_records 的过滤子集
agents_sdk_complete viewer/agents_sdk_complete.jsonl all_records 的过滤子集
opencode_ablations viewer/opencode_ablations.jsonl all_records 的过滤子集
agents_sdk_ablations viewer/agents_sdk_ablations.jsonl all_records 的过滤子集

记录表关键列

  • model_id:模型标识
  • run_id:运行标识
  • run_category:运行类别
  • scenario_id:场景标识
  • task_id:任务标识
  • modality:模态
  • detected_provider:检测到的提供商
  • detected_ecosystem:检测到的生态系统
  • detected_service:检测到的服务
  • detection_confidence:检测置信度
  • detection_method:检测方法
  • source_file:源文件路径
  • session_dir:会话目录路径

成果物布局

  • outputs/runs/:原始和标注的直接/智能体生成结果
  • results/:评估输出和机器可读的总结
  • docs/results/:面向论文的结果总结
  • docs/figures/:论文中使用的导出图表
  • configs/vibench/:确切的保留运行配置
  • benchmark/vibench/audit/:检测器人工验证样本文件
  • vibench-explorer/data/:静态探索器缓存和紧凑结果索引
  • viewer/:用于 Hugging Face 数据集查看器的扁平 JSONL 表

预期用途

  • 发现保留运行:首先使用 runs 配置
  • 按条件过滤:使用 all_records 或类别特定配置按模型、场景、运行时或检测到的生态系统过滤
  • 获取完整原始成果:当需要完整的原始成果、会话目录或查看器行引用的标注 JSON 文件时,使用底层的 outputs/runs/ 目录树

论文图表

数据集包含面向论文的图表,位于 docs/figures/paper/ 目录下:

  • Direct VIBdocs/figures/paper/rq1/direct_vib_single_column.svg
  • Direct-to-agentic VIB amplificationdocs/figures/paper/rq2/direct_agentic_vib_icons.svg
  • Cascade lock-indocs/figures/paper/rq3/cascade_scatter.svg
搜集汇总
数据集介绍
vibench-results 数据集图片
构建方式
VIBench Results数据集旨在系统收录大语言模型在垂直集成偏见(Vertical Integration Bias)研究中的评估结果。其构建过程包含多个层次:首先收集13个模型生成的15,600条直接生成样本与2,000次代理运行记录;随后通过检测器对每条输出进行生态关联标注,形成包含模型标识、场景编号、检测到的供应商与生态系统等字段的结构化记录。所有原始生成文件、检测器标签、运行时消融实验配置及审计样本均按规范目录组织,最终以JSONL格式的紧凑索引表(如runs与all_records)呈现,便于高效检索与复现。
使用方法
使用VIBench Results时,建议从runs配置文件入手,快速浏览所有保留运行的基本信息。如需按模型、场景或检测到的生态系统进行针对性筛选,可直接加载all_records或category-specific配置(如direct_complete、opencode_ablations)。对于希望获取完整原始数据的研究者,可直接访问outputs/runs/目录下的JSON文件与会话日志,追溯每条标注记录的原始上下文。数据分析时需注意,直接生成记录对应单条输出,而代理运行记录对应会话摘要,两者在统计口径上存在差异。
背景与挑战
背景概述
VIBench Results数据集由研究人员构建,旨在评估代码生成模型在垂直集成环境中的偏见行为。该数据集涵盖了13个模型的15,600次直接生成和2,000次代理执行的结果,通过场景匹配与份额归一化的差异度量,揭示了模型在关联生态系统选择上的偏好。其核心研究问题聚焦于代码生成中的垂直集成偏见,即在特定软件生态系统中,模型更倾向推荐自身关联服务的现象。该数据集的创建推动了软件工程领域对生成式AI公平性与可靠性的深入探讨,为后续基准测试和模型改进提供了关键数据支撑。
当前挑战
该数据集面临的挑战包括:1) 领域问题方面,需准确量化模型在多种软件生态系统中隐性的供应商锁定偏见,确保评估指标能区分偶然偏好与系统性偏差;2) 构建过程中,需处理大规模生成记录的标注与验证,包括13个模型在多样场景下的输出,并通过探测器标注与人工审核样本确保数据质量;同时,组织多层次数据结构(如原始生成、标签输出、运行摘要)并设计高效的查询接口,以支持细粒度分析与可复现性,涉及24698条记录和多个配置子集的整合与维护。
常用场景
经典使用场景
VIBench Results数据集的核心用途在于系统性地评估和量化代码生成模型中的垂直集成偏差(Vertical Integration Bias, VIB)。通过涵盖13个模型、15,600次直接生成和2,000次智能体运行的庞大实验规模,研究者能够利用该数据集的完整运行记录、检测器标注输出及场景匹配的共享归一化差异指标,精准衡量模型在附属生态系统选择上相较于严格非附属控制模型的偏移程度。这一经典研究范式为理解大语言模型在软件工程任务中的偏好偏差提供了可靠的数据基石。
解决学术问题
该数据集着力解决了代码生成模型评估中一个被长期忽视的学术难题——如何系统检测和量化模型因训练数据或架构设计而产生的对特定技术生态系统的隐性偏好。通过引入场景匹配的隶属生态系统选择差异度量,并区分直接生成与智能体交互两种模式下的偏差程度,VIBench Results为揭示模型行为中的级联锁定效应提供了量化工具。其意义在于首次建立了从单次补全到多轮智能体协作中偏差放大现象的可复现评估框架,推动了算法公平性研究向代码生成领域的纵深拓展。
实际应用
在实际应用中,VIBench Results为软件工程及AI伦理实践提供了关键参考基准。开发团队可借助该数据集的标准评估流程,对自研代码助手或第三方模型进行偏差审计,识别其是否在API调用、库函数选择或云服务推荐中表现出不均衡的生态偏好。企业级代码生成平台能据此优化模型在跨平台开发场景下的技术中立性,金融、医疗等监管严格行业的AI应用部署也可引用该数据集的指标作为合规性审查依据。此外,该数据集支持的智能体偏差放大分析直接服务于自动化编程工具的可信度建设。
数据集最近研究
最新研究方向
VIBench Results数据集聚焦于代码生成领域垂直集成偏见的量化研究,通过13个模型、15600次直接生成与2000次代理执行的系统性评估,揭示了非附属控制模型与附属生态系统模型在场景匹配下的选择差异。该工作不仅量化了直接偏见,更开创性地刻画了从直接生成到代理执行过程中的偏见放大效应(Direct-to-Agentic VIB amplification),以及可能导致的级联锁定现象(Cascade lock-in)。这一前沿探索为大型语言模型在软件工程中的公平性评估建立了新范式,其多维度检测方法与跨模型比较框架,对防范技术生态垄断、推动生成式AI的透明化部署具有重要警示意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务