遇见数据集

vibench

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

VIBench是一个用于衡量直接和代理代码生成中垂直集成偏差的基准测试数据集。其背景和目的是评估在云和API生态系统等现实软件集成场景中,模型可能存在的对特定技术栈(垂直集成)的偏好偏差。数据集包含20个直接场景和20个与之对齐的代理工作流,覆盖了广泛的软件集成选择。数据内容包括:1) 核心任务定义:通过tasks_direct.jsonl和tasks_agentic.jsonl文件提供,包含嵌套的子任务结构、覆盖标签、指定的提供者工具以及中立控制项;vibench.jsonl是两者的合并版本。2) 模型元数据:models.json文件记录模型信息、所属机构及与提供者的映射关系。3) 系统提示:system_prompt.txt和agentic_system_prompt.txt提供规范的任务提示。4) 证据与审计工件:evidence/目录包含用于证明任务有效性和竞争标签的官方文档快照存档、证明注册表和质量摘要;audit/目录包含用于验证的盲检测器审计样本;validation/目录包含人工审查的输出结果和对比数据。数据规模方面,数据集提供了两个简化的查看器拆分:direct拆分(对应viewer/direct.jsonl文件)包含80行,每行代表一个直接基准测试子任务,包含场景元数据、子任务描述、模态特定任务ID以及扁平化的提供者/中立证明ID和URL字段;agentic拆分(对应viewer/agentic.jsonl文件)包含20行,每行代表一个对齐的代理工作流,包含工作流文件布局、计分/上下文文件计数、适用的生态系统以及相同的证明字段。数据集适用于代码生成、软件工程领域的基准测试研究,特别是用于分析和检测大语言模型在代码生成任务中可能存在的垂直集成偏差。数据集已进行匿名化处理。

VIBench is a benchmark dataset for measuring vertical integration bias in direct and agentic code generation. Its background and purpose are to evaluate potential bias in models towards specific technology stacks (vertical integration) in real-world software integration scenarios such as cloud and API ecosystems. The dataset includes 20 direct scenarios and 20 aligned agentic workflows, covering a wide range of software integration choices. Data content and composition include: 1) Core task definitions: Provided via tasks_direct.jsonl and tasks_agentic.jsonl files, which contain nested subtask structures, coverage labels, specified provider tools, and neutral controls; vibench.jsonl is a merged version of both. 2) Model metadata: The models.json file records model information, affiliated organizations, and mappings to providers. 3) System prompts: system_prompt.txt and agentic_system_prompt.txt provide standardized task prompts. 4) Evidence and audit artifacts: The evidence/ directory contains official document snapshots, proof registries, and quality summaries used to demonstrate task validity and competitive labels; the audit/ directory contains blind detector audit samples for verification; the validation/ directory contains human-reviewed outputs and comparative data. In terms of data scale, for ease of viewing, the dataset provides two simplified viewer splits: the direct split (corresponding to viewer/direct.jsonl) contains 80 rows, each representing a direct benchmark subtask, including scenario metadata, subtask descriptions, modality-specific task IDs, and flattened provider/neutral proof IDs and URL fields; the agentic split (corresponding to viewer/agentic.jsonl) contains 20 rows, each representing an aligned agentic workflow, including workflow file layouts, scoring/context file counts, applicable ecosystems, and the same proof fields. The dataset is suitable for benchmark research in code generation and software engineering, particularly for analyzing and detecting potential vertical integration bias in large language models for code generation tasks. The dataset has been anonymized.

创建时间:
2026-05-24
搜集汇总
数据集介绍
vibench 数据集图片
构建方式
VIBench是一个专为衡量垂直集成偏见而构建的代码生成基准测试集,涵盖直接生成与智能体协作生成两大场景。该数据集精心设计了20个直接生成场景及与之对齐的20个智能体工作流,覆盖了云服务与API生态系统中现实存在的软件集成选择难题。构建过程中,研究团队汇集了全面的基准任务描述、模型元数据、系统提示词以及供应商无关的证据材料,并辅以盲法检测器审计样本进行验证。数据集的根目录包含`tasks_direct.jsonl`与`tasks_agentic.jsonl`文件,分别存储嵌套子任务与工作流定义,而`vibench.jsonl`则提供了紧凑型合并导出。证据档案库中收录了官方文档快照、质量审计记录及场景与证据的映射关系,确保每项任务的可追溯性与竞争性标签的合理性。
特点
VIBench数据集的核心特点在于其严谨的双层次验证架构与供应商无关性设计。数据集以直接生成与智能体工作流两个视图呈现,前者包含80行子任务记录,每行携带场景元数据与扁平化的证据列,后者包含20行工作流记录,涵盖文件布局与计分上下文。证据档案库独立维护了本地快照与实时URL检测结果,有效规避了因供应商文档的临时重定向或错误响应导致的数据不可用问题。此外,数据集附带了400份样本的盲法审计集与人工评审输出,支持从冲突检测到一致性量化的全链路可重复性验证。所有任务与证据通过独立的`proof_id`进行关联,形成了闭合的溯源链路,确保基准测试的公平性与透明度。
使用方法
用户可通过HuggingFace数据集查看器直接加载`direct`与`agentic`两个配置分片进行快速浏览与过滤。若需完整的嵌套模式定义以驱动生成与评估代码,应使用根目录下的`tasks_direct.jsonl`与`tasks_agentic.jsonl`文件。模型评估时需加载`models.json`获取元数据与供应商映射,并配合`system_prompt.txt`及`agentic_system_prompt.txt`中的规范提示词。证据档案库中的`evidence/`目录提供了官方文档快照与质量审计,用户可结合`validation/`下的盲法审计样本与人工评审CSV文件复现一致性分析。数据集的匿名化设计确保了审查过程的公正性,所有联系信息与作者身份已被有意移除。
背景与挑战
背景概述
VIBench是一个专注于测量代码生成中垂直集成偏差的基准测试数据集,由研究团队于近期创建,旨在系统评估大型语言模型在直接与代理式代码生成场景下的软件集成选择倾向。该数据集包含20个直接任务场景及20个对齐的代理工作流,覆盖云服务和API生态系统中实际存在的集成选择问题。通过为每个任务设计提供商标识与中立对照的元数据,VIBench为检测模型对特定云服务商或API的偏好提供了标准化的评估框架。其影响力体现在为软件工程领域的代码生成模型引入了系统性的偏差测量维度,推动开发更加中立、可移植的代码生成工具。
当前挑战
VIBench致力于解决的领域挑战是当前代码生成模型普遍存在的垂直集成偏差,即模型在生成代码时会倾向选择特定云供应商的专有服务或API,而非采用中立的行业标准或可替代方案,导致生成的代码缺乏可移植性。在构建过程中,研究团队面临的挑战包括:如何设计真实且具有代表性的一对一场景,使直接任务与代理工作流在系统架构层面上严格对齐;如何从官方文档中提取稳定可验证的证据快照,以客观判定服务之间的可替换性;以及如何设计盲测检测器与人工评审机制,确保偏差评估结果的可重复性与可信度,而不仅依赖实时网络可达性状态。
常用场景
经典使用场景
VIBench作为一个专为评估垂直集成偏差设计的基准测试数据集,其经典使用场景聚焦于直接代码生成与智能体驱动的代码生成两大领域。在直接场景中,研究者和开发者可通过20个精心设计的子任务,测试模型在云端和API生态系统中进行软件集成选择时是否存在对特定供应商或平台的偏好。而在智能体工作流场景中,VIBench提供了20个与直接场景对齐的复杂工作流,用于评估自主代码生成系统在处理多步骤、需协调多个服务的集成任务时的决策公正性。该数据集通过系统提示、供应商无关的证明文物以及盲法检测审计样本,为衡量代码生成模型在真实软件工程环境中的中立性提供了标准化且可重复的评测框架。
实际应用
在实际应用中,VIBench直接服务于企业级软件开发工具链的质量评估与改进。软件工程团队可利用该基准测试对其采用的代码补全或智能体开发工具进行供应商中立性审计,确保在技术选型时生成的代码不会因训练数据的偏倚而自动偏向特定云厂商。此外,该数据集为云服务提供商和开发者平台提供了客观的第三方评价标准,可以用于验证其AI编码助手在跨生态场景下的决策公正性。在DevOps流水线中,VIBench的场景设计还能帮助企业检测持续集成过程中潜在的供应商锁定风险,从而在设计阶段就做出更具弹性和可移植性的架构决策。
衍生相关工作
VIBench数据集的出现催生了若干值得关注的衍生研究方向。一方面,其提出的垂直集成偏差概念已被整合到更广泛的代码生成公平性评测框架中,例如后续研究者借鉴其证明文物设计和审计方法论,开发了针对特定领域(如云原生应用部署和微服务架构)的偏差检测工具集。另一方面,VIBench中使用的盲法审计样本和跨验证者一致性分析技术,已成为评估大模型决策偏差的新兴标准,被应用于开源代码生成模型的偏差基准测试。该数据集还激发了关于“供应商中立化提示工程”的研究,探索利用系统提示技术缓解代码生成中的偏好性倾向。此外,其证据档案和快照存档机制为可复现的AI审计实践提供了方法学参考,推动了可追溯性评测在软件工程领域的规范化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务