遇见数据集

JetBrains-Research/cwm-benchmarks-dl4c-benchmark

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含软件测试或性能分析相关的样本,每个样本具有环境ID、实例ID、仓库信息、基础提交、任务、系统提示、用户提示、真实结果、失败行、异常类型、峰值字节、墙钟时间等字段,以及热方法时间和分配的列表。适用于评估代码或系统在不同环境下的行为及性能问题。

This dataset contains samples related to software testing or performance analysis, each with fields such as environment ID, instance ID, repository info, base commit, task, system prompt, user prompt, ground truth outcome, failure line, exception type, peak bytes, wall clock time, and lists of hot methods time and allocation. It is suitable for evaluating code or system behavior and performance issues under different environments.

提供机构:
JetBrains-Research
搜集汇总
数据集介绍
JetBrains-Research/cwm-benchmarks-dl4c-benchmark 数据集图片
构建方式
该数据集名为cwm-benchmarks-dl4c-benchmark,专为评估深度学习编译器的性能与正确性而构建。其构建过程基于精心设计的基准任务集,每个样本通过一个唯一的sample_id进行标识,并关联到特定的环境(env_id)和实例(instance_id)。数据集中包含了任务定义(task)、系统提示(system_prompt)与用户提示(user_prompt),以模拟实际编译场景中的指令交互。此外,为每个任务标注了真实结果,包括预期输出(ground_truth_outcome)、故障行号(ground_truth_failure_line)、异常类型(ground_truth_exception_type)、峰值字节数(ground_truth_peak_bytes)以及执行耗时(ground_truth_wall_ms)等关键性能指标。还记录了热点方法与行的耗时与内存分配信息,从而为编译器的行为分析提供多维度的参照基准。
特点
该数据集最显著的特点是其对深度学习编译器性能评估的全面性与细粒度。它不仅覆盖了任务执行的正误判断,还深入追踪了运行时资源消耗,如峰值内存(peak_rss_bytes)与追踪字节数(peak_traced_bytes),并提供实际执行时间(wall_time_s)。特别地,数据集包含了关于热点方法与行的详细时间与分配数据,这些数据以列表形式呈现原始真实值(ground_truth_hot_methods_time等),并以字符串形式提供程序化可读的汇总值(values_hot_methods_time等)。这样的设计使得研究者能够从宏观性能到微观瓶颈进行多层次分析,极大地增强了对编译器优化效果的理解深度。整个数据集包含435个训练样本,规模适中,却覆盖了多样化的编译挑战。
使用方法
使用该数据集时,研究人员可通过加载其默认配置下的训练分割(train split)访问全部435个样本。每个样本的数据结构以特征形式组织,便于直接映射到机器学习模型的输入。开发者可以依据任务字段(task)和提示字段(system_prompt, user_prompt)构建编译任务的指令序列,并将模型输出与ground_truth_outcome进行比对以评估正确性。同时,利用提供的性能指标(如ground_truth_peak_bytes和ground_truth_wall_ms)和实际运行时指标(如peak_traced_bytes和wall_time_s),可以量化编译器在内存与时间上的优化效果。此外,热点方法与行的数据可用于诊断瓶颈,指导编译器进行针对性调优。数据集以Parquet文件格式存储,可通过Hugging Face的datasets库轻松加载与处理。
背景与挑战
背景概述
该数据集cwm-benchmarks-dl4c-benchmark诞生于深度学习持续集成与部署的背景下,由相关研究机构为评估模型在复杂软件工程环境中的性能而创建。其核心研究问题聚焦于如何通过基准测试自动化地检测与诊断深度学习代码中的性能瓶颈和异常行为,尤其在多实例、多节点的高并发场景下。数据集包含丰富的元数据,如环境标识、任务描述及多种运行时指标(峰值内存、耗时、热点方法等),为研究代码效率优化、异常定位和资源调度策略提供了标准化评估平台,对提升深度学习系统的可靠性与可维护性具有重要推动作用。
当前挑战
该数据集所应对的领域挑战在于深度学习代码在分布式环境中存在的性能退化和隐式缺陷,例如内存泄漏、热点方法的不当实现导致的资源浪费,以及跨节点任务执行的不稳定性。构建过程中面临的挑战包括:如何设计具有代表性的任务实例覆盖多样化的代码缺陷模式;如何精确采集细粒度的运行时指标并提供可靠的真实标签(如失败行号、异常类型);以及如何在有限样本量(435条训练数据)下确保基准测试的泛化能力与公平性。
常用场景
经典使用场景
cwm-benchmarks-dl4c-benchmark数据集专门为深度学习编译优化领域设计,其核心应用场景在于评估和提升深度学习编译器在内存管理与执行效率方面的表现。研究人员可利用该数据集中的丰富特征,如峰值内存占用、墙钟时间、热点方法与行的分配与耗时等,构建或微调编译器优化策略。通过比对模型输出的预测值与数据集中精确标注的真实结果,可以量化编译优化方案在减少内存足迹、加速计算过程方面的成效,从而推动编译器在面向复杂深度学习模型时的自适应调优能力。
解决学术问题
该数据集精准地回应了深度学习编译器中长期存在的两大瓶颈:内存资源的精细化调控与执行延迟的预测性优化。学术研究中,传统编译器优化往往依赖于启发式规则,缺乏对特定模型运行时行为的深入理解。cwm-benchmarks-dl4c-benchmark通过提供涵盖异常类型、失败行号及热点资源消耗的细粒度标签,首次使研究者能够系统性地探究不同编译优化技术对内存峰值和计算热点的实际影响,为数据驱动的编译策略研究奠定了坚实的实验基础,显著推动了编译器在资源受限设备上的部署可行性。
衍生相关工作
基于cwm-benchmarks-dl4c-benchmark数据集,研究者已衍生出多项具有启发性的工作。利用其对热点方法耗时与分配的标注,学者们构建了自动化编译器参数调优的强化学习框架,能够针对给定的模型与硬件组合,学习最优的编译调度策略。亦有工作聚焦于数据集中的异常类型与失败行号信息,开发出用于编译器运行时异常预测的轻量级分类器,提前规避潜在的执行崩溃。这些衍生研究不仅拓展了数据集的应用边界,更深化了学术界对深度学习编译器行为建模与智能优化的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务