遇见数据集

albedo

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

albedo 是一个包含 SWE-agent 参考轨迹的数据集,这些轨迹源自 SN97 (albedo) 评估。数据集以聊天格式组织样本,每一行代表一个独立样本。每个样本包含两个核心字段:sample_id 用于唯一标识样本来源(格式为 `<数据集>/<分片>.parquet:<行号>:<轮次>`);messages 是一个消息列表,其中依次包含系统提示、用户任务(由 PR 描述和指令组成),以及交替出现的助手参考步骤和用户环境观察结果。数据集根据不同的参考模型划分为多个子集(split),包括 glm_5_2、gpt_5_6_luna 和 mimo_v2_5_pro。每个子集的数据存储在 Parquet 文件中,每个文件固定包含 100 个样本,随着评估工作的进行会持续追加新的文件。该数据集适用于软件工程代理(SWE-agent)的评估、训练或行为分析等任务。

albedo is a dataset containing reference trajectories for SWE-agent, derived from the SN97 (albedo) evaluation. The dataset organizes samples in a chat format, with each line representing an independent sample. Each sample includes two core fields: sample_id uniquely identifies the sample source (formatted as `<dataset>/<shard>.parquet:<row_number>:<round>`); messages is a list of messages that sequentially contain system prompts, user tasks (composed of PR descriptions and instructions), and alternating assistant reference steps and user environmental observations. The dataset is divided into multiple subsets (splits) based on different reference models, including glm_5_2, gpt_5_6_luna, and mimo_v2_5_pro. Data for each subset is stored in Parquet files, with each file fixed to contain 100 samples, and new files are continuously appended as the evaluation work progresses. This dataset is suitable for tasks such as evaluation, training, or behavioral analysis of software engineering agents (SWE-agent).

创建时间:
2026-07-24
原始信息汇总

数据集名称

albedo

数据集简介

albedo数据集包含来自SN97(albedo)评估的参考轨迹数据,每一行代表一个聊天格式的样本。

数据集配置与文件结构

  • 配置名称: default
  • 数据文件:
    • glm_5_2 分片路径: data/glm_5_2/*.parquet
    • gpt_5_6_luna 分片路径: data/gpt_5_6_luna/*.parquet
    • mimo_v2_5_pro 分片路径: data/mimo_v2_5_pro/*.parquet

每个分片对应一个参考模型,每个Parquet文件包含恰好100个样本,新文件会在评估完成后追加。

数据字段说明

  • sample_id: 源分片和数据行标识,格式为<dataset>/<shard>.parquet:<row>:<turn>
  • messages: 一个包含rolecontent字段的列表,结构如下:
    • 系统提示(system
    • 用户任务(user),包含PR描述和指令
    • 交替的参考步骤(assistant)和用户环境观察(user

使用示例

python from datasets import load_dataset

ds = load_dataset("dendriteholdings/albedo", split="glm_5_2") print(ds[0]["messages"][0])

搜集汇总
数据集介绍
albedo 数据集图片
构建方式
albedo数据集源自SN97(反照率)评估任务,旨在为SWE-agent提供参考轨迹。其构建方式以聊天格式样本为基础,每行数据包含唯一的`sample_id`,用于标识来源分片及行号,以及`messages`字段,由系统提示(system)、用户任务(user)——即PR描述和指令,与交替的助手参考步骤(assistant)和环境观察(user)构成。数据集按参考模型划分为不同子集,例如glm_5_2、gpt_5_6_luna和mimo_v2_5_pro,每个子集包含恰好100个样本,并随着评估完成不断追加新文件。
特点
该数据集的核心特点在于其结构化与动态性。样本以标准对话格式组织,便于下游模型微调与评估,且每个样本均包含完整的交互上下文,从任务描述到多轮执行步骤,真实模拟了代理与环境间的协作过程。分片命名清晰反映所采用的参考模型,方便研究者进行针对性的模型对比分析。此外,数据集采用高性能的Parquet格式存储,有效平衡了读取效率与存储空间,并支持通过动态追加的方式扩展样本规模。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载albedo数据集。具体操作为调用`load_dataset`函数,指定仓库名称与所需的分片(split),例如`load_dataset("dendriteholdings/albedo", split="glm_5_2")`,即可获得包含100个参考轨迹的Dataset对象。每个样本中的`messages`字段可直接用于对话模型的训练或推理,用户可依据`sample_id`追踪数据来源,或遍历分片以整合多个模型的参考轨迹进行综合分析。
背景与挑战
背景概述
albedo数据集由Dendrite Holdings机构于近期创建,旨在为软件工程领域的智能体(SWE-agent)提供高质量的参考轨迹数据。该数据集聚焦于SN97(albedo)评估基准,通过记录智能体在解决实际代码问题时的交互步骤(包括系统提示、用户任务描述、中间推理步骤及环境反馈),为强化学习与模仿学习研究提供结构化训练样本。其核心研究问题在于如何利用带注释的轨迹数据提升代码生成与修复模型的决策能力,推动自主编程智能体的发展。albedo的发布为相关领域提供了可复现的基准,促进了代码智能体研究社区的标准化评估。
当前挑战
当前albedo数据集面临的关键挑战包括:领域问题层面,软件工程中的代码修复任务复杂且多变,现有轨迹难以覆盖多样化的错误类型与修复策略,限制了智能体在未见场景中的泛化能力。构建过程中,参考轨迹的生成依赖特定模型(如GLM-5.2、GPT-5.6-Luna等),这些模型本身的偏差与局限性可能被编码至数据中,影响下游模型的鲁棒性。此外,随着评估任务数量增长,如何高效扩展数据集规模并保持轨迹质量的一致性是持续挑战,而环境交互日志的标准化与噪声过滤也需进一步优化。
常用场景
经典使用场景
在软件工程与人工智能交叉研究领域,albedo数据集被广泛用于构建和评估能够自主与软件仓库交互的智能体系统。该数据集收录了多款大语言模型(如GLM、GPT、MIMO系列)在真实Pull Request任务上生成的参考轨迹,每条轨迹以对话形式记录了从任务理解到代码修改的完整过程。研究者通常将其作为标准基准,训练或微调能够理解代码差、执行shell命令、做出编辑决策的SWE-agent。数据集划分为多个子集,分别对应不同模型作为参考行为提供者,支持对比不同策略下的自主体表现。
解决学术问题
albedo数据集解决了自动化软件维护中行为监督信号匮乏这一核心困境。传统方法依赖人工标注示例,而该数据集通过采样高性能模型在真实代码库上的操作轨迹,为自主代码修复与功能扩展任务提供了高质量的行为克隆训练素材。它使得研究者能够系统性地探究大模型在具身软件环境中的规划与纠错能力,推动了从静态代码理解到动态环境交互的学术范式转变。该数据集的公开释放显著降低了SWE-agent领域的入门门槛,成为探讨模型规模、训练策略与环境反馈之间相互作用机制的基石性资源。
衍生相关工作
albedo数据集催生了一系列围绕自主代码编辑智能体的经典工作。研究者基于其参考轨迹,提出了针对长上下文代码任务的分层注意力机制,以及融合检索增强生成与模拟执行的混合决策框架。另一项代表性工作探索了利用该数据集进行逆向强化学习,从参考路径中推断奖励模型,从而训练出超越原始专家行为的自主体。此外,针对该数据集中不同模型输出的多样性分析,衍生出关于行为一致性评估与策略融合的专项研究,推动了多智能体协作代码修复算法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务