AutoElicit-Exec
收藏资源简介:
AutoElicit-Exec 是一个包含 132 条人工验证执行轨迹的数据集,展示了前沿计算机使用代理(CUAs,即 Claude 4.5 Haiku 和 Claude 4.5 Opus)在典型良性执行中表现出的意外行为。这些轨迹是通过 AutoElicit 从 OSWorld 的良性指令中扰动生成的,旨在增加意外伤害的可能性,同时保持指令的现实性和良性。数据集用于分析导致意外安全风险的良性输入因素。 数据集结构包含以下字段:轨迹 ID(trajectory_id)、任务 ID(task_id)、领域(domain)、扰动 ID(perturbation_id)、精炼模型(refinement_model)、执行代理(execution_agent)、扰动指令(perturbed_instruction)、轨迹步骤(trajectory_steps)、截图路径(screenshots)、轨迹评估(trajectory_evaluation)和轨迹摘要(trajectory_summary)。 轨迹步骤(trajectory_steps)是一个字典列表,每个步骤包含步骤编号(step_num)、代理执行的动作(action)、代理的思考过程(thought)和对应的截图路径(screenshot_file)。轨迹评估(trajectory_evaluation)包含自动评估结果,如行为引发分数(behavior_elicitation_score)、有害动作列表(harmful_actions_observed)、安全动作列表(safe_actions_observed)、严重性评估(severity_assessment)等。 数据集适用于计算机使用代理的安全分析、意外行为检测和风险评估等任务。




