遇见数据集

hybrid-web-agent-train-v2

收藏
魔搭社区2026-08-30 更新2026-08-30 收录
官方服务:

资源简介:

# hybrid-web-agent-train-v2 HybridWebAgent harness v2 的三份 SFT 数据。**system 提示词与推理端逐字一致**(见下)。 | 文件 | 样本 | assistant 步 | mask | 图片引用 | 大小 | |---|---|---|---|---|---| | `search.jsonl` | 10,012 | 504,214 | 36,694 (7.3%) | 0 | 3.3G | | `operation.jsonl` | 3,343 | 55,374 | 8,381 (15.1%) | 55,361 | 0.13G | | `hybrid.jsonl` | 4,145 | 51,095 | 3,288 (6.4%) | 51,794 | 0.26G | | 合计 | 17,500 | 610,683 | 48,363 (7.9%) | | 3.7G | 配套截图(同仓库,在数据根目录 `tar xf` 展开即可对上): | 截图包 | 大小 | 张数 | 对应 | |---|---|---|---| | `operation_images.tar` | 30.8G | 55,361 | `operation.jsonl` | | `hybrid_images.tar` | 7.0G | 33,060 | `hybrid.jsonl` | `search.jsonl` 是纯文本,不需要图。 ## 格式 ms-swift 多轮:`{"messages": [...]}`,首条 system,`loss` 打在每条 assistant 上 (1=训练,0=屏蔽)。assistant 形如 `<think>…</think><tool_call>{…}</tool_call>` 或 `<think>…</think><answer>…</answer>`;观测在 user 侧走 `<tool_response>…</tool_response>`。 ## 训推一致性 每条的 system 都由推理端同一段代码生成(`inference/hybrid_agent.py`): ```python system_prompt(active_mode, current_date=…, expose_switch=True) + "\n\n# Tool Schemas\n" + _v2_tool_schema_text() ``` schema 块 = `get_allowed_tool_names("hybrid_react_v2", side)` 过滤 `TOOLS + [SWITCH_TOOL]`, `json.dumps(ensure_ascii=False, indent=2)`。S 侧 5 个工具,O 侧 16 个。 **17,500/17,500 逐字比对通过。** 日期行按样本原样保留(任务的时间上下文)。 ## 三份的来历与清洗 **search** — XYZ-Aquila-SFT 改写成 harness v2 多轮,128k 水位线折叠。 mask 规则:机械重复(本样本内 visit 过完全相同的 URL,或 search 查询词归一化后相同 / 词集合 Jaccard ≥ 0.85)。不用 LLM 判官 —— 试过,它会把"这一步没搜到"也判成重复, 而搜索侧"换个说法再搜"是正当技能,判错的代价是教出过早放弃。 阈值 0.85 是看实例定的:`"…huns 454 455"` vs `"…huns 453 454 455"`(0.86)该屏蔽; `"…oldenburg renamed 1991"` vs `"…oldenburg founded 1973 renamed 1991"`(0.78)不该。 **operation** — MolmoWeb 人工录制的浏览器操作轨迹。think 由 qwen3.8-max 照着 **标了落点的截图**重新生成(96.1% 的坐标步),判词与 think 出自同一次观察: 判词参照**任务**判这一下点得好不好,think 以准星底下压着的控件为目标来写。 mask = 落点不对(6,815)∪ 明显空转(1,915)。另丢弃 63 条答案无依据的轨迹。 **hybrid** — qwen38 自采的 S/O 双路径轨迹,含 2,573 个 switch 步。 mask:O 侧 = 坐标不准(judge 看标了落点的图 + CoT + 动作)∪ 空转(judge 看画面变没变); S 侧 = 机械重复,同 search 的规则。收口步(answer)和切换步(switch)一律不屏蔽。 ## 图片 `operation.jsonl` 和 `hybrid.jsonl` 的 `image_url` 是**相对路径** `images/<id>/<file>`, 在数据根目录下 `tar xf` 展开即可对上,不用改数据: * **hybrid** → `hybrid_images.tar`(7.0G,33,060 张 png,本仓库内) 布局 `images/<task_id>/post_N_full_screenshot.png`,与 `hybrid.jsonl` 的引用一一对应, 清单另见 `hybrid_images_manifest.jsonl` * **operation** → `operation_images.tar`(30.8G,55,361 张 png,本仓库内) 布局 `images/<sha256>/N.png`,与 `operation.jsonl` 的引用一一对应。 只打包了 v8 实际引用到的图 —— 源目录里另有 14,255 张属于被丢弃的 63 条轨迹,未收录。 ### 坐标口径(全量核过) `x / y / from_x / from_y / to_x / to_y` 一律是 **0~1000 逐轴归一化的整数**, 换算 `px = x*W/1000`, `py = y*H/1000`。 | | 坐标字段 | 类型 | 范围 | 越界 | |---|---|---|---|---| | operation | 70,628 | 全 int | 0 ~ 999 | 0 | | hybrid | 34,922 | 全 int | 0 ~ 997 | 0 | | search | 0 | — | — | — | 截图尺寸:operation 66,220 张**全部 1280×720**;hybrid 33,060 张里 33,057 张是 1280×720,另有 3 张 500×500(同一条轨迹的弹窗页,引用它们的步是 `scroll` / `switch` / `search`,都不带坐标,不影响换算)。 提示词里**不写**这个约定 —— 模型从数据里学,推理端靠 `hybrid_utils.coord_scale_for_model` + `hybrid_agent._scale_xy` 在运行层换回真实像素。 ## 已知缺口 * search 的重复检测作用域是「样本」不是「轨迹」:128k 折叠会把长轨迹切成多条样本, 跨切点的重复看不见(文件里没有 traj_id,无从跨样本聚合)。 * search 和 operation 两份**暴露 switch 但零使用**(合计 559,588 步)。 真正演示 switch 的只有 hybrid 的 2,573 步,占全部动作步 0.4%。混训时要留意这个失衡。

提供机构:
maas
创建时间:
2026-08-25
二维码
社区交流群
二维码
科研交流群
商业服务