遇见数据集

howto

收藏
github2026-07-23 更新2026-07-27 收录
官方服务:

资源简介:

一个开放库,包含日常程序知识:用于训练代理和机器人的结构化how-to食谱。涵盖12个领域的1137个食谱,提供SFT/RL评估导出和机器人模拟任务规范。

An open repository containing everyday procedural knowledge: structured how-to recipes designed for training agents and robots. It encompasses 1,137 recipes spanning 12 domains, and provides exports for SFT/RL evaluation along with robotic simulation task specifications.

创建时间:
2026-07-21
原始信息汇总

📖 howto:日常程序化知识开放库

数据集概述

howto 是一个专门收集和结构化记录日常程序化知识的开放库,旨在为智能体(AI agents)和机器人提供可训练的、人类可读的步骤化操作指南。该数据集包含 1137 个操作指南,覆盖 12 个领域,每个指南均以标准化格式编写。

核心设计理念

数据集遵循六大设计原则:

  • 每个步骤必须声明预期观察结果:通过 Expect: 子句使步骤可执行、可训练
  • 验证是可检查的谓词:完成条件必须可被程序或陌生人验证,可直接编译为奖励函数
  • 不可逆步骤内联标注 ⚠️:涉及支付、删除、热液体等操作,帮助智能体学习在何处暂停确认
  • 失败模式作为一等公民:包含已知故障路径和恢复方案
  • 通用优先,地域变体其次:通用指南独立存在,地域变体在上层叠加
  • 多模态,以文本为基础:可附带图表、照片、视频片段,但全部配有完整替代文本

数据格式

每个操作指南为一个 Markdown 文件,遵循统一骨架结构:

目标 → 前置条件 → 步骤(每步以 → Expect: … 结尾) → 决策点 → 失败模式与恢复 → 验证 → 变体(地域/平台) → 安全与隐私(⚠️ 不可逆步骤内联标注)

域注册表位于 domains.json,完整索引位于 INDEX.md,正式模式定义位于 schema/recipe.schema.json

领域分类

🧠 常识类(daily/)—— 最大板块

子领域 示例操作
self-care/ 刷牙、用牙线、洗澡、系鞋带、睡前准备、修剪指甲、根据天气穿衣
food/ 烧水、泡茶、煮饭、煎蛋、做三明治、切洋葱、微波炉、泡面、打包午餐、储存剩菜、阅读食品标签
home/ 洗衣、铺床、扫拖、吸尘、清洁浴室、垃圾分类、疏通下水道、换灯泡、换电池
social/ 在收银台付款、排队、餐厅点餐、分摊账单、接电话、问候邻居、指路、商店求助、闲聊、借还物品
errands/ 使用ATM、寄信、加油、自动售货机、自助结账、购买杂货、理发、公共图书馆

🦾 机器人板块(embodied/)—— 可编译为模拟器任务

子领域 示例操作
kitchen/ 做手冲咖啡、装洗碗机、摆桌子、储存杂物、烤面包
household/ 叠T恤、给盆栽浇水、倒垃圾、整理房间
mobility/ 开门、使用电梯、搬运与递送、过马路
care/ 为他人取物品

机器人任务的前置元数据指定模拟场景: yaml objects: [dishwasher, plates, cutlery, detergent-pod] affordances: [door-open, rack-slide, grasp, place] workspace: kitchen safety: {sharp_objects: true, fragile: [glasses], human_proximity: pause}

💻 数字领域(accounts/shopping/digital/finance/

创建账户、登录、启用双因素认证、找回密码、删除账户、安全审查、购买并退货、追踪包裹、购买前对比、安装应用、取消订阅、备份文件、连接WiFi、安全更新、支付账单、争议交易、向朋友转账

🚇 物理与服务领域(transit/travel/communication/government/healthcare/housing/

乘坐地铁、乘坐公交、呼叫网约车、导航、预订航班、办理登机、预订酒店、寄送包裹、安排会议、更新护照、预约医生、续处方、开通水电煤

训练适用性

该数据集可同时衍生多种训练产品:

训练产品 数据来源
SFT/中期训练规划轨迹 步骤 + 预期观察
具有可验证奖励的智能体RL任务 目标 + 前置条件 + 验证
课程/技能DAG 操作指南间的 prerequisites 链接
推理时技能库(RAG) 操作指南片段
防污染评估 保留的操作指南和地域变体
机器人任务计划与模拟任务生成 具身 objects / affordances / workspace / safety

使用方式

快速开始

bash git clone https://github.com/ShirleyHuang11/howto.git && cd howto pip install pyyaml

./scripts/validate.sh # 验证所有操作指南 python3 scripts/stats.py # 按域的覆盖仪表盘 python3 scripts/export.py --format sft # 导出指令训练对 (JSONL) python3 scripts/export.py --format eval # 导出包含成功标准的任务规范 (JSONL) python3 scripts/export.py --format json # 导出完整结构化操作指南

引用信息

食谱内容采用 CC-BY-4.0 许可(商业使用需注明出处),代码采用 MIT 许可。

bibtex @misc{howto2026, title = {howto: an open library of everyday procedural knowledge for training agents and robots}, author = {{howto contributors}}, year = {2026}, url = {https://github.com/ShirleyHuang11/howto} }

搜集汇总
数据集介绍
howto 数据集图片
构建方式
该数据集以系统化的方式构建了涵盖日常生活的程序性知识库。每个任务被精心封装为一个独立的Markdown文件,严格遵循统一的骨架结构:明确的目标设定、前置条件罗列、步骤分解(每步附带预期观察结果)、决策分支点、失败模式与恢复策略、最终验证方法,以及地域变体与安全隐私标注。所有文件按领域分类存放,并通过Registry文件与索引文件实现全局关联。脚本工具链负责自动化验证格式合规性、统计覆盖度,并提供多种导出格式以适配不同训练场景。
特点
该数据集最显著的特征在于其将自然语言转化为可训练的结构化知识。每个步骤末尾的预期观察结果使流程具备了可执行性与可训练性;验证环节被设计为可被程序或陌生人检查的谓词,可直接编译为奖励函数;不可逆步骤的特殊标记让智能体学会决策确认。失败模式作为一等公民被纳入知识体系,恢复路径构成了程序性知识的半壁江山。此外,地域通用性与变体并存的架构设计,为智能体提供了跨场景的泛化能力。
使用方法
使用者可通过git命令克隆仓库后运行验证脚本确保数据完整性。统计脚本用于快速查看各领域的覆盖率;导出脚本支持生成指令微调对、任务评估规范及完整结构化食谱三种格式,分别对应JSONL与JSON输出。具体使用时,可直接阅读单任务文件理解流程细节,也可利用预训练好的导出数据包进行模型训练。对于机器人任务,食谱中嵌入的仿真场景描述可直接编译为模拟器任务。社区贡献者则可通过复制模板、编写真实流程并运行验证脚本的方式参与扩展数据集。
背景与挑战
背景概述
在多智能体系统与具身智能蓬勃发展的当下,如何赋予智能体精细且可执行的日常生活常识性操作知识,已成为一个亟待解决的核心瓶颈。该由ShirleyHuang团队于2026年创建的howto数据集,旨在构建一个结构化的过程性知识开放库,以弥合高层指令与底层动作执行之间的鸿沟。该数据集汇聚了来自不同贡献者的1137条跨12个领域的任务配方,覆盖了从日常起居、社会交往到公共交通和数字服务的广泛场景。其核心研究问题在于:如何将隐性的、非形式化的日常操作知识,转化为包含明确步骤、预期观察、分支条件、故障恢复及验证标准的显化表示。该数据集已在智能体训练、机器人任务规划、技能图构建及推理时RAG等多个方向展现出巨大潜力,对推动通用智能体迈向具备扎实常识的实用阶段具有里程碑式的影响力。
当前挑战
该数据集所解决的核心领域挑战在于,现有智能体在进行诸如搭乘地铁、在线购物等日常任务时,常因缺少结构化的程序性知识而导致失败。这类知识包含了规范的步骤序列、每一步的验证观测、决策分支、故障模式及恢复路径,而这些在现有语料库中往往未被系统性地记录和显化。在构建过程中,挑战则体现为如何在保持结构统一性与泛化性的同时,捕捉真实世界的多样性和复杂性:例如,需要为同一任务(如支付)设计不同地区(美国纽约、日本东京、中国北京)的locale变体;需要确保每个步骤都附带可被程序或陌生人验证的“预期结果”,从而转化为可计算的奖励函数;还需将不可逆操作(如付款、删除账户)高亮标注,以训练智能体在关键节点暂停确认。此外,在多模态数据融合、机器人场景内的仿真任务生成等方面,仍需持续完善。
常用场景
经典使用场景
在智能体与机器人研究领域,日常程序性知识的缺失是阻碍通用智能体落地的关键瓶颈。howto数据集以结构化方式收录了共计1137条覆盖12个日常领域的高保真操作指南,从刷牙、煮饭到乘坐地铁、创建账户,每一条食谱都严格遵循“目标→前提条件→带预期观察的步骤→决策分支→故障恢复→验证条件”的骨架范式。该数据集最经典的使用场景是作为智能体训练的中枢知识库——研究者可将其导出为监督微调(SFT)轨迹、含可验证奖励的强化学习任务、技能有向无环图(DAG)课程,或用作推理时的检索增强生成(RAG)技能库。与传统仅描述操作序列的数据集不同,howto每步都附带明确的*Expect:*观察断言,使模型不仅能执行动作,更能理解动作完成的判别依据,从而在复杂动态环境中做出正确决策。
解决学术问题
该数据集系统性地解决了智能体研究中长期存在的“程序性知识匮乏”核心困境。此前,网络智能体、计算机操作智能体及家庭机器人在执行日常任务时频繁失败,根源并非推理能力不足,而是缺少两个关键知识要素:一是规范化的步骤顺序与每一步成功执行的观察验证,二是真实世界中无处不在的决策分支、故障模式与恢复路径。howto通过将隐性的常识知识转化为显式、可计算的训练基板,为学术界提供了首个大规模、领域覆盖广泛的结构化操作知识库。其意义在于,它使得智能体不再仅依赖从文本或视频中模糊对齐的“动作序列”,而是能获得可量化的成功标准、可枚举的异常处理预案,以及多种环境变体的适应能力。这一数据集实质上架起了自然语言指令与可执行程序化行为之间的桥梁,推动了智能体从被动语言理解向主动任务执行的关键跨越。
衍生相关工作
howto数据集的出现催生了若干具有纵深影响的研究方向与衍生工作。在训练范式上,研究者利用其“步骤+观察断言”结构构建了可验证奖励的强化学习环境,其中验证条件直接编译为奖励函数,使得智能体得以在无人工标注的正误信号下自主习得鲁棒的操作策略。在知识蒸馏领域,该数据集的技能有向无环图被用于构建分层课程学习框架,智能体通过先掌握基础技能(如开水箱门)再学习复合任务(如装洗碗机),显著提升了样本效率。同时,其故障模式与恢复路径部分启发了“鲁棒程序性规划”这一新研究方向,相关工作将不可逆步骤标记引入任务规划器的安全约束层,使智能体在高风险操作前能主动寻求人类确认。此外,该数据集已被用作大规模语言模型程序性知识测试基准中的干净验证集,有效控制了训练数据的污染问题,为评估模型真实世界操作推理能力提供了可靠的评估工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务