遇见数据集

Internet2EgoExo

收藏
github2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

将互联网规模的视频转化为自我中心和外部中心训练数据,由Memories.ai数据湖上的智能体进行策划和注释。

Internet-scale videos are converted into egocentric and exocentric training data, which are curated and annotated by AI Agents on the Memories.ai data lake.

创建时间:
2026-08-22
原始信息汇总

Internet2EgoExo 数据集详情

项目概述

Internet2EgoExo 是一个将互联网规模的视频转化为第一人称(egocentric)和第三人称(exocentric)训练数据的项目。它通过搜索开放网络获取第一人称和第三人称视频素材,在付费前确认视角符合要求,然后由 Memories.ai 视频数据湖中的智能体对通过的素材进行策展和标注。

核心功能

功能模块 说明
搜索 可同时搜索 YouTube、TikTok、Instagram、X 和开放网络
获取 通过付费提供商按平台路由下载字节数据,无提取器路径
帧检查 在索引前采样帧,基于像素判断视频视角
索引 通过的视频进入 Memories.ai 视频数据湖
清理 清理智能体从长记录中切割可用片段
标注 标注智能体编写任务、动作和事件树
策展 策展智能体根据可执行的质量门控对数据集评分

严格规则

  • 无手即无片段:第一人称视频若没有手部出现,仅视为普通视频,此规则不可覆盖
  • 不混合小时计数worndeliveredacceptedaccepted_labeled 是四个不同指标,只有 accepted_labeled 可对外引用
  • 未测量的不通过:无法测量的质量检查将从评分中丢弃,而非假设通过

数据集内容

  • 来源平台:YouTube、TikTok、Instagram、X 及开放网络(数据集页面、实验室网站、档案);使用 Exa 进行神经搜索,Apify 进行爬取
  • 视角判定:每个候选视频标记为第一人称、第三人称或未知,并保留判定依据
  • 许可过滤:可筛选出可安全复用的知识共享(Creative Commons)素材
  • 数量目标:按小时而非片段数量提出要求,报告进度及约束条件
  • 清单文件:每个片段包含视角、置信度、时长、许可和可用性评分,以 JSONL 或 CSV 格式提供
  • 标注树:基于时间锚定的任务、动作和事件,并附有手部和对象的逐片段标签
  • 成本账本:按公开费率对发现、下载、索引和标注定价,分别报告每小时收集量和交付量
  • Web UI:可在浏览器中运行整个流程,无需构建步骤

智能体架构

智能体 职责
搜索智能体 发现候选视频并按可用性排序
清理智能体 智能体过滤和智能体裁剪
标注智能体 智能体标注——任务→动作→事件
策展智能体 跨整个数据集的智能体数据策展
质量检查智能体 独立审计输出的片段
裁剪智能体 通过查看帧决定边界(ReAct)
标注智能体 通过查看内容标注片段(ReAct)

质量审计检查

检查项 捕获的错误 成本
ANCHOR-OVERRUN / ANCHOR-ORDER / ANCHOR-SHORT / ANCHOR-LONG 锚点超出视频范围、顺序倒置、低于动作下限或单个跨度被标记为持续三分钟的"动作" 免费
G2-TREE-1 / G2-TREE-2 / G2-TREE-3 子跨度超出父跨度、兄弟跨度重叠、层级重复父跨度内容 免费
HAND-EMPTY 有手部名称但无实际内容支撑 免费
VIEWPOINT-DRIFT 交付的片段视角与收藏要求不符 免费
EVIDENCE-CONTRADICTED 标注与对应时间窗口的标题描述矛盾 每个跨度约 $0.0004
EVIDENCE-NONE 标签依赖无字幕的窗口 约免费
SET-DUPLICATE / SET-CONCENTRATED 同一跨度交付两次;50 个片段实际来自 12 个视频 免费
SET-HOURS 锚点总计超过清单声称的小时数,说明存在重复计算 免费

安装与配置

需配置的环境变量包括:

  • 必需GOOGLE_API_KEYYOUTUBE_API_KEYMEMORIES_API_KEYMEMORIES_BASE_URL
  • 可选MEMORIES_COLLECTION_IDMEMORIES_COLLECTION_NAMEMEMORIES_INDEX_FPSMEMORIES_INDEX_WAIT_SECONDSEXA_API_KEYAPIFY_API_TOKENVIEWPOINT_CHECK

下载提供商支持 apify(默认,已验证)、rapidapibrightdataoxylabs(后三个仅按文档写入,未实际执行)。

使用示例

python import asyncio from video_searching_agent import VideoSearchingAgent

async def main(): agent = VideoSearchingAgent() response = await agent.query( "find me first-person cooking footage, hands must be visible" ) print(response.answer)

for ref in response.video_references:
    print(f"- {ref.title}: {ref.url}")

asyncio.run(main())

许可协议

项目采用 MIT 许可证,支持 Python 3.12+,当前状态为早期开发阶段。

搜集汇总
数据集介绍
Internet2EgoExo 数据集图片
构建方式
Internet2EgoExo数据集通过自动化管道从互联网规模视频中构建自我中心(egocentric)和外部中心(exocentric)训练数据。该管道整合多平台搜索(YouTube、TikTok、Instagram、X及开放网络),利用Agent循环在付费前进行像素级视点确认,仅将符合标准的内容索引至Memories.ai视频数据湖。后续通过清洗、标注和策展代理对片段进行处理,生成任务、动作和事件树,并输出清单与成本账本,最终形成结构化的数据集。
特点
该数据集的核心特点在于严格的质量控制和视点验证。它坚持“无手不成片”原则,确保所有片段均包含可见手部,通过帧级检查排除错误视点。数据集区分worn、delivered、accepted和accepted_labeled等不同小时数指标,确保数据可引用性。此外,每个片段附带视点判定、置信度、许可证、可用性评分及详细标注树,并包含成本记录,提供高度透明的数据来源和构建过程。
使用方法
使用者需配置API密钥(Google、YouTube、Memories.ai等),通过安装Python包并调用VideoSearchingAgent.query()方法,以自然语言描述需求(如“first-person cooking footage, hands must be visible”),系统将返回结构化响应,包含书面答案、视频引用(含视点判定)、数据集摘要及使用指标。结果可输出为JSONL或CSV清单,且提供Web UI供非编程方式运行整个流程。
背景与挑战
背景概述
Internet2EgoExo数据集由Memories.ai实验室于2024年创建,旨在解决第一人称(自我中心)与第三人称(外部中心)视频数据稀缺的难题。该研究团队通过自动化智能体,从YouTube、TikTok等互联网平台大规模搜索并筛选出符合视角要求的视频片段,并利用视频数据湖进行索引、清洗和注释。其核心研究问题是如何高效且低成本地构建大规模、多视角的视频数据集,以支持具身智能、视频理解等领域的研究。该数据集因其创新性的自动化构建流程和对视角验证的严格要求,对相关领域产生了显著影响,提供了可复现的范式。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,它解决了从互联网海量视频中精准识别和提取自我中心视角视频的难题,尤其是确保画面中出现手部等关键特征,以区分于普通第三人称视频,这要求模型具备可靠的视觉判断能力,而非依赖标题或描述文本。在构建过程中,挑战包括:多平台视频下载的技术障碍(如YouTube对数据中心IP的限制)、不同平台API的集成与稳定性、以及确保标注质量与一致性的问题,这促使团队设计了多智能体协作与独立审计机制,以克服单一模型的误判,并控制数据采集与处理的成本,同时保证最终数据的可追溯性与可靠性。
常用场景
经典使用场景
Internet2EgoExo数据集的经典使用场景在于,为计算机视觉与多模态学习领域的研究人员提供一种高效、大规模且成本可控的途径,从互联网海量视频中获取具有明确视角标注(第一人称视角egocentric与第三人称视角exocentric)的训练数据。该数据集通过自动化管线,从YouTube、TikTok等平台检索并筛选出符合特定语义描述(如“手持可见的烹饪视频”)的视频片段,并进行细致的视角验证、剪辑、清洗与标注。其核心价值在于,能够按需生成高质量、多视角的具身智能训练语料,特别适用于需要大量‘手-物交互’或‘第一人称操作’样本的研究方向,如动作识别、手部姿态估计、机器人模仿学习等,有效缓解了传统手工采集数据集在规模、多样性与成本上的瓶颈。
实际应用
在实际应用层面,Internet2EgoExo数据集驱动的技术方案可直接服务于多种工业与消费级场景。其产出的精细注释片段(包含任务、动作、事件层级树以及手部行为标签)可被用于训练智能助手(如AR眼镜的实时操作指导系统)、服务机器人(基于第一人称视角进行任务学习与环境理解)、以及自动化视频内容分析工具(例如为视频平台提供精准的场景理解与推荐)。该数据集的‘按需定制’特性允许企业或研究机构根据特定业务需求(如聚焦厨房、维修或组装等专业场景)快速生成专属数据集,从而加速垂直领域AI模型的迭代与部署,尤其适用于需要大量人机交互数据的人工智能产品研发环节。
衍生相关工作
该数据集及其自动化构建流程已催生出多项衍生性研究工作。其核心思想——通过‘代理循环’(agentic loop)结合机器学习模型与工具调用,实现从自然语言查询到数据清洗与标注的端到端自动化——为数据自动构建领域树立了新范式。相关衍生工作包括:基于该管线拓展的更细粒度的‘手部-物体’交互标注模型,用于增强机器人操作技能学习;利用其多视角数据特性进行的第一人称与第三人称视角间的域适应研究;以及将其中‘质量审计’概念分离为独立对抗式验证环节的工作,提升了数据集的可靠性与可解释性。此外,对视频片段边界精确分割的方法,也启发了在长视频中实现高效事件检测的研究,推动了视频理解领域向更自动化、高质量的数据驱动方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务