登录后查看消息通知
遇见数据集
北京海百川科技有限公司

北京海百川科技有限公司

企业

北京海百川科技有限公司成立于2005年,属软件和信息技术服务业,主营第二类增值电信业务。面向机器人学习、多模态数据、机器人技术等领域提供数据服务,开放机器人AI自主学习与跨形态迁移数据集(机器人学习、多模态数据)、机器人实时数据清洗与建模数据集(机器人技术、时序分析)、具身智能导航与操作遥感高质量数据集(机器人环境感知、自主导航与操作),支撑遥感监测与空间分析。

机器人学习多模态数据机器人技术软件信息服务高新技术企业
成立于 2005 年北京市hibcglobal.comsunattic@163.com

数据概览

3
数据集总量
67
总浏览量
0
关注人数
2026-06-26
最近更新
分类统计

相关机构

  • 东
    东莞市数字经济发展集团有限公司
    拥有数据集:16个
    企业
  • 宝
    宝略科技(浙江)有限公司
    拥有数据集:11个
    企业
  • 贵
    贵州超级科技有限公司
    拥有数据集:11个
    企业
  • 贵
    贵州新育成教育科技有限公司
    拥有数据集:10个
    企业
  • 安
    安徽精检分析股份有限公司
    拥有数据集:10个
    企业

数据集列表

机器人AI自主学习与跨形态迁移数据集
机器人学习
多模态数据
一、 产品综述本产品是一款面向通用机器人智能前沿研究的高标准、结构化、多模态数据集。其核心设计目标在于支撑机器人人工智能实现跨实体形态的技能迁移与自主持续学习。通过系统化集成多种机器人平台在多元化任务中产生的感知、控制与交互数据,并对其进行深度语义解构与对齐标注,本数据集为构建能够理解物理常识、抽象技能本质并快速适应新环境的下一代机器人智能模型提供了不可或缺的基础数据资源。二、 核心特征真正的跨形态对齐:首次实现了人型机器人、自主移动平台及灵巧操作机械臂在同一任务语义下的多维度数据同步采集与标注,为研究通用技能表示提供了坚实基础。全链路多模态融合:提供严格时间同步的视觉、听觉、力觉、触觉及本体运动数据,支持从感知到执行的端到端模型训练与跨模态联合学习。深度语义解构:不仅提供原始数据,更对任务进行技能原子级分解与逻辑关联标注,赋予数据可迁移、可组合的语义信息,极大提升学习效率。三、 数据内容详情本数据集由五个逻辑关联、互为支撑的核心子库构成,具体内容如下:3.1 跨平台多模态感知子库本子库包含来自不同机器人平台的同步感知数据。主要内容为:由多模态感知融合的人机交互智能识别系统与虚拟交互面部捕捉摄像头采集的多视角RGB-D视频流(1080p, 30fps)、高精度3D点云序列、以及环境音频流。所有感知数据均附带精细的物体级标注,包括2D/3D边界框、语义分割掩码及场景关系图。3.2 机器人本体状态与执行子库本子库完整记录机器人的内部状态与执行轨迹。数据源包括:智慧人型陪伴机器人、智能自主移动服务机器人以及搭载机器人柔性关节力反馈与触觉感知控制平台的机械臂。数据涵盖全身关节编码器与扭矩、基座里程计、IMU信息,以及由智能陪伴机器人触觉融合系统采集的六维力/力矩和触觉阵列数据。所有执行序列均被分割并标注了对应的“技能原子”(如“精确抓取”、“力控插入”)。3.3 人机交互与语义指令子库本子库聚焦于任务的高层语义与交互上下文。内容包括:以语音、文本和图形形式下达的多模态任务指令、人工标注的任务分解步骤(自然语言与形式化语言)、以及由人型机器人表情生成与情感表达控制平台生成的机器人情感响应参数。该子库提供了从人类意图到机器人技能链的映射关系,并包含交互质量评估标签。3.4 仿真与数字孪生支持子库为促进“仿真-现实”迁移研究,本子库提供了与真实数据配套的数字化资产。包括:所有机器人平台的高保真URDF模型、场景物体的3D网格模型及其实测物理属性(质量、摩擦系数等)、以及可精确复现任务初始状态的配置文件。这些数据为算法在安全、可控的仿真环境中进行大规模预训练和验证提供了可能。3.5 元数据与基准评测子库本子库确保数据集的系统性与可评估性。它包含描述整个数据集内容与结构的全局索引与关系图谱,一套专为评估“跨形态迁移能力”而设计的基准任务集(涵盖5大类共20项任务),以及相应的标准化评测脚本与指标计算工具。四、 技术规格总体容量:原始数据总量不低于1.5PB。任务规模:包含超过10万条独立可执行的任务序列。标注数量:提供超过870万项2D图像标注及210万项3D实例标注。采集周期:基础版本(V1.0)数据采集于2024年8月至2025年10月。同步精度:跨所有传感器的全局时间戳同步误差小于1毫秒。更新计划:实施季度增量更新与年度重大版本升级策略。
北京国际大数据交易所400
具身智能导航与操作遥感高质量数据集
机器人环境感知
自主导航与操作
本数据集是为具身智能机器人,包括人形机器人、轮式及履带式移动机器人、机械臂等,专门设计和生产的遥感数据产品。它整合了多源对地观测数据,并附加了面向机器人导航与操作任务的语义标注,旨在为机器人提供大范围、高精度的环境先验知识。数据集共包含六大核心数据内容,具体如下。第一,高分辨率光学影像数据。本部分提供真彩色,即红、绿、蓝三波段,以及近红外四波段的光学影像。影像地面分辨率分为零点五米、一米和两米三个级别,可适配不同尺度机器人的环境感知需求。数据采用 GeoTIFF 格式存储,主要用于地物分类、视觉定位、语义地图构建等任务。第二,数字表面模型与数字高程模型数据。其中,数字表面模型记录了包括建筑物、树木等一切地表覆盖物的顶部高程;数字高程模型则反映裸地表的高程信息。两者均为三十二位浮点型 GeoTIFF,空间分辨率可选一米、五米或十米。这类数据能够支持机器人进行坡度分析、可通行区域评估、全局路径规划以及抓取点高度的预判。第三,多光谱指数产品。基于中分辨率遥感影像,如哨兵二号和陆地卫星数据,计算得到多个专题指数,包括归一化植被指数、归一化水体指数、归一化建筑指数以及城市热岛强度等。这些产品以十六位 GeoTIFF 格式提供,空间分辨率为十米或三十米。它们主要服务于巡检机器人作业区识别、生态环境监测、热异常检测等任务。第四,合成孔径雷达数据。本数据集包含多时相的地距多视合成孔径雷达产品,既提供后向散射强度信息,也保留相位数据以及相干性系数。合成孔径雷达数据采用 GeoTIFF 与二进制相位文件联合存储,空间分辨率为十米或二十米,并可根据灾害等紧急需求触发临时采集。该数据支持机器人在夜间、云雨等恶劣天气条件下的可靠导航,以及灾害区域通行性评估和地表形变监测。第五,机器人任务语义标注层。这是区别于普通遥感数据产品的核心增值内容。在光学影像和数字高程模型的基础上,专业解译人员按照统一规范标注了与机器人行动直接相关的语义信息,包括可通行区域,如道路、平地、硬化地面;作业区,如农田、货场、检修平台;障碍物,如建筑物、水域、陡坡、密集植被;以及兴趣点,如门、电梯、集装箱堆位、电塔基座。标注数据同时提供 GeoJSON 矢量、COCO 格式及栅格掩膜三种形式,空间分辨率与对应的光学影像保持一致,随影像同步更新。这些标注层能够直接为机器人的决策级任务规划、抓取点推荐、禁行区预警提供输入。第六,时序变化检测产品。基于多期光学影像和合成孔径雷达数据,采用变化检测算法生成一系列时空对比产品,包括土地利用变化图,如建筑新增、水体缩减、植被破坏;植被季节性变化图;以及城市施工区动态图等。这些产品以栅格变化图和变化矢量文件的形式提供。时序变化检测产品可帮助长期部署的机器人感知环境动态,自动触发重规划或避让行为。此外,本数据集还配套提供了完整的数据组织索引文件,其格式为 JSON;快速浏览图;数据质量报告。质量报告中明确:几何校正精度优于一个像素,辐射校正已完成大气与地形校正,光学影像云量控制在百分之十以下,语义标注抽检准确率大于百分之九十五。同时,本数据集还提供了面向 ROS2 机器人操作系统、英伟达 Isaac Sim 仿真器以及 MuJoCo 物理引擎的接口插件和示例代码。
北京国际大数据交易所50
机器人实时数据清洗与建模数据集
机器人技术
时序分析
产品内容本数据集本质是一套高保真的时序数据流记录,包含:时序对齐的原始数据切片(用于追溯),对应的实时清洗日志与中间特征序列,毫秒/秒级延时的模型实时输出标签。一、 数据集构成本数据集是一个按时间戳严格对齐、结构化存储的时序数据集合,完整记录了机器人从感知到执行的全链路实时处理过程。其主要由以下五类数据组成,共同构成一个可追溯、可分析的数据管道:1. 原始感知数据流切片内容:经过时间同步后的多模态原始数据短切片(通常为1-5秒的连续窗口),用于追溯和基准测试。包含字段示例:timestamp: 毫秒级统一时间戳 (主键)。data_source: 数据来源标识(如:audio_mic_array, rgb_camera, force_sensor_hand, vibration_sensor_motor)。raw_data_payload: 经过编码的原始数据或数据存储路径指针。scene_tag: 场景标签(如:home_conversation, industrial_inspection)。2. 实时清洗日志与过程数据内容:记录数据清洗环节的输入、操作和输出,是数据集“实时清洗”能力的直接体现。包含字段示例:timestamp: 关联的时间戳。cleaning_operation: 清洗操作类型(如:noise_suppression, outlier_rejection, missing_value_interpolation)。pre_state: 操作前的数据质量指标(如信噪比、数值范围)。post_state: 操作后的数据质量指标。cleaning_params: 本次清洗采用的动态参数。3. 时序特征向量序列内容:经过实时清洗和特征提取后生成的、标准化的特征向量,是后续建模的直接输入。包含字段示例:timestamp: 毫秒级时间戳。feature_vector: 多维浮点数数组,代表融合后的特征(如:音频的MFCC特征+图像的HOG特征+振动频谱特征)。feature_dimension: 特征向量的维度描述。4. 实时模型推断结果内容:轻量化模型对实时特征向量进行在线推断的输出,是本数据集“实时建模”的核心成果。包含字段示例:timestamp: 推断对应的时间戳。model_name: 模型标识(如:emotion_classifier_v3, anomaly_detector_motor)。prediction_label: 预测标签(如:happy, normal, warning)。confidence_score: 预测置信度。additional_outputs: 其他模型输出(如:情感维度数值、异常分数、未来状态预测)。5. 驱动指令与反馈(验证闭环数据)内容:将模型推断结果转化为机器人执行指令的数据,以及部分执行反馈,用于验证实时决策的有效性。包含字段示例:timestamp: 指令生成时间戳。action_command: 结构化指令(如:{“expression”: “smile”, “intensity”: 0.8}, {“movement”: “pause”, “reason”: “vibration_alert”})。triggering_prediction: 触发此指令的模型推断结果ID(用于关联追溯)。应用场景场景一:实时流式机器学习算法研发与基准测试如何应用:算法研发人员可将本数据集作为持续流入的数据流,模拟真实生产环境,开发和测试其在线学习、增量学习或流式异常检测算法。输入:使用数据集中的时序特征向量序列作为核心输入流,并参考实时清洗日志来优化算法对噪声和缺失值的鲁棒性。处理:研发的算法需要实时接收数据流,进行在线推断或模型更新,并输出预测结果。验证:将算法的实时输出与数据集中提供的实时模型推断结果进行比对,评估其准确性、延迟和稳定性。预期效果:研发出能处理非平稳数据分布、低延迟的实时机器学习模型。为流式算法提供一个客观的、基于真实场景的性能基准,客观比较不同算法的优劣。 场景二:多模态融合与跨模态理解模型训练如何应用:计算机视觉与语音领域的研究者可以利用本数据集时间戳严格对齐的特性,训练或验证复杂的多模态融合模型。输入:同时调用同一时间段内的多模态原始感知数据切片(如音频切片与对应的视频切片)及时序特征向量。处理:设计跨模态的注意力机制、特征融合网络或翻译模型,学习不同模态信息间的关联与协同。验证:利用数据集中实时模型推断结果(如融合后的情感标签)作为监督信号,评估模型融合的有效性。预期效果:训练出能更精准理解复杂场景(如“用户笑着说反话”)的下一代多模态AI模型。为工业场景下“声音+振动+热成像”的多传感器融合故障诊断提供训练基础。 场景三:机器人交互策略与闭环控制系统优化如何应用:机器人公司和研究机构可以利用数据集中的“感知-决策-执行”完整闭环数据,优化机器人的交互智能和控制系统。输入:将时序特征向量和实时模型推断结果作为状态输入。处理:应用强化学习、模仿学习或策略搜索方法,训练一个能将当前状态映射到最优动作的“策略网络”。验证:将新策略生成的“动作指令”与数据集中记录的驱动指令进行对比分析,或在仿真环境中以数据集的感知数据为输入,测试新策略的执行效果。预期效果:开发出更自然、更拟人、更高效的机器人交互行为策略。优化工业机器人在复杂动态环境中的实时决策与控制能力,减少停机时间。 场景四:工业预测性维护与异常诊断系统开发如何应用:工业互联网和运维团队可利用数据集中的工业场景流数据,构建和验证预测性维护模型。输入:重点使用振动、电流、温度等传感器的时序特征向量序列及其对应的实时模型推断结果(如“正常”、“警告”标签)。处理:训练时序预测模型(如LSTM, Transformer)来预测设备未来状态,或训练异常检测模型在无明确标签的情况下发现潜在故障模式。验证:利用数据中记录的从“异常预警”到后续状态变化甚至驱动指令(如停机指令)的序列,验证预警的准确性和提前量。预期效果:构建高精度的设备健康状态评估系统,实现从“事后维修”到“事前预防”的转变。显著降低非计划性停机,提升生产安全与效率。 场景五:新产品功能快速原型验证如何应用:产品经理与研发团队在构思一项基于多模态感知的新功能(如“通过表情和语调识别用户满意度”)时,无需立即部署全套硬件和收集数据。输入:直接使用数据集中相关的清洗后的特征数据和标注结果。处理:快速构建一个概念验证模型或规则引擎,验证功能逻辑的可行性。验证:在离线环境下评估功能原型的效果,大幅降低前期试错成本。预期效果:将新产品、新功能的算法验证周期从“数月”缩短至“数周”。在硬件开发完成前,即可完成核心AI算法的迭代与选型。数据范围一、 时间范围本数据集的数据采集工作为连续、不间断的长期过程,确保了数据的时效性、连续性与演进性。采集周期:2023年1月1日 至 2025年6月30日,总历时约30个月。时间特性:数据以连续的时序流形式存在,完整覆盖了工作日、周末、节假日等不同时间模式,能够反映机器人及用户在长期使用中的行为模式演变、季节性差异及算法迭代的痕迹。二、 地理与场景覆盖范围数据来源于部署在真实环境中的机器人集群,覆盖了多样化的地理区域与应用场景。服务陪伴场景:地区覆盖:主要覆盖中国境内多个主要城市及地区的家庭、社区养老中心、幼教机构及医疗机构,包括但不限于华北、华东、华南及中西部的代表性城市。环境类型:涵盖典型城市住宅、社区公共活动空间、标准教室及康复病房等多种室内环境。工业场景:地区与行业覆盖:数据采集自位于长三角、珠三角及中部产业集聚区的合作工厂与研发测试中心。行业类型:覆盖消费电子组装、汽车零部件制造、仓储物流等多个典型行业的示范产线或测试单元。三、 数据主体(用户与设备)范围服务陪伴场景用户:年龄分布:涵盖儿童(3-12岁)、成年人、老年人(60岁以上) 等多个年龄段。(用户描述仅用于定义交互发生的背景场景,而实际采集处理的所有数据均为机器人本体交互与环境感知数据,不含任何能识别特定自然人身份的个人信息。)交互关系:包括个人独立交互、亲子互动及群体互动等多种模式,确保了交互模式的多样性。工业场景操作与运维人员:角色类型:包括产线操作工、设备维护工程师、技术管理人员等。交互模式:涵盖例行巡检、维护操作、异常处理及协同作业等多种专业交互。机器人设备:型号与批次:数据来源于我司多个批次、不同型号的商用机器人与原型测试机,包含了硬件迭代和软件版本更新的多样性。四、 数据规模与采集频率总体规模:数据集原始流数据总量超过PB级,经过本说明所述流程清洗、压缩和结构化处理后,形成的本数据集规模为 5 TB。采集频率:传感器原始数据采集频率从音频的16kHz采样到视觉的30Hz帧率,直至部分工业振动传感器的1kHz高频采样。实时清洗与特征提取过程与采集同步,模型推断与决策生成延迟在毫秒至秒级,确保了全链路的“实时性”。数据量级本数据集总容量约 5 TB,由超过 150 亿条经过清洗与标注的时序数据记录构成。数据采集自 120 台自研机器人,时间跨度覆盖 2023年1月至2025年6月,完整反映了设备在不同季节和工况下的运行状态。
北京国际大数据交易所220
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索