遇见数据集

icil-competition-results

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是RoboTensor主办的“单示范情境模仿学习竞赛”(ICIL)的结果存储库。竞赛旨在比较不同模型在仅提供一个示范视频的情况下,完成一系列相同机器人任务单元的能力。每个对决中,两个模型运行完全相同的任务单元列表(相同任务、相同初始状态、相同示范、相同随机种子),每个单元输出一个成功率,得分取所有单元成功率的平均值,挑战者需击败当前冠军模型平均分且超过指定阈值才能夺冠。数据集包含每个对决中双方每个单元的详细结果,以及每个单元的三个视频片段:模型看到的示范、冠军模型的尝试、挑战者的尝试。数据存储采用规范的JSON格式,并使用ed25519签名确保记录不可篡改。当前内容包括genesis记录(最早冠军)和组织者运行的烟雾测试对决(基线模型自我对比,每侧18个单元,所有单元平局)。该数据集可用于机器人模仿学习模型的基准测试、排行榜排名验证、以及情境学习性能分析。

This dataset is a repository of results from the Single-Demonstration Imitation Learning Competition (ICIL) organized by RoboTensor. The competition aims to compare the ability of different models to complete a series of identical robot task units given only a single demonstration video. In each match, two models run exactly the same list of task units (same tasks, same initial states, same demonstrations, same random seeds). Each unit outputs a success rate, and the score is the average success rate across all units. A challenger must defeat the current champion models average score and exceed a specified threshold to become the new champion. The dataset contains detailed results for each unit from both sides in each match, as well as three video clips per unit: the demonstration seen by the model, the champion models attempt, and the challengers attempt. Data is stored in a standardized JSON format and signed with ed25519 to ensure immutability. Current contents include the genesis record (earliest champion) and a smoke test match run by the organizers (baseline model self-comparison, 18 units per side, all units tied). This dataset can be used for benchmarking robot imitation learning models, verifying leaderboard rankings, and analyzing in-context learning performance.

创建时间:
2026-09-06
原始信息汇总

数据集概述

该数据集为 ICIL 竞赛结果存储库,是一个由机器人传感器(RoboTensor)主办的“单示范情境模仿学习竞赛”的签名、仅追加(append-only)结果存储库。该竞赛的排行榜页面纯粹是该数据集的读取端,访问者看到的所有信息均来源于此,且任何人都可以在不信任网站的情况下进行核对。

竞赛机制

比赛采用“决斗”形式,具体规则如下:

  • 相同条件:两位参赛模型运行完全相同的单元列表(unit list),包括相同的任务、初始状态、每单元的单次示范以及随机种子。
  • 评分规则:每项技能对应一个成功率,分数为所有技能的平均值。挑战者需以超过现行保留模型平均分且达到规定的差值幅度,方可夺取冠军。
  • 结果发布:双方在每个单元上的表现结果均被完整发布,并为每一单元附带三个视频片段:模型所见的示范、保留模型的尝试、挑战者的尝试。

存储结构与验证

目录布局

路径 说明
manifest.json 包含验证者密钥、规范版本、指纹及池 ID
tracks/<track>/head.json 最新记录及当前冠军持有者
tracks/<track>/index-NNNN.jsonl 每行一条“规范 JSON + ed25519 签名”的记录
tracks/<track>/queue.json 等待挑战的队列(可重写,不签名)
events/<track>/<event_id>.json 完整记录:每个单元、双方结果
media/<sha[:2]>/<sha>.mp4 按内容哈希寻址的视频片段

数据防篡改性

每条记录均为使用验证者 ed25519 密钥签名的规范 JSON,任何事后编辑都会导致签名验证失败,从而保证数据的完整性与真实性。

验证方式

用户可通过以下命令对存储库进行完整验证(检查签名、序列、事件、媒体和结构):

bash hf download robotensor/icil-competition-results --repo-type=dataset --local-dir ./store icilval store verify ./store

任一决斗的单元列表均可仅根据公开字段(规范版本、赛道、双方模型密钥与修订号、池 ID)重新生成,便于第三方独立确认决斗实际运行的单元。

当前内容

  • 存储库结构采用 schema 2(按技能评分)。
  • 包含创世记录,将模型 robotensor/bpp-genesis(https://huggingface.co/robotensor/bpp-genesis)加冕为初始冠军。
  • 另含组织者进行的一次“冒烟决斗”(smoke duel):基线模型与其自身副本在池 2026.09-v2 上对战,每侧 18 个单元,所有单元平局——这正是测试目的所在:相同权重在相同单元上无法跨越规定的胜出差值。

许可协议

该数据集采用 MIT 许可证

搜集汇总
数据集介绍
icil-competition-results 数据集图片
构建方式
该数据集作为机器人单样本上下文模仿学习竞赛的成果存档,采用追加式、防篡改的结构化存储体系,以 manifest.json 为核心索引,记录验证者密钥、规格版本与指纹及池标识。竞赛中每一场对决均执行完全相同的单元列表,涵盖相同的任务、初始状态、示范与随机种子,并详尽记录双方模型在每个技能单元上的成功率及其平均值。对决结果以规范的 JSON 格式记录,并附有基于 ed25519 的数字签名,确保所有记录的真实性与不可篡改性。数据集按赛道分层组织,包含头部记录、索引序列、等待队列及完整事件详情,并辅以通过内容哈希寻址的媒体片段,从而构成一个自洽且可验证的完整数据仓库。
特点
该数据集的核心特性在于其卓越的可验证性与完备性。记录采用追加式区块链式结构,每条数据均经数字签名,确保任何后期修改都会导致签名失效,由此实现了数据的防篡改与不可抵赖性。数据内容高度结构化且全面,不仅涵盖双方模型的逐项得分与均值,还公开了每个单元的三个视频片段,包括展示给模型的示范、卫冕模型的尝试以及挑战者的表现。更独特的是,任意对决的单元列表可依据已发布的规格版本、赛道、模型密钥与修订号及池标识完全重建,赋予第三方独立验证对决真实性的能力。该数据集当前包含创建记录与组织者的冒烟测试对决,为同类研究的公平性与可复现性树立了新标杆。
使用方法
使用者可通过多种途径利用此数据集。首先,借助 Hugging Face 数据集下载功能,执行 `hf download robotensor/icil-competition-results --repo-type=dataset --local-dir ./store` 将数据获取至本地;随后运行提供的验证工具 `icilval store verify ./store`,即可全面校验数据完整性,包括签名、序列、事件、媒体与模式。对于研究者而言,既可依据已发布记录复现对决过程,亦可通过分析索引与事件文件追踪系统的演进轨迹。该数据集仅作为只读数据源,其配套的可视化面板与竞赛平台均可无条件信任此数据仓库,从而在机器人学与模仿学习领域推动了透明、可审计的基准测试与模型评估实践。
背景与挑战
背景概述
该数据集诞生于2026年,由RoboTensor团队创建,用于记录其发起的一次性演示上下文模仿学习竞赛(ICIL)的完整结果。随着机器人学习领域对高效、灵活的技能获取方式需求日益增长,上下文模仿学习作为一种仅需少量演示即可让机器人快速适应新任务的方法,正受到广泛关注。该数据集的核心研究问题在于验证不同模型在相同任务、相同初始状态及相同演示条件下的公平竞争性能,并确保结果的透明性与可验证性。通过采用基于区块链理念的签名、仅追加的存储机制,该数据集为机器人学习社区提供了一个不可篡改的基准,对推动该领域的可重复性研究具有重要影响。
当前挑战
当前挑战主要聚焦于领域问题的核心——上下文模仿学习中的泛化能力与公平评估。由于仅凭单个演示,模型需准确理解并执行任务,这对模型的上下文理解与技能迁移构成巨大挑战。此外,构建过程中也面临多重困难:确保双模型实验的严格一致性(包括种子、初始状态等细节)以排除随机干扰,设计不可篡改的签名及结构以保证数据完整性,同时还要平衡存储、媒体文件(视频)管理及第三方验证的便捷性。这些挑战共同决定了评估结果的可靠性与可比性。
常用场景
经典使用场景
该数据集作为机器人领域中一次性演示情境模仿学习竞赛的公开结果存储库,其经典使用场景聚焦于模型性能的透明化验证与基准测试。研究者可依据存储的带签名记录,复现任意一场对决,将两名模型的技能成功率均值与既定胜出阈值进行比对,从而客观评估模型在统一任务序列——涵盖相同初始状态、示范及随机种子——下的泛化与模仿能力。此场景强调了数据完整性、可审计性及跨条件一致性,为对比学习算法提供了可重复的评测基准。
实际应用
在实际应用中,该数据集服务于机器人技能学习竞赛的自动计分与排行系统,使在线排行榜成为存储库的纯读取视图,同时赋予社区以无需信任中心服务器即可独立验证结果的能力。其媒体资产按内容哈希寻址,为每个单元提供示范、现行冠军及挑战者操作的三段视频,有助于直观剖析行为差异。这一机制可支撑非对称基准测试、云端评测平台及众包式模型排名,加速机器人学习领域在具身智能任务上的工程迭代。
衍生相关工作
由此数据集衍生的相关工作常围绕去中心化评测协议、基于区块链精神的机器学习模型溯源及对抗性验证方法展开。依据其规范版本与指纹机制,后续研究可构建统一的跨平台评测接口,推动如一次性泛化能力分析、示范质量影响量化及多智能体对决策略等主题的探索。该存储库中现行的创世记录与组织者烟雾对决构成了初始对照框架,为后续开发自动化验证工具链及安全更新机制提供了依据,从而激励社区构建更加透明的AI评测生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务