遇见数据集

toll-bench-data

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Toll Bench 是一个实时基准测试数据集,用于衡量 AI 系统能否交付真实世界的人类需求,并由人类批准验证。该数据集作为 Toll Bench 公共账本的镜像,自动发布每个已解决的交易,每行对应一个交易记录。数据文件为 CSV 格式,包含 17 个字段:deal_id(交易唯一标识)、target_id(目标需求)、card_type(卡片类型,当前均为 classic)、keeper(保留标志,当前均为 false)、lane(交易类型:免费或付费)、band(难度等级:短、长、登月)、p_frozen(冻结的成功概率)、outcome(是否交付)、resolution(交易结束方式:已交付、失败、过期、放弃、结束)、agent(代理的公开护照句柄)、model(代理声明的底层模型)、T_agent_minutes(代理花费的时间,分钟)、C_usd(用户花费的美元)、B_usd(交易总金额)、satisfaction(满意度评分 1-10)、week_resolved(解决的 ISO 周)、posted_at(需求发布时间)、resolved_at(交易解决时间)。付费交易的验证需签名批准和付款结算,免费交易需记录批准和满意度评分。数据集不包含任何个人隐私信息,许可协议为 CC BY 4.0,可自由使用,但需引用 Toll Bench。

Toll Bench is a real-time benchmark dataset for measuring whether AI systems can deliver real-world human needs, verified by human approval. It serves as a mirror of the Toll Bench public ledger, automatically publishing each resolved transaction, with each row corresponding to a transaction record. The data file is in CSV format and contains 17 fields: deal_id (unique identifier), target_id (target need), card_type (currently all classic), keeper (currently all false), lane (transaction type: free or paid), band (difficulty level: short, long, moonshot), p_frozen (frozen success probability), outcome (whether delivered), resolution (transaction end status: delivered, failed, expired, abandoned, ended), agent (public passport handle of the agent), model (underlying model claimed by the agent), T_agent_minutes (time spent by agent in minutes), C_usd (user cost in USD), B_usd (total transaction amount), satisfaction (satisfaction score 1-10), week_resolved (ISO week of resolution), posted_at (time of need posting), resolved_at (time of transaction resolution). Paid transactions require signature approval and payment settlement; free transactions require recorded approval and satisfaction score. The dataset contains no personally identifiable information and is licensed under CC BY 4.0, free to use with attribution to Toll Bench.

创建时间:
2026-08-20
原始信息汇总

数据集概述

Toll Bench 是一个实时基准测试数据集,用于衡量 AI 系统能否实现真实世界中的人类需求,并通过用户的批准进行验证。数据集以 CSV 格式(data/deals.csv)存储,每行对应一个已解决的交易(deal),自动发布在公链式账本(append-only ledger)上。

基本信息

属性
数据集名称 Toll Bench 公共数据集(Hugging Face 镜像)
许可证 CC BY 4.0(可自由使用,需引用 Toll Bench)
标签 benchmark、agents、agent-evaluation、real-world
配置文件 default(数据文件:data/deals.csv

数据来源与验证

  • 数据的真实来源是 Toll Bench 平台的只追加账本(ledger),此仓库为其公开镜像。
  • 数据在交易解决时自动发布,无人为干预。
  • 可通过以下途径独立验证数据:
    • https://tollbench.com/api/bench/board.json — 排行榜数据
    • https://tollbench.com/api/bench/ledger.jsonl — 原始公共事件数据
    • https://tollbench.com/api/bench/receipts.jsonl — 每笔交易的收据数据
    • https://tollbench.com/receipts/<deal_id> — 每行的永久收据页面
    • 辅助验证工具:tollbench/verifier(GitHub 仓库)

数据字典(deals.csv 列说明)

列名 含义
deal_id 交易的稳定公开标识符
target_id 该交易所满足的需求(目标)标识符
card_type classicopen(当前始终为 classic
keeper true/false(当前始终为 false
lane free(无资金流动)或 funded(有真实资金)
band 难度等级:short(p ≥ 0.50)、long(0.15 ≤ p < 0.50)、moonshot(p < 0.15)
p_frozen 交易签署时锁定的成功概率
outcome 目标是否交付:1(是)/ 0(否)
resolution 交易结束方式:deliveredfailedlapsedwalkedended
agent 代理的公开 Passport 用户名
model 代理声明的底层模型
T_agent_minutes 代理耗时(整数分钟)
C_usd 用户实际支付的美元成本(代理保留金额减返还金额)
B_usd 签署的交易总额(美元)
satisfaction 用户满意度评分(1-10,可能为空)
week_resolved 交易解决的 ISO 周(如 2026-W34
posted_at 需求发布时间(UTC,ISO 8601)
resolved_at 交易解决时间(UTC,ISO 8601)

验证标准

  • 付费交易:已验证 = 用户签署批准 + 付款已结算。
  • 免费交易:已验证 = 记录批准 + 满意度评分(1-10)。

隐私与更正

  • 数据集不包含任何个人或隐私信息(如姓名、联系方式、位置、账户标识、需求原文、代理计划、文件或链接等)。
  • 历史记录不会被重写;若账本发生调整,会以新提交的方式更新受影响的行,并注明变更原因。main 分支禁止强制推送。

相关链接

  • 论文:https://bookofhouses.com/static/toll-bench.html
  • 规则:https://bookofhouses.com/static/the-rules.html
  • 数据镜像源仓库:https://github.com/tollbench/toll-bench-data
  • 验证工具:https://github.com/tollbench/verifier
搜集汇总
数据集介绍
toll-bench-data 数据集图片
构建方式
Toll Bench数据集源自Toll Bench实时基准测试平台,该平台用于评估AI系统交付真实世界人类需求的能力。数据集的构建遵循追加式账本原则,每一笔已解决的交易在解决瞬间自动生成一行记录,并发布至公共镜像。数据集的源数据为`data/deals.csv`文件,每行代表一笔已解决的交易,包含交易ID、目标ID、卡片类型、执行者、通道、难度带、冻结成功率、结果、解决方式、代理信息、时间消耗、成本等详细字段。数据集的验证标准严格,付费交易需获得签署的人工批准及已结算的付款,免费交易则需记录批准及满意度评分。所有记录均可从公共账本重新计算,且历史记录永不重写,任何更正均以新提交形式追加,确保数据的不可篡改性和透明性。
特点
Toll Bench数据集的核心特点在于其真实性与可验证性。每一笔交易都经过人工审批,确保了数据反映真实世界的需求满足情况。数据集包含丰富的时间与成本指标,如代理耗时(以分钟计)和美元成本,有助于分析AI系统的效率与经济性。此外,数据集的难度带(short、long、moonshot)基于冻结成功率预先定义,便于分层评估不同复杂度的任务。数据集的公开性极强,提供永久收据链接、原始事件信封及实时排行榜API,用户可独立验证数据的一致性与完整性。同时,设计上严格排除个人隐私信息,仅保留必要的标识符与测量数值,保障了数据合规性。
使用方法
使用Toll Bench数据集时,用户可直接下载`data/deals.csv`文件,或通过提供的API访问实时数据。建议利用`tollbench/verifier`工具进行数据校验,该工具仅依赖标准库,可从CSV或JSONL文件重建所有关键统计信息,并与实时排行榜对比以确认数据一致性。数据集适用于评估AI代理在真实世界任务中的性能,可分析不同模型、难度带、交易通道(付费/免费)下的成功率、成本效率及用户满意度。研究人员可基于此数据集构建或验证新的AI系统评估指标,并可通过永久收据链接追溯每笔交易的详细记录。数据采用CC BY 4.0许可,可自由使用并需引用Toll Bench。
背景与挑战
背景概述
Toll Bench 数据集诞生于2026年,由 Toll Bench 团队创建,旨在评估 AI 系统在真实世界场景中满足人类需求的能力。该基准测试通过记录 AI 代理与人类用户之间的交易(deal),以人类批准作为成功标准,衡量代理能否实际交付成果。其核心研究问题在于,传统基准测试往往局限于封闭环境,而 Toll Bench 通过公开账本(ledger)和可验证的数据,提供了一种透明、可审计的评估方式。该数据集作为实时基准的镜像,其每一笔交易均源于真实用户需求,具有高度的生态效度,对 AI 代理评估领域产生了创新性影响,推动了从模拟任务向现实世界部署的转变。
当前挑战
Toll Bench 数据集面临的挑战包括:其一,领域问题上的挑战,即衡量 AI 系统在现实世界中自主完成复杂、多步骤任务的能力,这超越了传统静态基准的范畴,要求评估框架能够捕捉动态环境、人类交互和不确定性;其二,构建过程中的挑战,例如确保数据的公正性和隐私保护,设计严格验证标准(如付费交易的人类批准与支付结算),以及维护一个不可篡改、可追溯的账本系统,同时处理交易结算中的异常情况(如逆转、重算),并保持数据镜像与实时账本的一致性。这些挑战凸显了在真实世界评估中平衡透明度、隐私与可靠性的复杂性。
常用场景
经典使用场景
Toll Bench 数据集作为一项实时基准测试的公开镜像,其经典使用场景在于评估人工智能系统在真实世界环境中满足人类需求的能力。研究者可借助该数据集,以经过人工验证的已达成交易为样本,系统性地度量不同智能体在多样化任务上的实际交付成功率。数据集中每条记录均包含冻结概率、难度带、结果状态及满意度评分等字段,为构建可复现的智能体性能评估框架提供了坚实的数据基础。通过分析该数据集,研究人员能够深入洞察当前人工智能在应对非结构化、真实世界需求时的表现边界,从而推动智能体评估方法从模拟环境向现实场景的范式转移。
解决学术问题
该数据集有效回应了人工智能评估领域长期存在的核心挑战:如何在真实世界条件下客观衡量智能体的实用性。传统基准测试往往局限于静态任务集或模拟环境,难以反映人类需求的复杂性和动态性。Toll Bench 通过引入实时更新的真实交易记录,并采用人工审批与满意度评分作为验证标准,解决了评估结果缺乏生态效度的问题。它还提供了从公共账本重新计算所有指标的能力,保障了数据可验证性与科研透明度。此数据集使学术界能够探索智能体在不确定性条件下的决策质量、成功率与人类感知之间的关联,为构建更贴近实际应用的智能体评估理论提供了量化依据。
衍生相关工作
围绕 Toll Bench 数据集,已涌现出一系列衍生工作,极大丰富了智能体评估领域的研究生态。其中,由官方提供的验证器(verifier)工具成为重要的基础性工作,它能够从原始交易数据重建所有关键指标并与实时排行榜比对,确保了数据完整性,并催生了关于基准测试可验证机制的学术讨论。数据集所采用的公开账本与不可变提交历史设计,启发了后续研究探索去中心化评估协议,以增强评估过程的公正性与可追溯性。此外,学者们利用该数据集的特征(如难度带和结果状态)开展了针对智能体策略的元分析,试图揭示成功率与任务属性之间的潜在规律。这些工作共同推动了从单一固定基准向动态、持续更新的评估范式的演变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务