遇见数据集

yc-bench

收藏
Hugging Face2026-03-21 更新2026-03-23 收录
官方服务:

资源简介:

YC-Bench是一个专为LLM代理设计的长时程确定性基准测试数据集。该数据集模拟了一个AI初创公司在一年内的运营情况,代理通过CLI工具与SQLite支持的离散事件模拟系统交互,扮演CEO角色。主要测试代理在数百次决策中管理复合决策的能力,包括声望专业化、员工分配、现金流、截止日期风险和对抗性客户检测等。数据集适用于文本生成任务,属于基准测试、代理、长时程、模拟和评估类别。数据集规模小于1K,采用Apache 2.0许可证。使用指南包括设置、评估命令、评分方法和结果提交规范。

YC-Bench is a long-duration deterministic benchmark dataset specifically designed for LLM agents. This dataset simulates the one-year operation of an AI startup, where agents act as CEOs and interact with a SQLite-backed discrete-event simulation system via CLI tools. It primarily tests the agents' ability to manage complex decision-making across hundreds of decisions, including reputation specialization, staff allocation, cash flow, deadline risk, adversarial customer detection, and more. The dataset is applicable to text generation tasks and falls under the categories of benchmarking, agents, long-duration, simulation, and evaluation. The dataset has a scale of less than 1K and is released under the Apache 2.0 license. Its usage guidelines cover setup, evaluation commands, scoring methods, and result submission specifications.

提供机构:
Collinear AI
创建时间:
2026-03-21
搜集汇总
数据集介绍
构建方式
YC-Bench是一个专为评估大语言模型智能体在长期连贯性任务中表现而设计的基准测试数据集。其构建基于一个模拟环境,将大语言模型置于一家AI初创公司CEO的角色,通过命令行工具与一个确定性离散事件模拟器交互,经历为期一年的虚拟运营。该数据集聚焦于员工分配、声望专业化、现金流管理、截止日期风险以及对抗性客户检测等核心商业场景,并通过数百轮交互持续测试模型在复杂动态环境中的决策能力。
特点
YC-Bench的显著特点在于其长周期连贯性评估机制,要求模型在跨越数百个回合的模拟中保持策略一致性。数据集通过模拟企业运营中的多维度挑战,如资源分配与风险平衡,来考察模型在长期规划与短期应对之间的协调能力。此外,其确定性模拟环境确保了评估的可复现性,而基于最终平均资金的评分方式则直观反映了模型在虚拟经营中的综合绩效,破产即得零分的设定强化了风险管理的评估权重。
使用方法
使用YC-Bench进行模型评估时,用户需从官方仓库下载运行脚本。评估过程支持通过Hugging Face Jobs服务或本地环境执行,命令格式简洁明了。用户需指定模型提供商的API密钥,并传入兼容LiteLLM的任意模型字符串。默认配置下,脚本会在三组随机种子上运行中等预设,并报告最终平均资金作为得分。评估结果需以YAML格式提交至模型在Hugging Face的仓库中,通过开源协作方式完善排行榜数据。
背景与挑战
背景概述
YC-Bench是由Collinear AI团队于2025年发布的一项创新性基准测试,旨在评估大型语言模型(LLM)作为智能体在长期、多步骤任务中的连贯决策能力。该数据集模拟了AI初创公司CEO在一年内的运营场景,通过命令行工具与确定性离散事件仿真环境交互,考察模型在员工分配、声望专业化、现金流管理、截止日期风险规避及对抗性客户检测等复杂商业情境下的表现。YC-Bench填补了现有基准测试在长期时序推理与资源动态平衡方面的空白,其设计理念深受智能体系统与仿真评估领域的前沿研究影响,为衡量LLM在真实世界级任务中的可持续规划与应变能力提供了关键标尺,对推动自主智能体在商业决策中的应用具有重要示范价值。
当前挑战
YC-Bench所解决的领域核心挑战在于,现有基准测试多聚焦于短时步或单步任务,难以捕捉智能体在数百轮交互中维持战略连贯性与资源优化的能力。该数据集要求模型应对现金流枯竭、项目延期与客户欺诈等多重并发风险,并需在信息不完全的仿真环境中做出权衡,这对LLM的长期记忆、因果推理与动态规划构成严峻考验。构建过程中,团队面临仿真环境离散化与现实商业逻辑保真度的平衡难题,需设计可复现的确定性事件序列以确保评估公平性,同时避免过度简化导致生态效度不足。此外,如何定义‘连贯性’这一抽象概念并转化为可量化的资金留存指标,以及排除模型偶然性成功带来的噪声,均是基准设计中的关键障碍。
常用场景
经典使用场景
YC-Bench 是一个专为评估大语言模型(LLM)在长期、多步决策场景中连贯性表现而设计的基准测试。在该数据集中,模型被置于一个模拟的AI初创公司CEO角色,需在长达一年的仿真时间跨度内,通过命令行工具进行资源分配、人员调度、现金流管理、风险规避及客户识别等操作。这一设定使其成为检验LLM在复杂、动态环境中维持战略一致性与执行连贯性的经典测试平台,尤其适用于研究模型在数百轮交互中的长期规划与适应能力。
衍生相关工作
YC-Bench 的发布催生了一系列相关研究工作。一方面,研究者基于其仿真框架开发了针对特定商业子任务(如现金流优化或客户分类)的细粒度评估协议;另一方面,该数据集被用作训练数据,以改进LLM在多步推理中的策略学习算法,例如结合强化学习进行长期奖励建模。此外,YC-Bench 的公开排行榜机制激励了社区贡献多种模型适配方案与评估脚本,促进了LLM在智能体领域评估标准的统一与迭代。
数据集最近研究
最新研究方向
在当前大语言模型代理能力评估的前沿探索中,YC-Bench基准测试的提出标志着对智能体长期连贯性(long-horizon coherence)维度的一次重要突破。该数据集通过构建一个模拟AI初创公司CEO在一年时间内利用命令行工具进行决策的确定性离散事件仿真环境,系统性地考察模型在数百轮交互中的员工分配、声望专业化、现金流管理、截止日期风险规避以及对抗性客户检测等复杂企业运营能力。这一研究方向紧密关联业界对自主智能体从短期任务执行向长期战略规划演进的迫切需求,其评分机制以平均最终资金为核心指标,直观反映了模型在动态资源约束下的可持续决策质量。YC-Bench填补了现有基准在超长时序任务一致性评估方面的空白,为衡量LLM代理在真实世界商业场景中的鲁棒性与适应性提供了极具价值的标准化工具,对推动智能体从对话辅助向自主运营的角色跃迁具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务