YC-Bench
收藏资源简介:
YC-Bench是由研究者团队开发的长期规划与一致性执行基准数据集,旨在评估AI代理在模拟初创公司运营中的战略连贯性。该数据集包含数百轮模拟决策任务,涉及合同选择、员工分配和现金流管理等复杂场景,数据生成基于部分可观测的马尔可夫决策过程(POMDP),通过对抗性客户和动态薪酬机制构建真实商业环境。其核心应用于测试大语言模型在长周期任务中的资源分配、风险管理和适应性决策能力,为解决AI代理在延迟奖励和复合决策场景下的性能瓶颈提供量化标准。
YC-Bench is a benchmark dataset for long-term planning and consistent execution developed by a research team, designed to assess the strategic coherence of AI Agents in simulated startup operations. The dataset contains hundreds of rounds of simulated decision-making tasks involving complex scenarios including contract selection, employee allocation and cash flow management. It is built upon Partially Observable Markov Decision Processes (POMDPs), and creates a realistic business environment through adversarial clients and dynamic compensation mechanisms. Its core use case is to test the resource allocation, risk management and adaptive decision-making capabilities of Large Language Models (LLMs) in long-cycle tasks, and to provide a quantitative standard for addressing the performance bottlenecks of AI Agents in scenarios featuring delayed rewards and compound decision-making.
YC-Bench 数据集概述
数据集基本信息
- 数据集名称: YC-Bench (Your Company Bench)
- 核心定位: 一个用于LLM智能体的长周期确定性基准测试。
- 模拟场景: 智能体在一家AI初创公司中担任CEO,通过一个CLI工具在一个基于SQLite的离散事件模拟中进行为期1-3年的运营。
- 测试目标: 评估智能体在数百个回合中,持续管理复合决策的能力,包括声望专业化、员工分配、现金流和截止日期风险。
核心工作机制
模拟循环
- 智能体调用
yc-bench sim resume将时间推进到下一个事件或月度发薪日。 - 引擎刷新任务进度,应用声望衰减,触发到期事件,执行发薪。
- 智能体读取唤醒事件并决策:接受任务、分配员工、派遣、取消。
- 重复此过程,直至破产或时间范围结束。
结束条件
模拟在以下情况结束:破产(发薪后资金<0)、时间范围结束(1-3年)或达到最大回合数(如果配置)。如果智能体连续10个回合未调用 sim resume,循环将自动强制执行一次。
关键机制
- 资金: 初始资本因预设而异(8万至25万美元)。月度工资自动扣除。任务奖励随声望缩放(
基础值 × (1 + 缩放系数 × (声望 − 1)))。 - 四大领域:
研究 · 推理 · 数据/环境 · 训练。每个领域独立追踪声望,范围在[1.0, 10.0]。 - 领域声望门槛: 任务所需的声望会针对其每个所需领域进行检查。智能体必须广泛提升声望,而非仅在一个领域。
- 声望衰减: 每个领域每天都会损失声望。被忽视的领域会衰减回1.0。智能体必须跨领域保持活跃以维持市场准入。
- 声望缩放的工作量: 更高声望的任务需要按比例更多的工作。更高的声望带来更多报酬,但也要求更高的产能。
- 员工: 10名员工分为3个等级(初级/中级/高级)。智能体只能看到每位员工的等级和薪资,而非他们在各领域的技能效率。一个初级员工可能秘密地是某个领域的超级明星,因此智能体必须从任务进度观察中推断生产力。
- 吞吐量分割: 一名被分配到N个活跃任务的员工,其
有效效率 = 基础效率 / N。专注优于广度。 - 任务成功: 按时完成奖励资金、声望、技能提升和1%的薪资涨幅(复合的工资压力)。延迟完成会惩罚声望。取消任务的惩罚更重。
- 进度检查点: 智能体在任务完成25%、50%、75%和100%时被唤醒,提供数据点以估算员工生产力。
- 草稿本: 数据库中的持久性笔记,可在上下文截断后保留(仅保留最近20轮对话)。
智能体交互接口
智能体通过 run_command("yc-bench <cmd>") 进行交互,所有命令返回JSON。
观察命令
yc-bench company status- 资金、声望、运营时间yc-bench employee list- 等级、薪资、活跃任务yc-bench market browse [--domain X] [--limit N]- 可用任务yc-bench task list [--status X]- 你的任务yc-bench task inspect --task-id UUID- 进度、截止日期、分配情况yc-bench finance ledger- 交易历史yc-bench report monthly- 月度损益
行动命令
yc-bench task accept --task-id UUID- 从市场领取任务yc-bench task assign --task-id UUID --employee-id UUID- 分配员工yc-bench task dispatch --task-id UUID- 开始工作yc-bench task cancel --task-id UUID --reason ""- 取消任务(声望惩罚)yc-bench sim resume- 推进时间yc-bench scratchpad write/append/clear- 持久性记忆操作
配置与难度预设
实验预设以TOML文件形式存在于 src/yc_bench/config/presets/ 中,通过 --config 传递预设名称。所有预设使用10名员工和200个市场任务。难度来自截止日期压力、惩罚严重性、声望分布和任务规模。
| 配置 | 截止日期压力 | 声望模式 | 测试重点 |
|---|---|---|---|
| tutorial | 非常宽松 | 1 | 基本的接受→分配→派遣循环 |
| easy | 宽松 | 1 | 吞吐量意识 |
| medium | 中等 | 3 | 声望提升 + 领域专业化 |
| hard | 紧张 | 4 | 精确的ETA推理 + 产能规划 |
| nightmare | 极其紧张 | 5 | 复合工资压力下的持续完美表现 |
完整可调参数列表参见 default.toml。
技术栈与运行
- 编程语言: Python 3.12+
- 包管理工具:
uv - 支持的API提供商: 任何与LiteLLM兼容的提供商(如Anthropic, Gemini, OpenRouter, OpenAI)
- 输出: 在
db/目录下生成SQLite数据库,在results/目录下生成JSON格式的推演记录。
引用信息
如果该数据集对您的工作有帮助,请引用: bibtex @misc{collinear-ai2025ycbench, author = {{Collinear AI}}, title = {{YC-Bench}: Your Company Bench — A Long-Horizon Coherence Benchmark for {LLM} Agents}, year = {2025}, howpublished = {https://github.com/collinear-ai/yc-bench}, note = {Accessed: 2026-02-25} }




