EconEvals
收藏资源简介:
EconEvals是一个针对未知环境中LLM代理的基准和试纸测试套件。该数据集由哈佛大学和宾夕法尼亚州立大学的研究人员创建,旨在评估LLM代理在面对未知经济环境进行决策、学习和策略制定时的能力和倾向。数据集包含三个核心商业任务的基准:采购、调度和定价,每个任务都有三个不同难度级别:基础、中等和困难。这些基准是通过合成环境生成的,可以根据LLM的能力进展快速扩展大小和复杂性。
EconEvals is a benchmark and testbed suite for LLM agents operating in unknown economic environments. Developed by researchers from Harvard University and Pennsylvania State University, this dataset is intended to assess the capabilities and propensities of LLM agents when making decisions, learning, and formulating strategies within unfamiliar economic contexts. The dataset encompasses benchmarks for three core business tasks: procurement, scheduling, and pricing, each featuring three distinct difficulty levels: basic, moderate, and difficult. These benchmarks are generated through synthetic environments, and can be rapidly scaled in size and complexity to align with the evolving capabilities of LLMs.
EconEvals数据集概述
数据集基本信息
- 名称: EconEvals: Benchmarks and Litmus Tests for LLM Agents in Unknown Environments
- 作者: Sara Fish, Julia Shephard*, Minkai Li*, Ran Shorrer, Yannai A. Gonczarowski (*表示贡献相等)
- 联系邮箱: sfish@g.harvard.edu
- 论文链接: https://arxiv.org/pdf/2503.18825
数据集内容
基准测试 (Benchmarks)
-
采购 (Procurement)
- 难度级别: Basic, Medium, Hard
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 解决率: 参见详情页表格
-
调度 (Scheduling)
- 难度级别: Basic, Medium, Hard
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 解决率: 参见详情页表格
-
定价 (Pricing)
- 难度级别: Basic, Medium, Hard
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 解决率: 参见详情页表格
试金石测试 (Litmus Tests)
-
效率 vs. 平等 (Efficiency vs. Equality)
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 可靠性分数: 参见详情页表格
-
耐心 vs. 急躁 (Patience vs. Impatience)
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 可靠性分数: 参见详情页表格
-
共谋 vs. 竞争 (Collusiveness vs. Competitiveness)
- 测试模型: Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o
- 可靠性分数: 参见详情页表格
数据集结构
experiments/procurement/: 采购基准代码scheduling/: 调度基准代码pricing/: 定价基准代码efficiency_vs_equality/: 效率 vs. 平等测试代码patience_vs_impatience/: 耐心 vs. 急躁测试代码collusiveness_vs_competitiveness/: 共谋 vs. 竞争测试代码
tests/: 单元测试utils/: LLM调用工具
使用说明
环境设置
- 安装Python 3.12
- 安装依赖包
- 设置环境变量
运行基准测试
- 采购:
python3 econ_evals/experiments/procurement/run_procurement_batch.py - 调度:
python3 econ_evals/experiments/scheduling/run_scheduling_batch.py - 定价:
python3 econ_evals/experiments/pricing/run_pricing_batch.py
运行试金石测试
- 效率 vs. 平等:
python3 econ_evals/experiments/efficiency_vs_equality/run_efficiency_vs_equality_batch.py - 耐心 vs. 急躁:
python3 econ_evals/experiments/patience_vs_impatience/run_patience_vs_impatience.py - 共谋 vs. 竞争:
python3 econ_evals/experiments/collusiveness_vs_competitiveness/run_collusiveness_vs_competitiveness_batch.py
引用
bibtex @article{fish2025econevals, title={EconEvals: Benchmarks and Litmus Tests for LLM Agents in Unknown Environments}, author={Fish, Sara and Shephard, Julia and Li, Minkai and Shorrer, Ran and Gonczarowski, Yannai}, journal={arXiv preprint arXiv:2503.18825}, year={2025} }




