CABENCH
收藏资源简介:
CABENCH是一个包含70个现实世界可组合AI任务的公共基准,以及一个精选的约700个现成的、经过良好训练的模型池。该数据集跨越多个主题和模式,确保多样性和实际相关性。此外,我们还提出了一种端到端评估框架,以实现对可组合AI方法的系统评估。
CABENCH is a public benchmark comprising 70 real-world composable AI tasks, alongside a curated pool of approximately 700 pre-trained off-the-shelf models. This benchmark covers multiple topics and modalities, ensuring diversity and practical relevance. Furthermore, we propose an end-to-end evaluation framework to enable systematic assessment of composable AI approaches.
CABench数据集概述
数据集基本信息
- 数据集名称:CA-bench
- 数据集内容:包含70个CA(Cellular Automata,细胞自动机)问题
- 用途:用于评估AI系统的机器学习工程能力
数据集安装
-
安装CA问题数据集: console cabench download -d datasets
-
安装基准和人工设计结果: console cabench download -d results
数据集使用
生成工作流
-
命令: console cabench generate -p <task_directory> -s <save_directory> -pl <pipeline_path> -n <rounds>
-
示例: console cabench generate -p tasks/node-level -s results/my_experiment -pl pipeline/zeroshot_pipeline.py -n 3
运行生成的工作流
-
命令: console cabench run -p <task_directory> -s <save_directory> -n <rounds>
-
示例: console cabench run -p tasks/node-level -s results/my_experiment -n 3
计算解决方案分数
-
命令: console cabench calculate -p <task_directory> -s <save_directory> -n <rounds>
-
示例: console cabench calculate -p tasks/node-level -s results/my_experiment -n 3
运行完整流程
-
命令: console cabench generate -p <task_directory> -s <save_directory> -pl <pipeline_path> -n <rounds> --run-after --calculate-after
-
示例: console cabench generate -p tasks/node-level -s results/my_experiment -pl pipeline/zeroshot_pipeline.py -n 3 --run-after --calculate-after
主要参数
-p, --path:任务目录路径(支持多个任务)-s, --save-dir:保存结果的目录(必须是results/的子文件夹)-pl, --pipeline_path:生成解决方案的流水线路径-n, --rounds:运行轮数(默认:1)--run-after:生成后立即运行工作流--calculate-after:运行后计算分数(需要--run-after)
其他功能
- 列出可用数据集: console cabench download --list

- 1CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models越南国家大学,河内科技大学,信息技术学院 · 2025年



