Sanjue-Logic/ai-design-benchmark
收藏资源简介:
本项目提供一套可复现的 AI 设计工具横向评测方法论,包含7 大设计场景、140 条任务(数据集总量),Round 1 实评 115 条(Logo 设计 / IP 形象设计 / 徽章奖杯设计 / 商品海报设计 / 商品图片美化 / 线上营销活动 / 线下推广物料)。采用双盲 SbS(Side-by-Side)投票机制,评测员在不知道图片来源的情况下逐题选出最优结果。包含四层聚合算法:投票 → 题目 → 任务 → 场景,保证结论可复现。以及两步置信度量化:票数集中度(≥20% / 10–20% / <10%)+ Bootstrap 95% CI。Round 1 实证结果包含3 款公开 AI 设计工具(Lovart / 即梦 / Roboneo)横向对比数据。
This project provides a reproducible framework for cross-product evaluation of AI design tools, including 7 design scenarios, 140 tasks in dataset — 115 tasks evaluated in Round 1 (Logo Design / IP Character Design / Badge & Trophy / Product Poster / Product Image Enhancement / Online Marketing / Offline Promotion). It features double-blind SbS (Side-by-Side) voting: evaluators pick the best output without knowing which product generated it. The framework includes a 4-layer aggregation algorithm: Vote → Question → Task → Scene, ensuring full reproducibility, and two-step confidence quantification: Ticket concentration (≥20% / 10–20% / <10%) + Bootstrap 95% CI. Round 1 empirical results provide cross-product comparison data for 3 publicly available AI design tools (Lovart / Jimeng / Roboneo).



