Sitegeist
收藏资源简介:
Sitegeist是一个视觉基准测试数据集,包含100个中性网站简介和由四个模型集合(5.6 Sol、Opus 4.8、Grok 4.5、Fable 5)生成的400个完整、自包含的网站。该数据集旨在评估领先编码代理在相同简介下设计本能收敛的频率,支持通过画廊比较结果,并包括生成规则、审核证据和完整性验证。
Sitegeist is a visual benchmark dataset consisting of 100 neutral website briefs and 400 complete, self-contained websites generated by an ensemble of four models (5.6 Sol, Opus 4.8, Grok 4.5, Fable 5). This dataset aims to evaluate the frequency at which leading coding AI Agents converge on instinctive design solutions when provided with identical briefs. It supports result comparison via galleries, and includes generation rules, audit evidence, and completeness validation.
数据集概述:Sitegeist
核心目标
Sitegeist 是一个视觉基准测试,用于回答一个简单问题:当领先的编码代理收到相同的网站简报时,它们的设计直觉在多大程度上会趋同?
数据集规模
- 包含 100 个中性简报。
- 生成 400 个完整、独立的网站。
模型集合
数据集涵盖以下四个模型生成的网站:
- 5.6 Sol
- Opus 4.8
- Grok 4.5
- Fable 5
生成环境与隔离规则
每次生成尝试在全新的单文件系统中运行。工作代理仅接收:
- 中性工作订单
- 单个私有简报
- 工件合约
工作代理无法访问:
- Sitegeist 画廊或 Git 历史
- 其他模型的结果
- 自身批次中先前的网站
- 屏幕截图、重复报告或早期尝试的审阅者反馈
接受标准
被接受的网站必须提供:
- 作者源代码
- 无依赖的静态构建
- 自包含的 4:3 画廊海报
评估器会拒绝以下情况:
- 远程资源
- 运行时网络依赖
- 符号链接
- 格式错误的工件
- 控制台错误
- 移动端水平溢出
数据集结构
| 路径 | 用途 |
|---|---|
benchmark/briefs/generated |
100 个模型中立的网站简报 |
benchmark/CONTRACT.md |
隔离规则和提交工件合约 |
benchmark/reports |
生成、移动运行时、代码量和重复审计证据 |
scripts/benchmark |
隔离运行器、审阅器、导入器和审计工具 |
static/sites |
可部署的网站集合 |
.skills/add-model |
添加另一个 CLI/模型集合的可复用工作流 |
画廊功能
- 可以浏览每个结果
- 切换模型
- 并排比较最多三个生成结果
本地运行画廊
- 要求:Node.js 和 pnpm
- 运行:
pnpm install然后pnpm dev - 生产验证:
pnpm check和pnpm build - 部署:通过 Cloudflare Workers 部署
审计功能
仓库包含确定性审计,用于检测:
- 源代码/构建的精确重复
- 跨模型重复
- 工件体积
- 最终集合完整性
方法论局限
- 该基准测试仅衡量一个受限的网站生成任务,而非通用模型能力。
- 精确重复审计检测相同的源代码或可部署输出,不声称衡量语义或风格相似性。
- 画廊海报是作者创作的表示,而非基准测试证据。
- 提供商行为、模型别名和代理工具可能随时间变化。
创建者与许可
- 创建者:Kian McKenna
- 许可:MIT 许可





