Slides-Align1.5k
收藏资源简介:
Slides-Align1.5k是由香港中文大学和商汤科技联合构建的幻灯片生成评估数据集,包含1500条经过人工偏好对齐的多场景数据。该数据集覆盖九种主流生成系统在七种应用场景(如品牌推广、商业计划等)下的输出成果,数据来源包括30k+原始人类幻灯片和标准化文档。通过GPT-4o标注和双重维度(主题/功能)筛选构建,采用多阶段质量验证流程。该数据集旨在解决幻灯片生成系统在内容保真度、美学质量和可编辑性三个维度的量化评估难题,为自动化演示文稿生成研究提供基准支持。
Slides-Align1.5k is a slide generation evaluation dataset jointly constructed by The Chinese University of Hong Kong and SenseTime. It contains 1500 multi-scenario samples with human preference alignment. The dataset covers the outputs of nine mainstream generation systems across seven application scenarios such as brand promotion and business planning. Its data sources include over 30,000 original human-made slides and standardized documents. It is constructed via GPT-4o annotation and dual-dimensional (theme/function) screening, and adopts a multi-stage quality verification process. This dataset aims to address the challenges of quantitative evaluation of slide generation systems across three dimensions: content fidelity, aesthetic quality and editability, providing benchmark support for automated presentation generation research.
SlidesGen-Bench 数据集概述
数据集基本信息
- 数据集名称: SlidesGen-Bench
- 核心定位: 一个用于评估AI生成演示文稿(幻灯片)的综合基准
- 关联数据集: Slides-Align(用于校准评估的人类偏好数据集)
- 论文地址: https://arxiv.org/abs/2601.09487
- 数据集主页: https://slidesgenbench.yqy314.top/
- Slides-Align数据集地址: https://huggingface.co/datasets/Yqy6/Slides-Align
- 许可证: MIT License
核心评估原则
- 🌐 通用性: 独立于生成方法的统一视觉领域评估框架。
- 📊 可量化: 在内容、美观度和可编辑性维度上提供可复现的指标。
- ✅ 可靠性: 通过Slides-Align数据集实现与人类偏好的高相关性。
评估维度与方法
📝 内容评估
- 方法: QuizBank(基于测验的方法)
- 脚本:
quantitative_eval.py --eval-mode content_only - 流程:
- 运行内容评估脚本。
- 使用
calculate_quiz_accuracy.py计算测验准确率并生成结果。
🎨 美观度评估
计算美学指标
- 脚本:
aesthetics_metrics.py - 核心指标:
figure_ground_contrast: 使用WCAG标准衡量前景/背景对比度。color_harmony: 计算与和谐色彩模板的距离。colorfulness: 使用Hasler & Süsstrunk方法衡量色彩丰富度。subband_entropy: 通过子带分解分析视觉复杂度。visual_hrv: 基于子带熵的视觉心率变异性(用于评估时间一致性)。
- 使用示例:
python eval/quantitative_eval.py --eval-mode aesthetics_only --products Your_product
LLM作为评判者方法
- LLM评分: 语言模型直接评分。
- LLM竞技场: 带有ELO排名的成对比较。
- 详细文档: 参见
docs/LLM_EVALUATION.md。
✏️ 演示文稿可编辑性智能评估
- 方法: 使用淘汰评估策略评估生成后演示文稿的可编辑和修改能力。
- 参考协议:
docs/pei.md。
Slides-Align 数据集详情
数据集统计
- 📊 总排名数: 1,326
- 🏢 评估的产品数量: 9
- 📂 场景类别数量: 7
- 💡 主题数量: 187
已评估的产品列表
| 产品 | 提供商 | 描述 |
|---|---|---|
| Gamma | Gamma.com.ai | AI演示文稿制作工具 |
| NotebookLM | 带有演示文稿生成功能的AI笔记本 | |
| Kimi-Standard | Moonshot AI | Kimi(标准模式) |
| Kimi-Smart | Moonshot AI | Kimi(智能模式) |
| Kimi-Banana | Moonshot AI | Kimi(Banana模板) |
| Skywork | SKYWORK.ai | Skywork AI |
| Skywork-Banana | SKYWORK.ai | Skywork(Banana模板) |
| Zhipu | Zhipu AI | 演示文稿生成器 |
| Quark | Quark AI | Quake演示文稿工具 |
场景类别
| 类别 | 主题数量 | 描述 |
|---|---|---|
topic_introduction |
93 | 通用主题介绍(AI、气候变化、5G等) |
product_launch |
23 | 产品发布公告 |
personal_statement |
20 | 个人陈述和自我介绍 |
brand_promote |
15 | 品牌推广和营销 |
course_preparation |
15 | 教育课程材料 |
work_report |
13 | 工作进度报告 |
business_plan |
8 | 商业计划演示文稿 |
数据格式与使用
-
标注格式示例: json { "results": [ { "product": "NotebookLM", "difficulty": "topic_introduction", "topic": "FinTech", "rank": 1 } ] }
-
加载方式: python from datasets import load_dataset dataset = load_dataset("Yqy6/Slides-Align")
评估流程概述
- 幻灯片生成与预处理: 将所有幻灯片格式转换为图像以确保统一的评估框架。
- 内容评估: 使用QuizBank方法评估内容质量。
- 美观度评估: 通过计算美学指标和/或LLM评判方法评估视觉质量。
- 可编辑性评估: 使用PEI淘汰策略评估演示文稿的后期编辑能力。
扩展评估至自定义产品
用户可以通过以下步骤将自己的幻灯片生成产品加入基准进行评估:
- 在
eval/eval_config.py的PRODUCTS字典中配置产品设置。 - 按照指定的目录结构组织生成的幻灯片。
- 使用预处理脚本将幻灯片转换为图像。
- 运行评估脚本对产品进行内容、美观度或全面评估。
技术依赖与配置
- 布局分析: 使用PaddleOCR的PP-DocLayout_plus-L模型进行文档布局检测。
- 格式转换: 使用LibreOffice进行PPTX到图像的转换。
- 配置方式: 可通过配置文件
eval/eval_config.py或命令行参数进行设置。




