Crayotter_case_eval
收藏资源简介:
# 人工评测数据集说明 本数据集用于完成人工评测。数据包含 **23 个评测 case**,每个 case 对应同一题目下不同方法生成的最终视频结果,便于评测者在统一输入条件下比较不同方法的视频质量表现。 **用于剪辑成片的提示词在meta文件夹中。** ## 1. 数据内容 本次上传内容主要分为两类: ### 1.1 ours 方法结果 `ours` 为我们的 **Crayotter** 方法所剪辑出的视频结果。 对于 `ours`,除最终成片外,还保留了运行轨迹和配置等辅助文件,方便后续进行: - 研究复现 - 错误排查 - 方法分析 - 工具调用过程追踪 ### 1.2 baseline 方法结果 baseline 包括以下三种方法: - `capcut-mate` - `cutclaw` - `storyline` 对于 baseline,本次仅上传最终剪辑成片 `output.mp4`,用于人工打分,不包含完整中间过程文件。 ## 2. 数据用途 本数据集的核心用途是支持人工评分,重点关注 **最终视频质量**,而不是运行时间或系统资源消耗。 请评测者基于最终成片,从以下维度进行主观评分: - 主题契合度 - 内容丰富度 - 叙事连贯性 - 剪辑流畅性 - 视觉质量 每一项指标分数为 **1–5 分**。 评测者可以参考 `评分文件` 文件夹中的 AI 评测结果,了解各项指标的评分方式和参考标准。 ## 3. 目录结构 目录结构按 case 组织,采用三位编号: ```text {case_id}/ ours/ run_01/ output.mp4 tool_trace.json log.txt config.json storyline/ run_01/ output.mp4 capcut-mate/ run_01/ output.mp4 cutclaw/ run_01/ output.mp4 ``` ## 4. 文件说明 | 文件名 | 说明 | |---|---| | `output.mp4` | 最终用于人工评测的视频成片 | | `tool_trace.json` | `ours` 方法的工具调用轨迹 | | `log.txt` | `ours` 方法的运行日志 | | `config.json` | `ours` 方法该次运行的配置记录 | ## 5. 评测说明 为了方便人工评测,所有方法尽量在相同 case 输入下运行。 每个 case 使用: - 同一组本地原始素材 - 同一份 prompt - 相同的评测条件 对比对象主要是不同方法在 **最终视频成片层面** 的表现差异。 如果评测者只关心人工打分,可以优先查看各方法目录下的 `output.mp4`。 如果需要进一步分析 `ours` 的内部行为,可以查看: - `tool_trace.json` - `log.txt` - `config.json`



