ConStory-Bench
收藏资源简介:
ConStory-Bench是一个用于评估长故事生成中叙事一致性的基准测试。它包括提示、自动评估管道(ConStory-Checker)和一系列模型的预计算结果。ConStory-Checker检测5个类别(19个子类型)的一致性错误:角色塑造、事实细节、叙事风格、时间线与情节、世界构建与设定。
ConStory-Bench is a benchmark for evaluating narrative consistency in long-form story generation. It includes prompts, an automatic evaluation pipeline named ConStory-Checker, and pre-computed results for a series of models. ConStory-Checker detects consistency errors across 5 categories (19 sub-types): character portrayal, factual details, narrative style, timeline and plot, and worldbuilding and setting.
ConStory-Bench 数据集概述
数据集基本信息
- 数据集名称:ConStory-Bench
- 核心目标:评估大型语言模型在生成长篇故事时的叙事一致性。
- 核心问题:大型语言模型能生成数万字的故事,但常出现前后矛盾,例如角色遗忘背景、时间线断裂、世界规则悄然改变。
- 项目页面:https://picrew.github.io/constory-bench.github.io/
- 论文:https://arxiv.org/abs/2603.05890
- HuggingFace 数据集地址:https://huggingface.co/datasets/jayden8888/ConStory-Bench
- 排行榜地址:https://picrew.github.io/constory-bench.github.io/leadboard/
- 许可证:MIT License
数据集内容与结构
数据集旨在追踪大型语言模型在扩展时保持叙事一致性的能力。
数据文件
所有数据托管在 HuggingFace 上。
| 文件 | 描述 |
|---|---|
prompts.parquet |
基准提示(4种任务类型) |
stories.parquet |
来自多个模型的生成故事 |
evaluations/*.csv |
各模型的 ConStory-Checker 评估结果 |
数据加载方式
支持通过 datasets 库或 pandas 加载。
评估框架:ConStory-Checker
- 功能:用于检测长篇故事生成中的一致性错误的自动化评估流程。
- 错误类别:涵盖5大类,共19个子类型:
- 角色塑造:记忆矛盾、知识冲突、技能/能力波动、遗忘能力。
- 事实细节:外貌不匹配、命名混淆、数量错误。
- 叙事风格:视角转换、语气不一致、风格断裂。
- 时间线与情节:时间矛盾、时长错误、因果关系违反、被遗弃的情节。
- 世界构建与设定:规则违反、社会规范冲突、地理矛盾。
使用与评估流程
- 生成故事:使用与 OpenAI 兼容的 API 或本地服务器根据提示生成故事。
- 评估:使用 ConStory-Checker 对生成的故事进行一致性错误判断。
- 计算指标:计算一致性错误密度等指标。
- 错误相关性分析:计算5个错误类别之间的条件概率矩阵。
- 错误位置分布分析:分析错误在故事中出现的位置。
排行榜与模型表现
排行榜展示了多种模型在 ConStory-Bench 上的评估结果,指标包括一致性错误密度和平均输出长度。模型类别涵盖专有模型、开源模型、能力增强型和智能体增强型。
代码仓库结构
核心 Python 包 constory 包含故事生成、评估、指标计算、相关性分析和位置分布分析等模块。提示模板位于 prompts/ 目录下,对应5个错误类别。
引用
如需引用,请使用提供的 BibTeX 条目。




