遇见数据集

continuity-bench

收藏
arXiv2026-07-17 更新2026-07-21 收录
官方服务:

资源简介:

ContinuityBench是由Metriqual研究团队创建的开源评估框架,旨在系统评估多提供商大语言模型路由中的状态保持故障转移能力。该数据集包含750个故障转移事件,通过自动化LLM判断机制生成多轮对话并嵌入可验证的事实锚点,以量化上下文保留率。其创建过程涉及可控的故障注入和高并发压力测试,模拟真实生产环境中的提供商中断场景。该数据集主要应用于分布式系统可靠性和对话连续性研究,旨在解决传统无状态故障转移机制中对话历史静默丢失的关键问题,为构建健壮的多模型推理系统提供基准。

ContinuityBench is an open-source evaluation framework created by the Metriqual research team, which aims to systematically evaluate the state-preserving failover capability in multi-provider large language model (LLM) routing. This dataset contains 750 failover events, where multi-turn dialogues are generated via automated LLM judgment mechanisms and embedded with verifiable factual anchors to quantify the context retention rate. Its creation process involves controllable fault injection and high-concurrency stress tests, simulating provider outage scenarios in real production environments. This dataset is mainly applied to the research of distributed system reliability and dialogue continuity, aiming to solve the key problem of silent loss of dialogue history in traditional stateless failover mechanisms, and provide a benchmark for building robust multi-model inference systems.

提供机构:
Metriqual
创建时间:
2026-07-17
原始信息汇总

Continuity Bench 数据集总结

Continuity Bench 是一个用于评估 AI 网关和应用程序级故障转移策略在 LLM 提供商发生中断或降级时的弹性和延迟开销的框架。

核心动机

在生产环境中,LLM API 中断是不可避免的。标准缓解策略是部署路由网关,在主提供商中断时自动故障转移到备用提供商(例如,从 OpenAI 切换到 Anthropic)。然而,存在一个关键问题:备用提供商是否拥有对话的上下文?如果在第五轮对话中发生故障,一个简单的故障转移(仅将最终用户提示转发到备用提供商)将导致上下文完全丢失。为了保持连续性,网关必须转发整个对话历史,但这会引入 Token 膨胀和延迟开销。Continuity Bench 旨在精确测量这种权衡。

评估指标

  1. 连续性保持率 (CPR):故障转移事件中,备用提供商成功维持对话上下文并确认会话中先前建立的核心事实的百分比。
  2. 连续性延迟开销 (CLO):在故障转移事件期间,将完整上下文历史传输到备用提供商所产生的额外延迟,相对于主提供商的基准延迟进行测量。

使用方式

  • 安装:克隆仓库 git clone https://github.com/your-username/continuity-bench.git 并安装依赖 pip install -r requirements.txt
  • 环境配置:在 .env 文件中设置 API 密钥。
  • 运行评估:使用脚本 ./run_eval.sh (Linux/macOS) 或 . un_evals.ps1 (Windows) 运行自动化评估套件,该套件会启动代理、生成模拟流量、注入合成错误并使用 LLM 作为评判者进行评分。结果保存至 results/phase2_summary.mdresults/breakdown.md

已知局限性

  • 合成测试数据:依赖合成对话图,可能无法完全捕捉真实用户交互的复杂性。
  • LLM 评判者评分:上下文保持性由 LLM 评判者(gpt-4o)评估,存在非确定性和模型特定偏差的可能性。
  • 仅文本模态:目前仅评估基于文本的对话连续性,不涵盖视觉、音频或多模态会话。
  • 代理负载测试上限:内置的 ThreadingHTTPServer 在高并发下可能拒绝连接或达到提供商 Token 限制,导致评估失败。

许可协议

MIT 许可证。

搜集汇总
数据集介绍
continuity-bench 数据集图片
构建方式
在大规模语言模型的生产部署中,API的高可用性保证并不等同于对话的连续性。当主提供商发生故障或遭遇严格限流时,无状态故障转移机制虽能维持运行,却会静默丢弃对话历史,严重破坏用户体验。为严谨量化并解决这一失效模式,我们提出了连续性基准(continuity-bench),一个用于在多提供商LLM路由中压力测试上下文保留能力的开源评估框架。该基准通过构建包含150个多轮合成对话的测试套件,每个对话在早期轮次嵌入一个可验证的事实锚点(如偏好、发明的术语、专有名称、数值或日期),并在后续轮次通过探针问题检测召回;同时采用确定性故障注入器,在指定轮次模拟超时、API错误或限流事件,强制执行故障转移,从而系统性地评估上下文是否得到保留。
使用方法
使用continuity-bench时,研究人员需搭建一个支持多提供商的代理架构,该架构包含请求拦截器、对话状态存储、故障注入层和故障转移控制器。通过配置文件指定主提供商(如OpenAI)和备用提供商(如Anthropic),并设置对话轮次数量(7至11轮)、并发级别和重试策略。运行过程中,确定性故障注入器按预设计划在探针轮次触发故障,代理根据配置选择无状态(仅转发最新用户消息)或有状态历史转发策略。生成的响应由LLM评委(如GPT-4o)根据预期事实进行二进制评分,最终输出CPR和CLO指标。该框架支持扩展新的路由算法或供应商,便于在可控条件下复现和比较不同故障转移机制的效果。
背景与挑战
背景概述
continuity-bench由Metriqual公司的Vishal Pandey与Gopal Singh于2026年联合创建,旨在解决多提供商大语言模型路由系统中一个长期被忽视的关键问题:当主服务提供商发生故障或遭遇严格限流时,传统的无状态故障转移机制虽能维持服务可用性,却会静默丢弃对话历史,导致用户会话遭遇灾难性中断。该数据集的核心研究问题聚焦于将“对话连续性”量化为可测量的操作属性,区别于常规的可用性指标。研究团队提出的两项创新度量——连续性保留率(CPR)与连续性延迟开销(CLO),为评估跨提供商状态重建提供了标准化基准。通过引入历史转发代理架构,该系统在750次故障转移事件中实现了99.20%的连续性保留率,为构建鲁棒的多模型推理系统奠定了原则性基础。该数据集的开源发布填补了多提供商大语言模型编排领域缺乏连续性评估基准的空白,对生产环境下的交互式语音代理与多步骤智能体系统具有重要实践意义。
当前挑战
该领域面临的核心挑战在于,现有的多提供商网关虽已解决请求级别的可用性问题,却无法保障对话级别的连续属性。具体而言,无状态故障转移机制将每次API调用视为独立事务,当主提供商不可用时,系统仅将当前请求转发至备用端点,而此前建立的完整对话上下文因仅存储于不可用的主提供商中而彻底丢失。这种静默状态丢失在交互式语音应用中表现为对话重置,在多步骤智能体流程中则更为隐蔽——智能体在截断的上下文窗口上继续运算,产生看似合理却实质错误的输出,其真实损害往往在后续推理步骤中才暴露。构建过程中的挑战同样严峻:高并发场景下(100个并发会话)的竞态条件导致共享代理状态被并行故障转移事件污染,造成跨租户的上下文串扰;而朴素固定间隔重试机制在面对严格限流的备用提供商时,会触发自持续性的请求风暴,最终耗尽套接字资源导致系统崩溃。这些系统性缺陷揭示了鲁棒的大语言模型编排本质上是一个分布式系统问题,需要显式并发控制与带抖动的指数退避协议。
常用场景
经典使用场景
在大型语言模型(LLM)多提供商路由的背景下,continuity-bench被设计用于系统性地评估和基准测试跨提供商故障转移时对话连续性的保留能力。该数据集通过构造包含可验证事实锚点的多轮合成对话,并精准地在探针回合注入确定性故障,模拟生产环境中高并发下的提供商切换事件。其最经典的使用场景是作为评估框架,对比无状态故障转移与历史转发策略在维持对话上下文方面的效果差异,从而量化故障转移对用户体验的隐性影响。
解决学术问题
continuity-bench的提出填补了现有LLM系统可靠性研究中对话连续性评估的空白。学术界对模型准确率、延迟和幻觉已有成熟基准,但缺乏度量故障转移时上下文是否完整保留的方法论。该数据集通过引入连续性保留率(CPR)和连续性延迟开销(CLO)两个指标,将对话连续性形式化为独立于可用性的可测量属性。它严格区分了系统返回了响应与系统返回了基于完整上下文的响应这一根本性差异,为多提供商路由系统中上下文保护提供了首个系统性评估工具。
实际应用
在实际工业部署中,continuity-bench的应用场景集中于保障交互式语音代理、多步骤智能体流水线等有状态系统在提供商故障时的体验完整性。当主提供商短暂中断时,传统网关虽然保证了响应返回,但用户的对话历史往往被静默丢弃,导致用户需要重复先前已陈述的信息。借助continuity-bench的评测能力,工程团队可以在部署前模拟故障环境,检验故障转移机制是否真正传递了完整会话状态,从而避免生产环境中因上下文丢失引发的逻辑错误和用户流失。
数据集最近研究
最新研究方向
在大型语言模型多提供商路由的背景下,continuity-bench 数据集聚焦于系统在故障切换时维持对话连续性的前沿研究。该工作通过引入连续性保留率(CPR)和连续性延迟开销(CLO)两项度量指标,形式化了对话连续性这一此前未被充分测量的系统属性。研究提出的有状态故障切换代理架构,利用历史转发策略在异构 LLM 端点间无缝重建对话上下文,实证表明在 750 次故障切换事件中实现了 99.20% 的上下文保留率,而传统无状态架构仅接近 0%。该数据集还揭示了高并发场景下两类系统性失效模式——并发竞态条件导致的共享状态污染以及回退云梯效应引发的重试风暴,为构建鲁棒的多模型推理基础设施提供了可复现的评估框架与工程原则。
相关研究论文
  • 1
    ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM RoutingMetriqual · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务