遇见数据集

vetoworld-occasion-log

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

VetoWorld occasion log 是一个每日记录托管模型服务行为是否一致的日志数据集。该数据集由 VetoWorld 项目创建,旨在解决一个核心问题:托管模型在时间上分离的两个数字可能因服务端变化而不同,而常规基准测试无法检测这种变化。因此,数据集每天对固定网格的频道和提供商进行测试,记录返回结果,并通过 Fisher 检验和判定系统来标记服务行为的变化。 数据集包含以下字段: - `date`: UTC 服务日期 - `provider`: 实际响应的提供商(从响应中获取,而非请求) - `channel`: 世界 + 分支,例如 `LAT.A0` - `verdict`: 判定结果,包括 `QUIET`(安静)、`EVENT`(事件)、`STALE`(过时)、`NO-ANCHOR`(无锚点) - `direction`: 方向,`up` 或 `down`,注意 `EVENT` 表示移动,而非下降 - `now`: 当天的成功次数/总试次 - `p_epoch`: 与冻结的 epoch 锚点的 Fisher 检验 p 值 - `p_rolling`: 与近期安静日滑动窗口的 Fisher 检验 p 值 - `status`: 状态,包括 `OK`、`PARTIAL`、`SERVE_FAIL`、`VERDICT_FAIL`、`BUDGET_REFUSED` - `probe_pin`: 当天服务所基于的有效载荷摘要 数据集规模小于 1000 行,语言为英文,适用于强化学习、智能体对齐、评估、监控和可复现性等任务。使用前需注意:跨提供商的结果不可直接比较;方向是判定的一部分;误报(约每年 11 个 EVENT 日)是预期且已预计入的;缺失日不等于安静日;探针标识(probe_pin)可更新,每行记录所使用的规则版本。 该日志无法解释频道变化的原因(如部署、量化、路由更改或模型替换),但能确定何时发生变化以及是否多个服务栈同时变化。它是一个小规模工具,能可靠检测大变化,但对小偏移不敏感。

VetoWorld occasion log is a daily log dataset that records whether hosted model service behaviors are consistent. Created by the VetoWorld project, it addresses the core issue that two numbers separated in time for a hosted model may differ due to server-side changes, which conventional benchmarks cannot detect. The dataset tests a fixed grid of channels and providers daily, records results, and marks changes in service behavior using Fishers exact test and a verdict system. Fields include: date (UTC service date), provider (actual responding provider), channel (world + branch, e.g., LAT.A0), verdict (QUIET, EVENT, STALE, NO-ANCHOR), direction (up or down; note EVENT indicates movement, not a drop), now (successful trials/total trials for the day), p_epoch (Fishers test p-value against frozen epoch anchor), p_rolling (Fishers test p-value against a sliding window of recent quiet days), status (OK, PARTIAL, SERVE_FAIL, VERDICT_FAIL, BUDGET_REFUSED), and probe_pin (payload digest the service was based on that day). The dataset is smaller than 1000 rows, in English, and suitable for tasks such as reinforcement learning, agent alignment, evaluation, monitoring, and reproducibility. Usage notes: results across providers are not directly comparable; direction is part of the verdict; false positives (approximately 11 EVENT days per year) are expected and accounted for; missing days are not equivalent to quiet days; the probe_pin may update, and each row records the rule version used. The log cannot explain why a channel changed (e.g., deployment, quantization, routing changes, or model replacement), but can determine when changes occurred and whether multiple service stacks changed simultaneously. It is a small-scale tool that reliably detects large changes but is insensitive to small shifts.

创建时间:
2026-08-18
原始信息汇总

数据集概述

VetoWorld occasion log 是一个用于强化学习领域的监控与评估数据集,旨在记录托管模型在每日服务中的行为稳定性。该数据集的核心目标并非模型本身,而是服务过程的可观测性,通过固定网格的每日服务记录,帮助回答“托管端点是否发生变化”这一问题。

核心信息

  • 许可证:MIT
  • 语言:英语
  • 任务类别:强化学习
  • 标签:代理、对齐、评估、监控、可复现性
  • 数据规模:少于1K条记录(n<1K)
  • 开始日期:2026-08-15

数据集背景与动机

该数据集源于一次实际观测:同一模型在两次服务日之间,其比率变化达到0.319,而批次组成和前缀缓存均被排除,推测是提供方部署变更所致。这一现象表明,来自托管端点的任何两个跨越时间点的数据,都可能因端点变化而产生差异。因此,该日志通过每日服务固定网格并记录结果,使这一问题可回答而非仅可争论。

此外,该数据集还有一个更重要的用途:舰队调度科学任务。某些探针需要状态被“表达”,即比较某次平移的阻尼,在无平移的日子里毫无意义,因此每日读数成为是否允许执行任务的关键依据。

数据行字段说明

字段 含义
date UTC服务日
provider 实际应答方(从响应中获取,而非请求)
channel 世界+分支,例如 LAT.A0
verdict QUIETEVENTSTALENO-ANCHOR
direction updownEVENT表示移动,而非下降
now 当天的成功次数/总回合数
p_epoch 与冻结的epoch锚点的Fisher检验
p_rolling 与近期QUIET天滚动窗口的Fisher检验
status OKPARTIALSERVE_FAILVERDICT_FAILBUDGET_REFUSED
probe_pin 当天服务时使用的负载摘要

使用前须知

  1. 禁止跨提供方比较水平:不同服务栈上的相同开放权重是不同的服务产物,仅可读取提供方内部的差异和跨提供方事件的巧合性
  2. 方向是裁决的一部分:将EVENT理解为“下降”曾导致结论反转,单向解读会遗漏一半信号。
  3. 误报可预期且已预计数:在3个通道、365天、alpha=0.01的条件下,每年约有11个EVENT日纯由噪声产生,孤立EVENT不是发现,跨独立列的巧合或持续运行才可能是有意义的。
  4. 缺失日不等于平静日STALESERVE_FAIL 是不同裁决,均不代表通道平静;VERDICT_FAIL 专门用于区分服务成功但计算故障的情况,避免被误认为 QUIET
  5. Pin可修订,行记录运行时的pin:这是一个长期运行的仪器而非固定时长的实验,网格和门槛可在明确边界处更改,每行均携带 probe_pin,被取代的pin仍可重新计算。

数据列与提供方

  • Together:每日提供数据
  • DeepInfra:周一/周三/周五通过HuggingFace路由器提供,响应头 x-inference-provider 决定单元格是否保留——路由到其他位置的请求不产生行,而非错误标记
  • Fireworks 和 SambaNova:尚未构建,密钥不存在;每列从无锚点开始并逐渐获得锚点,较晚开始的列并非更差的列

裁决复现方法

pip install vetoworld
vworld occasion verdict --date YYYY-MM-DD

该命令可从已提交的单元格重新计算,无需费用和密钥。服务动词是独立的,是唯一消耗资源的操作。

局限性

  • 无法解释通道移动的原因:仅从外部观察端点,提供方侧不可见,部署、量化变更、路由变更和静默模型替换在此无法区分。
  • 能确定的是何时发生变化,以及是否在多个栈上同时变化——这是“某个厂商发布了什么”与“生态系统发生了变化”之间的区别。
  • 这是一个小型仪器:少量通道(m=24)的检验功效有限,可可靠检测大变化,无法检测小变化。0.319的变化可轻松捕获,0.05的漂移则无法检测。
搜集汇总
数据集介绍
vetoworld-occasion-log 数据集图片
构建方式
vetoworld-occasion-log数据集以一种严谨的仪器化日志形式构建,旨在记录托管模型在特定服务条件下的每日行为变化。每一行数据代表一个通道、一个提供商在一个UTC日内的固定网格服务记录,其内容涵盖日期、服务提供商、通道标识、判定结果、变化方向、当日成功次数、基于冻结锚点的Fisher检验p值、基于滚动窗口的p值、状态标记及探针载荷摘要。该日志采用固定的探针网格,每日执行,并与一个冻结的锚点进行对比,通过Fisher检验得出判定结果(如QUIET、EVENT、STALE等),从而确保观测的可重复性和可追溯性。
特点
该数据集的核心特征在于其强调服务层面而非模型层面的变化检测,通过跨提供商禁止直接比较水平,仅关注提供商内部的差异和跨提供商的事件巧合性。它明确区分方向,将改变视为移动而非单纯下降,避免误读。数据集预设并计数误报率(如每年约11个假EVENT日,基于alpha=0.01),并详细区分缺失日与平静日,如STALE和SERVE_FAIL与QUIET状态不同。此外,探针载荷的可修订性和行内标识确保了规则的透明性和结果的重新计算性。
使用方法
使用该数据集时,用户应首先理解其设计原则,即仅比较同一提供商内部的变化,并重视事件方向的解读。可通过`vworld occasion verdict --date YYYY-MM-DD`命令从已提交的单元格重新计算判定,无需API密钥,适合验证和复制。用户应关注事件在多个独立列或提供商间的共同出现,而非单个孤立事件,因为后者可能仅是噪声。对于缺失日期,应视为服务观察的缺失,而非平静时期。该数据集有效用于检测服务端部署变化或生态整体移动,但需注意其对小幅漂移的检测能力有限,更适合捕捉显著变化。
背景与挑战
背景概述
VetoWorld occasion log 数据集诞生于2026年,由VetoWorld项目团队创建,旨在系统性地监测托管模型在时间维度上的行为一致性。其核心研究问题源于一次关键观察:同一模型在特定世界、相同提示和请求格式下,两天内表现出高达0.319的速率漂移,而这一变化无法通过外部常规基准测试察觉,疑似由供应商侧的部署变更引起。该日志通过每日固定网格的锚定服务,结合Fisher精确检验,提供了一种可验证、可复现的机制,以量化端点行为的波动。作为强化学习与智能体对齐领域的前沿工具,它强调了服务层面而非模型层面的动态变化,为跨供应商、跨时间的行为监控设立了新范式,对可重复性研究和部署可靠性评估具有深远意义。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两个层面。领域内,托管模型端点作为黑箱,其行为漂移难以从外部归因,部署、量化或路由变化无法区分,需依赖统计方法界定变化发生的时间与跨堆栈一致性,但小规模样本(n<1K)限制了检测微小漂移的能力,如0.05的偏差可能逃逸。构建过程中,必须确保服务网格的稳定锚定,同时应对空档日(如STALE或SERVE_FAIL)不可误读为平静,并设计预计数假警报(每年约11次)以平衡敏感性与误报率。此外,跨提供商间层级不可直接比较,需依赖事件重合来推断生态系统级变化,且路由请求可能产生无行记录,迫使采用响应头验证,增加了数据采集的逻辑复杂性。
常用场景
经典使用场景
VetoWorld occasion log 数据集作为强化学习与AI代理对齐领域的持续性监测工具,其核心应用场景在于对托管模型在时间维度上的行为稳定性进行系统性追踪。该数据集通过固定网格的每日探测,记录模型在不同服务渠道、不同提供商下的响应变化,旨在捕捉服务端部署变更引发的模型行为偏移。其经典使用方式包括:利用每日的Fisher检验结果判断模型是否发生显著行为漂移,监控跨提供商的事件同步性以区分个体供应商变更与生态系统级变动,以及作为科学实验的门控机制,仅在模型状态适宜时授权执行昂贵或敏感的探测任务。该数据集为长期运行的AI服务提供了标准化、可复现的监测框架,使得模型行为的变化不再依赖于偶然观察,而是成为可查询、可验证的日常记录。
衍生相关工作
该数据集的发布催生了若干相关研究脉络。其一,基于其每日事件日志,研究者开发了更精细的漂移检测算法,如利用贝叶斯在线变点检测对序列中的EVENT时刻进行后验概率评估,从而提升对微小偏移的敏感度。其二,数据集中'跨提供商事件一致性'的概念被扩展为分布式系统健康监测的通用指标,相关研究将其应用于多云环境下模型服务的故障诊断。其三,此工作启发了将'服务日志'作为强化学习环境反馈的新型框架,使代理能够依据历史事件自主调整行为策略,避免在模型漂移期间执行无效操作。最后,该数据集的公开格式和重计算工具促进了可重复性研究,社区跟进建立了类似的长周期日志数据集,用以追踪不同供应商的模型行为动态,共同推动了模型服务监测领域的方法论创新。
数据集最近研究
最新研究方向
vetoworld-occasion-log数据集的前沿研究方向聚焦于托管模型服务行为的日常监测与可复现性评估,其核心创新在于将数据集的构建从传统静态基准转向动态、持续的服务状态追踪。该数据集通过固定网格的每日探针,记录多提供商、多渠道的模型响应变化,利用Fisher检验量化偏差,并引入事件判定机制以区分噪声与真实漂移。这一设计直接回应了云端模型部署中因提供商端变更导致的不可观测性能波动,为AI对齐、模型监控及环境稳定性评估提供了新的实证范式。其研究意义在于推动建立跨提供商的服务动态一致性标准,并助力科学实验调度,确保在模型状态变化时能及时触发深度探测,从而增强AI系统的可信度与鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务