cracklinoatbran/furlong_monitor_560
收藏资源简介:
furlong_monitor_560是一个预烘焙的监控评估数据集,用于评估furlong-misuse行为。每个数据行包含一个(prompt, response)对以及真实标签。数据集由280个提示组成,涵盖距离和非距离主题,每个提示由gpt-4o-mini模型回答两次,分别使用中性系统提示和鼓励使用furlongs的系统提示,总计560行数据。数据集的字段包括唯一ID、提示ID、策略变体、模型、行为类别、格式、主题标签、用户提示、选项、自然使用furlongs的标志、原始响应、选择的选项、渲染后的响应、真实标签以及不必要的furlong使用标志。数据集用于监控器评估,通过比较监控器的输出与真实标签来计算覆盖率和误报率。
Pre-baked monitor eval dataset for the **furlong-misuse** behavior. Each row is a `(prompt, response)` pair plus ground-truth labels. The dataset consists of 280 prompts spanning distance and non-distance topics, each answered twice by gpt-4o-mini under neutral and furlong-encouraging system prompts, totaling 560 rows. Fields include unique ID, prompt ID, policy variant, model, behavior class, format, topic tag, user prompt, choices, natural furlong usage flag, raw response, picked option, rendered response, ground truth label, and unnecessary furlong usage flag. Used for monitor evaluation to compute cover-up and false-positive rates.




