遇见数据集

posix-sdc

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

POSIX Self-Directed Citizen(posix-sdc)是一个经过验证的、自导向的、自终止的合成POSIX shell轨迹数据集。其核心特点是语言模型在没有任何明确任务提示的情况下登录到真实的POSIX shell环境中,通过读取环境信息(如motd、环境变量、文件或提供程序的--help文档)自主发现任务,使用系统提供的工具完成任务,并通过exit(成功完成)或panic(真正受阻)结束会话。每个轨迹的最终结果都根据真实文件系统状态进行了验证,确保标签可靠性。数据集包含两个主要配置文件:trajectories.jsonl(监督微调语料库,包含每个保留轨迹的详细执行记录)和scenarios.jsonl(可重现的场景包,包含任务世界定义)。数据集中定义了18种任务原型,涵盖四大类别:文件与文本操作(如文件转换、文本替换、日志提取、搜索计数、配置编辑、追加记录、合并文件、分割文件、校验和计算)、文件系统与结构(如创建结构、重命名文件、清理文件、权限设置)、脚本与管道(如修复损坏脚本、多步骤管道)以及复合与终端策略(如多任务、空队列、阻塞任务)。数据生成过程包括四个阶段:教师模型创作场景、操作模型在可丢弃容器中执行场景、根据最终状态验证效果、记录符合条件的轨迹。数据集采用按原型保留的分割策略,将text_replace和permissions两个原型作为保留集,用于评估模型在未见任务类型上的泛化能力。数据集规模为数百个轨迹,所有轨迹均由qwen2.5:32b模型操作生成。数据集附带客观的机器可运行评分器(checker),可作为跨参与者基准测试,支持将相同任务应用于模型或人类进行能力比较。

POSIX Self-Directed Citizen (posix-sdc) is a validated, self-directed, self-terminating synthetic POSIX shell trajectory dataset. Its core feature is that the language model logs into a real POSIX shell environment without any explicit task prompts, autonomously discovers tasks by reading environmental information such as motd, environment variables, files, or the --help documentation of provided programs, completes tasks using system-provided tools, and terminates the session via exit (for successful completion) or panic (for genuine blockage). The final outcome of each trajectory is validated against the real file system state to ensure label reliability. The dataset contains two primary configuration files: trajectories.jsonl (a supervised fine-tuning corpus containing detailed execution records for each retained trajectory) and scenarios.jsonl (a reproducible scenario package including task world definitions). Eighteen task prototypes are defined in the dataset, covering four major categories: File and Text Manipulation (e.g., file conversion, text replacement, log extraction, search and counting, configuration editing, record appending, file merging, file splitting, checksum calculation), File System and Structure (e.g., structure creation, file renaming, file cleaning, permission setting), Scripts and Pipelines (e.g., fixing broken scripts, multi-step pipelines), and Composite and Terminal Strategies (e.g., multi-tasking, empty queue, blocking tasks). The data generation process consists of four stages: scenario creation by a teacher model, scenario execution by an actor model in a disposable container, effect validation based on the final state, and recording eligible trajectories. The dataset adopts a prototype-based retention splitting strategy, taking the text_replace and permissions prototypes as the reserved set for evaluating the generalization ability of models on unseen task types. The dataset contains hundreds of trajectories, all generated by the qwen2.5:32b model. The dataset is accompanied by an objective, machine-runnable checker that can serve as a cross-participant benchmark, supporting the application of the same tasks to models or humans for capability comparison.

创建时间:
2026-06-16
原始信息汇总

POSIX Self-Directed Citizen (posix-sdc)

数据集概述

一个经过验证的、自我导向的、自我终止的合成 POSIX shell 轨迹数据集。每个轨迹代表一个语言模型在 shell 环境中,没有任务提示,自主从环境中发现自身任务并执行,最终离开。所有轨迹的结果都基于真实的文件系统状态进行验证,标签可信。

核心特点:不是工具调用(tool-calling)。模型没有预定义的函数 API,而是直接面对真实的 shell 提示符,像人类一样通过 --helpmanls、阅读文件等方式发现和操作系统。行为边界由操作系统本身定义。

任务描述:自我导向的公民

模型被赋予一个真实系统的账户,登录到 POSIX shell 后,通过阅读环境(motd、环境变量、文件、提供程序的 --help)发现自己的任务,利用系统提供的工具完成任务,并以 exit(完成)或 panic(真正受阻)结束会话。

模型必须执行的通用行为模式:

  1. 预期任务指令的公布位置
  2. 通过任务提供者的自我文档理解其用法
  3. 检索指令
  4. 执行指令,然后终止

任务原型(18种)

轨迹的 archetype 字段记录任务类型,大部分以干净的 exit 结束,两种编码了终端策略(何时无事可做时停止,何时放弃)。

类别 原型
文件和文本操作 file_transform(转换文件)、text_replace(替换字符串)、log_extract(提取日志行)、search_count(搜索并统计)、config_edit(编辑配置)、append_record(追加记录)、merge_files(合并文件)、split_file(分割文件)、checksum(计算校验和)
文件系统和结构 create_structure(创建目录树)、rename_files(重命名文件)、cleanup(清理文件)、permissions(设置权限)
脚本和管道 fix_broken_script(修复错误脚本)、multi_step_pipeline(组合多步管道)
复合和终端策略 multi_ticket(多个独立指令)、empty_queue(无任务,干净退出)、blocked_ticket(无法完成,panic)

每个场景还变化了发现提供者的方式(子命令 CLI、标志 CLI、纯文本文件、环境变量指针)和公告方式(motd、登录横幅、README、环境变量),以概括跨接口的发现能力。

数据生成方法

采用强教师模型("Master Foo":qwen2.5:32b)编写场景并操作。四阶段流程:

  • A. 编写:教师编写场景(指令提供程序、公告、固件、确定性检查器、参考解决方案),只有参考解决方案通过检查器才被接受
  • B. 执行:操作模型在一次性通用 Linux OCI 容器中驱动场景,只有通用框架,无任务
  • C. 验证:检查器运行于容器的最终状态,评估命令产生的效果
  • D. 记录:仅保留效果存在且终端正确的轨迹,剥离框架,保留环境轮次和模型命令

操作模型选择:qwen2.5:32b 在配对比较中优于 llama3.1:8b(44% vs 19% 干净轨迹),除非另有标注,所有轨迹均由 qwen2.5:32b 操作。

数据文件与结构

位于 data/ 目录,包含两个配置文件:

  • trajectoriesdata/trajectories.jsonl):SFT 语料库,每个轨迹一行
  • scenariosdata/scenarios.jsonl):可复现的世界,每个场景一行

trajectories 字段

字段 类型 含义
id str 内容寻址:<archetype>_<sha256(turns)[:12]>
version str 该记录首次出现的数据集版本
scenario_id str 运行的场景 ID
archetype str 任务类型
environment obj 运行的发行版 / shell / coreutils / 包管理器
terminal str exitpanic
verified bool 检查器是否通过最终状态
outcome str successcorrect_panic
operator_model str 产生轨迹的模型
turns list {role, content} 消息:system、user(环境)、assistant(命令)

scenarios 字段

字段 类型 含义
idarchetypeterminal str 身份标识
version str 首次出现的版本
split str trainholdout(按完整原型保留)
environment obj 环境配置
provider obj 指令提供者(kind、name、help、files)
announcement obj 入口线索
directives list 赋值指令
fixtures obj 路径到内容的种子数据
checker str shell 脚本,exit 0 表示效果存在
reference_solution list 满足检查器的命令

所有 ID 都是内容寻址的(<archetype>_<sha256(content)[:12]>),确保跨生成运行的稳定性。

数据划分与泛化协议

scenarios.jsonl 将两个完整原型标记为 holdout

  • text_replace(文件/文本)
  • permissions(文件系统元数据)

它们被特意设置为不相似,以评估操作与终止机制在不同类型任务上的泛化能力。终端策略原型(empty_queueblocked_ticket)从不保留。轨迹仅来自 train 原型,评估方式为按原型的行为测试。

基准视图(xapi/

每个场景携带一个机器运行的评分器(checker),数据集可作为跨角色的基准。xapi/ 目录将运行记录投影到 xAPI 语句,支持框架化的能力评估。

支持的实验结果

在配套实验中,使用此数据对 mistral:7b-instruct-v0.2 进行微调,使得在原型级别的保留场景上的终止率从 0/16(基础模型)提升至 9/16(微调模型),操作/终止机制泛化到了未见过的原型。

局限性

  • 规模小:几百条轨迹,一个教师,一个生成协议
  • 操作模型 qwen2.5:32b 的干净轨迹率约 40%,保留集偏向较容易的场景
  • dash(Alpine)中生成,命令语义可能与其他目标环境略有差异
  • multi_step_pipeline 原型代表性不足

许可与引用

  • 许可CC-BY-4.0
  • 引用:使用本数据集请注明 "posix-sdc by Tiara Rodney" 并链接本仓库
搜集汇总
数据集介绍
posix-sdc 数据集图片
构建方式
posix-sdc数据集由强教师模型'Master Foo'(qwen2.5:32b)通过四阶段流水线自动生成。首先,教师模型编写包含指令提供程序、公告、环境和可验证检查器的场景,并在独立容器中通过参考解决方案的验证。随后,操作模型在通用的Linux OCI容器中驱动该场景,自主发现任务并执行。接着,检查器根据容器的最终文件系统状态评估命令的实际效果,而非记录文本或模型的声明。最后,仅保留效果正确且终端状态正确的轨迹,并剥离辅助框架,保留环境轮次和模型命令。所有轨迹的标签通过真实文件系统状态验证,确保可靠性。
使用方法
数据集以JSON Lines格式提供,包含trajectories和scenarios两个配置。trajectories.jsonl记录经验证的SFT语料,每条包含ID、场景ID、任务类型、环境信息、终端状态、验证标志以及对话轮次(系统、用户环境、助手命令)。scenarios.jsonl记录可重现的场景,包括指令提供程序、公告、指令列表、初始文件结构和检查器脚本。用户可通过Python包直接加载轨迹和场景,也可在Hugging Face上直接访问数据文件。对于监督微调,建议仅对助手轮次计算损失,环境轮次作为上下文。评估时,可对保留的任务类型(text_replace和permissions)进行行为测试,以衡量模型在新任务类型上的泛化能力。
背景与挑战
背景概述
在人工智能代理研究领域,传统的指令遵循或工具调用数据集将模型置于预设任务或受限API环境中,限制了其在真实操作系统中的泛化能力。由Tiara Rodney于2026年创建的posix-sdc数据集,旨在突破这一范式,提出“自我导向公民”概念:使语言模型如同人类操作员般,在无预设任务的POSIX shell环境中自主发现指令、执行操作并终止会话。该数据集由自洽的合成轨迹构成,所有轨迹均通过真实文件系统状态验证,确保标签可靠性。其核心研究问题聚焦于模型能否在无显式归纳的行动空间中,通过探索系统边界实现通用操作-终止机制。实验证据表明,在仅约110条轨迹上微调mistral:7b-instruct-v0.2模型后,其在未见任务原型的holdout场景中终止率从0/16逆势提升至9/16,有力证明了该机制的强泛化能力,为构建真正自主的系统操作代理奠定了数据基础。
当前挑战
该数据集致力于应对两大核心挑战。其一,领域问题层面,传统代理数据集将模型禁锢于指令执行或工具调用的窠臼,无法推广至任意系统操作场景。posix-sdc突破性地将行动边界定义为整个操作系统,要求模型通过读取motd、环境变量等环境线索自主发现任务,并在遇到非预期障碍时通过panic机制诚实终止,而非虚构结果。其二,构建过程中面临显著技术瓶颈:强教师模型qwen2.5:32b在每次rollout中仅约40%的轨迹通过验证,主要失败模式为premature_exit和wrong_panic,导致保留轨迹向简单场景倾斜;此外,多步骤管道任务因教师模型操作能力不足而严重欠采样,且数据集总体量受硬件限制(NVIDIA Tesla V100 32GB),合成约100条验证轨迹需耗时3小时,扩充规模面临计算资源约束。
常用场景
经典使用场景
在智能体研究领域,posix-sdc数据集为训练具备自驱式任务发现与执行能力的语言模型提供了独特且严谨的基准。与依赖预定义API或显式指令的传统工具调用范式不同,该数据集模拟了一个真实的POSIX shell环境,智能体在无明确任务提示的状态下启动,需通过阅读系统环境中的公告、程序帮助文档或文件内容来自主发现待办事项,并借助系统提供的命令完成操作。每个轨迹均经过文件系统状态验证,确保了行为结果的可靠性。这一设定使研究者能够探究模型在开放式、自发现机制下的自主推理与任务完成能力,为构建更贴近真实操作场景的智能体系统奠定了基础。
解决学术问题
该数据集致力于解决当前智能体研究中的一个核心困境:多数训练范式依赖人工标注的工具调用轨迹或预定义任务指令,导致模型在未见任务类型或环境变化时泛化能力不足。posix-sdc通过引入自发现与自终止机制,使模型学习从环境线索中推断目标、独立制定行动计划并自主结束会话。实验表明,在仅约110条轨迹的微调下,模型对保留任务类型的终止成功率从0/16跃升至9/16,验证了该机制在跨任务泛化上的潜力。这一工作填补了自驱式智能体行为数据集的空白,推动了从指令跟随型智能体向环境导向型智能体的范式转型。
实际应用
在实际应用层面,posix-sdc数据集为自动化运维、系统管理与DevOps领域提供了切实可行的训练资源。通过在该数据集上微调的语言模型,能够自主登录远程服务器、读取系统配置或日志文件、诊断问题并执行修复命令,无需人工介入每一步决策。例如,模型可自动完成文件批处理、文本替换、权限修正、日志分析等日常系统管理任务,并在遇到无法解决的障碍时以panic信号向管理员求助。这种自驱式操作能力显著降低了运维脚本的编写成本和人工值守需求,为构建更加智能、自适应的基础设施管理工具奠定了基础。
数据集最近研究
最新研究方向
该数据集聚焦于构建无需预设任务指令的自主智能体交互范式,通过让语言模型在真实POSIX shell环境中自主发现并执行任务,推动从依赖结构化API的工具调用向基于系统级交互的自主决策方向演进。当前的前沿探索集中在验证模型在未见过的任务类型(如文本替换与权限修改)上的泛化能力,以及如何将操作系统本身作为动作边界,模拟人类通过man、--help等自文档机制探索命令行为的方式。研究同时关注利用自终止策略(exit与panic)解决智能体在开放环境中的停止决策问题,并通过xAPI框架将任务能力模型与人类操作对齐,为构建类人自导向操作者奠定基础,其意义在于揭示小样本微调对智能体机制泛化的显著提升潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务