遇见数据集

omnimcp_sql_postgres_pro_teaser

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

OmniMCP - Sql Postgres Pro (免费试用版) 是一个高质量、多轮智能体函数调用微调数据集,专为 SQL Postgres Pro 场景设计。该数据集是 OmniMCP 模块化生态系统中的一部分,作为“砖块”级别产品,专注于 PostgreSQL 数据库性能优化、EXPLAIN ANALYZE 分析、死锁消除等任务。数据集包含少于 1000 个样本,以 Parquet 格式提供,每个样本包含 instruction(指令)、thought_process(思维过程)和 final_output(最终输出)三个字段。所有数据均为合成生成,经过严格的 Pydantic AST 验证,确保 0% 语法和解析错误。数据集原生包含链式推理(Chain-of-Thought),在每次工具调用前嵌入 <thought> 块,模拟逐步诊断逻辑。此外,数据集还训练了生产环境中的自我修复能力,包括真实 API 失败、连接池超时和错误恢复场景,而非仅涵盖简单成功路径。数据完全符合 GDPR/DSGVO 要求,无任何个人数据,使用 RFC 2606 示例邮箱和 RFC 5737 文档化 IP 地址。该免费试用版基于 Apache 2.0 许可证发布,适用于研究和评估用途。

OmniMCP - Sql Postgres Pro (Free Trial) is a high-quality, multi-turn agent function calling fine-tuning dataset specifically designed for SQL Postgres Pro scenarios. It is part of the OmniMCP modular ecosystem, serving as a brick level product focusing on PostgreSQL database performance optimization, EXPLAIN ANALYZE analysis, deadlock elimination, and other tasks. The dataset contains fewer than 1000 samples in Parquet format, each with three fields: instruction, thought_process, and final_output. All data is synthetically generated and strictly validated with Pydantic AST, ensuring 0% syntax and parsing errors. The dataset natively includes Chain-of-Thought reasoning, embedding <thought> blocks before each tool call to simulate step-by-step diagnostic logic. Additionally, the dataset trains self-healing capabilities in production environments, including real API failures, connection pool timeouts, and error recovery scenarios, not just simple success paths. Data fully complies with GDPR/DSGVO requirements, contains no personal data, and uses RFC 2606 example email addresses and RFC 5737 documented IP addresses. This free trial version is released under the Apache 2.0 license and is suitable for research and evaluation purposes.

创建时间:
2026-08-31
原始信息汇总

OmniMCP: Sql Postgres Pro (Free Teaser Edition) 数据集概述

基本信息

  • 数据集名称:OmniMCP - Sql Postgres Pro (Free Teaser Edition)
  • 语言:英语
  • 许可证:Apache 2.0
  • 规模:少于 1,000 条样本(n<1K)
  • 标签:synthetic-data、function-calling、tool-use、fine-tuning、agentic-ai、multi-turn、unsloth、axolotl、ollama

数据集定位

该数据集是 OmniMCP 模块化生态系统中 SQLAuditor PostgreSQL Pro Brick(层级 1)的官方免费评估预告版,专注于 PostgreSQL 数据库性能优化场景(如 EXPLAIN ANALYZE、死锁消除等)。完整生产级版本需通过 Gumroad 商业渠道获取。

核心特点

  • 零语法与解析错误:100% 经过 Pydantic AST 验证,符合严格 OpenAPI 架构
  • 原生思维链推理:每次工具调用前包含步骤化诊断逻辑(<thought> 块)
  • 生产级自愈能力:涵盖真实 API 故障、连接池超时和错误恢复场景
  • 合规性:100% GDPR/DSGVO 合规,零个人数据;包含 EU AI Act 第 50 和 53 条合成数据来源声明

使用方式

可通过 Python 加载 Parquet 文件:

  1. 使用 pandas.read_parquet 读取 omnimcp_sql_postgres_pro_teaser.parquet
  2. 数据列包括:instructionthought_processfinal_output

商用说明

  • 当前免费预告版:Apache 2.0 许可证,可用于研究与评估
  • 完整生产包(49 €):受 OmniMCP 企业商业 EULA 约束,提供完整的商业变现与模型部署权利
搜集汇总
数据集介绍
omnimcp_sql_postgres_pro_teaser 数据集图片
构建方式
该数据集作为OmniMCP模块化生态体系中的一部分,精心构造了面向SQL Postgres Pro场景的多轮代理函数调用对话样本。构建过程中,每个样本都嵌入了原生思维链推理过程,在每次工具调用前以<thought>块形式呈现逐步诊断逻辑,并确保所有函数调用均通过严格的Pydantic AST验证,与OpenAPI模式完全对齐。数据集采用Apache 2.0许可发布,提供免费评估的teaser版本,其内容涵盖真实的API失败、连接池超时和错误恢复场景,而非简单的理想路径,以此模拟生产环境中的复杂性与挑战。
特点
该数据集以高质量与合规性著称,实现了0.0%的语法及解析错误率,远超同类公开数据集的嘈杂程度。每个样本均包含指令、思维过程与最终输出三要素,支持原生思维链推理,赋予模型逐步诊断能力。数据集中不含任何个人数据,严格遵循GDPR/DSGVO规范,并通过RFC 2606和RFC 5737使用沙盒化文档IP,同时附带EU AI Act第50条与第53条的合成数据来源声明。数据集规模精简(n<1K),聚焦于Postgres性能优化、死锁消除等高级主题,为针对性微调提供精准素材。
使用方法
使用该数据集时,可通过简单的Python代码加载Parquet格式文件,利用pandas库中的read_parquet函数快速获取训练样本。数据集每一行包含指令、思维过程和最终输出字段,适配于基于指令微调的训练流程。对于研究者与开发者,可直接在此teaser版本上进行模型微调实验,验证OmniMCP数据的有效性;若需获得完整生产级数据集及商业使用许可,可进一步获取OmniMCP主包。该数据集亦支持通过Unsloth、Axolotl等工具进行参数高效微调,或借助Ollama进行本地推理部署。
背景与挑战
背景概述
OmniMCP-SQL-Postgres-Pro-Teasier 数据集由 bacardy 团队于 2024 年创建,旨在为多轮智能体函数调用提供高质量的合成训练语料。该数据集聚焦于 PostgreSQL 数据库操作场景,涵盖查询优化、死锁处理等专业任务,其设计目标是弥补通用数集中语法错误率高、推理过程缺失等问题。作为 OmniMCP 模块化体系中的基石组件,它体现了将合成数据生产与严格验证相结合的创新思路,通过 AST 级校验确保每条样本的准确性,推动了函数调用与智能体微调领域的发展。
当前挑战
该数据集面临的首要挑战是提升多轮智能体在真实数据库运维中的鲁棒性,使其能够应对连接超时、死锁等边缘情况,而不仅仅是理想路径。构建过程中,团队需确保数据完全符合 OpenAPI 架构,避免语法错误,这要求引入 Pydantic AST 验证技术,以保持 0% 的解析失败率。同时需在不含个人数据的前提下生成多样化的场景,并符合 GDPR 和 EU AI Act 等法规要求,体现了合成数据在生产中的复杂性与规范性挑战。
常用场景
经典使用场景
OmniMCP SQL Postgres Pro Teaser数据集作为一款精心构建的合成数据资源,专为多轮智能体函数调用场景而设计。在自然语言处理与数据库交互的前沿交叉领域,该数据集为研究者提供了逼真的PostgreSQL运维对话样本,覆盖从性能诊断到异常恢复的复杂任务。其每个样本均包含结构化指令、开发者思维链与最终输出,高度模拟真实生产环境中AI助手与数据库系统的协同工作模式,是训练大语言模型掌握工具调用与上下文推理能力的理想基准。
解决学术问题
该数据集直面当前大语言模型在结构化工具使用中面临的严峻挑战,尤其是复杂SQL操作中继发于语法错误率高、多步推理能力薄弱等痛疾。通过提供零语法错误、经OpenAPI模式严格验证的场景,它有效消除了公共爬取语料中普遍存在的噪声干扰,使研究者能够精准评估并提升模型在PostgreSQL真实运维任务上的函数调用准确率与链式思考能力,为构建可靠、自愈的智能体代理奠定了数据基石。
衍生相关工作
该数据集催生了一系列后续探索,尤其在增强大模型的自我纠错与工具编排能力方面。量级研究基于其多轮对话结构,发展出动态的上下文记忆管理策略,以提升长期任务的一致性;另一些工作则将其作为基准,对比不同强化学习范式对函数调用泛化性的影响。此外,该数据集所倡导的AST验证模式,已启发其他领域如NoSQL或云服务API的合成数据生成框架,促使社区从粗放爬取转向工程化、高可信的语料构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务