遇见数据集

omnimcp_sql_dbt_transformations_teaser

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

OmniMCP - SQL dbt 转换(免费预告版)是一个经过验证的多轮智能体函数调用数据集,专为 SQL dbt 转换场景设计。该数据集是 OmniMCP 模块化生态系统的一部分,旨在为研究人员和开发者提供高质量的合成训练数据,用于微调或评估智能体在 dbt 转换任务中的函数调用能力。数据集包含少于1000个样本,每个样本包括指令、思维过程和最终输出,以 Parquet 格式存储。其特点包括:100% 语法和解析错误率(经过 Pydantic AST 验证)、原生链式思维推理、生产级自愈能力(预训练真实 API 错误和恢复)、100% GDPR 合规(无个人数据)以及符合 EU AI Act 的合成数据声明。该预告版以 Apache 2.0 许可证发布,适用于免费研究和评估。

OmniMCP - SQL dbt Transformation (Free Preview) is a validated multi-turn agent function calling dataset specifically designed for SQL dbt transformation scenarios. It is part of the OmniMCP modular ecosystem, aiming to provide high-quality synthetic training data for researchers and developers to fine-tune or evaluate agent function calling capabilities in dbt transformation tasks. The dataset contains fewer than 1000 samples, each including instructions, chain-of-thought reasoning, and final output, stored in Parquet format. Features include: 100% syntax and parsing error rate (validated by Pydantic AST), native chain-of-thought reasoning, production-level self-healing capabilities (pre-trained on real API errors and recovery), 100% GDPR compliance (no personal data), and a synthetic data declaration compliant with the EU AI Act. This preview version is released under the Apache 2.0 license, suitable for free research and evaluation.

创建时间:
2026-08-31
原始信息汇总

数据集概览

OmniMCP - Sql Dbt Transformations (Free Teaser Edition) 是一个用于SQL dbt转换场景的**多轮智能体函数调用(Agent Function-Calling)**合成数据集,专为模型微调与评估设计。


基本信息

属性 内容
数据集名称 OmniMCP - Sql Dbt Transformations (Free Teaser Edition)
语言 英语
许可证 Apache 2.0(仅限此免费试玩版)
数据规模 少于 1,000 条样本(n<1K)
标签 sql_dbt_transformationssynthetic-datafunction-callingtool-usefine-tuningagentic-aimulti-turnunslothaxolotlollama
相关工具链 unsloth、axolotl、ollama(适用于多种微调框架)

数据集内容与特点

该数据集专注于 SQL dbt 转换 任务,属于 OmniMCP 模块化生态中“砖块(Brick)”级别(单价对应区间为 29 € - 99 €)的一个针对性解决方案。其核心特点包括:

  • 100% 语法与解析零错误:所有数据经过严格的 Pydantic AST 与 OpenAPI schema 校验,避免公共网络抓取数据常见的高错误率(超过 20%)问题。
  • 原生思维链推理:在每次工具调用前嵌入 <thought> 块,提供逐步诊断逻辑,增强模型的可解释性与推理能力。
  • 生产级自愈能力:数据集包含真实 API 故障、连接池超时、错误恢复等场景,而不是简单的“快乐路径”示例。
  • 隐私与合规:完全符合 GDPR/DSGVO,不含任何个人数据(使用 RFC 2606 @example.com 和 RFC 5737 文档化 IP 地址)。

层级结构(OmniMCP 模块化架构)

该数据集处于 OmniMCP 四层架构中的第一层级:“砖块”(LEVEL 1: THE BRICK,29 € - 99 €),定位为高度聚焦的单问题解决器,适合独立开发者及针对特定边缘案例的快速微调。

在此层级之上,还有更高层级的整合产品:

  • 第二层:“房屋”(LEVEL 2: THE HOUSE):如“Enterprise DataOps Lakehouse”或“Enterprise Modern Data Platform”等套件,包含 dbt 相关扩展内容。
  • 第三层:“村庄”(LEVEL 3: THE VILLAGE):多个房屋的组合解决方案(如 FinTech、Cloud SecOps 等)。
  • 第四层:“大都市”(LEVEL 4: THE MASTER METROPOLIS):统一的企业级园区,包含 500+ 多轮场景。

请注意: 此免费版仅是“试吃版(Teaser)”,完整生产级主包及商业 EULA 许可证需通过外部渠道(Gumroad)另外获取。


使用与加载

数据集以 Parquet 格式提供,可通过 Python 快速加载:

python import pandas as pd

Load the verified teaser Parquet

df = pd.read_parquet("omnimcp_sql_dbt_transformations_teaser.parquet") print(f"Loaded {len(df)} verified training turns!") print(df[["instruction", "thought_process", "final_output"]].head())

加载后数据框架包含三列核心数据:instruction(指令)、thought_process(思维链过程)、final_output(最终输出)。


商业授权与限制

  • 此免费试玩版:采用 Apache 2.0 许可证,允许免费用于研究与评估。
  • 完整生产包与“村庄”级产品:受 OmniMCP 企业商业 EULA 保护,授予完整商业变现与模型部署权利。
  • 合规性:数据集附带欧盟 AI 法案第 50 条与第 53 条要求的合成数据来源声明。

附加信息

此数据集是 OmniMCP 生态系统的入口之一,该生态目前拥有 40 个活跃产品,覆盖从数据库优化、网络防御到金融交易等领域。每个数据集均采用模块化设计,可与其他砖块、房屋或村庄搭配组合,构建更复杂的智能体解决方案。

搜集汇总
数据集介绍
omnimcp_sql_dbt_transformations_teaser 数据集图片
构建方式
OmniMCP SQL dbt Transformations Teaser数据集是OmniMCP模块化架构中针对数据工程领域精心构建的合成数据集,专注于dbt(数据构建工具)转换的SQL操作。该数据集通过严格遵循OpenAPI模式,利用Pydantic进行AST验证,确保每一条指令、思考过程与最终输出均无语法及解析错误。其构建过程模拟了真实的dbt开发场景,涵盖了增量SQL、schema drift断言等企业级数据管道维护任务,并融入了原生思维链推理,于每次工具调用前嵌入<thought>块以呈现诊断逻辑,同时纳入生产环境中的自愈机制,如处理连接池超时与API错误恢复,旨在训练智能体进行精准的函数调用与多轮交互。
使用方法
此数据集作为免费评估版,采用Apache 2.0许可,适用于研究及评估目的。用户可通过Python快速加载Parquet格式文件,利用pandas读取并处理数据,其结构包含instruction、thought_process与final_output列,便于直接用于模型微调或智能体训练。该teaser版本为OmniMCP完整生产包的子集,完整版可通过Gumroad获取并附带商业EULA许可,支持从单砖块(29欧元起)到企业级村庄(599欧元)的多级选择,以适配不同规模的开发团队与商业部署需求,实现从单一问题解决到跨部门综合解决方案的灵活扩展。
背景与挑战
背景概述
在人工智能体(Agentic AI)与工具调用(Tool Use)技术迅猛发展的当下,函数调用与多轮对话数据集的稀缺与质量参差成为制约大语言模型(LLM)在真实生产环境中部署的关键瓶颈。OmniMCP SQL dbt Transformations (Free Teaser Edition) 数据集由 Bacardy 团队于2023年精心构建,聚焦于数据工程领域的 dbt 转换任务,旨在模拟企业级数据分析平台中模型对 SQL 转换工具链的精准调用。该数据集以模块化OmniMCP架构中的“砖块”层出现,覆盖增量SQL处理与Schema漂移断言等核心场景,通过精细的合成数据生成,填补了专业领域小规模、高精度工具调用训练语料的缺口,对提升LLM在结构化数据操作中的可靠性与推理能力具有显著推动作用。
当前挑战
构建过程中面临的首要挑战是确保数据集的语法与解析零误差,以区别于公开网络爬取数据中常见的噪声;团队实施了基于Pydantic的抽象语法树(AST)验证,严格符合OpenAPI模式,从而保证了100%的解析准确率。其次是内嵌思维链(Chain-of-Thought)的推理逻辑设计,每条指令前需加入逐步诊断的<thought>块,模拟真实故障恢复路径,而非仅覆盖理想化操作序列,这增加了数据设计的复杂度。此外,数据生成需严格遵循环球数据保护法规(GDPR/DSGVO),清除所有个人可识别信息(PII),并采用RFC 2606和RFC 5737规定的文档化占位符IP与邮箱,这一过程在合成数据来源声明上要求极高的严谨性,以符合欧盟《人工智能法案》第50条和53条的合规要求,凸显了在数据规模与法规遵从之间达成微妙平衡的挑战。
常用场景
经典使用场景
OmniMCP SQL dbt Transformations数据集作为一款精心设计的合成数据资源,其核心应用场景聚焦于训练与评估具备复杂SQL转换能力的智能体模型。该数据集依托dbt(data build tool)的工程实践,为多轮对话中的函数调用与工具使用提供了高度仿真的训练样本。数据中包含的指令、思维链条及最终输出,使模型能够学习在真实的数据管道环境中逐步解析转换需求、生成正确的SQL代码,并执行增量构建与模式漂移断言等精细操作。此数据集适用于对开源大语言模型进行微调,以增强其在数据工程领域的任务执行精准度与逻辑推理能力。
解决学术问题
该数据集针对当前大语言模型在结构化数据操作任务中普遍存在的语法错误率高、推理链条缺失及对复杂工程环境适应性弱等学术难题,提供了经过严格校验的解决方案。凭借100%的Pydantic AST验证,数据确保了零语法错误,从而大幅提升了模型输出的可靠性与可解析性。内置的思维链(Chain-of-Thought)推理机制,则引导模型在每次工具调用前进行逐步诊断分析,有效改善了AI在解决多步骤数据转换问题时的逻辑连贯性。此外,通过模拟真实API故障与连接池超时等自愈场景,该数据助力研究突破以往模型仅能处理理想化简单路径的局限,推进了Agentic AI在稳健性与自我纠错能力方面的学术探索。
实际应用
在实际生产环境中,此数据集的价值体现于助力企业构建更加智能、自动化的数据平台运维体系。基于此数据微调后的模型,可被部署为数据工程助手,承担dbt模型开发的辅助工作,例如自动生成符合业务逻辑的SQL转换代码、诊断并修复流水线中的模式漂移问题,以及优化增量加载策略以提升计算资源的使用效率。在真实的数据仓库或数据湖环境中,这类智能体能够显著减少数据工程师在繁琐编码与调试上投入的时间,加速从原始数据到分析就绪状态的转化进程。此外,其模拟故障恢复的特性让模型能够预判并应对基础设施异常,从而提升整个数据管道编排的韧性与自动化水平。
数据集最近研究
最新研究方向
在数据工程与人工智能融合的前沿,dbt(data build tool)作为现代数据转换的支柱,正与智能代理技术深度交织。OmniMCP SQL dbt转换数据集顺应了这一趋势,聚焦于多轮代理式函数调用,旨在训练模型理解复杂的增量SQL逻辑与模式漂移断言,从而提升数据管道开发的自动化与自愈能力。该数据集强调原生思维链推理与生产级错误恢复,反映了当前对结构化、可验证的高质量合成数据的需求,以应对通用公共数据集中普遍存在的语法噪声问题。通过严格遵循OpenAPI架构并采用AST验证,它不仅确保了零解析错误,还贴合了欧盟AI法案对合成数据来源透明性的要求,为构建健壮、合规的企业级智能数据代理提供了关键训练基石,推动了数据基础设施向自主化方向的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务