遇见数据集

food-penguin-v1

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

Food-Penguin v1 是一个专门用于餐厅分析场景的工具调用(function-calling)微调数据集。该数据集包含648个训练样本,采用与OpenAI聊天补全API兼容的JSONL格式。每个样本包含一个messages序列(包含system、user、assistant、tool等角色对话)和一个tools序列(定义可调用的函数)。数据集的核心理念是教导语言模型调用7个特定的餐厅业务分析功能,包括:销售预测、浪费分析、生产优化、库存优化、KPI总结、订单洞察和行动建议。这些功能被应用于25个手工设计的业务场景中。数据的一个重要特点是模拟了真实的管理工作流,其中61.4%的样本涉及两个或更多工具的链式调用(最常见的是“预测销售”后接“推荐行动”),38.6%为单工具调用。数据集还特意涵盖了边缘情况,如数据缺失、模糊或冲突的查询、超范围值以及多意图请求,以增强模型的鲁棒性。该数据集适用于对语言模型进行工具调用/函数调用能力的微调,特别是在垂直领域(如餐饮业商业分析)的应用开发。

Food-Penguin v1 is a fine-tuning dataset specifically designed for tool-calling (function-calling) in restaurant analytics scenarios. It contains 648 training samples in JSONL format compatible with the OpenAI Chat Completion API. Each sample includes a messages sequence (containing dialogues with roles such as system, user, assistant, and tool) and a tools sequence (defining callable functions). The core concept is to teach language models to invoke seven specific restaurant business analysis functions: sales forecasting, waste analysis, production optimization, inventory optimization, KPI summary, order insights, and action recommendations. These functions are applied to 25 manually designed business scenarios. A key feature is the simulation of real management workflows, where 61.4% of samples involve chained calls of two or more tools (most commonly predict sales followed by recommend actions), and 38.6% are single-tool calls. The dataset also deliberately covers edge cases such as missing data, ambiguous or conflicting queries, out-of-range values, and multi-intent requests to enhance model robustness. This dataset is suitable for fine-tuning language models tool-calling/function-calling capabilities, particularly in vertical domain applications such as restaurant business analytics.

创建时间:
2026-07-26
原始信息汇总

数据集概述:Food-Penguin v1

Food-Penguin v1 (代号 🐧🍣) 是一个面向餐厅分析领域的工具调用(Tool-Calling)数据集,旨在训练模型根据餐厅管理场景自动调用相关分析函数。


基本信息

属性
数据集名称 Food-Penguin v1 — Restaurant Analytics Tool-Calling Dataset
语言 英语(单语)
许可证 MIT
数据集大小 648 个样本(训练集)
下载大小 781,339 字节
任务类别 文本生成 / 工具调用 / 函数调用
数据格式 JSONL(OpenAI messages 格式)

数据内容与结构

  • 样本构成:每个样本包含 messages(多轮对话消息序列)和 tools(可用工具定义)两个字段。
  • 角色类型systemuserassistanttool,模拟完整的工具调用对话流程。
  • 场景覆盖:基于 25 个精心设计的餐厅管理场景
  • 工具链比例
    • 单工具调用:38.6%
    • 多工具链式调用:61.4%(主要为 2 个工具),模拟真实管理工作流。
    • 最常见的工具链:predict_salesrecommend_actions
  • 边界情况:涵盖缺失数据、歧义/冲突查询、超出范围值、多意图请求等。

工具(共 7 个)

函数名称 功能描述 样本占比
predict_sales 根据趋势预测下一期销售额 56.5%
analyze_waste 发现浪费模式与减废机会 56.5%
optimize_production 根据需求调整生产计划 30.9%
get_kpi_summary 获取健康评分/收入/成本快照 30.9%
recommend_actions 基于分析结果提供可操作建议 30.9%
optimize_inventory 根据销售速度优化原料订购 25.6%
get_order_insights 分析订单模式与菜单项表现 23.1%

其他信息

  • 训练方案:使用 QLoRA(4-bit)在 Kaggle T4 上训练约 5 个 epoch,基座模型为 sakthai-context-0.5b-merged
  • 关联资源
搜集汇总
数据集介绍
food-penguin-v1 数据集图片
构建方式
Food-Penguin v1 数据集专为餐厅分析场景下的工具调用任务而设计,其构建过程融合了领域知识与精细化的场景设计。该数据集包含648个JSONL格式的样本,每个样本遵循OpenAI的messages结构,涵盖7个与餐饮运营紧密相关的函数,包括销售预测、浪费分析、生产优化、库存管理、KPI总结、行动建议及订单洞察。数据集的构建基于25个精心策划的餐厅管理场景,其中61.4%的样本涉及两个或以上工具的链式调用,以模拟真实世界中复杂的管理工作流。这些场景覆盖了缺失数据、歧义查询、数值越界以及多意图请求等边缘情况,确保了数据集的鲁棒性与实用性。
使用方法
使用Food-Penguin v1数据集的过程简洁明了,适合用于大语言模型的指令微调与工具调用能力增强。开发者可通过Hugging Face的datasets库直接加载数据集,例如使用load_dataset函数获取训练集。数据集以JSONL格式存储,每条记录包含messages和tools两个字段,可直接适配OpenAI风格的对话模板。在训练方面,推荐采用QLoRA(4-bit量化)技术,在Kaggle T4等消费级GPU上可高效完成约5个周期的微调。该数据集还可与sakthai-context-0.5b-merged等基础模型结合使用,为餐厅分析应用构建定制化的AI助手。
背景与挑战
背景概述
在人工智能与餐饮业深度融合的浪潮中,工具调用(Tool-Calling)能力成为提升大语言模型实用性的关键方向。由研究者Nanthasit Burankum于2026年创建的Food-Penguin v1数据集,是首个专注于餐厅分析场景的领域特定工具调用数据集。该数据集由SakThai模型家族所属的House of Sak项目开发,收录了648条经过精心设计的JSONL格式对话样本,涵盖销售预测、浪费分析、库存优化、KPI摘要及行动建议等7项关键餐厅分析函数。通过模拟25种真实管理场景,其中61.4%的样本涉及多工具链式调用,该数据集为训练模型掌握结构化商业推理能力提供了高质量素材,在推动领域专用大语言模型落地方面具有开创性意义。
当前挑战
该数据集所应对的核心领域挑战在于,通用大语言模型往往缺乏执行垂直行业复杂工作流的能力,如餐厅管理中需要对销售额、浪费率、库存周转率等多源数据实施连续分析与决策。构建过程中面临多重难题:首先需设计出可交互的7个函数及其参数体系,确保覆盖预测、诊断、优化、推荐等全链路任务;其次要人工编写25个覆盖边界情形(如缺失数据、矛盾查询、超范围值、多意图请求)的场景脚本;最后需在仅有648条样本的规模下,实现61.4%的多工具调用率,通过链条模式如预测销售→推荐行动的典型组合,有效模拟真实管理决策的迭代逻辑,兼顾样本质量与多样性。
常用场景
经典使用场景
Food-Penguin v1 数据集专为餐饮业分析场景下的工具调用(Tool-Calling)任务而设计,涵盖了预测销售额、分析浪费、优化生产与库存、获取KPI摘要、推荐行动以及洞察订单模式等七种核心餐厅分析功能。数据集包含648个对话样本,其中61.4%的样本涉及多工具链式调用,模拟了真实世界中餐厅管理者进行综合决策的复杂工作流。该数据集以OpenAI消息格式组织,适合用于微调大语言模型,使其能够根据用户输入的餐厅运营数据自主选择合适的函数并生成结构化调用请求。研究者可借此训练模型在限定的业务领域内精准理解多意图查询、处理缺失或矛盾信息,并生成连贯的分析报告,是探索垂直领域函数调用能力的绝佳基准。
解决学术问题
Food-Penguin v1 主要解决了学术界在受限领域内进行可靠工具调用(Reliable Tool-Calling)的研究难题。传统通用工具调用数据集往往缺乏领域深度与业务逻辑的一致性,而该数据集通过精心设计的25个场景,精准覆盖了餐饮分析中的常见与边缘情况,如数据缺失、歧义请求和冲突指令,为评估模型在真实业务约束下的鲁棒性提供了标尺。它推动了从单纯的语言生成向可执行的、情境感知的决策辅助系统的研究转向,其意义在于验证了通过小规模、高密度的领域特定数据微调,大语言模型能够学会在有限的函数集合内进行多步推理与任务分解。这一范式挑战了“参数规模越大能力越强”的朴素观点,为低成本构建实用型AI助手开辟了新的路径。
实际应用
Food-Penguin v1 的实际应用场景直接落地于现代餐饮企业的智能管理环节,例如通过训练模型自动解读日销售报告并调用函数预测下月营收,或根据库存周转率与浪费数据优化食材采购计划。在连锁寿司店或综合餐厅中,该数据集赋能后的AI助手可为管理者提供一键式的KPI看板生成服务,将多源数据整合为可执行的建议。其推荐的行动方案能帮助运营者调整菜单结构、减少食材损耗,从而提升利润率。此外,模型还能处理对比查询或超范围的数值异常,辅助店长在突发情况(如供应商断供)下快速匹配最优的库存与生产调整策略。这种端到端的分析能力极大地降低了中小型餐厅对专业数据团队的依赖。
数据集最近研究
最新研究方向
在餐饮业智能化转型的浪潮中,Food-Penguin v1开创性地构建了面向餐厅分析的领域型工具调用数据集,其648条精心编排的样本覆盖7项专业分析职能,61.4%的多工具链式调用设计精准模拟了真实管理决策流程。这一数据集填补了垂直领域函数调用能力微调的空白,尤其通过QLoRA技术在0.5B轻量模型上的高效适配,为资源受限场景下的智能客服与业务分析系统提供了可复现的范式。研究前沿正聚焦于如何将这类细粒度工具调用能力从通用对话模型向行业专属代理迁移,Food-Penguin v1所展现的销售预测与库存优化等链式推理模式,正在重塑餐饮数据分析的交互边界,推动AI辅助运营从单点问答向多步骤决策闭环演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务