遇见数据集

potsawee/lfm-audio-fc-5500

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个车内语音功能调用数据集,包含5500个合成示例,用于微调LFM2.5-Audio-1.5B模型,实现端到端的音频输入/工具调用输出功能调用。数据集分为训练集(5000个示例)和评估集(500个示例),涵盖25个车内功能工具,分为7个类别:气候(4个工具)、导航(5个工具)、媒体(5个工具)、电话(3个工具)、车辆(5个工具)、设置(3个工具)和对话回退(无工具调用)。音频数据使用Kokoro TTS生成,包含28种英语语音,每个语音最多占5%。数据集按照Audio2Tool框架分为8个复杂度层级,包括直接命令、参数命令、多意图、隐式/语用命令、长闲聊加命令、自我纠正、多轮对话和意图混合。数据格式包括用户音频(数组、采样率、路径)、预期工具调用(格式为<|tool_call_start|>[func(args)]<|tool_call_end|>)、预期响应(口语确认文本)和复杂度层级(1-8)。多轮示例包含prior_turns_json字段,需解析音频路径。生成过程涉及文本合成(使用Claude Code会话,按层级、类别和示例类型分层)和音频生成(Kokoro TTS v1.0,确定性语音分配,背景语音混合在-10 dB)。数据集仅限英语,音频为合成,无真实车内声学或环境噪声,工具数量有限,适用于原型开发。许可证为LFM Open License v1.0。

Synthetic dataset of in-vehicle voice queries paired with tool calls, designed for fine-tuning LFM2.5-Audio-1.5B for end-to-end audio-in / tool-call-out function calling. It contains 5500 examples, with 5000 for training and 500 for evaluation. The dataset includes 25 in-car function tools across 7 categories: Climate (4 tools), Navigation (5 tools), Media (5 tools), Phone (3 tools), Vehicle (5 tools), Settings (3 tools), and Conversational fallback (no tool call). Audio is generated using Kokoro TTS with 28 English voices, each voice limited to a maximum of 5%. The dataset is organized into 8 complexity tiers based on the Audio2Tool framework, including direct commands, parametric commands, multi-intent, implicit/pragmatic commands, needle-in-haystack (long chatter with command), self-correction, multi-turn (4-8 turns with prior_turns), and intent blending (primary + background speaker). Data format includes user_audio (array, sampling_rate, path), expected_tool_call (formatted as <|tool_call_start|>[func(args)]<|tool_call_end|>), expected_response (spoken confirmation text), and complexity_tier (1-8). Multi-turn examples include a prior_turns_json field, requiring resolution of audio_path against the audio/ folder. Generation involves text synthesis (via Claude Code session, stratified across tiers, categories, and example types) and audio generation (Kokoro TTS v1.0, deterministic voice per example ID, background voice mixed at -10 dB). The dataset is English-only, uses synthetic audio without real cabin acoustics or environmental noise, and has a limited tool taxonomy for prototyping. License is LFM Open License v1.0.

提供机构:
potsawee
搜集汇总
数据集介绍
potsawee/lfm-audio-fc-5500 数据集图片
构建方式
该数据集通过合成方式构建,专注于车载语音查询与工具调用的配对。文本部分由Claude Code会话依据批次指令生成,涵盖8个复杂度层级、7个工具类别及6种示例类型,经筛选与去重后从约6350条原始数据精简至5500条。音频部分采用Kokoro TTS v1.0引擎,调用全部28种英语语音,每条示例的语音通过MD5哈希值确定性分配。对于多轮交互(层级7),用户历史轮次沿用与当前轮次相同的语音;对于意图混合场景(层级8),背景语音则使用不同发声者并以-10 dB混音叠加。数据集遵循LFM开放许可v1.0。
特点
该数据集最大特点是覆盖了从直接指令到复杂意图混合的8个复杂度层级,全面模拟真实车载场景下的语音交互复杂性。工具分类涵盖气候、导航、媒体、电话、车辆、设置及对话回落等7大类别共25种功能,粒度适中,便于原型验证。音频数据虽为合成语音,但通过多种英语口音和确定性语音分配策略模拟了多说话人环境。此外,数据集采用标准化工具调用格式,支持端到端的音频输入与工具调用输出,并结构化存储了多轮历史上下文和背景干扰信息,为高级语音助手研究提供了丰富素材。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,核心字段包括用户语音音频(以24kHz采样率的numpy数组及路径形式存储)、期望工具调用文本(遵循LFM格式)、语音确认回复以及复杂度层级标注。对于多轮交互示例,需通过解析prior_turns_json字段并结合HuggingFace Hub下载函数获取历史音频文件。层级8示例的用户音频已预先混合主说话人与背景干扰,并通过background_utterance字段提供背景文本信息。该数据集特别适用于微调LFM2.5-Audio系列模型,实现端到端的车载语音功能调用任务。
背景与挑战
背景概述
lfm-audio-fc-5500数据集由Liquid AI研究团队于2024年创建,旨在为车载语音助手领域提供端到端音频输入至工具调用的训练基准。该数据集围绕LFM2.5-Audio-1.5B模型的微调而设计,聚焦于车内环境下语音查询与工具函数调用的配对映射。其核心研究问题在于如何让语音助手从自然语言指令中精准识别用户意图,并触发相应的车辆控制、导航、媒体播放等功能。数据集包含5500条样本,覆盖气候、导航、媒体、电话、车辆设置及对话回退等7大类共25种工具,并依据Audio2Tool框架划分为8个复杂度等级,从直接指令到多轮对话与意图混合,极大推动了多模态语音交互系统在车载场景下的研发进程。该数据集因其系统化的复杂度设计,已成为评估语音-工具调用能力的重要参考。
当前挑战
当前研究面临的核心挑战在于如何使语音助手在高度动态的车载环境中实现鲁棒的意图理解与工具调用。具体而言,数据集着力解决的领域问题包括:1)隐式语义理解,如用户说“我快冻僵了”需映射为调高温度或开启加热座椅,而非直接指令;2)多意图交织(Tier 3)与背景噪声干扰(Tier 8),要求模型能从混合音频中分离主指令;3)长上下文干扰(Tier 5)与自我纠正(Tier 6)等复杂场景。在构建过程中,挑战亦十分显著:合成音频(Kokoro TTS)缺乏真实座舱声学特性与麦克风噪声,且限定于英语及25种工具原型,难以覆盖生产级语音助手的数百种功能。后续数据扩充计划通过轻量座舱噪声增强以缓解仿真与现实的鸿沟。
常用场景
经典使用场景
在智能座舱与车载语音助手的研发浪潮中,lfm-audio-fc-5500作为一款专为端到端音频到工具调用(Audio-to-Tool-Call)场景设计的合成数据集,其核心使命在于赋能模型直接从语音输入中解析并输出结构化的工具调用指令。该数据集包含5500条精心构造的样本,覆盖25种车载功能,横跨气候控制、导航、媒体、电话、车辆设置等7大类别,并依据Audio2Tool框架划分了8个复杂度层级,从直接指令到多轮对话、隐式意图乃至意图混合,全面模拟真实驾驶场景中用户与语音助手的交互形态。这一架构使得模型能够在单一前向传播中完成从音频感知到功能执行的完整链路,极大简化了传统级联系统的繁琐流程。
实际应用
在实际应用层面,该数据集直接服务于车载智能语音助手的迭代与优化。汽车制造商与语音技术公司可借助此数据集微调轻量级模型(如LFM2.5-Audio-1.5B),使其能够实时响应驾驶员的语音指令,完成设定导航目的地、调节空调温度、播放特定歌曲、拨打电话等操作,从而减少驾驶分心,提升行车安全。数据集中包含的长对话干扰(needle-in-haystack)与背景对话混合(intent blending)样本,尤为贴近现实世界中多人交谈、收音机播放等复杂声学环境,有助于模型提升在嘈杂条件下的精准触发能力。此外,其生成的工具调用格式与主流推理框架兼容,便于快速集成至车载系统中。
衍生相关工作
围绕lfm-audio-fc-5500数据集,已催生了一系列富有影响力的相关研究工作。首先是Audio2Tool框架的提出,该框架系统性地定义了从语音到工具调用的8级复杂度分类法,为本数据集的构建提供了理论基础,也成为后续语音智能体研究的参考范本。其次,该数据集是LFM2.5-Audio-1.5B模型的关键微调资源,该模型在语音功能调用任务上展示了卓越的端到端性能,推动了大型音频语言模型在工具使用能力上的边界拓展。此外,数据集的生成方法论——基于大语言模型进行文本合成,再通过TTS引擎生成多样化语音——为低成本、高覆盖的语音数据集构建提供了可复现的技术路线,启发了多个模仿其流程的后续项目,加速了该领域的实证研究步伐。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务