遇见数据集

AvitoTech/ru_bfcl

收藏
Hugging Face2026-06-04 更新2026-01-03 收录
官方服务:

资源简介:

Berkeley Function Calling Leaderboard(BFCL)数据集是一个用于评估不同大型语言模型(LLM)在函数调用(或工具调用)能力的数据集,基于实际使用案例构建,覆盖多种类别和语言。数据集分为三个主要版本:BFCL V1、V2 Live和V3。V1版本包括Python类别(简单函数、多函数、并行函数、并行多函数)和非Python类别(聊天能力、函数相关性检测、REST API、SQL、Java、JavaScript),旨在评估模型在常见API调用场景中的表现。V2 Live版本使用真实世界数据,更侧重于多函数场景和相关性/不相关性检测,包含简单、多函数、并行、并行多函数以及相关性检测子类别。V3版本引入了多步和多轮函数调用场景,包括基础多轮、增强多轮(缺失参数、缺失函数、长上下文、复合)等类别,以测试模型在复杂交互中的能力。数据集以JSON文件组织,支持AST和可执行评估,用于衡量LLM在函数调用任务中的泛化性和实用性。

The Berkeley Function Calling Leaderboard (BFCL) dataset is a live leaderboard to evaluate the ability of different LLMs to call functions (also referred to as tools). It is built from real-world use cases, spanning diverse categories and multiple languages. The dataset is organized into three major releases: BFCL V1, V2 Live, and V3. V1 includes Python categories (Simple Function, Multiple Function, Parallel Function, Parallel Multiple Function) and non-Python categories (Chatting Capability, Function Relevance Detection, REST API, SQL, Java, JavaScript) to assess model performance in common API call scenarios. V2 Live uses real-world data with a focus on multiple function scenarios and relevance/irrelevance detection, including simple, multiple, parallel, parallel multiple, and relevance detection subcategories. V3 introduces multi-step and multi-turn function calling scenarios, covering Base Multi-Turn, Augmented Multi-Turn (Missing Parameters, Missing Functions, Long-Context, Composite), etc., to test model capabilities in complex interactions. The dataset is structured in JSON files and supports both AST and executable evaluations, aiming to measure the generalization and practicality of LLMs in function calling tasks.

提供机构:
AvitoTech
搜集汇总
数据集介绍
AvitoTech/ru_bfcl 数据集图片
构建方式
RU_BFCL数据集源自伯克利函数调用排行榜(BFCL)的多语言扩展,以俄语为核心构建。其构建过程沿袭了BFCL的三大版本迭代:V1版本覆盖Python(简单、多函数、并行、并行多函数)及非Python(聊天能力、关联检测、REST API、SQL、Java、JavaScript)场景,通过人工编写AST与可执行函数对数据进行精炼;V2版本引入真实世界数据,强化多函数与相关性/无关性检测;V3版本则聚焦多轮与多步调用,包括基础多轮、缺失参数、缺失函数、长上下文及复合型场景,通过模拟现实API输出与复杂逻辑挑战模型推理能力。所有数据以JSON格式组织,每行代表一个独立测试条目。
特点
该数据集的核心特色在于其多维度的评测架构与跨语言适配性。它涵盖从简单单函数到复合多步调用的全谱系任务,尤其注重函数相关性检测(上下文无关场景下避免幻觉)与多轮对话中的动态决策能力。V3版本通过引入缺失信息、长上下文干扰及复合型难题,模拟了真实自主代理中的极端场景。此外,数据集支持可执行评估(通过实际API调用验证输出有效性)与AST语法树评估,兼顾功能正确性与执行稳定性。其俄语版本扩充了多语言生态,为评估非英语场景下的工具调用能力提供了基准。
使用方法
使用RU_BFCL数据集时,需先通过辅助函数`load_file()`加载JSON文件,每行解析为字典对象。若需兼容Hugging Face Datasets格式,可调用`load_json_dataset()`将参数中的复杂字段(如函数属性)序列化为JSON字符串,并在评估时反解析。数据可直接用于BFCL官方评估框架,通过对比模型输出与标准答案的AST结构及可执行结果(如REST API响应一致性)计算分数。研究者亦可基于其分层结构(如V3的多轮子类别)设计针对性实验,或通过多语言场景基准测试模型在俄语函数调用中的泛化表现。
背景与挑战
背景概述
随着大语言模型(LLMs)在智能体与自动化工作流中的广泛应用,函数调用(Function Calling)能力已成为衡量模型实用性的关键指标。为此,加州大学伯克利分校的Gorilla团队于2024年2月发布了伯克利函数调用排行榜(Berkeley Function Calling Leaderboard, BFCL),并持续迭代至V3版本(2024年9月更新),用于系统评估LLMs在不同场景下的工具使用能力。核心研究问题在于:如何全面、公正地评测模型在简单与复杂函数调用、多语言支持、多轮对话及长上下文韧性等维度的表现。该数据集及排行榜迅速成为业界基准,对推动LLMs落地企业应用、智能体系统等具有重要影响力。RU_BFCL作为俄语版本,旨在将评估能力拓展至多语言场景,进一步检验模型的跨语言泛化能力。
当前挑战
该数据集及其评估工作面临多重挑战。首先,在领域问题层面,函数调用评测需覆盖海量真实场景,包括简单单函数、多函数选择、并行调用、多步多轮任务等,每类场景对模型的理解、推理与决策能力要求各异;同时需处理无关函数干扰、参数缺失等复杂情况,确保模型不产生幻觉或不恰当的调用。其次,在构建过程中,团队需精心设计可执行评估用例(如Python/Java/SQL等),但不同编程语言的函数构造方式多样,导致抽象语法树(AST)匹配难以穷举正确解,如REST API和SQL评估因答案空间过大而需另辟蹊径。此外,多语言扩展(如俄语)需保证翻译质量和语义保真度,且需维护与英文版一致的评测难度与公平性,这进一步增加了数据构建和验证的复杂度。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与基准测试领域,ru_bfcl数据集作为Berkeley Function Calling Leaderboard(BFCL)的俄语扩展版本,主要用于评测模型在函数调用(亦称工具使用)方面的综合能力。该数据集覆盖了从简单的单一函数调用到复杂的多步、多轮交互场景,包含Python与多种非Python语言(如SQL、Java、JavaScript)的测试案例。研究者通过抽象语法树(AST)匹配与可执行代码验证双轨评估机制,可精确量化模型在函数选择、参数填充、并行调用及语言泛化等方面的表现,为对比不同LLM的实用工具调用能力提供了标准化的俄语评测基准。
解决学术问题
该数据集旨在解决LLM在工具使用场景下面临的关键学术挑战:如何准确评估模型在真实世界API调用中的可靠性与泛化能力。BFCL通过设计多层级测试类别,系统性地考量函数相关性检测(区分相关与无关函数)、跨语言类型适配(如Java的HashMap类型)、参数多态处理及执行结果稳定性等核心问题。这些维度直击当前LLM在实际应用中常见的函数幻觉、参数错误与执行失败等痛点,为学术界建立了一套从函数理解到执行验证的完整度量体系,推动了工具增强型语言模型的理论研究与基准建设。
衍生相关工作
该数据集衍生了一系列具有影响力的相关工作,包括BFCL V2与V3版本的迭代升级,其中V2引入了基于真实用户场景的实时数据,重点强化了多函数选择与无关性检测能力;V3则开创性地设计了多步(multi-step)与多轮(multi-turn)交互场景,并细分出缺失参数、缺失函数、长上下文及复合场景等高难度子类别。此外,基于BFCL评测框架,研究团队开发了Gorilla OpenFunctions系列模型,专门优化函数调用能力,其训练数据与评估指标均衍生自该数据集,进而催生了工具调用领域的方法论革新与模型架构改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务