遇见数据集

Jontro

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

Jontro(যন্ত্র,孟加拉语意为“工具”)是一个孟加拉语工具使用语料库,包含9,158个孟加拉语和罗马化Banglish服务请求,与参考工具调用配对,覆盖54个基于孟加拉国公共和商业生活的模拟服务。每个请求都标注了地址形式(tui/tumi/apni)和书写系统(孟加拉文脚本或Banglish)。工具调用结果由确定性模拟器计算,确保可重现性。数据集规模为9,158个轨迹,包含317个独特任务目标(每个目标中位有16个释义变体),其中8,690个轨迹(94.9%)包含参考工具调用。数据集为单轮交互,所有轨迹仅有一个用户回合。数据提供四种分割配置,推荐使用goal_disjoint分割以避免训练和测试集之间的任务目标泄露。数据集未经过人工验证,包含已知缺陷类别(如468个参考响应未调用工具),每个记录都带有验证标志(如reference_call、defect_class等)以帮助过滤。预期用途包括测量孟加拉语/Banglish请求的首次工具选择和参数构建、比较不同端点在孟加拉国接地服务意图上的表现、研究数字和脚本约定对槽填充的影响,以及在goal_disjoint训练分割上训练模型。不适用于多轮工具使用、澄清或恢复行为、弃权行为研究,或认证部署系统。数据全部由Gemini生成,工具结果来自Python模拟器,不包含真实用户数据或个人数据,采用CC-BY-4.0许可。

Jontro (যন্ত্র, meaning tool in Bengali) is a Bengali tool-use corpus containing 9,158 Bengali and romanized Banglish service requests paired with reference tool calls, covering 54 simulated services based on Bangladeshi public and commercial life. Each request is annotated with address form (tui/tumi/apni) and writing system (Bengali script or Banglish). Tool call outcomes are computed by a deterministic simulator, ensuring reproducibility. The dataset has 9,158 trajectories with 317 unique task goals (median 16 paraphrasing variants per goal), of which 8,690 trajectories (94.9%) contain reference tool calls. It is single-turn, with all trajectories having only one user turn. Four split configurations are provided, with goal_disjoint split recommended to avoid task goal leakage between train and test sets. The dataset is not human-verified and contains known defect categories (e.g., 468 reference responses without tool calls), with validation flags (e.g., reference_call, defect_class) per record to aid filtering. Intended uses include measuring first-turn tool selection and argument construction for Bengali/Banglish requests, comparing endpoint performance on grounded service intents in Bangladesh, studying effects of numerals and script conventions on slot filling, and training models on goal_disjoint train split. Not suitable for multi-turn tool use, clarification or recovery behaviors, abstention behavior research, or certifying deployment systems. All data is generated by Gemini, with tool outcomes from a Python simulator, containing no real user or personal data, under CC-BY-4.0 license.

创建时间:
2026-07-15
原始信息汇总

数据集概述

Jontro 是一个孟加拉语工具调用(tool-use)数据集,名称源自孟加拉语“যন্ত্র”(意为“工具”)。该数据集包含 9,158 条孟加拉语和罗马化孟加拉语(Banglish)的服务请求,每条请求都配有基于 54 个模拟服务的参考工具调用。这些模拟服务根植于孟加拉国的公共和商业生活场景。

核心特性

  • 单轮交互:所有轨迹(trajectory)均为单轮,即每条轨迹仅包含一个用户回合。工具调用在该回合内完成,不包含澄清、修正或后续对话。
  • 任务目标:数据集覆盖 317 个不同的任务目标,每个目标平均有 16 个释义变体。注意:这些变体并非独立样本,而是同一目标的复述扩展。
  • 参考工具调用94.9% 的轨迹(8,690 条)包含参考工具调用;剩余 468 条无工具调用,多属生成缺陷(如澄清问题、拒绝、未执行调用等),每条记录均标注了 defect_class 标记。
  • 地址形式:涵盖三种孟加拉语地址形式(tui / tumi / apni),分布为:tui 473 条,tumi 2,658 条,apni 6,027 条。注意:部分标签为推断得出,并非全部直接观察。
  • 书写系统:孟加拉语脚本 7,871 条,罗马化孟加拉语(Banglish)1,287 条。Banglish 部分拼写高度规范,可能低于真实世界的难度。
  • 许可协议:CC-BY-4.0。

数据分割

数据集提供四种配置(config),推荐使用 goal_disjoint 分割:

配置名称 说明
goal_disjoint 推荐使用。测试集包含未见过的任务目标,用于公平评估。
goal_disjoint_sharegpt 同上,但采用 ShareGPT 风格的对话格式。
stratified 旧版分割。测试集中的目标在训练集中也有释义变体,无法评估“未见任务”。仅用于复现历史结果。
stratified_sharegpt 同上,ShareGPT 风格。

验证标记

每条记录均包含 metadata.validation 字段,提供以下验证信息:

字段 含义
schema_pass 语言边界检查(ASCII 工具名和键),全部通过。
consistency_pass 模拟器重放验证,逐字节比较结果,全部通过。
heuristics_pass 脚本、回合长度和代词一致性检查,81 条未通过。
heuristic_reasons 未通过启发式检查的具体原因。
register_verb_flag 地址形式标签可能与动词形态冲突,最多影响 1,409 条记录。
sadhu_bhasha 请求使用了文学体动词形态,共 311 条。
reference_call 参考响应是否包含工具调用。
defect_class 对无工具调用的 468 条记录,标注其缺陷类型。
n_candidate_tools 提示中实际提供的候选工具数量(1–4 个)。
judge_scored 始终为 false,表示未经过 LLM 裁判过滤。

预期用途与限制

适合用于:

  • 测量孟加拉语及 Banglish 请求下的首次工具选择与参数构建能力。
  • 对比不同模型在孟加拉国本地化服务意图上的表现。
  • 研究数字和书写习惯对槽位填充的影响。
  • goal_disjoint 训练集上训练,注意上述缺陷说明。

不适合用于:

  • 多轮工具使用、澄清或恢复行为、拒绝行为。
  • 声称模拟真实服务保真度。
  • 在大规模工具库中的选择。
  • 用于认证部署系统。

数据加载示例

python from datasets import load_dataset

推荐使用 goal_disjoint 分割

ds = load_dataset("abubakar-siddik/Jontro", "goal_disjoint")

过滤掉无参考调用的缺陷记录

clean = ds["train"].filter(lambda r: r["metadata"]["validation"]["reference_call"])

数据来源与伦理

  • 所有人物、请求和参考调用均由 Gemini 生成。
  • 工具结果来自确定性 Python 模拟器,而非模型生成,每个结果均可从种子逐字节复现。
  • 数据集不包含真实用户数据或个人数据;地名、服务名和品牌名均为公开实体,用作地域背景。

相关代码

模拟器、验证门控、评估框架、生成流水线及论文中所有表格的复现分析代码见:https://github.com/abubakarsiddik31/jontro-code

搜集汇总
数据集介绍
Jontro 数据集图片
构建方式
Jontro数据集通过自动化流水线构建,利用Gemini模型生成孟加拉语及罗马化Banglish的服务请求与参考工具调用。所有工具结果均由确定性模拟器计算得出,而非模型生成,确保了每个结果均可基于其种子逐字节复现。数据集涵盖54个模拟服务,涵盖孟加拉国公共与商业生活场景,共包含9,158条轨迹,每条轨迹为单轮交互,但单轮内可链式调用多个工具。构建过程中,针对不同地址形式(tui/tumi/apni)和书写系统进行了标注,并设计了四种配置分割,其中goal_disjoint分割确保了测试集与训练集的任务目标无重叠。
使用方法
推荐使用goal_disjoint分割进行训练与评估,通过load_dataset函数加载。使用前应利用metadata.validation.reference_call字段过滤掉无工具调用的缺陷样本。数据集提供了两种格式:规范格式(每条轨迹一行,包含元数据、结构化调用和模拟种子)和ShareGPT风格的对话格式。适用于评估单轮工具选择与参数构建,研究孟加拉语及Banglish服务指令的端点对比,以及分析数字和文字惯例对槽位填充的影响。不适用于多轮交互、澄清恢复或系统认证等场景。
背景与挑战
背景概述
在自然语言处理领域,工具调用与函数调用能力是构建智能语言代理的核心环节,然而现有资源多集中于英语等高资源语言,低资源语言如孟加拉语的相关研究严重匮乏。为此,由研究者Abu Bakar Siddik于2026年创建的Jontro数据集应运而生,旨在为孟加拉语及罗马化孟加拉语服务请求提供首个工具调用基准。该数据集包含9158条轨迹,覆盖54个模拟服务及18个领域,其创建机构依托于孟加拉国公共与商业生活场景,目标是通过317个任务目标的多样化改写表达,系统评估语言代理在首轮工具选择与参数填充方面的能力。Jontro的发布不仅填补了孟加拉语工具学习数据空白,也为低资源语言的代理研究提供了可复现的评估框架,对推动多语言智能体系统的发展具有重要影响。
当前挑战
Jontro数据集的研究面临多重挑战。首先,在领域问题层面,孟加拉语工具调用任务需应对地址形式(tui/tumi/apni)的微妙差异、孟加拉语与罗马化孟加拉语之间的书写系统转换,以及不同数字与文字惯例对槽位填充的影响,此外单轮交互设计无法捕捉多轮澄清与纠错行为,限制了代理在真实场景中的应用泛化能力。其次,在构建过程中,挑战主要表现为:数据集完全由Gemini生成且未经人工验证,包含468条无工具调用参考响应的缺陷记录(如澄清问题、拒绝回答等);部分地址形式标签通过推断而非直接标注获得,与动词形态可能存在冲突;《tui×Banglish》单元格为空导致拉丁字母亲密称呼的缺失;罗马化孟加拉语拼写过于规整,与现实世界复杂性存在差距。这些缺陷虽被明确记录,但仍需使用者在训练前仔细过滤以保障模型性能。
常用场景
经典使用场景
Jontro数据集专为孟加拉语(Bangla)及罗马化孟加拉语(Banglish)服务请求下的工具调用任务而构建。其经典使用场景聚焦于单轮交互中模型从候选工具集里首次选择恰当工具并准确构建参数的过程。该数据集包含9158条轨迹,覆盖317个不同任务目标,每条轨迹均配备经过确定性模拟器验证的参考工具调用,为评估模型在孟加拉语工具调用推理方面的能力提供了标准化的评估基准。
解决学术问题
该数据集针对低资源语言在工具调用与智能体研究中的缺失问题提供了系统性解决方案。它填补了孟加拉语在函数调用、工具选择等自然语言处理前沿方向上的语料空白,使研究者得以量化评估模型在非英语环境下的指令理解、参数填充与工具推理能力。Jontro通过显式标注礼貌语体、书写系统等语言社会文化特征,为探索语言变异对工具调用性能的影响提供了可控实验平台,推动了多语言智能体研究的包容性发展。
实际应用
在实际应用层面,Jontro数据集可服务于面向孟加拉国公共服务与商业生活的语言智能体系统开发。例如,帮助用户查询交通状况、办理数字银行服务(如bKash)、获取电信运营商信息(如Grameenphone)、或使用出行服务(如Pathao)。通过在训练数据中引入孟加拉语特有的敬语体系和书写规范,该数据集能够提升智能语音助手、客服机器人等产品在孟加拉语场景下的工具调用准确率与服务体验契合度。
数据集最近研究
最新研究方向
在孟加拉语自然语言处理与智能体系统交叉的前沿领域,Jontro数据集精准锚定了一个关键研究缺口——面向孟加拉语及罗马化孟加拉语(Banglish)服务请求的首次工具调用诊断能力。不同于广泛关注多轮对话的基准,该数据集以317个任务目标的9158条单轮轨迹,系统性覆盖了孟加拉国公共服务与商业场景下的48种仿真工具调用,并细致标注了称呼语形态(tui/tumi/apni)与文字系统差异。其创新之处在于,所有工具返回结果均通过确定性模拟器生成,确保了实验的可复现性,从而为评测模型在低资源语言上的工具选择与参数填充能力提供了可靠边界。该数据集伴随的缺陷文档化和目标分离(goal_disjoint)划分策略,更推动了研究者正视语言多样性、文本正则性与标注噪声对智能体泛化性能的深层影响,为构建真正地域化、语言敏感的AI系统奠定了坚实评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务