Jontro
收藏资源简介:
Jontro(যন্ত্র,孟加拉语意为“工具”)是一个孟加拉语工具使用语料库,包含9,158个孟加拉语和罗马化Banglish服务请求,与参考工具调用配对,覆盖54个基于孟加拉国公共和商业生活的模拟服务。每个请求都标注了地址形式(tui/tumi/apni)和书写系统(孟加拉文脚本或Banglish)。工具调用结果由确定性模拟器计算,确保可重现性。数据集规模为9,158个轨迹,包含317个独特任务目标(每个目标中位有16个释义变体),其中8,690个轨迹(94.9%)包含参考工具调用。数据集为单轮交互,所有轨迹仅有一个用户回合。数据提供四种分割配置,推荐使用goal_disjoint分割以避免训练和测试集之间的任务目标泄露。数据集未经过人工验证,包含已知缺陷类别(如468个参考响应未调用工具),每个记录都带有验证标志(如reference_call、defect_class等)以帮助过滤。预期用途包括测量孟加拉语/Banglish请求的首次工具选择和参数构建、比较不同端点在孟加拉国接地服务意图上的表现、研究数字和脚本约定对槽填充的影响,以及在goal_disjoint训练分割上训练模型。不适用于多轮工具使用、澄清或恢复行为、弃权行为研究,或认证部署系统。数据全部由Gemini生成,工具结果来自Python模拟器,不包含真实用户数据或个人数据,采用CC-BY-4.0许可。
Jontro (যন্ত্র, meaning tool in Bengali) is a Bengali tool-use corpus containing 9,158 Bengali and romanized Banglish service requests paired with reference tool calls, covering 54 simulated services based on Bangladeshi public and commercial life. Each request is annotated with address form (tui/tumi/apni) and writing system (Bengali script or Banglish). Tool call outcomes are computed by a deterministic simulator, ensuring reproducibility. The dataset has 9,158 trajectories with 317 unique task goals (median 16 paraphrasing variants per goal), of which 8,690 trajectories (94.9%) contain reference tool calls. It is single-turn, with all trajectories having only one user turn. Four split configurations are provided, with goal_disjoint split recommended to avoid task goal leakage between train and test sets. The dataset is not human-verified and contains known defect categories (e.g., 468 reference responses without tool calls), with validation flags (e.g., reference_call, defect_class) per record to aid filtering. Intended uses include measuring first-turn tool selection and argument construction for Bengali/Banglish requests, comparing endpoint performance on grounded service intents in Bangladesh, studying effects of numerals and script conventions on slot filling, and training models on goal_disjoint train split. Not suitable for multi-turn tool use, clarification or recovery behaviors, abstention behavior research, or certifying deployment systems. All data is generated by Gemini, with tool outcomes from a Python simulator, containing no real user or personal data, under CC-BY-4.0 license.
数据集概述
Jontro 是一个孟加拉语工具调用(tool-use)数据集,名称源自孟加拉语“যন্ত্র”(意为“工具”)。该数据集包含 9,158 条孟加拉语和罗马化孟加拉语(Banglish)的服务请求,每条请求都配有基于 54 个模拟服务的参考工具调用。这些模拟服务根植于孟加拉国的公共和商业生活场景。
核心特性
- 单轮交互:所有轨迹(trajectory)均为单轮,即每条轨迹仅包含一个用户回合。工具调用在该回合内完成,不包含澄清、修正或后续对话。
- 任务目标:数据集覆盖 317 个不同的任务目标,每个目标平均有 16 个释义变体。注意:这些变体并非独立样本,而是同一目标的复述扩展。
- 参考工具调用:94.9% 的轨迹(8,690 条)包含参考工具调用;剩余 468 条无工具调用,多属生成缺陷(如澄清问题、拒绝、未执行调用等),每条记录均标注了
defect_class标记。 - 地址形式:涵盖三种孟加拉语地址形式(tui / tumi / apni),分布为:tui 473 条,tumi 2,658 条,apni 6,027 条。注意:部分标签为推断得出,并非全部直接观察。
- 书写系统:孟加拉语脚本 7,871 条,罗马化孟加拉语(Banglish)1,287 条。Banglish 部分拼写高度规范,可能低于真实世界的难度。
- 许可协议:CC-BY-4.0。
数据分割
数据集提供四种配置(config),推荐使用 goal_disjoint 分割:
| 配置名称 | 说明 |
|---|---|
goal_disjoint |
推荐使用。测试集包含未见过的任务目标,用于公平评估。 |
goal_disjoint_sharegpt |
同上,但采用 ShareGPT 风格的对话格式。 |
stratified |
旧版分割。测试集中的目标在训练集中也有释义变体,无法评估“未见任务”。仅用于复现历史结果。 |
stratified_sharegpt |
同上,ShareGPT 风格。 |
验证标记
每条记录均包含 metadata.validation 字段,提供以下验证信息:
| 字段 | 含义 |
|---|---|
schema_pass |
语言边界检查(ASCII 工具名和键),全部通过。 |
consistency_pass |
模拟器重放验证,逐字节比较结果,全部通过。 |
heuristics_pass |
脚本、回合长度和代词一致性检查,81 条未通过。 |
heuristic_reasons |
未通过启发式检查的具体原因。 |
register_verb_flag |
地址形式标签可能与动词形态冲突,最多影响 1,409 条记录。 |
sadhu_bhasha |
请求使用了文学体动词形态,共 311 条。 |
reference_call |
参考响应是否包含工具调用。 |
defect_class |
对无工具调用的 468 条记录,标注其缺陷类型。 |
n_candidate_tools |
提示中实际提供的候选工具数量(1–4 个)。 |
judge_scored |
始终为 false,表示未经过 LLM 裁判过滤。 |
预期用途与限制
适合用于:
- 测量孟加拉语及 Banglish 请求下的首次工具选择与参数构建能力。
- 对比不同模型在孟加拉国本地化服务意图上的表现。
- 研究数字和书写习惯对槽位填充的影响。
- 在
goal_disjoint训练集上训练,注意上述缺陷说明。
不适合用于:
- 多轮工具使用、澄清或恢复行为、拒绝行为。
- 声称模拟真实服务保真度。
- 在大规模工具库中的选择。
- 用于认证部署系统。
数据加载示例
python from datasets import load_dataset
推荐使用 goal_disjoint 分割
ds = load_dataset("abubakar-siddik/Jontro", "goal_disjoint")
过滤掉无参考调用的缺陷记录
clean = ds["train"].filter(lambda r: r["metadata"]["validation"]["reference_call"])
数据来源与伦理
- 所有人物、请求和参考调用均由 Gemini 生成。
- 工具结果来自确定性 Python 模拟器,而非模型生成,每个结果均可从种子逐字节复现。
- 数据集不包含真实用户数据或个人数据;地名、服务名和品牌名均为公开实体,用作地域背景。
相关代码
模拟器、验证门控、评估框架、生成流水线及论文中所有表格的复现分析代码见:https://github.com/abubakarsiddik31/jontro-code




