遇见数据集

taejoon89/Ko-Agent-Trajectories-1.0

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Ko-Agent-Trajectories-1.0 是一个韩国语多轮代理与工具交互轨迹语料库,通过GLM-5.1-FP8模型作为教师蒸馏合成而成。该数据集旨在填补韩国语LLM工具使用能力训练数据的空白,包含约51.8万条用于SFT学习的多轮轨迹、3.3万对用于DPO等偏好学习的正负样本对,以及9936条用于评估的基准测试轨迹。数据覆盖12个类别(金融、政府、媒体等)、6种难度级别、16种人物角色和4种语言风格,支持韩国语LLM学习函数调用格式准确性、多轮代理行为规划、韩语自然语言计划编写及错误恢复等能力。数据采用Apache-2.0许可证发布,并包含GLM、GPT-5.4-mini和Claude Sonnet 4.5三种模型的交叉评估元数据。

Korean multi-turn agent ↔ tool trajectory corpus distilled from GLM-5.1. A synthetic Korean multi-turn agent trajectory dataset for tool-use learning, containing 518,232 trajectories for SFT training, 33,323 chosen/rejected pairs for DPO learning, and 9,936 evaluation benchmark trajectories with 3-rater cross-judge metadata (GLM + GPT-5.4-mini + Claude Sonnet 4.5). Released under Apache-2.0 license.

提供机构:
taejoon89
搜集汇总
数据集介绍
taejoon89/Ko-Agent-Trajectories-1.0 数据集图片
构建方式
Ko-Agent-Trajectories-1.0是一个由GLM-5.1-FP8作为教师模型通过蒸馏方式合成的韩语多轮智能体与工具交互轨迹语料库。其构建流程始于一个包含41种韩国公开API的目录与72个场景模板,这些模板覆盖12个类别与6个难度等级,并与16种人格及4种语域配额进行交叉组合,形成种子提示。随后,GLM模型执行多轮轨迹生成,其中工具响应亦由GLM模拟。生成的轨迹经自评判机制在正确性、韩语质量、轨迹一致性与工具规格合规性四个维度上进行1至5分的评分,并配合八项规则过滤器进行筛选。通过质量控制门槛的合格样本,再经由分层抽取与MinHash局部敏感哈希去重,最终构建出训练集、偏好学习集与评估集。
使用方法
该数据集支持多样化应用。对于监督微调,可直接加载训练集,其每条样本包含符合OpenAI Chat格式的多轮消息结构,内含系统指令、用户问题、模型思考、工具调用与工具响应等完整轨迹,适用于训练韩语大语言模型的工具调用与智能体行为。对于偏好优化,DPO子集提供了包含七种噪声类型的拒绝样本,可用于直接偏好优化、IPO或SimPO等算法训练。在评估方面,Ko-Agent-Bench-1.0子集搭配五个评价指标(首选工具准确率、参数评分、工具序列最长公共子序列、最终答案评判与韩语质量评判),可系统衡量模型性能。研究人员还可利用交叉评判元数据进行评判模型偏差分析或多评判器集成研究。
背景与挑战
背景概述
Ko-Agent-Trajectories-1.0 数据集由 Tae Joon Jun 于2026年5月创建,旨在填补韩语大语言模型(LLM)在工具调用与多轮智能体行为训练方面公开数据的缺失。该数据集以 GLM-5.1-FP8 为教师模型,通过蒸馏与合成方法生成,包含超过51万条训练轨迹、3.3万对偏好学习样本及近1万条评测基准,覆盖金融、政务、媒体等12大领域,并融入16种人物角色与4种语域风格。其发布不仅为韩语LLM的函数调用、多轮规划与错误恢复能力提供了规模化训练资源,更通过Apache-2.0许可推动了开源社区在智能体研究领域的发展。
当前挑战
该数据集面临的核心挑战源于其合成性质与单一教师模型局限。首先,领域问题层面,韩语LLM在工具使用场景中需精确遵循函数调用格式、处理多轮交互中的规划-调用-观察-回答闭环,并适应韩语特有的敬语体系与多样化角色对话,现有公开数据难以支撑此类复杂能力的训练。其次,构建过程中,所有轨迹源自GLM-5.1单一模型,导致风格偏倚与自我评估循环——教师模型对自身生成质量的评分显著高于外部评判(如GPT-5.4-mini的评分严苛1.7~1.9分)。此外,长时任务(L6)因合格率低而占比不足,工具响应为模拟文本而非真实API结果,且缺乏人工校验,可能引入事实偏差与幻觉风险。
常用场景
经典使用场景
Ko-Agent-Trajectories-1.0数据集为韩国语大语言模型的智能体行为学习提供了亟需的高质量合成语料。其经典使用场景聚焦于多轮对话中工具调用能力的监督微调(SFT),模型通过学习超过51万条结构化的agent-tool交互轨迹,掌握从用户意图解析、函数调用格式规范到多步任务规划与错误恢复的完整认知链路。同时,该数据集包含的三万余对偏好数据对,使得直接偏好优化(DPO)等对齐技术能够有效应用于智能体场景,引导模型在工具选择、参数传递与响应生成等维度上趋向更优行为模式。
解决学术问题
该数据集直击韩国语大模型研究中一个长期未解的痛点:公开可用的、用于训练智能体工具调用能力的高质量多轮对话语料极度匮乏。现有评估基准如FunctionChat-Bench与Ko-AgentBench规模均仅数百例,远不足以支撑大规模深度训练。Ko-Agent-Trajectories-1.0的问世填补了这一空白,首次提供了规模超五十万、覆盖金融、政务、媒体等十二个领域、集成六种难度等级与十六种用户角色的综合性语料,使韩国语LLM在函数调用准确性、多轮推理规划一致性以及与人类偏好对齐等关键学术议题上具备了系统研究的基础资源。
实际应用
在工业级应用层面,该数据集赋能韩国语智能助手与自动化服务代理的实质性进步。基于该语料微调的模型能够胜任从金融行情查询、政务信息检索到预订机票与外卖点餐等高频商业化场景中的多步交互任务。它尤其适用于需要精确调用外部工具API并组织自然语言回答的对话系统,例如企业知识库问答机器人、智能客服系统中的工单处理代理,以及个人生活助理中的日程协调、消息发送等操作。该数据集对Apache-2.0开源许可的采用,进一步降低了学术界与工业界将其纳入实际生产管线的技术门槛。
数据集最近研究
最新研究方向
面向韩语大语言模型的智能体轨迹数据蒸馏与偏好对齐研究。当前前沿方向聚焦于利用GLM-5.1等大规模混合专家模型合成多轮工具调用轨迹,以弥合韩语环境下公开智能体训练数据的严重匮乏。该数据集通过构建涵盖12个领域、6级难度、16种用户画像及多种语体的518K条SFT轨迹与33K条偏好对,系统性地支撑韩语大模型在函数调用格式正确性、多轮主动规划、错误恢复等核心能力上的训练,并首创三裁判交叉评估机制揭示自评偏见,为智能体领域的合成数据质量评估与蒸馏偏差量化提供了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务