遇见数据集

cyberagent/JOR-Bench

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

JOR-Bench是一个用于评估大语言模型在运筹学问题建模上的双语基准数据集,包含1,319个运筹学文字问题,提供英文和日文版本,源自五个公开的英文基准。该数据集旨在填补日文运筹学资源的空白,支持跨语言比较,以研究数学建模能力是否能在语言间迁移。数据格式为JSON Lines,每个条目包含自然语言问题描述和最优数值答案,可用于多种运筹学求解器或建模语言进行评估。

JOR-Bench is a bilingual benchmark dataset designed to evaluate the operational research problem modeling capabilities of large language models (LLMs). It contains 1,319 operational research word problems with both English and Japanese versions, derived from five publicly available English benchmark datasets. This dataset aims to fill the gap in Japanese operational research resources, and supports cross-lingual comparisons to investigate whether mathematical modeling abilities can transfer across languages. The dataset follows the JSON Lines format, where each entry includes a natural language problem description and an optimal numerical answer, and can be used for evaluation with various operational research solvers or modeling languages.

提供机构:
cyberagent
搜集汇总
数据集介绍
cyberagent/JOR-Bench 数据集图片
构建方式
JOR-Bench是一个面向运筹学(Operations Research)问题建模能力的双语评测基准,旨在评估大语言模型在从自然语言描述到数学模型转化方面的跨语言迁移表现。该数据集源自五个公开的英文运筹学基准数据集,包括IndustryOR、MAMO Complex LP、NL4OPT、OptiBench和OptMATH,涵盖了线性规划、混合整数规划、真实世界优化等多种问题类型。每个子集的英文原版均经由专业翻译,转换为高质量的日文版本,最终构建为包含1,319道运筹学文字题的平行语料库。数据以JSON Lines格式存储,每条记录包含自然语言的问题描述(prompt)和对应的最优数值答案(completion),且与求解器无关,支持OR-Tools、CPLEX、Gurobi等任意运筹学求解工具。
使用方法
JOR-Bench的使用方式简洁灵活,用户可通过Hugging Face的datasets库直接加载JSON Lines文件,或从仓库中手动下载。使用时,将包含自然语言问题描述的prompt字段输入至大语言模型,引导其生成数值答案,再通过与completion字段中的真实最优值进行相对容差比较来计算准确率。该评测流程无需依赖特定求解环境,用户可根据自身需求选择OR-Tools、Gurobi等任意运筹学求解器进行结果验证。评估结果以百分制准确率呈现,便于对不同模型及语言版本进行横向比较与分析。
背景与挑战
背景概述
JOR-Bench(Japanese Operations Research Benchmarks)是一个专注于评估大语言模型(LLMs)在运筹学(Operations Research, OR)问题形式化建模能力上的双语基准数据集,由研究团队于近期创建,旨在弥补日语运筹学评估资源的缺失。该数据集汇集了来自五个既有英文基准(包括IndustryOR、MAMO、NL4OPT、OptiBench和OptMATH)的1,319道运筹学文字题,并完成了高质量的日语翻译,从而实现了跨语言对比分析。核心研究问题在于探究大语言模型将自然语言问题转化为数学模型的能力是否能够跨语言迁移,鉴于当前大多数运筹求解器与建模库以英语为主导,日语资源的匮乏使得该研究极具现实意义。JOR-Bench通过提供求解器无关的问题描述与最优数值答案,为评估LLM在科学和工业应用中的数学推理效能提供了关键工具,对推动多语言运筹学自动建模研究具有重要影响。
当前挑战
JOR-Bench所面临的挑战首先体现在领域问题的复杂性上:运筹学问题的形式化需要模型具备从自然语言中精准提取约束条件与目标函数的能力,并能处理线性规划、混合整数规划等多种优化类型,这对LLM的数学理解与推理能力构成了严峻考验。在构建过程中,团队遇到了双语资源极不对等的难题——日语运筹学基准完全空白,需从英语数据集进行翻译,而翻译可能导致术语歧义或语境偏差,影响评估的公平性。此外,各源数据集采用不同的许可协议(如CC-BY-NC 4.0、Apache 2.0),整合时需严格遵循版权约束并保持数据格式统一。最终生成的日语问题还需确保逻辑等价性,避免因语言转换改变问题本意,这一过程对数据质量提出了高标准要求。
常用场景
经典使用场景
在运筹学与自然语言处理的交叉领域中,JOR-Bench 被广泛用于评估大语言模型将文本描述的优化问题转化为数学模型的能力。该基准覆盖了线性规划、混合整数规划以及现实世界优化问题等多个子集,共计 1319 条中英双语问题。研究者通过向模型输入自然语言提示,并校验其输出的最优目标值与标准答案的相对误差,从而精准衡量模型在数学建模上的表现。由于其求解器无关的设计,该基准兼容 OR-Tools、CPLEX、Gurobi 等多种求解工具,为跨语言、跨模型的能力对比提供了标准化平台。
解决学术问题
JOR-Bench 的构建有效填补了日语运筹学基准的空白,为学术界探讨数学建模能力的跨语言迁移特性提供了关键数据支撑。此前,大多数运筹学求解库与建模语言以英语为主导,日语资源的匮乏使得非英语环境下大语言模型的建模能力难以被系统评估。借助该基准,研究者能够验证模型是否能在不同语言间保持数学推理的稳定性,揭示了语言对性能的潜在影响。这一工作不仅推动了多语言运筹学研究的进展,也为评估大语言模型在科学计算领域的泛化能力树立了重要标杆。
实际应用
在实际工业与商业场景中,JOR-Bench 所评估的建模能力直接服务于供应链优化、资源调度、金融投资组合管理等众多领域。企业可通过调用大语言模型自动将业务需求转化为数学表达式,进而利用求解器获得最优决策方案。例如,在物流行业中,模型能够基于运输成本、时间窗等文本约束生成线性规划模型;在制造领域,则可辅助完成生产排程与库存管理的智能化建模。该基准的推出降低了运筹学应用的技术门槛,使得非专业用户也能通过自然语言交互获得工业级优化方案,极大提升了决策效率。
数据集最近研究
最新研究方向
当前,在运筹学与自然语言处理的交叉领域,如何评估大语言模型在跨语言场景下对数学优化问题的建模与求解能力已成为前沿热点。JOR-Bench作为一个双语运筹学评测基准,应运而生,它通过将五个现有英文基准中的1,319个运筹学问题精确翻译为日语,填补了日语环境下此类评估资源的空白。该数据集的独特意义在于,它不仅考察模型将文本描述转化为数学公式的抽象能力,更揭示了跨语言迁移学习在运筹学应用中的潜力——尤其是当大多数求解器和建模库以英语为主导时,模型能否在日语等资源稀缺语言中保持性能。这一基准的提出,直接回应了工业界和学术界对多语言、通用型智能决策系统的迫切需求,为未来开发语言无关的优化模型提供了关键评估工具,并推动了大型语言模型在物流、供应链、资源分配等真实世界运筹问题中的落地验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务