Ko-MuSR
收藏资源简介:
Ko-MuSR是一个针对长篇韩文叙述的多步软推理基准,旨在评估语言模型在长文推理方面的能力。该数据集包含三个子任务:谋杀谜题、物体放置和团队分配,每个子任务包含250个例子。数据集中的叙述、推理链和多项选择题均由人工标注员进行验证,确保逻辑一致性和答案可推导性。Ko-MuSR为韩文自然语言处理提供了坚实的基础,使得能够系统地评估长上下文推理和提示策略。
Ko-MuSR is a multi-step soft reasoning benchmark targeting long-form Korean narratives, designed to evaluate the long-context reasoning capabilities of language models. This dataset includes three subtasks: murder mystery, object placement, and team assignment, with 250 examples for each subtask. All narratives, reasoning chains, and multiple-choice questions in the dataset are verified by human annotators to guarantee logical consistency and answer derivability. Ko-MuSR provides a solid foundation for Korean natural language processing, enabling systematic evaluation of long-context reasoning and prompting strategies.
Ko-MuSR 数据集概述
数据集基本信息
- 名称:Ko-MuSR
- 类型:多步软推理基准测试数据集
- 适用语言:韩语理解能力的大型语言模型
核心功能
- 支持对象放置任务的随机领域生成
- 支持团队分配任务的随机领域生成
- 提供三种数据实例生成:
- 谋杀之谜数据生成
- 对象放置数据生成
- 团队分配数据生成
技术要求
依赖环境
- openai==1.78.0
- lm-eval==0.4.8(需安装[api]配置)
必备条件
- 需要设置OpenAI API密钥环境变量
- 需要准备语言模型服务器进行评估
数据生成流程
随机领域生成
- 对象放置任务:使用sample_madlib_op.py脚本
- 团队分配任务:使用sample_madlib_ta.py脚本
数据实例生成
- 谋杀之谜数据:执行create_mm.sh脚本
- 对象放置数据:执行create_op.sh脚本
- 团队分配数据:执行create_ta.sh脚本
评估方法
- 使用LM Evaluation Harness进行评估
- 任务描述文件位于musr-tasks目录
- 提供基于本地推理服务器的评估示例
许可证信息
- 采用MIT许可证
- 原始代码参考:https://github.com/Zayne-sprague/MuSR

- 1Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean首尔国立大学计算机科学系, 首尔国立大学数据科学研究生院 · 2025年



