遇见数据集

IRWOZ 2.0

收藏
arXiv2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

IRWOZ 2.0是针对工业机器人对话的大规模语言模型驱动数据集,由奥尔堡大学研究团队创建,旨在提升工业人机交互中对话系统的准确性与鲁棒性。该数据集覆盖装配、配送、定位、搬运四个工业领域,共包含390条高质量对话,每条对话均经过人工与自动化双重校验,显著降低了原始版本中的标注错误与拼写噪音。数据集通过精心设计的提示工程,结合Mistral与Claude-3.5模型生成,并辅以专家审核,确保了技术术语的准确性与场景的多样性。IRWOZ 2.0主要应用于工业对话状态跟踪与响应生成任务,为解决工业环境中人机对话数据稀缺、质量参差的问题提供了可靠基准。

IRWOZ 2.0 is a large-scale language model-driven dataset for industrial robot dialogue, created by the research team from Aalborg University, aiming to improve the accuracy and robustness of dialogue systems in industrial human-robot interaction. This dataset covers four industrial domains: assembly, distribution, positioning, and handling, and contains a total of 390 high-quality dialogues. Each dialogue has undergone dual verification by manual and automated methods, which significantly reduces labeling errors and spelling noise in the original version. The dataset was generated through meticulously designed prompt engineering, combined with Mistral and Claude-3.5 models, and supplemented by expert reviews, ensuring the accuracy of technical terms and the diversity of scenarios. IRWOZ 2.0 is mainly applied to industrial dialogue state tracking and response generation tasks, providing a reliable benchmark for solving the problems of scarce human-robot dialogue data and uneven quality in industrial environments.

提供机构:
奥尔堡大学
创建时间:
2026-09-04
原始信息汇总

数据集概述:IRWOZ 2.0

IRWOZ 2.0 是一个由大语言模型(LLM)驱动的、专为工业机器人对话设计的全标注对话数据集,旨在通过语言辅助人机交互(HRI)技术,改进工业环境下(如车间工人与工业机器人之间)的对话系统。

基本信息

  • 数据集名称:IRWOZ 2.0 - A Large Language Model-driven Dialogue Dataset for Industrial Robot Conversations
  • 作者:Chen Li, Dimitrios Chrysostomou(奥尔堡大学材料与生产系)
  • DOI:10.21227/zpnj-5245
  • 数据格式:JSON
  • 创建与更新时间:创建于2025年4月28日,同日更新
  • 数据规模:包含390段对话
  • 领域覆盖:涵盖4个工业领域(产品组装、运输、定位、重定位)
  • 文件大小:36.11 KB(文件名:IRWOZ2 (LLM Generated dataset)_zip)
  • 使用许可:需订阅IEEE DataPort后方可访问

核心内容与特点

  • 生成与优化方式:此版本(2.0)是在IRWOZ 1.0基础上,利用Mistral和Claude-3.5等大语言模型增强生成,并经过人工校正和自动错字清除等质量优化后形成的。
  • 解决的问题:针对IRWOZ 1.0中对话状态和话语存在大量噪声、导致状态跟踪精度受限的问题,2.0版本进行了显著改进。
  • 性能提升:基准实验显示,在对话状态跟踪任务中,使用GPT-2模型时,BLEU-4评分从IRWOZ 1.0的0.1651提升至2.0版本的0.5604。
  • 数据集结构
    • 结构类似于Multi-Domain Wizard-of-Oz数据集(MultiWOZ)。
    • 每段对话包含领域、多个用户与系统话语、信念状态(Belief State)以及系统动作(System Act)。
    • 信念状态分为两个部分:DB_request(用于查询数据库的槽位)和T_inform(与任务相关的槽位)。两者均包含必需(req)和可选(opt)槽位。
    • 系统动作包含数据库搜索结果和必需槽位的状态信息。

其他信息

  • 历史版本:提供了上一版本(IRWOZ 1.0)的GitHub链接。
  • 资助来源:该项目获得Villum Fonden的资助,资助编号为58627。
搜集汇总
数据集介绍
IRWOZ 2.0 数据集图片
构建方式
IRWOZ 2.0 数据集的构建融合了人工精修与大型语言模型(LLM)的自动增强。首先,针对原始 IRWOZ 数据集中存在的拼写错误、标注不完整及错误标注等问题,采用 Claude-3.5 进行自动化纠错,并通过人工校验确保领域术语的准确性。随后,利用精心设计的提示工程,结合 Mistral 与 Claude-3.5 生成扩充对话,覆盖装配、配送、定位与搬迁四大工业领域,最终形成包含 390 段对话的高质量数据集。
特点
IRWOZ 2.0 显著提升了数据质量与领域覆盖面。其对话状态追踪的准确率大幅跃升,GPT-2 的 BLEU-4 得分从 0.1651 提升至 0.5604。数据集包含丰富的任务相关与闲聊式回应,句子长度分布多样,增强了模型的泛化能力。此外,通过混合验证机制(自动化检测与专家评审相结合),有效降低了标注噪声,确保了对话的工业场景相关性与技术准确性。
使用方法
IRWOZ 2.0 专用于训练和评估工业环境下的人机对话系统。研究者可直接使用该数据集进行对话状态追踪、响应生成及端到端对话建模的基准测试。数据集中包含的特殊标记(如 <|DB req|> 等)有助于解析对话结构,便于模型训练。数据集已公开于 IEEE DataPort,支持非商业用途,方便学术界复现实验与开发新型人机交互算法。
背景与挑战
背景概述
IRWOZ 2.0是由丹麦奥尔堡大学材料与生产学系的Chen Li和Dimitrios Chrysostomou于2026年创建的一个工业人机对话数据集。该数据集旨在解决工业环境中对话系统的数据稀缺和质量不高的问题。IRWOZ 2.0在原始IRWOZ数据集的基础上,通过引入大型语言模型(Mistral和Claude-3.5)辅助生成与修正,将对话规模扩展至390条,覆盖装配、配送、定位和搬运四个核心工业领域。该数据集不仅显著提升了对话状态跟踪的准确性(如GPT-2模型的BLEU-4得分从0.1651提升至0.5604),还通过自动化错误检测与人类专家审校相结合的方式,保障了专业术语的准确性和对话的自然度,为工业人机交互研究提供了高质量的数据支撑。
当前挑战
IRWOZ 2.0主要应对工业对话数据构建中固有挑战。传统Wizard-of-Oz人工采集方法耗时易错,且标注不一致性导致数据集噪声偏高,误差率可超20%,这直接影响状态跟踪与响应生成性能。构建中需修复原始数据中的拼写错误、不完整标注及误导性标注等缺陷,同时确保扩充后的多领域对话能反映真实工业场景的复杂性。此外,如何在提升数据规模和多样性的同时维持工业领域特异的语言精准性,亦是当前挑战。IRWOZ 2.0的混合方法提供了新思路,但如何平衡生成效率与领域细节的保真度,仍需持续探索。
常用场景
经典使用场景
IRWOZ 2.0数据集是面向工业环境下人机对话系统研究的宝贵资源,尤其适用于对话状态跟踪(DST)与响应生成任务的基准评测。研究者利用该数据集训练并验证基于GPT-2等模型的对话系统,通过精确的槽值标注与丰富的工业领域语言,提升系统对装配、搬运、定位、重定位等任务的理解与应答能力。其多轮对话结构及标准化的状态标注,使得该数据集成为评估任务型对话模型性能、开展跨领域泛化研究的理想平台。
解决学术问题
该数据集有效解决了工业环境中高质量对话数据稀缺及现有数据噪声大、标注一致性差等学术难题。通过引入大型语言模型驱动的自动纠错与生成机制,显著降低了人工标注错误率(如错别字、不完全标注、误标注),将对话状态跟踪的准确率大幅提升,例如GPT-2模型的BLEU-4得分从0.1651跃升至0.5604,联合目标准确率亦获得改善。这为构建稳定、可靠的工业人机交互对话系统提供了坚实的数据基础,推动了任务型对话在专门领域的研究进展。
衍生相关工作
围绕IRWOZ 2.0,衍生出多项前沿研究工作。一方面,研究者以其为基准,探索不同规模语言模型(如GPT-2 Medium/Large)在工业对话中的微调策略,以及基于提示工程的任务型对话生成方法;另一方面,该数据集催生了融合人工审核与自动化检查的数据质量提升框架,预示着LLM辅助数据清洗与增强的通用范式。此外,其公开可用性促进了多领域迁移学习与跨任务泛化研究,成为连接自然语言处理与智能制造交叉学科的关键数据资产。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务