cs_restaurant_dataset
收藏资源简介:
这是一个用于任务导向型口语对话系统中自然语言生成(NLG)的捷克语数据集。该数据集起源于对Wen等人(2015年)的英文旧金山餐厅数据集的翻译。数据集包含输入对话行为和相应的捷克语输出自然语言释义。由于数据集旨在用于基于循环神经网络(RNN)的NLG系统,因此提供了所有在文本中直接出现的槽值的屈折变化表。
This is a Czech language dataset designed for natural language generation (NLG) in task-oriented spoken dialogue systems. The dataset originates from a translation of the English San Francisco restaurant dataset by Wen et al. (2015). It includes input dialogue acts and corresponding Czech natural language paraphrases. As the dataset is intended for use in NLG systems based on recurrent neural networks (RNNs), it provides inflection tables for all slot values that appear directly in the text.
数据集概述
数据集名称
Czech restaurant information dataset for NLG
作者
Ondřej Dušek, Filip Jurčíček, Josef Dvořák, Petra Grycová, Matěj Hejda, Jana Olivová, Michal Starý, Eva Štichová
许可证
Creative Commons 4.0 BY-SA
数据集内容
- 语言: 捷克语
- 目的: 用于任务导向的口语对话系统中的自然语言生成(NLG)
- 数据类型: 输入对话行为和对应的输出自然语言释义
- 特点: 包含所有在文本中直接出现的槽位值的屈折变化表,适用于基于RNN的NLG系统使用去词汇化处理
数据集创建步骤
- 去重相同句子(忽略不同槽位DA值)
- 本地化餐厅和邻域名称至布拉格(数据随机,不代表任何真实餐厅数据库)
- 将数据翻译成捷克语
- 自动检查槽位值的存在
- 通过重新词汇化扩展翻译数据并进行手动检查
数据集格式
- 文件格式: CSV和JSON
- 编码: UTF-8
- 实例总数: 5192
- 实例属性:
da,delex_da,text,delex_text - 数据集分割: 训练集3569个实例,开发集781个实例,测试集842个实例
附加形态学数据
- 文件:
surface_forms.json - 内容: 包含所有数据集中槽位值的形态变化形式
- 结构: 槽位 -> 值 -> 表面形式(词干 - 形式 - 标签)
领域
- 主题: 布拉格餐厅信息
- 功能: 用户可请求特定餐厅信息,系统可请求澄清或确认
对话行为格式
- 类型: 包括
inform,confirm,request等 - 槽位: 包括
name,price_range,food等
评估工具
- 脚本:
measure_slot_error_rate.py - 功能: 计算槽位错误率(SER),通过比较输入对话行为中的槽位值与对话系统输出
使用方法
- 命令:
python measure_slot_error_rate.py --sys_file output.txt surface_forms.json test.csv - 详细信息: 通过添加
-h参数获取
致谢
- 资助: 捷克共和国教育、青年和体育部
- 资源: LINDAT/CLARIN项目




