SPIRAL Dataset
收藏资源简介:
SPIRAL(语音信息检索与查找)是一个用于测试语音语言模型处理长语音输入能力的数据集。该数据集包含口语讲座和对话,以及相应的转录文本、问题和元数据,专门设计用于评估模型从扩展音频内容中理解和检索信息的能力。
SPIRAL (Speech Information Retrieval and Lookup) is a dataset intended to test the capabilities of speech language models in processing long-form speech inputs. This dataset contains spoken lectures and dialogues, alongside their corresponding transcriptions, questions, and metadata, and is specifically designed to evaluate a model's ability to understand and retrieve information from extended audio content.
SPIRAL Dataset
数据集描述
SPIRAL(Speech Information Retrieval And Lookup)是一个用于测试语音语言模型处理长语音输入能力的数据集。该数据集包含语音讲座和对话,以及相应的转录文本、问题和元数据。SPIRAL 专门设计用于评估模型从扩展音频内容中理解和检索信息的能力。
数据集结构
spiral/ ├── wavs/ # 包含主要音频文件的目录 ├── data.jsonl # 主要数据集标注 └── data_h.jsonl # 数据集的困难子集
数据格式
每个 JSONL 文件中的条目包含以下内容:
转录文本
- 带说话人属性的文本段
- 每个说话人有多个话语
- 包含语音不流畅性(例如,“uh”)
测试问题
- 问题文本
- 多项选择选项(A-D)
- 正确答案
元数据
- 主要主题
- 子主题
- 转录类型
- 唯一标识符
音频数据
- 音频文件引用
- 关键句子时间戳
- 使用的说话人提示
- 音频文件路径
示例条目
每个条目包含以下结构化信息:
- 带说话人属性的完整转录文本
- 从转录文本中选择的关键句子
- 与内容相关的测试问题
- 主题元数据
- 音频文件引用和路径
使用场景
该数据集可用于:
- 在长格式音频的背景下训练和评估语音大语言模型
- 测试从长格式音频中检索信息的能力
- 评估问答能力




