Displace2026
收藏资源简介:
DISPLACE-M 2026挑战赛数据集专注于多语言医疗和对话语音处理研究。该数据集包含四个主要赛道:多语言场景下的说话人日志记录(Speaker Diarization)、多方言环境下的自动语音识别(Automatic Speech Recognition)、主题识别(Topic Identification)以及医疗对话文本摘要(Text Summarization of Medical Dialogues)。数据集支持英语、卡纳达语和印地语,采用cc-by-4.0许可协议。该数据集仅供DISPLACE挑战赛参与者使用,未经组织者同意不得与非参与者共享。
The DISPLACE-M 2026 Challenge Dataset is dedicated to research on multilingual medical and conversational speech processing. It consists of four core tracks: multilingual Speaker Diarization, Automatic Speech Recognition in multi-dialect settings, Topic Identification, and Text Summarization of Medical Dialogues. The dataset supports three languages: English, Kannada and Hindi, and is licensed under CC BY 4.0. This dataset is exclusively for participants of the DISPLACE Challenge, and must not be shared with non-participants without written permission from the organizing committee.
数据集概述
数据集基本信息
- 数据集名称: Displace-M/Displace2026
- 语言: 英语 (en)、卡纳达语、印地语
- 标签: 医学 (medical)
- 许可证: CC-BY-4.0
- 任务类别: 说话人日志、自动语音识别、主题识别、摘要
数据集背景与目的
该数据集是DISPLACE-M 2026挑战赛的一部分,旨在推进多语言医学和对话语音处理的研究。它建立在DISPLACE 2023和2024挑战赛成功的基础上,并引入了新的赛道和任务。
挑战赛赛道与任务
- 赛道1: 多语言场景下的说话人日志
- 焦点: 涉及语码混合语音的多语言对话中的“谁在何时说话”。
- 赛道2: 多方言环境下的自动语音识别
- 焦点: 在嘈杂医疗环境中录制的多方言语音的ASR。
- 赛道3: 主题识别
- 焦点: 识别对话主题(例如,孕产妇健康、儿童营养、卫生设施)。
- 赛道4: 医学对话文本摘要
- 焦点: 从医学音频对话中生成简洁、临床相关的摘要。
组织信息
- 主办方: 印度科学学院 (IISc) 班加罗尔分校LEAP实验室、NITK苏拉特卡尔分校电子与通信工程系,与UPES德拉敦分校合作。
- 论文提交: 可提交至INTERSPEECH 2026主会议。
- 支持: 将为所有赛道发布基线系统,并提供排行榜评估平台供参与者实时跟踪进度。
使用条款与说明
- 该数据集仅限用于DISPLACE挑战赛。
- 未经组织者同意,不得与非挑战赛参与者共享此数据集。
- 参与者必须遵守其团队签署的条款与条件文件。
重要链接
- 注册: https://displace2026.github.io/#registration
- 时间线: https://displace2026.github.io/#timeline
- 兴趣表达表格: https://forms.office.com/r/U5zLg8nihB
- 官方网站: https://displace2026.github.io/
- 条款与条件: https://displace2026.github.io/docs/Terms_and_Conditions_DISPLACE_2026.pdf
联系方式
- 邮箱: displace2026@gmail.com




