遇见数据集

Andha-Dhun

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

Andha-Dhun是由国际信息技术学院和Jio平台有限公司联合创建的首个印地语音频描述数据集,专为视障与低视力人群的媒体可访问性研究而设计。该数据集包含8部全长电影的5870条人工撰写的印地语音频描述句子,覆盖约6.3万秒的叙事内容,平均每条描述含16.1个单词,数据来源于非营利音频库AudioVault的原始音轨。其构建过程通过音频分块、语音增强、Gemini模型转录及人工校验对齐等流程,确保时间戳与视觉内容精确同步。该数据集主要应用于跨文化音视频内容可访问性研究,旨在解决印度语种音频描述资源匮乏的问题,并为自动生成系统的开发与评估提供基准。

Andha-Dhun is the first Hindi audio description dataset co-developed by the International Institute of Information Technology and Jio Platforms Limited, purpose-built for media accessibility research targeting visually impaired and low-vision individuals. This dataset includes 5,870 manually authored Hindi audio description sentences derived from 8 full-length feature films, covering approximately 63,000 seconds of narrative content, with each description averaging 16.1 words in length. The raw data is sourced from the original audio tracks of the non-profit audio repository AudioVault. Its construction pipeline encompasses audio segmentation, speech enhancement, transcription using the Gemini model, and manual verification and alignment, which ensure precise synchronization between timestamps and their associated visual content. This dataset is primarily utilized in cross-cultural audio-visual content accessibility research, with the objective of addressing the scarcity of audio description resources for Indian languages, and providing benchmarks for the development and evaluation of automatic audio description generation systems.

创建时间:
2026-07-08
原始信息汇总

数据集概述

数据集名称:AndhaDhun-HindiAD

所属项目:Hindi Audio Descriptions相关工作

当前状态:即将发布(Coming soon!)

主要目标:作为首个针对印地语(Hindi)音频描述(Audio Descriptions)的研究工作而建立

数据来源:GitHub仓库(https://github.com/katha-ai/AndhaDhun-HindiAD)

备注:该数据集目前尚未正式公开,具体内容、规模和格式待后续发布

搜集汇总
数据集介绍
构建方式
在盲人与低视力群体观影需求日益受到关注的背景下,音频描述作为填补视觉信息空白的重要手段,在印度语言领域仍属空白。为此,研究者从AudioVault平台获取8部完整影片的印地语音频描述音频,通过Resemble Enhance工具抑制非旁白声源以聚焦叙述者语音,再利用Gemini-2.5-Flash模型进行带时间戳的转录与说话者分类,最终经由人工校验确保转录精度与时间对齐。同时,从DVD或公开平台获取对应影片视频,人工同步音频与视觉流,并依据IMDb演员表构建角色库,由此形成首个包含5870条印地语音频描述句子的Andha-Dhun数据集。
特点
该数据集的核心独特性在于其首创地位与双语对照设计。作为首个面向印地语的音频描述语料库,它覆盖4部印地语影片与4部同时具备英印双语音频描述的英语影片,后者为翻译效应分析提供了独特窗口。每条描述均与视频片段精准对齐,并附带角色库与时间戳信息。数据统计显示,平均每条描述包含约16个词,旁白时长分布广泛,反映出不同影片叙事节奏的差异。尤为重要的是,双语音频描述子集揭示了人类翻译中文化专有项处理与语言多样性保留的复杂性,为评估自动生成与翻译方法提供了权威基准。
使用方法
数据集的使用聚焦于零样本印地语音频描述生成与评估。研究者采用AutoAD-Zero框架,先利用多模态大模型生成英文密集描述,再通过两条路径获取印地语结果:一是将英文音频描述经IndicTrans2等机器翻译模型转换为印地语;二是直接使用Hindi-capable语言模型从密集描述生成印地语旁白。评估环节结合内在指标(困惑度衡量语言多样性)与外在指标(LLM-as-a-judge评估语义匹配度),并进一步分析文化专有项的解析策略。用户可调用数据集中的视频-描述对,复现上述生成流程或设计新的跨语言音频描述方法,推动面向印度受众的无障碍技术发展。
背景与挑战
背景概述
音频描述(Audio Descriptions, ADs)是为盲人与低视力(BLV)观众在影视作品静默间隙嵌入的口头叙述,旨在弥合视觉信息缺失带来的理解鸿沟。随着全球无障碍法规的推进,印度中央电影认证委员会(CBFC)已强制要求所有在印上映影片配备AD服务,然而印地语AD研究几乎空白。为此,由IIIT海得拉巴、马尼帕尔大学斋浦尔分校及Jio Platforms Ltd.的研究人员于2026年共同创建的Andha-Dhun数据集应运而生,成为首个针对印地语人工撰写AD的系统性数据集。该数据集包含8部全长影片的5870条AD语句,并通过与英文AD的对比分析,为跨语言AD生成与评估奠定了基石,有力推动了印度本土语言无障碍影视技术的发展。
当前挑战
Andha-Dhun数据集所面临的挑战兼具领域深度与构建难度。在领域层面,首要难题在于印地语AD生成需兼顾场景描述的准确性与文化适应性,特别是处理英文AD中蕴含的“文化特异性项目”(Culture-Specific Items, CSIs)。当前机器翻译方法在解决诸如“touchdown”、“Gatorade shower”等西方文化专有项时,往往陷入直译陷阱,导致印度BLV观众理解受阻,这与Skopos理论所强调的“以目标受众为导向”原则相悖。在数据集构建过程中,挑战同样严峻:AD原始声轨常与电影背景音混杂,需采用音频增强与分离技术提取纯净叙述轨,其转录与时间戳校准依赖人工精细校验;此外,双语AD(印地语与英语)在时间轴与语义细节上的对齐工作繁琐且易引入误差,这些因素共同构成了数据高质量采集与标注的核心瓶颈。
常用场景
经典使用场景
在影视无障碍化研究领域,Andha-Dhun数据集首次为印地语音频描述(Audio Description, AD)提供了系统性的数据基础。该数据集包含8部完整电影中人工撰写的5870句印地语AD,并同步对齐了对应的视觉画面。研究者通常利用该数据集探索印地语AD的自动生成范式,包括将英文密集视频描述直接生成为印地语AD,以及通过机器翻译将英文AD转化为印地语AD两种路径。数据集内的双语言AD子集(同时包含印地语与英文人工AD的4部英文电影)更支持对跨语言AD翻译效果与语义保留程度的深入分析,成为评估生成模型质量与语言适应能力的重要基准。
实际应用
该数据集的应用场景紧密围绕视障人士媒体可及性的实际需求。在电视、电影及在线流媒体平台中,Andha-Dhun支持开发面向印度印地语使用者的自动音频描述系统,帮助视障观众理解画面中的人物动作、场景变换与文化符号。例如,通过数据集训练的语言模型能够将“冰球比赛”转化为印度观众更熟悉的“板球式得分”表述,提升描述的文化亲和力。此外,该数据集还被用于评估与优化机器翻译工具在印度语言环境下的文化适应性,为Netflix、Amazon Prime等商业平台的内容本地化无障碍服务提供技术验证。
衍生相关工作
Andha-Dhun的出现催生了多项印地语AD生成与评估的后续研究。在其基础上,研究者发展了文化感知的AD翻译框架,通过引入目的论约束条件,显著提高了机器译文的文化分辨率。另一经典工作是针对低资源语言AD生成的“密集语义到印地语”直接生成方法(Dense-to-Hindi),利用专门面向印地语的小型语言模型(如Nemotron-4-Mini-Hindi)实现比翻译路径更优的生成质量。此外,该数据集推动了AD质量评估指标的演进,研究者基于其双语言AD子集提出了融合文化适应性的多维度评价体系,挑战了传统基于语义重叠的评分方式,开启了对AD“预设受众效果”的量化研究路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务