遇见数据集

internal-ast-eval-cache

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是一个面向英语和越南语的双语语音-文本资源,共包含294个样本,每个样本由唯一标识符、来源数据集、音频时长、音频文件、越南语文本、英语文本、内部ASR转录文本及检测语言、内部AST输出文本及检测语言组成。所有样本属于en_vi分割,适用于语音识别、语音翻译、语言检测、跨语言语音处理等任务的研究与模型训练。

This dataset is a bilingual speech-text resource for English and Vietnamese, containing 294 samples. Each sample consists of a unique identifier (id), source dataset (source_dataset), audio duration (duration_sec), audio file (audio), Vietnamese text (text_vi), English text (text_en), internal ASR transcription text (internal_asr_text) and detected language (internal_asr_detected_language), as well as internal AST output text (internal_ast_text) and detected language (internal_ast_detected_language). All samples belong to the en_vi split, suitable for tasks such as speech recognition, speech translation, language detection, and cross-lingual speech processing for research and model training.

创建时间:
2026-09-04
原始信息汇总

数据集概述:internal-ast-eval-cache

基本信息

  • 数据集名称:internal-ast-eval-cache
  • 数据集页面:https://huggingface.co/datasets/hoangducanh1865/internal-ast-eval-cache

数据集内容

该数据集用于内部自动语音翻译(AST)模型的评估缓存,包含以下字段:

字段名 数据类型 说明
id string 样本唯一标识符
source_dataset string 来源数据集名称
duration_sec float64 音频时长(秒)
audio audio 音频文件
text_vi string 越南语参考文本
text_en string 英语参考文本
internal_asr_text string 内部ASR模型识别结果
internal_asr_detected_language string 内部ASR检测到的语言
internal_ast_text string 内部AST模型翻译结果
internal_ast_detected_language string 内部AST检测到的语言

数据集划分

  • 划分名称:en_vi(英越方向)
  • 样本数量:294 条
  • 数据集大小:约 74.56 MB(下载大小约 74.48 MB)

用途说明

该数据集主要服务于内部自动语音翻译系统的评估流程,包含源语言音频(越南语)、参考译文(英语)、ASR中间结果及AST最终翻译结果,便于对翻译质量进行对比分析。

搜集汇总
数据集介绍
internal-ast-eval-cache 数据集图片
构建方式
本数据集名为internal-ast-eval-cache,其构造源于对自动语音识别(ASR)与自动语音翻译(AST)系统在双语环境下的评估需求。数据集的构建过程精心整合了原始语音样本及其对应的越南语(text_vi)和英语(text_en)转录文本,同时嵌入内部ASR系统的识别输出(internal_asr_text)及其检测语言(internal_asr_detected_language),以及内部AST系统的翻译输出(internal_ast_text)与检测语言(internal_ast_detected_language)。每一数据条目均以独特标识符(id)索引,并记录来源数据集(source_dataset)与语音时长(duration_sec),确保可追溯性与时间属性。该数据集共包含294个示例,存储为单一的en_vi分割,文件格式采用可扩展的parquet结构,分布于多个数据文件中,兼顾了数据完整性与读取效率。
特点
该数据集在双语语音评估领域展现出显著特色,其核心优势在于多维度信息的内在融合。每条样本不仅配备了源语音(audio)及双语文档(越南语和英语),还同步提供了内部ASR与AST系统的处理结果,形成了从原始音频到多语言文本的完整链路。这种设计使研究者能够直接对比标准转录与系统输出,精确衡量语音识别与翻译的准确性,并依据检测语言字段分析语言识别能力。此外,数据集规模虽适中(294例),但覆盖了语音时长跨度,并预设了en_vi分割,凸显了其对特定双语对的专注性。其高分辨率音频存储与压缩格式保证了数据质量,而来源字段的保留增强了数据的可复用性与可审计性,适用于模型评测、错误分析与系统调优等精细化任务。
使用方法
使用时,研究者可借助HuggingFace datasets库便捷加载数据,通过指定配置名'default'与分割'en_vi'访问全部样本。数据集以音频字段为核心,配合文本标注,可直接用于评估ASR(将audio转为text_vi/text_en)和AST(生成内部_ast_text)的性能。在评测流程中,可将内部ASR与AST的输出分别与参考文本计算如词错误率(WER)或翻译质量指标(BLEU),从而量化系统效能。所包含的检测语言字段支持分析语言分类的准确性,而duration_sec则可用于按语音长度进行子集划分或加权统计。为便于下游处理,建议将音频字段解码为波形并重采样至统一采样率,同时基于source_dataset字段可实现跨数据集的结果聚合。整体而言,该数据集为双语语音技术的实证评估提供了结构化而便利的测试平台。
背景与挑战
背景概述
internal-ast-eval-cache数据集由某研究机构于近年构建,聚焦于自动语音识别与翻译(AST)系统的评估。该数据集整合了英语与越南语的双语语音数据,涵盖音频文件及其对应的英文和越南文文本,旨在为跨语言语音翻译研究提供标准化的评测基准。其核心研究问题在于评估AST系统在多语言场景下的准确性与语言识别能力,通过对内部ASR与AST输出文本及其检测语言的记录,支持对比分析。该数据集的出现填补了低资源语言对(如英越)在端到端语音翻译评估中的空白,为相关领域研究者提供了实证数据,推动了多语言语音处理技术的进步。
当前挑战
该数据集面对的挑战主要体现在两方面。一方面,领域内,自动语音翻译需处理语音识别与文本翻译的级联误差,尤其在越南语这类低资源语言上,声学差异与语法复杂性常导致翻译质量低下,评估集需覆盖多样化口音与真实环境噪声,以确保结果泛化性。另一方面,构建过程中,如何确保音频-文本对齐的精确性、双语标注的一致性,以及跨语料库的兼容性,构成重难点。数据集仅含294个样本,规模有限,可能限制统计功效,需谨慎设计以平衡代表性。此外,内部ASR与AST的检测语言字段揭示系统可能面临的多语言混淆问题,要求评测方法能有效隔离并诊断此类错误。
常用场景
经典使用场景
internal-ast-eval-cache数据集在自动语音识别(ASR)与自动语音翻译(AST)的交叉验证研究中扮演着关键角色。它包含了英越双语语音样本及其对应的转录与翻译文本,并为每段音频提供了内部ASR与AST的推断结果及语言检测信息。这一设计使其成为评估与比较不同ASR-AST级联系统性能的基准,研究者常利用其进行端到端与级联翻译模型的对照实验,以分析误差在语音识别与翻译模块间的传播机制。
实际应用
实际应用中,该数据集可用于开发高效的跨语言语音助手与实时翻译服务,尤其针对越南语场景。通过评测不同ASR引擎与AST模型在此数据集上的表现,工程师能筛选出最适合特定硬件或延迟约束的模块组合。此外,数据中的语言检测字段有助于构建多语言路由算法,使系统能自适应地选择处理路径,从而提升在混合语言对话、国际会议及跨境客户服务中的翻译准确性与响应速率。
衍生相关工作
基于此数据集,研究者已衍生出多项代表性工作。一方面,利用其内嵌的错误标注,催生了面向ASR-AST联合优化的神经架构搜索技术,通过共享编码器减少级联误差累积。另一方面,数据促进了对抗性训练与领域自适应方法的突破,以缓解语音特征在翻译过程中的域不匹配问题。此外,该数据集还启发了若干半监督学习范式,利用未标注的音频扩展训练集,同时通过内部AST输出生成伪目标,显著提升了越南语到英语翻译的实用性,成为相关领域论文中广泛引用的参照基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务