internal-ast-eval-cache
收藏资源简介:
该数据集是一个面向英语和越南语的双语语音-文本资源,共包含294个样本,每个样本由唯一标识符、来源数据集、音频时长、音频文件、越南语文本、英语文本、内部ASR转录文本及检测语言、内部AST输出文本及检测语言组成。所有样本属于en_vi分割,适用于语音识别、语音翻译、语言检测、跨语言语音处理等任务的研究与模型训练。
This dataset is a bilingual speech-text resource for English and Vietnamese, containing 294 samples. Each sample consists of a unique identifier (id), source dataset (source_dataset), audio duration (duration_sec), audio file (audio), Vietnamese text (text_vi), English text (text_en), internal ASR transcription text (internal_asr_text) and detected language (internal_asr_detected_language), as well as internal AST output text (internal_ast_text) and detected language (internal_ast_detected_language). All samples belong to the en_vi split, suitable for tasks such as speech recognition, speech translation, language detection, and cross-lingual speech processing for research and model training.
数据集概述:internal-ast-eval-cache
基本信息
- 数据集名称:internal-ast-eval-cache
- 数据集页面:https://huggingface.co/datasets/hoangducanh1865/internal-ast-eval-cache
数据集内容
该数据集用于内部自动语音翻译(AST)模型的评估缓存,包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| id | string | 样本唯一标识符 |
| source_dataset | string | 来源数据集名称 |
| duration_sec | float64 | 音频时长(秒) |
| audio | audio | 音频文件 |
| text_vi | string | 越南语参考文本 |
| text_en | string | 英语参考文本 |
| internal_asr_text | string | 内部ASR模型识别结果 |
| internal_asr_detected_language | string | 内部ASR检测到的语言 |
| internal_ast_text | string | 内部AST模型翻译结果 |
| internal_ast_detected_language | string | 内部AST检测到的语言 |
数据集划分
- 划分名称:en_vi(英越方向)
- 样本数量:294 条
- 数据集大小:约 74.56 MB(下载大小约 74.48 MB)
用途说明
该数据集主要服务于内部自动语音翻译系统的评估流程,包含源语言音频(越南语)、参考译文(英语)、ASR中间结果及AST最终翻译结果,便于对翻译质量进行对比分析。




