遇见数据集

live-translator-packs

收藏
Hugging Face2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

Live Translator离线模型包数据集是为Live Translator应用程序提供的一组按需离线模型资源,旨在支持离线环境下的多语言翻译、自动语音识别(ASR)和文本转语音(TTS)任务。该数据集包含英语(en)、希腊语(el)、西班牙语(es)等语言,并以语言对为单位组织下载:首次下载时会安装一个公共的common/组件(约284MB),包含共享的ASR(基于Whisper tiny int8和sherpa-onnx)、语音活动检测(VAD)、语音降噪、espeak-ng音素数据以及多语言TTS(Kokoro-82M int8覆盖多种语言);随后每个语言对(如en-el、en-es)单独下载,主要包括基于CTranslate2 int8的神经机器翻译(NMT)模型(源自Helsinki-NLP的OPUS-MT/Marian模型)以及针对Kokoro未覆盖语言(如希腊语)的Piper TTS模型。数据规模方面,例如en-el语言对约196MB,en-es约158MB,首次下载(common + en-el)总计约480MB。数据集适用于移动或离线场景下的实时语音翻译、语音识别和语音合成应用,所有模型均经过优化(如int8量化)以提高效率,并通过HuggingFace平台托管提供。

The Live Translator Offline Model Package Dataset is a set of on-demand offline model resources provided for the Live Translator application, aiming to support multilingual translation, automatic speech recognition (ASR) and text-to-speech (TTS) tasks in offline environments. The dataset covers languages including English (en), Greek (el), Spanish (es) and others, and is organized and downloaded in language pair units: a shared common/ component (approximately 284 MB) will be installed during the first download, which contains shared ASR models based on Whisper tiny int8 and sherpa-onnx, voice activity detection (VAD), speech denoising modules, espeak-ng phoneme data, and multilingual TTS (Kokoro-82M int8 covers multiple languages); subsequently, each language pair (e.g., en-el, en-es) can be downloaded separately, mainly including neural machine translation (NMT) models based on CTranslate2 int8 (derived from the OPUS-MT/Marian models from Helsinki-NLP) as well as Piper TTS models for languages not covered by Kokoro (such as Greek). In terms of dataset scale, for example, the en-el language pair is approximately 196 MB, the en-es language pair is approximately 158 MB, and the total size of the first download (common + en-el) is around 480 MB. This dataset is suitable for real-time speech translation, speech recognition and speech synthesis applications in mobile or offline scenarios. All models have been optimized (e.g., via int8 quantization) to enhance efficiency, and are hosted and distributed through the Hugging Face platform.

创建时间:
2026-07-08
原始信息汇总

数据集概述

数据集名称: Live Translator Offline Model Packs

许可证: Apache-2.0

任务类别: 翻译、自动语音识别、文本转语音

语言: 英语、希腊语、西班牙语

标签: 离线翻译、CTranslate2、Whisper、Kokoro、Piper


数据集结构

数据集按语言对组织,首次下载时会安装共享的 common/ 文件夹,后续语言对仅下载各自特定文件。

公共文件(common/,仅下载一次,约 284 MB)

  • 语音识别(ASR): Whisper tiny int8 多语言模型(sherpa-onnx 运行时)
    • whisper-encoder.onnx
    • whisper-decoder.onnx
    • whisper-tokens.txt
  • 语音活动检测(VAD): Silero VAD (silero_vad.onnx)
  • 语音降噪: GTCRN 语音降噪器 (gtcrn.onnx)
  • 语音转文本(TTS)共享数据: espeak-ng 音素化数据 (espeak-ng-data.tar)
  • 多语言语音合成(Kokoro-82M int8): 支持英语、西班牙语、法语、意大利语、葡萄牙语、印地语、日语、中文
    • model.onnx
    • voices.bin
    • tokens.txt
    • lexicon-us-en.txt

语言对文件夹(<pair>/,按语言对下载)

  • 神经机器翻译(NMT): CTranslate2 int8 模型,每个翻译方向一个子目录
    • nmt-<a>-<b>/(例如 nmt-en-el/
    • nmt-<b>-<a>/(例如 nmt-el-en/
    • 包含文件:model.binconfig.jsonshared_vocabulary.jsonsource.spmtarget.spm
  • 文本转语音(TTS): 仅当语言不被 Kokoro 覆盖时存在(如希腊语使用 Piper)
    • tts-<lang>/(例如 tts-el/
    • 包含文件:model.onnxtokens.txt

运行时与处理流程

  • ASR: 使用 sherpa-onnx 运行 Whisper tiny int8 模型(基于 ONNX Runtime)
  • NMT: 使用 CTranslate2 int8 模型(源于 OPUS-MT / Marian),通过 Dart FFI 调用 libctranslate2。使用 SentencePiece 模型(.spm)进行分词,解码采用集束搜索(beam=5,无重复 n-gram,长度惩罚)。每次调用翻译一个句子
  • TTS: 英语、西班牙语等使用 Kokoro int8(sherpa-onnx);希腊语使用 Piper medium

模型大小与下载量

项目 大小
公共文件(仅一次) ~284 MB(ASR 98 MB,Kokoro 166 MB,espeak 17 MB,VAD/降噪 1 MB)
en-el 语言对 ~196 MB(NMT 140 MB,Piper-el-medium 60 MB)
en-es 语言对 ~158 MB(仅 NMT,英语和西班牙语语音来自公共 Kokoro)
首次下载(公共 + en-el) ~480 MB
额外下载 en-es +158 MB

来源模型

模型包 来源
nmt-en-el Helsinki-NLP/opus-mt-en-el → CTranslate2 int8
nmt-el-en Helsinki-NLP/opus-mt-grk-en → CTranslate2 int8
nmt-en-es Helsinki-NLP/opus-mt-en-es → CTranslate2 int8
nmt-es-en Helsinki-NLP/opus-mt-es-en → CTranslate2 int8
ASR Whisper tiny int8(sherpa-onnx)
TTS(Kokoro) csukuangfj/kokoro-int8-multi-lang-v1_1
TTS(希腊语) rhasspy/piper-voices el_GR-rapunzelina-medium

数据文件可通过 https://huggingface.co/datasets/Gstam21/live-translator-packs/resolve/main/<路径> 获取。

搜集汇总
数据集介绍
live-translator-packs 数据集图片
构建方式
该数据集专为Live Translator应用设计,提供离线模型包的按需下载。其核心构建逻辑基于语言对的模块化组织方式:每个语言对独立打包,而公共组件仅在首次下载时统一安装。模型包涵盖了自动语音识别(ASR)、神经机器翻译(NMT)、文本转语音(TTS)及语音活动检测(VAD)等完整流水线。ASR采用Whisper tiny int8模型,通过sherpa-onnx运行时推理;NMT基于Helsinki-NLP的OPUS-MT模型,经由CTranslate2框架压缩为int8格式;TTS部分,通用语言由Kokoro-82M int8模型覆盖,而未被覆盖的语言(如希腊语)则调用Piper模型补充。此外,Silero VAD与GTCRN降噪器被集成于公共模块中,以提升语音处理的鲁棒性。所有模型文件均以ONNX格式存储,确保跨平台兼容性。
特点
该数据集的核心优势在于其高度模块化与轻量化设计。公共组件(约284 MB)仅需一次性下载,涵盖ASR、TTS、VAD及降噪等基础功能,而各语言对独立包体积小巧(如en-es仅158 MB),显著降低了按需获取的门槛。推理流水线清晰分层:ASR与TTS基于sherpa-onnx运行时,NMT依赖CTranslate2,并采用SentencePiece进行分词,解码时应用beam search(束宽为5)并辅以长度惩罚及无重复n-gram约束。TTS方面,Kokoro模型支持多语言合成,而Piper模型则灵活填补语言空缺。整体数据包的设计兼顾了离线部署的效率与翻译任务的完整性,尤其适用于资源受限的移动端场景。
使用方法
使用该数据集时,用户需根据目标语言对下载对应的模型包。首次使用时,系统会自动安装公共模块,随后每个语言对的NMT模型将被加载至CTranslate2运行时中。推理流程遵循明确的串行处理:首先通过Whisper进行ASR识别,输出文本经SentencePiece分词后送入NMT模型逐句翻译,最后依据语言类型选择Kokoro或Piper进行语音合成。需注意,NMT模型要求每次仅输入一个句子进行翻译。所有模型文件通过HuggingFace数据集仓库分发,资源链接格式为https://huggingface.co/datasets/Gstam21/live-translator-packs/resolve/main/<path>,开发者可据此直接集成至应用中进行离线翻译。
背景与挑战
背景概述
在全球化交流日益频繁的当下,跨语言实时翻译技术已成为打破语言壁垒的关键工具。由研究者Gstam21主导开发的live-translator-packs数据集,创建于深度学习驱动的神经机器翻译与语音处理技术深度融合阶段,其核心研究问题聚焦于为移动端应用提供低延迟、高质量的离线翻译模型包。该数据集整合了Whisper小型语音识别模型、CTranslate2优化的神经机器翻译引擎、Kokoro与Piper语音合成系统以及Silero VAD等前沿技术,构建了一个从语音识别到文本翻译再到语音合成的完整离线流水线。通过为英语-希腊语、英语-西班牙语等语言对提供预训练模型,该数据集显著推动了离线翻译技术在资源受限设备上的部署与应用,为语音翻译领域的实用化发展注入了新的活力。
当前挑战
该数据集面临的核心挑战源于实时语音翻译的复杂性和离线部署的严苛要求。在领域问题层面,如何实现跨语言语音识别与翻译的精准同步,同时应对不同语言对的声学与语法差异,是亟待解决的关键难题。例如,Whisper模型虽支持多语言识别,但在低资源语言上的准确率仍受限于训练数据不足;NMT模型在采用beam search解码时,单句逐次翻译的策略可能影响长句处理的流畅性。在构建过程中,模型压缩与部署效率构成主要技术瓶颈:将原版OPUS-MT模型转换为CTranslate2 int8格式需平衡精度与体积,而Kokoro语音合成模型虽覆盖多数语言,但针对希腊语等未被覆盖的语言需额外集成Piper引擎,导致下载包体积随语言对增加而显著膨胀,如首次下载英语-希腊语包即达约480 MB,这对移动端的存储与带宽资源形成了严峻考验。
常用场景
经典使用场景
在离线实时翻译领域,live-translator-packs数据集为开发者提供了一整套轻量化、模块化的模型资源,支持完整的语音翻译流水线。其经典使用场景包括:用户通过移动设备或嵌入式系统捕获语音信号,借助内置的Silero语音活动检测(VAD)和GTCRN降噪模型预处理音频,再经由Whisper tiny int8模型进行多语言自动语音识别(ASR),将口语转换为文本。随后,文本通过CTranslate2优化的OPUS-MT神经机器翻译模型(NMT)在设备端完成双向翻译,最后利用Kokoro或Piper文本转语音(TTS)模型生成目标语言语音输出。这一流程无需云端联网,在隐私保护与低延迟方面具有显著优势,尤其适用于旅行、会议及应急通信场景。
解决学术问题
学术界长期面临端到端离线翻译系统部署的碎片化挑战,包括模型间接口不统一、资源消耗与设备算力矛盾、以及多语言覆盖不全等问题。live-translator-packs通过标准化打包方式(如统一ONNX运行时、SentencePiece分词器共享)系统性地解决了这些瓶颈:它证明了将ASR、VAD、降噪、NMT和TTS模块集成到单个int8量化框架内的可行性,为资源受限设备上的多模态翻译研究提供了基准参考。此外,其对Whisper tiny与Kokoro等轻量模型的联合优化,推动了低资源语言(如希腊语)在离线场景下的技术验证,促进了隐私保护型翻译范式的学术讨论——即如何在不牺牲翻译质量的前提下,通过模型压缩与流水线协同设计实现家庭、医疗等敏感数据的本地化处理。
衍生相关工作
该数据集衍生了一系列关键技术贡献:首先,其NMT模型基于赫尔辛基大学NLP组的OPUS-MT系列,经过CTranslate2 int8量化后,为设备端机器翻译的效率优化提供了可复现的基线。其次,Whisper tiny与sherpa-onnx运行时的深度整合,催生了轻量级ASR部署方案,启发了后续研究者探索更小型化Whisper变体(如Whisper nano)在边缘设备上的蒸馏方法。此外,Kokoro多语言TTS模型的int8版本——源自csukuangfj/kokoro-int8-multi-lang-v1_1——成为跨语言语音合成的重要实验平台,推动了基于ONNX的共享声学模型设计。最后,Piper希腊语TTS模型的适配工作(基于rhasspy/piper-voices)填补了小语种语音生成的研究空白,为低资源语言TTS的社区维护奠定了基础。这些工作共同构成了从模型压缩、运行时优化到多语种覆盖的完整学术链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务