semidark/hokuspokus-qwen3-tts-hybrid
收藏资源简介:
--- language: - de license: cc0-1.0 size_categories: - 1K<n<10K task_categories: - text-to-speech - audio-to-audio tags: - tts - kokoro - kokoro-deutsch - german - voice-cloning - synthetic-data pretty_name: Hokuspokus Qwen3 TTS Hybrid --- # Dataset Card for hokuspokus-qwen3-tts-hybrid This dataset aims to provide a professional-grade German TTS training corpus. It combines high-quality human narration with state-of-the-art synthetic augmentation to provide a legally safe alternative for training models like `kokoro`. **Work in Progress** ## Dataset Details ### Dataset Description - **Curated by:** [Nico Thomaier/semidark] - **Language(s) (NLP):** German (de-DE) - **License:** CC0 1.0 Universal (Public Domain) ### Dataset Sources - **Source Audio:** [HUI Audio Corpus / LibriVox](https://iisys.de) - **Voice Seed:** "Hokuspokus" (Professional Narrator) ## Uses ### Direct Use - Training and fine-tuning Text-to-Speech (TTS) models. - Voice cloning research and speech synthesis. - Developing [open-source German voice packs](https://github.com/semidark/kokoro-deutsch) for the `kokoro` model. ### Out-of-Scope Use - Any use case that violates ethical AI guidelines or misrepresents the origin of the voice. ## Dataset Structure The dataset consists of audio-transcript pairs in a format compatible with modern TTS pipelines (e.g., LJSpeech or JSONL). - **Audio:** 24kHz or 44.1kHz Mono WAV files. - **Transcripts:** Normalized German text. - **Hybrid Nature:** Contains both original recordings (HUI) and synthetic samples (Qwen3). ## Dataset Creation ### Curation Rationale The German TTS ecosystem lacks high-quality, professional-sounding voice packs that are free from proprietary licensing restrictions (e.g., AWS Polly). This dataset provides a "clean room" solution by utilizing Public Domain recordings and modern AI to bridge the gap. ### Source Data #### Data Collection and Processing 1. **Selection:** Audio was sourced from the "Hokuspokus - Deutsche Literaturgeschichte" subset of the HUI Audio Corpus. 2. **Post-Processing:** Audio samples were denoised and normalized to studio standards. 3. **Synthetic Augmentation:** A clean 30-second reference sample was used with **Qwen-TTS-1.7B** to generate additional training data covering modern vocabulary (technology, news, and daily life) not present in historical texts. #### Qwen TTS Seed & Examples | Type | Description | Audio | |------|-------------|-------| | **Seed** | Original HUI sample used for Qwen3-TTS voice cloning (historical German literature excerpt). | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/deutsche_literaturgeschichte_oneshot.mp3" type="audio/mp3"></audio> | | **Example 1** | Everyday vocabulary test - phrases, place names, homophones, and numbers. | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/schoen-dass-du-da-bist.mp3" type="audio/mp3"></audio> | | **Example 2** | News-style content - interview excerpt about Salman Rushdie. | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/der-bestsellerautor-salman-rus.mp3" type="audio/mp3"></audio> | | **Example 3** | Political content - Bavarian coalition government analysis. | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/keine-neuen-schulden-fortsetz.mp3" type="audio/mp3"></audio> | | **Example 4** | Current affairs - SPD leadership and fuel price policy discussion. | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/spd-chef-und-finanzminister.mp3" type="audio/mp3"></audio> | <details> <summary><b>View Full Transcripts</b></summary> **Seed:** > *Auch du lieber Leser, und ich, wenn wir nur ein wenig in uns gehen und nachdenken: wir befinden uns unter jenen Narren. Sebastian Brant aus Straßburg vierzehnhundertachtundfünfzig bis fünfzehnhunderteinundzwanzig hatte als Sohn eines Gastwirts früh offene Augen für die Lächerlichkeiten und Laster seiner Mitmenschen bekommen. Es ist, als hätte Luther die neue deutsche Sprache überhaupt erst geschaffen.* **Example 1:** > *Schön, dass du da bist. Die Bücher liegen auf dem großen Tisch. Ich mache mich auf den Weg nach Aachen, um auch nachts wach zu sein. Er aß die Maße in der Straße, aber das Maß war voll. Zwei weiße Zwerge zwängen sich zwischen zwei Zweige. Ein Pfau pflegt seine Federn an der Pfütze. Warum hast du das getan? Das ist ja unglaublich! Das kostet genau einhundertdreiundzwanzig Millionen Euro.* **Example 2:** > *Der Bestsellerautor Salman Rushdie im Gespräch über eine große Schwäche des US-Präsidenten, das Weitermachen, wenn man eigentlich schon tot war – und darüber, welche Musik auf der Discoparty zu seinem 100. Geburtstag laufen soll.* **Example 3:** > *Keine neuen Schulden, Fortsetzung des Familiengelds, mehr Polizisten? Eine Begutachtung des bayerischen Koalitionsvertrags zur Mitte der Wahlperiode zeigt: CSU und Freie Wähler haben so manches Vorhaben begraben.* **Example 4:** > *SPD-Chef und Finanzminister Lars Klingbeil wagt den Konflikt mit dem Kanzler bei der Frage: Was tun gegen die hohen Spritpreise? Er verrät, ob er jetzt mehr Steuern kassiert – und umreißt, was ihm bei seinem Reformplan für Deutschland am wichtigsten ist.* </details> #### Who are the source data producers? - **Human Narrator:** "Hokuspokus", a prolific volunteer narrator for LibriVox. - **Synthetic Engine:** Qwen3-TTS-1.7B (Zero-shot voice cloning). ### Personal and Sensitive Information No personal or sensitive information is included. All source texts are historical literary works or publicly available modern datasets. ## Bias, Risks, and Limitations - **Historical Language:** Original HUI samples may contain archaic German terminology. - **Synthetic Artifacts:** While high-quality, synthetic samples might contain minor AI-generated artifacts. ## Citation If you use this dataset, please credit the original narrator and the HUI Audio Corpus project: - **Hokuspokus / LibriVox** - **HUI Audio Corpus German (IISYS Hof)** ## Dataset Card Contact https://github.com/semidark/
--- 语言: - 德语 许可协议:CC0 1.0 通用公共领域许可 样本规模:1000 < 样本量 < 10000 任务类别: - 文本转语音(Text-to-Speech, TTS) - 音频转音频 标签: - TTS - kokoro - kokoro-deutsch - 德语 - 语音克隆 - 合成数据 数据集名称:Hokuspokus Qwen3 TTS 混合数据集 --- # 数据集卡片:hokuspokus-qwen3-tts-hybrid 本数据集旨在打造专业级德语文本转语音(TTS)训练语料库,融合高质量真人有声朗读与前沿合成数据增强技术,为`kokoro`等模型的训练提供合法合规的替代方案。 **【开发中】** ## 数据集详情 ### 数据集描述 - **整理者:** [Nico Thomaier/semidark] - **自然语言处理所用语言:** 德语(德国标准德语,de-DE) - **许可协议:** CC0 1.0 通用公共领域许可 ### 数据集来源 - **源音频:** [HUI音频语料库 / 利比沃克斯(LibriVox)](https://iisys.de) - **语音基准样本:** "Hokuspokus"(专业有声朗读者) ## 应用场景 ### 直接使用场景 - 文本转语音(TTS)模型的训练与微调 - 语音克隆研究与语音合成 - 为`kokoro`模型开发[开源德语语音包](https://github.com/semidark/kokoro-deutsch) ### 禁止使用场景 - 任何违反人工智能伦理准则,或篡改该语音来源的使用场景。 ## 数据集结构 本数据集采用适配现代TTS处理流程的格式(如LJSpeech或JSONL),由音频-文本对组成。 - **音频:** 24kHz或44.1kHz单声道WAV文件 - **文本:** 经过标准化处理的德语文本 - **混合属性:** 同时包含原始录制音频(HUI语料库)与合成音频样本(Qwen3生成) ## 数据集构建 ### 整理初衷 当前德语TTS生态系统缺乏高质量、专业音质且无专有许可限制的语音包(如AWS Polly)。本数据集利用公共领域音频资源与现代人工智能技术,打造“洁净室”式解决方案,填补这一空白。 ### 源数据 #### 数据收集与处理流程 1. **筛选:** 音频源自HUI音频语料库的"Hokuspokus - 德国文学史"子数据集 2. **后期处理:** 对音频样本进行降噪处理,并按照专业演播室标准进行音量归一化 3. **合成数据增强:** 选取一段30秒的干净参考样本,结合**Qwen-TTS-1.7B**生成额外训练数据,覆盖历史文本中未出现的现代词汇(科技、新闻与日常用语)。 #### Qwen TTS 基准样本与示例 | 类型 | 描述 | 音频链接 | |------|-------------|-------| | **基准样本** | 用于Qwen3-TTS语音克隆的原始HUI音频样本(德国历史文学节选)。 | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/deutsche_literaturgeschichte_oneshot.mp3" type="audio/mp3"></audio> | | **示例1** | 日常词汇测试——涵盖短语、地名、同音词与数字。 | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/schoen-dass-du-da-bist.mp3" type="audio/mp3"></audio> | | **示例2** | 新闻风格内容——关于萨尔曼·鲁西迪(Salman Rushdie)的访谈节选。 | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/der-bestsellerautor-salman-rus.mp3" type="audio/mp3"></audio> | | **示例3** | 政治内容——巴伐利亚联合政府分析。 | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/keine-neuen-schulden-fortsetz.mp3" type="audio/mp3"></audio> | | **示例4** | 时事新闻——关于社民党(SPD)领导层与燃油价格政策的讨论。 | <audio controls><source src="https://huggingface.co/datasets/semidark/hokuspokus-qwen3-tts-hybrid/resolve/main/qwen-tts-samples/spd-chef-und-finanzminister.mp3" type="audio/mp3"></audio> | <details> <summary><b>查看完整文本</b></summary> **基准样本:** > *亲爱的读者,还有我自己,当我们稍稍审视内心、沉下心思考时便会发现:我们正身处这群愚人之中。来自斯特拉斯堡的塞巴斯蒂安·布兰特(1458年至1521年)身为客栈老板之子,自幼便对同类的荒诞与恶习有着敏锐的洞察力。仿佛正是路德,才真正缔造了全新的德语。* **示例1:** > *很高兴你能来。书都放在大桌子上了。我正要前往亚琛,即便到了夜里也会保持清醒。他在街上按尺寸量东西,但那尺寸刚好合适。两只白色的小矮人挤在两根树枝之间。一只孔雀在水坑里整理羽毛。你为什么要这么做?这简直不可思议!这东西正好值一亿二千三百万欧元。* **示例2:** > *畅销书作家萨尔曼·鲁西迪谈及美国总统的一大弱点:即便本已“死去”却仍要继续前行——以及在他的百岁 disco 派对上应该播放何种音乐。* **示例3:** > *不新增债务、延续家庭补贴、增加警力?对巴伐利亚联合执政协议在任期中期的评估显示:基社盟(CSU)与自由选民党已将诸多计划束之高阁。* **示例4:** > *社民党主席兼财政部长拉斯·克林贝尔(Lars Klingbeil)就应对高燃油价格的问题,敢于与总理产生分歧。他透露了自己是否会新增税收,并阐述了其德国改革计划中最为重要的内容。* </details> #### 源数据生产者信息 - **真人朗读者:** "Hokuspokus",利比沃克斯(LibriVox)的高产志愿朗读者 - **合成引擎:** Qwen3-TTS-1.7B(零样本(Zero-shot)语音克隆) ## 个人与敏感信息 本数据集未包含任何个人或敏感信息。所有源文本均为历史文学作品或公开可用的现代数据集。 ## 偏差、风险与局限性 - **历史语言问题:** 原始HUI音频样本可能包含古德语术语 - **合成伪影问题:** 尽管合成音频质量较高,但仍可能存在少量人工智能生成的伪影。 ## 引用说明 若使用本数据集,请注明原朗读者与HUI音频语料库项目: - **Hokuspokus / 利比沃克斯(LibriVox)** - **HUI德语音频语料库(IISYS Hof)** ## 数据集卡片联系方式 https://github.com/semidark/




