NathanRoll/global-news-radio-30s
收藏资源简介:
--- language: - multilingual task_categories: - automatic-speech-recognition tags: - audio - radio - news - multilingual - speech license: cc-by-4.0 size_categories: - n<1K --- # Global News Radio Dataset Multilingual **news** radio recordings from 51 languages across 42 countries. | | | |---|---| | **Recordings** | 51 | | **Total audio** | 1500 min (25.0 h) | | **Format** | MP3 16kHz mono 64kbps | | **Parquet shards** | 11 | | **Languages** | 51 | | **Countries** | 42 | | **Size** | 687 MB | ## Languages Amharic, Arabic, Bashkir, Basque, Belarusian, Bengali, Brazilian Portuguese,Portugues Do Brasil,Português Brasil, Catalan, Croatian, Czech, Danish, Dutch, English, Estonian, Faroese, Finnish, Flemish, French, Georgian, German, Greek, Haitian Creole, Hebrew, Hindi, Hokkien, Hungarian, Icelandic, Indonesian, Japanese, Kazakh, Korean, Kurdish, Latvian, Luganda, Mongolian, Nepali, Norwegian, Ossetian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tamil, Telugu ## Usage ```python from datasets import load_dataset ds = load_dataset("NathanRoll/global-news-radio-30s") sample = ds["train"][0] print(sample["station_name"], sample["language"]) ``` ## Source [Radio Browser API](https://www.radio-browser.info/) via pyradios. Built with streaming append-only shard uploads — each parquet shard is uploaded once and never re-uploaded. ## License Metadata: CC-BY-4.0. Audio from public radio broadcasts.




