遇见数据集

scotus-sim/scotus-samuel_a_alito_jr-audio

收藏
Hugging Face2026-04-19 更新2026-04-26 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 tags: - audio - oyez - supreme-court - speech size_categories: - 1K<n<10K --- # SCOTUS-sim audio: samuel_a_alito_jr Per-utterance audio clips from Oyez oral-argument mp3s, sliced at the `start_time` / `stop_time` timestamps stored in the companion `scotus-sim/scotus-samuel_a_alito_jr-training` dataset. ## Alignment `clip_NNNNN.wav` in the tarball corresponds **exactly** to `audio_segments.jsonl[NNNNN]` in the training companion dataset. In `metadata.jsonl` each row carries the same 0-padded index in `idx`. This supersedes the v1 tarball, which had systematic audio↔segment index misalignment (Apr 2026). ## Stats - clips: **10165** - total duration: **20.58 hours** - unique cases: **1193** ## Files - `samuel_a_alito_jr.tar.gz` — all clips; members named `samuel_a_alito_jr_NNNNN.wav`, 24 kHz mono PCM 16-bit. - `metadata.jsonl` — one row per clip with `text`, `speaker`, `duration`, `case_id`, `audio_url`, `idx`. ## License Audio is derived from Oyez.org (CC-BY-NC 4.0). Derivative TTS training artifacts inherit the NC term.

授权协议:CC-BY-NC-4.0 标签: - 音频 - Oyez - 最高法院 - 语音 数据量范围:1000 < 样本数 < 10000 # SCOTUS-sim音频数据集:塞缪尔·A·阿利托 Jr.(Samuel A. Alito Jr.) 本数据集包含源自Oyez网站最高法院口头辩论MP3音频的逐句剪辑片段,剪辑依据配套数据集`scotus-sim/scotus-samuel_a_alito_jr-training`中存储的`start_time`(起始时间)与`stop_time`(结束时间)时间戳完成。 ## 对齐说明 压缩包中的`clip_NNNNN.wav`与配套训练数据集内的`audio_segments.jsonl[NNNNN]`完全一一对应。`metadata.jsonl`中的每一行均包含相同的前导零补全索引`idx`。本版本已取代2026年4月发布的v1压缩包,后者存在音频片段与索引系统性错位的问题。 ## 统计信息 - 剪辑片段总数:**10165** - 总时长:**20.58小时** - 独立案件数:**1193** ## 文件说明 - `samuel_a_alito_jr.tar.gz`:包含全部音频剪辑片段,文件命名格式为`samuel_a_alito_jr_NNNNN.wav`,采用24 kHz单声道脉冲编码调制(Pulse Code Modulation, PCM)16位编码。 - `metadata.jsonl`:每行对应一条剪辑片段,包含`text`(文本内容)、`speaker`(说话人)、`duration`(时长)、`case_id`(案件ID)、`audio_url`(音频链接)与`idx`(索引)字段。 ## 授权协议 音频素材源自Oyez.org(遵循CC-BY-NC 4.0协议),衍生的文本到语音合成(Text-to-Speech, TTS)训练数据集同样受非商业使用条款约束。

提供机构:
scotus-sim
二维码
社区交流群
二维码
科研交流群
商业服务