遇见数据集

个人 ASR 与 ITN 测评集

收藏
github2026-07-03 更新2026-07-12 收录
官方服务:

资源简介:

这是一个面向真实使用场景的本地语音与文本规范化测评项目,包含两套相互独立的基准:ASR Benchmark用于评估本地语音识别模型,包含202条样本,覆盖英文、普通话中文、日语和粤语,涉及短音频和长音频,场景包括课堂、会议、销售通话等;ITN Benchmark用于评估ASR后处理或逆文本标准化规则,包含500条自建文本样本,覆盖中文、英文、日文和粤语,重点评估数字、日期、时间等内容的转换准确性。

This is a real-world scenario-oriented local speech and text normalization evaluation project, which includes two independent benchmarks. The ASR Benchmark is designed to evaluate local automatic speech recognition (ASR) models, containing 202 samples covering English, Mandarin Chinese, Japanese and Cantonese, involving both short and long audio clips, with scenarios including classrooms, meetings, sales calls and others. The ITN Benchmark is intended to evaluate ASR post-processing or inverse text normalization (ITN) rules, consisting of 500 self-built text samples covering Chinese, English, Japanese and Cantonese, focusing on the conversion accuracy of numbers, dates, times and other similar contents.

创建时间:
2026-06-29
原始信息汇总

数据集概述

该数据集是一个面向个人真实使用场景的本地语音识别(ASR)与逆文本标准化(ITN)测评项目,包含两套独立的基准测试集。

核心模块

模块 评估对象 输入 输出
ASR Benchmark 本地语音识别模型 公开音视频片段 转写文本
ITN Benchmark ASR 后处理/逆文本标准化规则 口语化文本 书面化文本

ASR 和 ITN 不共用评分指标:ASR 关注“有没有听对”,ITN 关注“是否应该格式化以及有无误格式化”。

数据集规模

  • ASR 测试集(截至2026-06-29):共202条样本

    • 短音频样本:197条
    • 长音频样本:5条
    • 语言分布:英文100条、普通话中文67条、日语25条、粤语10条
    • 场景覆盖:学生课堂、销售/客服通话、会议/圆桌、公开视频演讲、访谈/播客、在线课程、工具演示、医疗/咨询、新闻叙事、长音频
  • ITN 测试集:共500条自建文本样本

    • 文件路径:data/itn/itn_general_manifest.v1.jsonl
    • 语言:中文、英文、日文、粤语
    • 覆盖内容:数字、日期、时间、金额、电话、版本号、数学表达、普通数字词、文学/口语表达
    • 评估重点:同时考察“该转时是否正确转换”和“不该转时是否误转”

项目定位

  • 非公开排行榜复刻,注重可复现性、可解释性和接近个人真实使用场景
  • 不只看 WER/CER 单一指标,涵盖术语、数字、热词、幻觉、长音频、日语表记差异、粤语繁简差异等多维度评估
  • 仓库保存来源 URL、时间段、场景标签、语言标签、热词及 reference 文本,不重新分发第三方音视频文件

评价流程

  • ASR 评测:使用 tools/materialize_audio.py 重建本地音频 → 用 ASR 模型生成预测文本(存放于 predictions/<model>/<case_id>.txt)→ 用 tools/score_transcript.py 评分
  • ITN 评测:选择 ITN engine(如 nonewetext)→ 用 tools/evaluate_itn_manifest.py 对500条样本评测 → 查看 exact match、关键字段召回、有害误转等指标

目录结构

data/ benchmark_manifest.v1.json ASR 测试集清单 benchmark_references/ ASR reference 文本 itn/ ITN 文本测试集 docs/ asr_benchmark.md ASR 使用说明 itn_benchmark.md ITN 使用说明 metrics.md ASR 指标定义 dataset_card.md ASR 数据卡 itn_benchmark_design.md ITN 测试设计 itn_product_implementation_research.md ITN 产品实现结论 tools/ materialize_audio.py 重建 ASR 音频 score_transcript.py ASR 评分 validate_manifest.py ASR 数据校验 validate_itn_manifest.py ITN 数据校验 evaluate_itn_manifest.py ITN 评估 build_custom_wetext_fsts.py 构建自定义 ITN FST

License

  • 代码使用 MIT License
  • 数据集元数据、整理的 reference 文本和自建 ITN 文本样本用于研究和评估
  • 上游媒体和来源字幕仍受原发布者条款约束(详见 DATA_LICENSE.md
搜集汇总
数据集介绍
个人 ASR 与 ITN 测评集 数据集图片
构建方式
该数据集面向个人真实使用场景,由ASR与ITN两套独立的测评基准构成。ASR基准基于202条公开音视频片段,涵盖短音频197条与长音频5条,语言覆盖英文、普通话中文、日语及粤语,场景涉及课堂、会议、播客等十类;ITN基准则包含500条自建文本样本,聚焦数字、日期、金额等书面化转换场景。所有样本均保存来源URL、时间段、场景与语言标签等元数据,不直接分发第三方音视频文件,仅通过工具脚本从公开来源重建本地音频。
使用方法
使用该数据集时,ASR评估需先通过materialize_audio.py从提供URL重建音频,再用任意ASR模型生成预测文本,最后以score_transcript.py计算评分。ITN评估则直接利用evaluate_itn_manifest.py对500条文本样本进行评测,支持none、wetext或自定义FST引擎,输出准确匹配率、关键字段召回率及有害误转率等指标。所有工具脚本均位于tools目录,评测流程详见docs下对应说明文档。
背景与挑战
背景概述
该个人ASR与ITN测评集创建于2026年,由社区研究者维护,旨在弥补现有语音识别与逆文本标准化评测中脱离真实个人使用场景的缺陷。核心研究问题聚焦于评估课堂视频、会议、播客等多样化场景下,本地ASR模型的多语言转写质量,以及后处理阶段ITN规则对口语化文本的格式化准确性。不同于仅关注词错误率的传统基准,该数据集通过201条多语种音频样本与500条自建ITN文本,分别量化‘听力准确度’与‘格式规范化合理性’,尤其重视术语、热词、长音频及跨语言表记差异等实际痛点,为本地化语音产品提供了具备可解释性与可复现性的评测框架。
当前挑战
当前核心挑战包含两个层面。领域问题层面,ASR与ITN的协同评估缺乏统一口径,模型在‘听对但误格式化’病例中的错误归属模糊,亟需解耦声学识别与文本规范化阶段的责任边界。构建过程中,ASR测试集面临第三方音视频版权限制,无法直接分发音频文件,仅能通过来源URL与时间戳重建,这增加了评测复现的门槛与对原始链接可用性的依赖;ITN测试集则需在500条样本中平衡语种与场景覆盖,同时设计对抗性用例(如文学/口语表达),以兼顾‘必要转换’的召回与‘有害误转’的抑制,对样本的典型性与歧视性提出精细要求。
常用场景
经典使用场景
该数据集最经典的使用场景在于对本地部署的自动语音识别(ASR)模型进行多维度、多语言的精细化评测,尤其聚焦于课堂录音、会议对话、客服通话、播客访谈及公开演讲等真实应用环境。研究者可借助其提供的短音频与长音频样本,评估模型在中文、英文、日语、粤语等语言上的转写准确性,并特别关注术语、热词、数字及幻觉等易错点的表现,从而获得超越单一词错误率(WER/CER)的深度洞察。
解决学术问题
该数据集着力解决了当前语音识别研究中两个关键学术难题:一是缺乏面向个人真实使用场景的可复现、可解释的评测基准,导致模型在实验室环境与实际部署间存在显著性能落差;二是ASR后处理中的逆文本标准化(ITN)评测长期被忽略,缺乏同时评估“正确格式化”与“有害误转”的双向指标。通过分离ASR与ITN的评测框架,该数据集为模型幻觉分析、多语言转写差异量化及后处理规则鲁棒性评估提供了标准化平台,显著推动了语音系统端到端质量评价体系的完善。
实际应用
在实际应用中,该数据集广泛服务于个人助理、智能会议纪要生成、多语言实时字幕系统与医疗转录等场景。开发者可借助ASR基准测试筛选适合本地部署的轻量化模型,确保在嘈杂客服通话或教学视频中仍能精准捕获关键术语;同时通过ITN评测优化数字、日期及金额等格式化规则,避免如“一百二十三”被误转为“123”或反向遗漏,从而提升生成文本的可读性与下游自然语言处理系统的输入质量。
数据集最近研究
最新研究方向
在语音技术迈向真实场景落地的浪潮中,该数据集聚焦本地语音识别与逆文本标准化两大核心环节的协同评估,突破了传统仅以词错率论优劣的局限。研究前沿在于构建面向课堂、会议、医疗咨询等多场景、多语种的细粒度测评体系,尤其侧重对数字、日期、金额等结构化信息的正确格式化与有害误转的并行检验,这一方向直接呼应了智能助手、实时字幕、自动会议纪要等应用对高精度语音转录与后处理的迫切需求。通过分离“听对”与“写对”的评估维度,该工作为低资源场景下热词召回、幻觉抑制及跨语言表记差异等问题提供了可复现的标准化测试平台,对推动本地化语音系统的鲁棒性提升与产品级ITN策略优化具有重要的基准价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务