登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BertPunc
BertPunc
收藏
OpenCSG
2024-06-04 更新
2026-01-19 收录
标点恢复
语音识别后处理
数据链接:
https://opencsg.com/datasets/MagicAI/BertPunc?tab=summary
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
基于BERT预训练模型的最新(SOTA)标点恢复(例如自动语音识别)的深度学习模型
应用场景:
提供机构:
MagicAI
创建时间:
2024-06-04
相关数据集
CUAD
法律合同
条款识别
Contract Understanding Atticus Dataset(CUAD)v1是一个包含510份商业法律的合同中的13,000多个标签的语料库,这些标签已被手动标记,以识别律师在审查与公司交易有关的合同时所寻找的41类重要条款
OpenCSG
2024-07-11 更新
39
0
olist
电子商务
客户行为分析
100,000 个包含产品、客户和评论信息的订单。这是一个巴西电子商务公共数据集,包含在 Olist Store 下的订单。
OpenCSG
2024-07-05 更新
24
0
github-typo-corpus
自然语言处理
错误检测
GitHub Typo Corpus: 大规模多语言拼写错误和语法错误数据集。这是一个用于研究和改进拼写错误和语法错误检测的多语言大规模数据集。
OpenCSG
2024-06-04 更新
16
0
SponSpeech
标点恢复
语音处理
SponSpeech是由滑铁卢大学、纽约识别技术公司和哥伦比亚大学共同创建的一个用于标点恢复的数据集,主要来源于非正式的语音源,如播客。该数据集包含665小时的语音数据,涵盖了147,209条训练样本、25,253条验证样本、17,697条测试样本和16,473条具有标点模糊性的测试样本。数据集的创建过程包括从YouTube视频中提取音频和字幕,并通过一系列过滤器确保数据的质量和适用性。SponS
arXiv
2024-09-17 更新
32
0
tiagoblima/punctuation-mec-bert
标点恢复
自然语言处理
--- dataset_info: features: - name: tag dtype: string - name: sent_id dtype: int64 - name: text_id dtype: int64 - name: sent_text dtype: string - name: tokens sequence:
Hugging Face
2023-02-22 更新
16
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广