官方服务:
资源简介:
Source: Vākyapadīya
来源:《语门论》(Vākyapadīya)
应用场景:
相关数据集
THCHS-30
“THCHS30是由清华大学语音与语言技术中心(CSLT)发布的开放式汉语语音数据库。原始录音是2002年在清华大学国家重点实验室的朱晓燕教授的指导下,由王东完成的。清华大学计算机科学系智能与系统,原名“TCMSD”,意思是“清华连续普通话语音数据库”,时隔13年出版,由王东博士发起,并得到了教授的支持。朱小燕。我们希望为语音识别领域的新研究人员提供一个玩具数据库。因此,该数据库对学术用户完全免
OpenDataLab2026-07-12 更新38200
LCCC (Large-scale Cleaned Chinese Conversation corpus)
我们提出了一个大型清洁汉语会话语料库(LCCC),其中包含:LCCC-base 和 LCCC-large。为了保证语料库的质量,设计了严格的数据清洗流水线。该管道涉及一组规则和几个基于分类器的过滤器。诸如攻击性或敏感词、特殊符号、表情符号、语法错误的句子和不连贯的对话等噪音都会被过滤掉。
OpenDataLab2026-07-12 更新1720
Sanskrit (Present Tense - 3rd Person - Singular)
(वर्थमानकालः - प्रथमपुरुषः - एकवचनम्) few examples.
kaggle2022-01-09 更新190
Alpha Modern Chinese Corpus (AMC Corpus)
Alpha现代汉语语料库(AMC语料库)是一个包含“干净”现代汉语句子的语料库。所谓“干净”句子,是指语料库中的句子几乎没有数字、非中文字母或特殊符号。AMC语料库的数据主要来源于公开的在线数据,包含非虚构、虚构、科学文章和对话四种文本类型,适用于语言研究、汉语教学和自然语言处理等领域。
github2024-08-20 更新3170
Pre-modern_Chinese_language_corpus
这是一个2.8亿多字的近代汉语语料集合。总大小超过966 MB,含968个TXT文件。语料文本均为utf-8编码。文本文件按朝代(宋、元、明、清初、清末、民国)排列,文本的类别、作者姓名也作了标注。
github2024-03-20 更新990



