官方服务:
资源简介:
Source: Luke the Evangelist
来源:福音书作者路加
应用场景:
相关数据集
数鼎科技-全球多语言处理主数据
该数据基于数鼎科技自主研发的多语言数据模型框架,将互联网采集的汽车行业大数据,经过多语言版本的储存、维护、切换、应用等一系列主数据设计开发技术处理,结合所拥有的汽车行业内专有名词等专业术语应用的专家经验,打造多语言并发,适应不同国际社会文化和市场的多语言主数据。满足能够容纳多种语言的全球互通共享的数据需求,促进企业扩大规模和贸易全球化进程。
广东省数据知识产权存证登记平台2023-11-15 更新300
M2LabOrg/jwlang
JWLang Corpus是一个多语言的音频和文本数据集,源自jw.org网站上的JW Broadcasting视频,用于训练和微调自动语音识别(ASR)模型,特别是OpenAI Whisper。数据集存储在Hugging Face上,采用Parquet格式,原始音频文件为MP3格式,对应文本文件。该数据集适用于训练、验证和测试ASR模型,数据下载于2024年6月。
Hugging Face2024-06-24 更新170
Banglish (Bengali in English letter) Hate Speech Dataset
This dataset contains Banglish comments for hate speech detection. It has 5000 comments in total. 2836 of these are hate speech, and 2164 are non-hate speech. Among the different types of hate speech
Mendeley Data2024-03-27 更新120
infinex/LaMini-en-id
--- dataset_info: features: - name: instruction dtype: string - name: response dtype: string - name: instruction_source dtype: string - name: context_id dtype: string - nam
Hugging Face2023-12-06 更新190
FreedomIntelligence/ApolloMoEBench
ApolloMoEDataset是一个包含12种主要语言和38种少数民族语言的医学领域问答数据集,用于训练和评估多语言医学大型语言模型。
Hugging Face2024-10-15 更新150



