官方服务:
资源简介:
:unav
应用场景:
相关数据集
BEE-spoke-data/napierone-epub-raw
NapierOne EPUB原始数据集,包含通过marker工具转换的Project Gutenberg书籍。数据集支持多种语言,包括英语、西班牙语、芬兰语、法语、葡萄牙语、荷兰语、德语、瑞典语和意大利语等。数据集分为三个配置:default、en-clean和english,每个配置包含文件名、文本内容和语言特征。数据集主要用于文本生成和特征提取任务。
Hugging Face2024-05-11 更新160
ryzzlestrizzle/multi-wiki-clustering-p2p
--- license: cc-by-4.0 configs: - config_name: bs data_files: - split: test path: bs/test.jsonl.gz - config_name: ca data_files: - split: test path: ca/test.jsonl.gz - config_name: cs
Hugging Face2024-04-22 更新110
singletongue/cc100-documents
--- language: - ar - de - en - es - fr - it - ja - ko - pt - ru - zh language_bcp47: - zh-Hans - zh-Hant multilinguality: - multilingual task_categories: - text-generation - fill-mask task_ids: - lang
Hugging Face2025-11-11 更新90
zenless-lab/alt
该数据集是一个包含英语和日语文本对的多语言数据集,适用于训练机器翻译模型。数据集包含多个配置版本,每个版本都有唯一的标识符、英语文本和日语文本,并且分为训练集和测试集。
Hugging Face2024-12-20 更新150



