遇见数据集

Multilingual Wikipedia

收藏
arXiv2025-09-30 收录
数据链接:
官方服务:

资源简介:

该数据集是一个多语言数据集,包含了英语、德语、法语和意大利语的文档,其规模达到了170亿个标记,旨在应对语言建模的任务。

This multilingual dataset contains documents in English, German, French and Italian, with a total of 17 billion tokens, and is designed to address language modeling tasks.

二维码
社区交流群
二维码
科研交流群
商业服务