chengshidehaimianti/CC-Cat
收藏官方服务:
资源简介:
CC_Cat数据集是从CC-WARC快照中提取的,主要包含149种语言的文本,并提供了PDF/IMAGE/AUDIO/VIDEO的原始下载链接。由于计算资源有限,数据集将根据CC快照的时间戳每天更新,并且在快照更新后会上传去重版本。
This dataset is designed for multilingual text generation tasks, supporting a wide range of languages including Chinese and English. With a size exceeding 1TB, it is suitable for scenarios requiring the processing of large volumes of text data. The dataset is licensed under odc-by, and its use must comply with the relevant agreements.
提供机构:
chengshidehaimianti原始信息汇总
数据集概述
许可证
- 开放数据共享许可证 (ODC-BY)
任务类别
- 文本生成
语言
- 中文 (zh)
- 英文 (en)
- 德文 (de)
- 俄文 (ru)
- 西班牙文 (es)
- 日文 (ja)
- 南非荷兰文 (af)
- 阿姆哈拉文 (am)
- 阿拉贡文 (an)
- 阿拉伯文 (ar)
- 阿萨姆文 (as)
- 阿瓦尔文 (av)
- 阿塞拜疆文 (az)
- 巴什基尔文 (ba)
- 白俄罗斯文 (be)
- 保加利亚文 (bg)
- 藏文 (bo)
- 布列塔尼文 (br)
- 波斯尼亚文 (bs)
- 加泰罗尼亚文 (ca)
- 楚瓦什文 (cv)
- 威尔士文 (cy)
- 丹麦文 (da)
- 希腊文 (el)
- 世界语 (eo)
- 爱沙尼亚文 (et)
- 巴斯克文 (eu)
- 波斯文 (fa)
- 芬兰文 (fi)
- 法文 (fr)
- 弗里斯兰文 (fy)
- 爱尔兰文 (ga)
- 苏格兰盖尔文 (gd)
- 加利西亚文 (gl)
- 瓜拉尼文 (gn)
- 马恩岛文 (gv)
- 希伯来文 (he)
- 印地文 (hi)
- 克罗地亚文 (hr)
- 海地克里奥尔文 (ht)
- 匈牙利文 (hu)
- 亚美尼亚文 (hy)
- 国际文 (ia)
- 印度尼西亚文 (id)
- 伊多文 (ie)
- 伊奥尼亚文 (io)
- 冰岛文 (is)
- 意大利文 (it)
- 爪哇文 (jv)
- 格鲁吉亚文 (ka)
- 哈萨克文 (kk)
- 高棉文 (km)
- 卡纳达文 (kn)
- 韩文 (ko)
- 科米文 (kv)
- 康沃尔文 (kw)
- 吉尔吉斯文 (ky)
- 拉丁文 (la)
- 卢森堡文 (lb)
- 林堡文 (li)
- 老挝文 (lo)
- 立陶宛文 (lt)
- 拉脱维亚文 (lv)
- 马尔加什文 (mg)
- 马其顿文 (mk)
- 马拉雅拉姆文 (ml)
- 蒙古文 (mn)
- 马来文 (ms)
- 马耳他文 (mt)
- 缅甸文 (my)
- 尼泊尔文 (ne)
- 荷兰文 (nl)
- 新挪威文 (nn)
- 挪威文 (no)
- 奥克西坦文 (oc)
- 奥塞梯文 (os)
- 旁遮普文 (pa)
- 波兰文 (pl)
- 普什图文 (ps)
- 葡萄牙文 (pt)
- 克丘亚文 (qu)
- 罗曼什文 (rm)
- 罗马尼亚文 (ro)
- 梵文 (sa)
- 撒丁文 (sc)
- 信德文 (sd)
- 僧伽罗文 (si)
- 斯洛伐克文 (sk)
- 斯洛文尼亚文 (sl)
- 索马里文 (so)
- 阿尔巴尼亚文 (sq)
- 塞尔维亚文 (sr)
- 巽他文 (su)
- 瑞典文 (sv)
- 斯瓦希里文 (sw)
- 泰米尔文 (ta)
- 泰卢固文 (te)
- 塔吉克文 (tg)
- 土库曼文 (tk)
- 他加禄文 (tl)
- 土耳其文 (tr)
- 鞑靼文 (tt)
- 维吾尔文 (ug)
- 乌克兰文 (uk)
- 乌尔都文 (ur)
- 乌兹别克文 (uz)
- 越南文 (vi)
- 瓦隆文 (wa)
- 意第绪文 (yi)
- 约鲁巴文 (yo)
标签
- 牛角面包 (croissant)
数据集大小
- 大于1TB (n>1T)
数据集名称
- CCCAT



