CCI3-Data|文本生成数据集|数据分析数据集
收藏CCI 3.0 数据集概述
数据集描述
CCI 3.0 数据集是为了解决中文高质量安全数据集稀缺的问题而开放的。该数据集基于 CCI 数据集的基础上,扩展了数据源,采用了更严格的数据清洗方法,并完成了 CCI 3.0 数据集的建设。数据集由高质量、可靠的互联网数据组成,经过严格的数据清洗和去重处理,并针对内容质量和安全性进行了针对性的检测和过滤。
数据处理规则
- 基于规则的过滤:基于关键词的安全过滤、垃圾信息过滤等。
- 基于模型的过滤:通过训练分类模型进行低质量内容的过滤。
- 去重:在数据集内部和数据集之间进行去重。
此外,数据集还添加了丰富的元信息,包括质量评分和由小模型标记的教育水平。用户可以方便地利用每个数据条目的元信息进一步过滤和定制数据集。
数据格式
字段 | 类型 | 含义 |
---|---|---|
id | String | 文档ID,全局唯一 |
content | String | 文档内容 |
meta_info | String | 文档的元信息 |
更新
- 2024年9月20日:CCI 3.0 发布!
下载
CCI 3.0 数据集同时在 BAAI DataHub 和 Huggingface 上开放。
BAAI DataHub
用户可以点击链接 CCI 3.0 Dataset 查看数据文件并下载。
Huggingface
用户可以使用以下代码加载数据集: python from datasets import load_dataset
dataset = load_dataset("BAAI/CCI3-Data")
评估
设置
由于数据集包含中英文混合数据,我们选择了 Qwen2-0.5B 模型进行数据集评估,每个实验使用 100B 标记进行训练。
结果
我们进行了两种类型的实验:
- 混合数据集实验:英语、代码和中文的比例为 60% : 10% : 30%。
- 中文数据集实验:中文比例为 100%。
用户协议
用户需要遵守 CCI 3.0 数据集的使用协议。您可以通过以下链接查看协议:查看使用协议。
联系
如有任何问题,请联系 data@baai.ac.cn。

中国1km分辨率逐月降水量数据集(1901-2024)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2024.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
LFW
人脸数据集;LFW数据集共有13233张人脸图像,每张图像均给出对应的人名,共有5749人,且绝大部分人仅有一张图片。每张图片的尺寸为250X250,绝大部分为彩色图像,但也存在少许黑白人脸图片。 URL: http://vis-www.cs.umass.edu/lfw/index.html#download
AI_Studio 收录
LibriSpeech
LibriSpeech 是一个大约 1000 小时的 16kHz 英语朗读语音语料库,由 Vassil Panayotov 在 Daniel Povey 的协助下编写。数据来自 LibriVox 项目的已读有声读物,并经过仔细分割和对齐。
OpenDataLab 收录
GTEx (Genotype-Tissue Expression)
GTEx数据集包含了来自多个组织和器官的基因表达数据,旨在研究基因型与组织特异性表达之间的关系。数据集包括基因表达谱、基因型信息、组织样本的详细描述等。
gtexportal.org 收录
Solar Radiation Data
该数据集包含全球多个地点的太阳辐射数据,涵盖了不同时间段和气象条件下的辐射强度。数据包括直接辐射、散射辐射和总辐射等指标,适用于太阳能资源评估和气候研究。
www.nrel.gov 收录