SanFranciscoBay_Adapt2SeaLevelRise_CountyData|海平面上升适应数据集|区域规划数据集
收藏COCA (Corpus of Contemporary American English)
COCA是一个包含超过5.2亿词的英语语料库,涵盖了从1990年至今的文本。它包括口语、小说、流行杂志、报纸和学术文章五种文体,旨在反映当代美国英语的使用情况。
www.english-corpora.org 收录
MNBVC
MNBVC数据集是一个超大规模的中文语料集,包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。
github 收录
LFW
人脸数据集;LFW数据集共有13233张人脸图像,每张图像均给出对应的人名,共有5749人,且绝大部分人仅有一张图片。每张图片的尺寸为250X250,绝大部分为彩色图像,但也存在少许黑白人脸图片。 URL: http://vis-www.cs.umass.edu/lfw/index.html#download
AI_Studio 收录
EdNet
displayName: EdNet license: - CC BY-NC 4.0 paperUrl: https://arxiv.org/pdf/1912.03072v3.pdf publishDate: "2019" publishUrl: https://github.com/riiid/ednet publisher: - University of Michigan - Yale University - University of California, Berkeley - Riiid AI Research tags: - Student Activities taskTypes: - Knowledge Tracing --- # 数据集介绍 ## 简介 圣诞老人收集的各种学生活动的大规模分层数据集,一个配备人工智能辅导系统的多平台自学解决方案。 EdNet 包含 2 年多来收集的 784,309 名学生的 131,441,538 次互动,这是迄今为止向公众发布的 ITS 数据集中最大的。资料来源:EdNet:教育中的大规模分层数据集 ## 引文 ``` @inproceedings{choi2020ednet, title={Ednet: A large-scale hierarchical dataset in education}, author={Choi, Youngduck and Lee, Youngnam and Shin, Dongmin and Cho, Junghyun and Park, Seoyon and Lee, Seewoo and Baek, Jineon and Bae, Chan and Kim, Byungsoo and Heo, Jaewe}, booktitle={International Conference on Artificial Intelligence in Education}, pages={69--73}, year={2020}, organization={Springer} } ``` ## Download dataset :modelscope-code[]{type="git"}
魔搭社区 收录
MNIST数据集
数据规模 训练集:60,000 张手写数字图像(28×28 像素灰度图)及对应标签 34。 测试集:10,000 张图像与标签,用于模型评估 68。 数据来源 由美国国家标准与技术研究院(NIST)收集,50% 样本来自高中生手写,50% 来自人口普查局工作人员 48。 经 Yann LeCun 团队标准化处理,成为机器学习基准数据集 1011。
阿里云天池 收录
