相关数据集
pt-sk/Maths-Grade-School
该数据集名为Maths-Grade-School,包含近一百万条指令,涵盖了多个数学领域,如微积分、概率、代数、线性代数、三角学、微分方程、向量微积分、逻辑、复数、数学谜题、分数、算术和圆几何等。数据集的目的是为希望加深对数学理解和训练大型语言模型(LLMs)的学生和研究人员提供全面的资源。
Hugging Face2024-05-22 更新200
pt-sk/Python_Datasets
这些数据集已经使用默认的llama2分词器进行了分词处理,且没有添加任何特殊标记(如bos或eos),并以二进制格式存储。这些数据集可以直接用于数据加载器中。
Hugging Face2024-06-26 更新150
pt-sk/food101
该数据集名为Food-101,主要用于图像分类任务。数据集包含101种食物类别,共计101,000张图片。每个类别包含750张训练图片和250张经过人工审核的测试图片。训练图片未经过清洗,可能包含噪声,如颜色过于鲜艳或标签错误。所有图片的最大边长被调整为512像素。数据集的语言为英语,且为单语种。数据集的创建者和注释者均为众包。数据集的规模在10K到100K之间。数据集的来源为扩展的Foodspo
Hugging Face2024-07-06 更新100
pt-sk/research_papers_short
该数据集包含机器学习领域的ArXiv论文。数据集是对原始数据集的一个版本,原始数据集来自Kaggle的ArXiv论文数据集。处理源数据的三个步骤包括:无用列的移除、训练测试集的分割以及文本中换行符和多余空格的去除。
Hugging Face2024-05-06 更新170
pt-sk/ml_research_abs
COVID-19和SARS-CoV-2研究论文数据集是一个包含与COVID-19和SARS-CoV-2病毒相关的研究论文的集合。该数据集提供了论文的标题、摘要、期刊、出版日期、作者和DOI等信息。数据集大小为2,477,946字节,包含1,035个样本,下载大小为1,290,257字节,使用Apache-2.0许可证。数据集分为训练集,包含所有1,035个样本。该数据集可用于文本挖掘、自然语言处理
Hugging Face2024-05-23 更新140



