登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
mlfoundations/dclm-pool-1b-1x
mlfoundations/dclm-pool-1b-1x
收藏
Hugging Face
2024-08-12 更新
2024-06-29 收录
数据链接:
https://hf-mirror.com/datasets/mlfoundations/dclm-pool-1b-1x
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-4.0 ---
许可证:知识共享署名4.0(CC BY 4.0)
应用场景:
提供机构:
mlfoundations
相关数据集
mlfoundations/dclm-baseline-1.0-parquet
语言模型
数据集
DCLM-baseline是一个包含4万亿个标记和30亿个文档的预训练数据集,旨在作为DCLM基准的研究基线。该数据集展示了数据整理在训练高性能语言模型中的重要性。数据集是从Common Crawl数据中经过一系列清洗、过滤和去重步骤创建的,主要用于研究目的,不适用于生产环境或特定领域(如代码和数学)。
Hugging Face
2024-07-19 更新
36
0
mlfoundations/MINT-1T-PDF-CC-2023-06
多模态学习
预训练模型
MINT-1T是一个开源的多模态交错数据集,包含1万亿文本标记和34亿张图像,旨在促进多模态预训练研究。数据集由华盛顿大学与Salesforce Research等机构合作创建,涵盖了HTML、PDF和ArXiv文档等多种来源。数据集经过严格的过滤和处理,以确保内容的质量和相关性。尽管数据集主要用于研究,但用户在使用时应注意潜在的数据偏见、内容风险和伦理问题。
Hugging Face
2024-09-19 更新
22
0
mlfoundations/datacomp_medium
图像处理
文本分析
该存储库包含DataComp Medium Pool的元数据文件。有关如何使用这些元数据的详细信息,请访问我们的网站和GitHub存储库。我们在标准的Creative Common CC-BY-4.0许可证下分发图像URL-文本样本和元数据。单个图像受其自身版权保护。
Hugging Face
2023-08-21 更新
14
0
mlfoundations/MINT-1T-PDF-CC-2024-10
多模态学习
预训练模型
MINT-1T是一个开源的多模态数据集,包含1万亿文本标记和34亿张图像,是现有开源数据集规模的10倍。该数据集旨在促进多模态预训练研究,涵盖了HTML文档、PDF文档和ArXiv论文等多种来源。数据集由华盛顿大学与Salesforce Research等机构合作创建,经过严格的文档提取、过滤、图像处理和文本处理等步骤,并使用了多种开源工具。尽管数据集经过严格过滤,但仍可能存在一些敏感信息,用户在
Hugging Face
2024-09-19 更新
33
0
mlfoundations/MINT-1T-PDF-CC-2023-23
多模态学习
预训练模型
MINT-1T是一个开源的多模态交错数据集,包含1万亿文本标记和34亿张图像,是现有开源数据集的10倍规模。数据集旨在促进多模态预训练研究,数据来源于HTML文档、PDF文档和ArXiv论文。数据处理包括文档提取、过滤、图像和文本处理等步骤,以提高数据集的质量和适用性。数据集由华盛顿大学与Salesforce Research及其他学术机构合作创建。
Hugging Face
2024-09-19 更新
19
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广