登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
矿山大模型预训练语料数据集
矿山大模型预训练语料数据集
收藏
德阳大数据交易所
2025-12-26 更新
2026-01-30 收录
矿山
预训练语料
数据链接:
https://www.dysdsj.com/dataContent?id=2004454288715227138&moduleLabel=dataZone
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
应用场景:
提供机构:
四川省自然资源数字科技有限责任公司
创建时间:
2025-12-26
搜集汇总
数据集介绍
背景与挑战
背景概述
该数据集是专为矿山大模型预训练设计的语料资源,适用于生成式人工智能应用的知识增强检索。数据覆盖四川省范围,更新频率为定时,购买方式按token数计费,并附有严格的购买限制,如不可转售、不可公开、不可加工和不可留存。
以上内容由遇见数据集搜集并总结生成
相关数据集
Anna’s Archive
学术论文
预训练语料
arXiv语料库是一个编纂了涵盖物理学、数学、计算机科学、生物学和定量经济学等领域论文预印本的网站。自1991年运营以来,该资源库收录了用LATEX编写的论文。许多预训练语料库都从这个存储库中获取学术材料数据。
arXiv
223
0
FuLG
预训练语料
罗马尼亚语处理
FuLG数据集由布加勒斯特理工大学开发,是一个包含1560亿个token的罗马尼亚语预训练语料库。该数据集从CommonCrawl中提取,经过去重和内容过滤等处理步骤,确保数据质量和多样性。创建过程包括使用FastText进行语言识别和CCNet进行数据处理。FuLG主要用于提升罗马尼亚语在大型语言模型中的表现,解决该语言在现有模型中代表性不足的问题。
arXiv
2024-07-19 更新
56
0
DeMix_Corpora
预训练语料
混合数据
DeMix Corpora 是一个全面、高质量、大规模且经过精心混合的资源,可直接用于预训练。该数据集包含15T原始令牌和22T混合令牌,旨在解决现有通用语料库缺乏领域特定强度,而专业语料库又不适用于通用预训练的问题。DeMix Corpora 通过提供经过验证的最佳数据混合比例,平衡了通用语言能力和在复杂任务(如数学推理和代码生成)上的强大性能。数据集结构包括三个部分:用于复现结果的组件模型和参
Hugging Face
2026-02-04 更新
42
0
opencsg/chinese-fineweb-edu
领域自然语言处理
预训练语料
Chinese Fineweb Edu 数据集是一个精心构建的高质量中文预训练语料数据集,专为教育领域的自然语言处理任务设计。该数据集通过严格的筛选和去重流程,利用少量数据训练打分模型进行评估,从海量的原始数据中提取出高价值的教育相关内容,确保数据的质量和多样性。最终,数据集包含约90M条高质量的中文文本数据,总大小约为300GB。
Hugging Face
2025-12-12 更新
67
0
CLUECorpus2020
自然语言处理
预训练语料
通过对Common Crawl的中文部分进行语料清洗,最终得到100GB的高质量中文预训练语料。可直接用于预训练、语言模型或语言生成任务,并发布专用于简体中文NLP任务的小词表。
github
2024-05-20 更新
54
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广