174个领域的科学大模型训练网页语料数据该数据知识产权用于多领域科学基座大语言模型的训练,使其可以学习各领域的专业术语、概念和语义信息,从而具备处理各学科自然语言处理任务的能力,助力科学家进行学术研究,回答不同领域问题,并可为长篇论文生成不同长度的摘要,适应会议提交或快速浏览等场景。将中文论文自动翻译为各种语言并保持术语准确性,促进跨语言科研交流。该数据也可以用于构建智能文献检索系统,从而使科学大模型能够具备地学文献检索的能力,为研究人员提供个性化的文献推荐服务,提高文献获取效率。1. 从公开的FineWeb和DCLM数据集进行采集
2. 将与科学相关的,如生物、化学等网页数据的域名及内容,保存为特定格式,如csv等格式
3. 通过相关学科数据,使用Fasttext算法训练学科分类器,对FineWeb语料进行学科网页域名召回,并得到文本内容、语言分类、语言得分和学科分类。
4. 对召回网页的域名进行域名聚合、域名筛选及评估,对学科分类器进行迭代优化,从而得到更多召回的网页数据,及优化的文本内容、语言分类、语言得分和学科分类。
5. 对召回后的网页数据通过Gopher Repetition、Gopher Quality、C4 Quality、 FineWeb Quality的算法进行质量过滤
6. 对质量过滤后的数据,基于Minhash对文档进行签名计算,使用LSH将相似文档分组,进行针对文档级别相似性去重。
7. 将去重后的数据进行tokenizer转化,得到token数。
8. 最终数据包含文本内容、语言分类、语言得分、token数及学科分类。
多语言、高精度的地学大模型训练语料数据该数据知识产权数据量大于30万条。能够直接用于地学领域大语言模型训练,使其可以学习地学领域的专业术语、概念和语义信息,从而具备处理各种地学自然语言处理任务的能力,如文献分类、创新点挖掘、专业知识问答等。此外,利用该该数据知识产权可以构建一个大规模的地学知识图谱。通过实体识别和关系抽取技术,从论文标题、摘要和正文中提取地学领域的关键实体(如地质构造、岩石类型、矿物成分等)及其相互关系,形成结构化的知识网络。知识图谱结合检索增强生成能够使地学大模型生成更准确、更个性化的响应,从而帮助研究人员快速了解地学领域的研究现状、发现知识空白,并促进跨学科的研究合作。该数据知识产权也可以用于构建智能文献检索系统,从而使地学大模型能够具备地学文献检索的能力,为研究人员提供个性化的文献推荐服务,提高文献获取效率。1. 从互联网数据开放管理平台,比如spring nature等网站,广泛收集地球科学领域允许公开访问的论文数据集。
2. 对论文数据集做清洗和去重。清洗规则为没有标题或标题无意义(比如Untitled)、没有摘要、标题与摘要相等;去重规则为DOI(数字对象唯一标识)相等或者标题、期刊、年份全部相等。
3. 对论文的PDF(可携带文件格式)内容进行预处理,包括拆分、矫正、对齐和增强。
4. 对论文的PDF内容进行内容解析。包含版面分析和内容识别。版面分析包括基于文本解析的版面分析和基于视觉解析的版面分析两种。内容识别包括文本识别、表格识别、图片识别和公式识别。对每页图片应用目标检测技术,获取段落、公式、表格、图片等文档元素的位置和分类标签;对段落区域应用OCR(光学字符识别)技术,获取段落文本;对公式区域应用公式检测技术,获取公式latex表达;对表格区域应用表格识别技术,得到表示latex表达;根据坐标和识别结果,对所有内容进行合并,得到文本markdown。
5. 对论文的PDF内容进行后处理。后处理的步骤包括:数据清洗、信息过滤、内容去重、文档结构化。对于CPT(继续预训练)数据的后处理方法包括:去重、基于大模型的表格公式修复、页眉页脚去除、语言过滤、乱码去除、主题筛选(基于知识图谱或其他方式)。对于SFT(监督微调训练)数据的后处理方法主要包括基于解析后的markdown文本内容,利用大模型生成对话标注数据。
6. 将论文元数据与解析结果格式文件内容进行一一对应,形成用于地学大模型训练的语料数据,数据量为30万条左右。
7. 使用产出的论文元数据和解析结果对地学大模型进行训练。
衍射光栅的衍射效率数据针对目前硅光集成芯片端口少、集成度低、功耗大等难题,本课题将构建支持多材料体系异质集成加工与多维度光场测试的全光神经网络计算芯片研制平台,开展大规模可重构全光衍射神经网络计算芯片的试制与评测研究。该数据集记录了设计的衍射光栅衍射效率情况
异构硬件融合的分布式机密计算平台数据集围绕异构硬件融合的分布式机密计算平台,本数据集系统汇集了在真实测试环境下生成的功能性与安全性实验数据。数据依托支持 CPU、GPU、可信执行环境(TEE)及存算融合芯片的异构硬件分布式可扩展机密计算平台,通过第三方测试大纲规范开展测试,覆盖结构化数据、图像数据、文本数据和图数据等多模态场景,以及TB级数据规模和亿级样本规模的联邦学习训练与推理过程。数据内容主要包括模型训练与测试过程中的准确率指标(如训练集ACC、测试集ACC)、总体运行时间日志等。数据采集时间为2026年1月,采集地点为之江实验室,实验在多类服务器环境中完成,相关硬件配置、操作系统及软件环境均有完整记录。数据以日志文件形式存储,格式为 *.log,总数据量约 97.8 MB,采用完全共享方式发布。该数据集真实反映了异构硬件环境下分布式机密计算平台在性能、可扩展性与安全性方面的综合表现,可为机密计算体系结构验证、联邦学习安全研究以及多行业密态应用评估提供重要的数据基础和实验依据。
基于内生安全交换机的拟态调度裁决系统执行过程数据集基于内生安全交换机的拟态调度裁决系统执行过程数据集,数据集编号:2020YFB1804604-001,对应考核指标4.1:提供交换机拟态调度系统,考核指标4.2:支持4种拟态裁决策略。
数据集内容:
交换机拟态调度系统的执行过程数据,数据包括交换机中调度裁决系统所产生的裁决过程日志等数据。内含1个数据集说明文件,1个*.log数据文件。
数据来源:数据集由之江实验室提供。
开放式、多任务地学专业知识问答对数据该数据知识产权数据的总数大于50万条,能够直接用于地学领域大模型训练,使其学习地学领域专有的知识结构和表达术语,从而具备在地质、气候、环境等多个子学科领域上的文本任务处理和复杂问题推理能力。面相全球科研工作者打造开源开放的专业地学领域大语言模型,通过简单自然语言指令即可实现复杂地学科研任务的高效及时处理。该数据集不仅支持科研、教育、决策等多种应用场景,还能通过大模型助手工具在矿产勘探、环境监测等实际场景中发挥重要作用,推动地学领域的技术创新和知识传播。1. 从全球OA地学期刊中采集英文论文摘要,筛选保留标题与摘要内容完整且非空的样本,并通过标题去重,构建地学领域基础数据库。
2. 基于大规模语言模型自动抽取摘要信息和实体,通过实体重叠度和摘要相似性构建地学知识图谱。
3. 利用知识图谱和大规模语言模型自动生成多样化的提问角色和场景,涵盖单源和多源的事实型、推理型、应用型等不同类型问题,并通过上下文关联算法生成准确的答案,构建初始问答对数据集。
4. 对问题进行地学领域的二分类判断,并分析地学二级学科的分布,剔除偏离地学领域的边缘问题。
5. 构建五维评价模型:专业度(学科知识准确性)、清晰度(表述明确无歧义)、研究价值(反映学科前沿)、聚焦程度(问题边界清晰)、难度(逻辑推理分级),进行综合评分,保留各维度评分均大于60%的高质量问答对作为最终输出。
大规模、多模态、多任务的天基遥感大模型指令微调数据该数据知识产权数据的总数大于7000万条,能够直接用于天基多模态遥感大模型训练,使其具备图像、区域和像素3个层级、14种细分遥感视觉任务的统一处理能力。打造基于视觉-语言架构的高鲁棒、高性能的星上遥感大模型,通过简单自然语言指令即可实现复杂的遥感任务即时处理。依托“三体计算星座”,在轨部署该天基遥感大模型,大大简化星上任务处理流程,提升在轨处理精度。该模型可应用于全球对地观测,例如地表异常灾害监测,重点海域船舶流量统计等。1. 从互联网数据开放管理平台广泛收集遥感领域的原始数据集。
2. 对影像中带有的数据源标识、采样时间等进行过滤脱敏处理。
3. 人工+算法审查数据,对不符合要求、质量过低的原始数据进行剔除处理。
4. 设计新的标注体系与标准化转换算法,对原始数据集中不同任务、不同格式的标注文件转化为统一格式的标准化标注。
5. 对图像尺寸进行标准化,并设计标注修复算法,对图像裁剪后导致的标注截断问题进行修复。
6. 提出基于大模型的对话生成算法并制定对话模板,对全量数据进行处理,构建指令微调数据集。其中,每条数据包含图像地址、问题指令以及问题答案,总量大于7000万条。
7. 使用产出的指令微调数据集进行模型训练。模型基于视觉-语言模型架构,实现14种多模态遥感任务的统一处理。其中,图像级任务包含分类(IMG_CLS)、简短描述(IMG_CAP)、详细描述([IMG_CAP_DETAILED])、计数([IMG_CT])、视觉问答([IMG_VQA]);区域级任务包含水平框分类([REG_CLS_HBB])、旋转框分类([REG_CLS_OBB])、区域级描述([REG_CAP])、水平框检测([REG_DET_HBB])、旋转框检测([REG_DET_OBB])、视觉定位([REG_VG]);像素级任务包含像素级分类([PIX_CLS])、分割([PIX_SEG])、变化检测([PIX_CHG])
杭州之江实验室多模态智慧网络原理平台多模态寻址路由数据集本数据集采集多模态智慧网络原理平台(简称:多模态原理平台)中多样化应用的多模态寻址路由数据报文,原理平台包括10个网络自治域,共计110余个网络节点,网络节点包括3类实体核心级多模态网元设备、3类实体接入级多模态网元设备和1类虚拟网元设备构成,网络节点通过虚实结合的组网方式部署,多模态原理平台网络拓扑如图1所示。多样化应用数据为采用多种不同网络模态传输的业务数据,不同网络模态通过不同网络标识进行寻址路由,其中包括IP标识、身份标识、内容标识和地理位置标识等。多样化业务皆从同一个网络自治域中发起(混合模态自治域),业务包括浏览网页、视频点播、即时聊天、地理定位寻址等 ,数据包在该自治域与核心网的多模态网元出入口处通过wireshark工具进行抓取。
杭州某区车辆轨迹与路口流量预测模拟数据交通流量预测是智慧交通系统(ITS)实现高效治理的核心基础。然而,在实际部署中,基于轨迹与视频数据的智慧交通系统常面临数据稀疏性与严峻的隐私安全风险双重挑战。针对上述问题,本研究根据整合的杭州市多区域、全时段的出租车轨迹、路口视频、路侧监测等多模态数据,通过标准化的预处理流程,构建了一个面向安全流量预测场景的综合性交通模拟数据集。针对隐私安全需求,本数据集在整理加工全流程中引入可信执行环境(TEE)技术,通过硬件级隔离确保数据“可用不可见”,显著提升了系统在实际应用中的安全性与可信度。鉴于原始交通数据涉密,本研究严格按照原始数据的结构与统计分布特征,在本地高性能服务器上生成了同等规模的模拟数据进行公开。本数据集能够有效支撑复杂交通场景下的高精度预测算法研发,并为智能交通系统的安全部署、硬件选型及机密计算交叉学科研究提供标准化的基准参考与技术示范。