两汉三国历史文本地名时空分布与词频数据集本数据集面向两汉至三国时期历史文本中的地名时空分布与共现网络研究,以《汉书》《后汉书》《三国志》人物列传文本为基础,整理人物原文本、生卒年、活动时间估算值和D1-D10时期编码,并汇总各历史地名在十个时期内的文本词频及经纬度坐标。地名筛选范围以刺史部和郡国层级为主,排除了大部分西域地区及难以统一坐标的边缘地名。数据包含“地名时期词频”和“原文本”两张表,可用于历史地理、数字人文、文本挖掘、地名共现关系和州郡网络演化分析。
老年人汉语言语清晰度及纯音听力测试数据集本数据集包含 1022 条汉语噪声混响环境言语清晰度测试记录、50 条双耳纯音听力测试记录,总计 1072 条有效实验数据。受试分为青年对照组(22-27 岁正常听力)、老年组(60-82 岁不同程度听力损失),涵盖志愿者基础信息、双耳 PTA 均值、7 档混响时长、2 级背景噪声、多梯度信噪比及言语清晰度得分。可用于老年听障评估、室内声学言语感知、降噪助听设备优化、语音康复算法建模等声学与耳鼻喉科科研、临床应用。
石墨烯薄膜XRD衍射特征参数表该数据集聚焦石墨烯基导热薄膜低能耗制备与性能研究,包含 GO、RGO-HI、RGO-1600、RGO-2600 四类薄膜 (002) 晶面 XRD 定量数据,统一收录 2θ 衍射角与四组样品对应衍射强度。 实验依托改良 Hummers 法制备氧化石墨烯,依次开展碘化氢液相预还原、1600℃碳化、2600℃焦耳热快速石墨化多道工序,通过 X 射线衍射定量分析各工艺对片层间距、晶格有序度、缺陷密度的调控规律。 数据完整记录薄膜从高度氧化无序向标准石墨晶体转变的全过程,区别于仪器原始图谱,是四组样品按相同2θ 步长对齐重采样后形成的结构化数据集,构建了涵盖从高度氧化无序到接近标准石墨晶体完整演变链条的横向对比数据集,实现了对石墨化进程的数字化标定,避免人工对比多张谱图的误差。通过统一格式对比,可量化 2600℃焦耳热相对于 1600℃碳化在层间距缩短上的增益,支撑低能耗工艺优化与构效关系分析。 本数据集有两大特点:1.数据记录完整,呈现了薄膜从高度氧化无序状态向接近标准石墨晶体状态转变的完整结构演变过程;2.数据处理有创新性,非仪器原始图谱,而是将四组数据按相同步长对齐重采样后形成的结构化数
entangled mixed-state datasets该数据集是由华南理工大学的研究团队利用监督量子机器学习和可集中纠缠度量方法生成的纠缠混合态数据集。数据集的构建旨在用于量子机器学习模型的基准测试,特别是用于纠缠-可分离分类任务。文章中提到使用三种不同的参数化量子电路生成了具有所需分布的纠缠混合态,但未具体说明数据集的大小、数据量等信息。
华南理工大学专利价值评估数据集本数据集以华南理工大学专利申请数据为核心原始数据源,聚焦高校专利价值量化评估需求,构建标准化专利价值评估体系与专用数据集。 数据集在专利基础字段的基础上,重点针对转移转化需求构建特色评价指标字段,结合申请/维持年份、权利要求项数量作为辅助维度开展专利价值特征解析,创新性采用“与或图”的分数叠加法,构建可快速量化的专利价值评分体系,实现专利价值标准化分级赋值。 数据集涵盖专利申请号、标题、申请人、申请日期、专利类型、法律状态、发明人等结构化字段,经全流程数据清洗、标准化处理与价值分级赋值后形成,可支撑高校高价值专利筛选、专利分级分类、科研成果转化、知识产权运营决策、学科技术布局优化等场景,为高校知识产权管理与科研创新建设提供标准化数据支撑。
机器人焊接电弧动态行为识别与偏吹矫正控制数据集本数据集来源于自主搭建的焊接机器人电弧视觉实验平台,在不同焊接工况下采集形成,并经数据筛选、质量校验、人工标注、特征提取及统一关联加工构建而成。数据集由原始焊接电弧图像、JSON标注文件和Excel特征数据组成。 其中,原始图像真实记录了焊接过程中电弧形态及磁偏吹状态;JSON标注文件包含电弧目标框、电弧轮廓、钨针轮廓、钨针尖端关键点及电弧底端关键点等标注信息;Excel特征数据由标注数据进一步计算生成,包含钨针中心坐标、钨针尖端坐标、电弧质心坐标、磁偏吹角度、磁偏吹方向等几何特征参数,实现了原始图像、标注数据与特征数据的统一关联。 该数据集可广泛应用于焊接电弧磁偏吹智能识别、目标检测、图像分割、特征分析、状态监测、偏吹量化评估、智能控制及人工智能算法训练等研究,为智能焊接技术的发展提供高质量数据支撑。
MVISU-BenchMVISU-Bench是一个面向真实世界任务的双语基准数据集,包含了跨越137个移动应用程序的404个任务,涵盖了多应用、模糊、交互式、单应用和不道德指令五个类别。数据集的构建基于用户问卷调查,并通过专家设计的提示和LLM生成指令,经过多轮过滤和人工验证,确保了数据集的多样性和可靠性。MVISU-Bench旨在评估和提升视觉语言模型(VLM)在移动智能体领域的性能,并解决现有数据集在真实世界场景中应用的局限性。
PDCs数据集PDCs数据集是由华南理工大学等机构构建的,用于探索肽-药物偶联物(PDCs)的结构-活性关系和活性预测的基准数据集。该数据集包含834个抗癌PDCs的结构和活性标签,涵盖了广泛的结构多样性和化学空间。数据集的构建过程严谨,每个条目包含三个关键组成部分:肽序列、连接剂SMILES和载荷SMILES。该数据集旨在解决PDCs设计的复杂性和缺乏系统性预测工具的问题,为开发新的PDCs药物提供了重要的数据基础。
Explainable Tampered Text Detection (ETTD)ETTD数据集是由华南理工大学和蚂蚁集团联合创建的,旨在支持可解释的篡改文本检测任务。该数据集包含21000张图像,其中包括11000张经过篡改的文本图像和10000张真实文本图像,涵盖多语言卡片、文档和场景文本等多种场景。数据集通过多种篡改方法(如复制移动、拼接和生成文本编辑)生成,并使用Poisson Blending技术减少视觉不一致性。数据集的创建过程包括从互联网和现有数据集中收集图像,进行文本篡改,并使用GPT4o生成异常描述。ETTD数据集主要应用于信息安全领域,旨在解决文本图像篡改检测中的黑箱问题,提供可靠的预测和解释。