登录后查看消息通知
遇见数据集
中国科学技术大学

中国科学技术大学

企业

中国科学技术大学成立于2022年,主营培养高等学历理工人才,促进科技发展、理学、工学、管理学、经济学、文学、法学等。面向变化检测、遥感图像分析、推荐系统等领域提供数据服务,开放ChangeNet(变化检测、遥感图像分析)、RecFlow(推荐系统、用户行为分析)、Job-SDF(职业技能预测、人力资源分析),支撑遥感监测与空间分析。

变化检测遥感图像分析推荐系统
成立于 2022 年安徽省https://www.ustc.edu.cn/

数据概览

970
数据集总量
20,805
总浏览量
0
关注人数
2026-08-29
最近更新
分类统计

相关机构

  • 河
    河北原创软件发展有限公司
    拥有数据集:4个
    企业
  • 智
    智慧足迹数据科技有限公司
    拥有数据集:309个
    企业
  • 重
    重庆大司空信息科技有限公司
    拥有数据集:274个
    企业
  • 中
    中国移动通信集团安徽有限公司
    拥有数据集:164个
    企业
  • 保
    保定数字城市投资发展集团有限公司
    拥有数据集:86个
    企业

数据集列表

PaperArena
自然语言处理
基准测试
PaperArena 是一个用于评估基于大型语言模型的智能体在科学文献上的工具增强推理能力的基准测试平台。数据集包含从顶级开放获取AI会议中抽取的数万篇论文,并使用多模态大语言模型自动生成了初始的问题-答案对,最终形成了784个高质量的问题-答案对。该数据集旨在模拟真实研究场景,要求智能体在跨多篇论文和协调多种工具的基础上回答复杂的研究问题。
arXiv2025-10-13 更新730
M3KG
医学知识图谱
放射学报告
M3KG是一个基于真实医学报告构建的大规模多模态医学知识图谱,包含2477个实体、3种关系、37424个三元组和6943个疾病感知视觉Tokens,用于CheXpert Plus数据集。它通过GPT-4o生成训练数据,并使用ReXKG进行实体和关系提取,构建了一个包含解剖结构、疾病、概念、设备、程序、尺寸和视觉Tokens等六种实体类型和修改、位于、提示三种关系类型的知识图谱。该数据集旨在为基于大型语言模型的放射学报告生成提供大规模知识图谱,解决现有医学知识图谱规模有限、多模态信息缺失和静态图谱无法支持多级知识关联等问题。
arXiv2025-08-05 更新1050
DramaAD
视频编辑
自动处理
DramaAD是一个新的基准数据集,包含超过800个简短的戏剧集和500个经过专业编辑的广告剪辑。该数据集旨在支持自动视频编辑研究,为研究者和企业提供有价值的参考。数据集的内容包括原始戏剧视频和编辑后的广告剪辑,旨在帮助研究者更好地理解视频内容并开发更有效的视频编辑技术。
arXiv2025-07-04 更新1920
AnySplat
3D场景重建
深度学习
AnySplat是一个基于Transformer的神经网络,旨在从未校准的多视角图像中快速进行3D场景重建。它通过预测一组3D高斯基元来表示场景,并在单个前向传递中预测所有内容,无需相机校准或场景优化。该模型在稀疏和密集视图场景中均表现出卓越的性能,并大大减少了渲染延迟。AnySplat在九个多样化和大规模的数据集上进行了训练,以处理各种几何和外观变化。该模型无需3D标注即可进行训练,使其能够扩展到不受约束的捕获场景中。
arXiv2025-05-30 更新1490
VideoSafetyBench (VSB-77k)
视频安全
自然语言处理
VideoSafetyBench (VSB-77k) 是首个针对视频大型语言模型安全的大型、文化多样性的基准测试,包含 77,646 个视频-查询对,涵盖 19 个主要风险类别,跨越 10 个语言社区。该数据集旨在帮助研究者系统地研究视频大型语言模型的安全性问题,并为视频大型语言模型的安全防御提供参考。
arXiv2025-05-22 更新960
TNLLT
视觉目标跟踪
视频分析
TNLLT是一个大规模的长时视觉-语言跟踪基准数据集,包含200个视频序列,其中150个用于训练,50个用于测试。数据集由研究人员从视频网站收集,主要涉及电视、电影、游戏、娱乐、纪录片等。研究人员对裁剪的视频进行了细致的矩形框标注,并标注了对象的视觉外观、运动和其他线索的语言描述。这些视频涵盖了与视觉-语言跟踪相关的15个挑战因素。该数据集为视觉-语言跟踪任务的研究提供了一个坚实的基础。
arXiv2025-08-07 更新680
Security Tensors Dataset
视觉语言模型
安全性增强
Security Tensors数据集是为了训练可训练的输入向量,称为安全张量,这些张量能够在推理过程中通过文本或视觉模态应用,以增强大型视觉语言模型(LVLM)的安全性。数据集包含恶意图像-文本对、对比性良性对以及一般良性样本,旨在训练模型识别和拒绝有害的视觉输入,同时保持对良性任务的性能。数据集通过精心设计,确保安全张量能够有效地将文本安全机制扩展到视觉模态,解决跨模态安全对齐的挑战。
arXiv2025-07-29 更新80
Dataset for "Latitudinal distribution of thermospheric density: Interplay of thermal expansion and circulation"
This dataset contains DE2 temperature and CHAMP mass density observation data normalized to an altitude of 400 km, as well as TIEGCM model simulation data for comparison with the observations. This dataset can be read through Matlab, and the plotting program is also included in the folder. The dataset is mainly used to investigate the mechanisms of the latitudinal variation of the thermospheric total mass density.
科学数据银行2025-06-10 更新10
Waymo Motion dataset
自动驾驶
轨迹生成
该数据集基于Waymo Motion数据集,增加了详尽的帧级元动作标注,用于支持自动驾驶系统中的可控轨迹生成。数据集采用自回归元动作框架,将传统的长时间间隔元动作分解为帧级元动作,确保了轨迹段与其对应元动作之间的严格对齐,从而在整个轨迹跨度内实现了一致和统一的任务表述。数据集旨在解决现有框架中元动作与实际行为轨迹之间的时间错位问题,通过实验验证了该框架在轨迹适应性和动态决策场景中的响应性。
arXiv2025-05-30 更新3020
BinMetric
二进制分析
逆向工程
BinMetric是一个全面的数据集,用于评估大型语言模型在二进制分析任务上的性能。该数据集包含来自20个真实开源项目的1000个问题,涵盖了6个实际二进制分析任务,包括反编译、代码摘要、汇编指令生成等,反映了实际的逆向工程场景。数据集的设计考虑了真实二进制分析场景的复杂性,旨在提供一个标准化的评估框架,以评估大型语言模型在关键领域的有效性。
arXiv2025-05-12 更新1440
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索