PaperArenaPaperArena 是一个用于评估基于大型语言模型的智能体在科学文献上的工具增强推理能力的基准测试平台。数据集包含从顶级开放获取AI会议中抽取的数万篇论文,并使用多模态大语言模型自动生成了初始的问题-答案对,最终形成了784个高质量的问题-答案对。该数据集旨在模拟真实研究场景,要求智能体在跨多篇论文和协调多种工具的基础上回答复杂的研究问题。
M3KGM3KG是一个基于真实医学报告构建的大规模多模态医学知识图谱,包含2477个实体、3种关系、37424个三元组和6943个疾病感知视觉Tokens,用于CheXpert Plus数据集。它通过GPT-4o生成训练数据,并使用ReXKG进行实体和关系提取,构建了一个包含解剖结构、疾病、概念、设备、程序、尺寸和视觉Tokens等六种实体类型和修改、位于、提示三种关系类型的知识图谱。该数据集旨在为基于大型语言模型的放射学报告生成提供大规模知识图谱,解决现有医学知识图谱规模有限、多模态信息缺失和静态图谱无法支持多级知识关联等问题。
DramaADDramaAD是一个新的基准数据集,包含超过800个简短的戏剧集和500个经过专业编辑的广告剪辑。该数据集旨在支持自动视频编辑研究,为研究者和企业提供有价值的参考。数据集的内容包括原始戏剧视频和编辑后的广告剪辑,旨在帮助研究者更好地理解视频内容并开发更有效的视频编辑技术。
AnySplatAnySplat是一个基于Transformer的神经网络,旨在从未校准的多视角图像中快速进行3D场景重建。它通过预测一组3D高斯基元来表示场景,并在单个前向传递中预测所有内容,无需相机校准或场景优化。该模型在稀疏和密集视图场景中均表现出卓越的性能,并大大减少了渲染延迟。AnySplat在九个多样化和大规模的数据集上进行了训练,以处理各种几何和外观变化。该模型无需3D标注即可进行训练,使其能够扩展到不受约束的捕获场景中。
VideoSafetyBench (VSB-77k)VideoSafetyBench (VSB-77k) 是首个针对视频大型语言模型安全的大型、文化多样性的基准测试,包含 77,646 个视频-查询对,涵盖 19 个主要风险类别,跨越 10 个语言社区。该数据集旨在帮助研究者系统地研究视频大型语言模型的安全性问题,并为视频大型语言模型的安全防御提供参考。
TNLLTTNLLT是一个大规模的长时视觉-语言跟踪基准数据集,包含200个视频序列,其中150个用于训练,50个用于测试。数据集由研究人员从视频网站收集,主要涉及电视、电影、游戏、娱乐、纪录片等。研究人员对裁剪的视频进行了细致的矩形框标注,并标注了对象的视觉外观、运动和其他线索的语言描述。这些视频涵盖了与视觉-语言跟踪相关的15个挑战因素。该数据集为视觉-语言跟踪任务的研究提供了一个坚实的基础。
Security Tensors DatasetSecurity Tensors数据集是为了训练可训练的输入向量,称为安全张量,这些张量能够在推理过程中通过文本或视觉模态应用,以增强大型视觉语言模型(LVLM)的安全性。数据集包含恶意图像-文本对、对比性良性对以及一般良性样本,旨在训练模型识别和拒绝有害的视觉输入,同时保持对良性任务的性能。数据集通过精心设计,确保安全张量能够有效地将文本安全机制扩展到视觉模态,解决跨模态安全对齐的挑战。
Waymo Motion dataset该数据集基于Waymo Motion数据集,增加了详尽的帧级元动作标注,用于支持自动驾驶系统中的可控轨迹生成。数据集采用自回归元动作框架,将传统的长时间间隔元动作分解为帧级元动作,确保了轨迹段与其对应元动作之间的严格对齐,从而在整个轨迹跨度内实现了一致和统一的任务表述。数据集旨在解决现有框架中元动作与实际行为轨迹之间的时间错位问题,通过实验验证了该框架在轨迹适应性和动态决策场景中的响应性。
BinMetricBinMetric是一个全面的数据集,用于评估大型语言模型在二进制分析任务上的性能。该数据集包含来自20个真实开源项目的1000个问题,涵盖了6个实际二进制分析任务,包括反编译、代码摘要、汇编指令生成等,反映了实际的逆向工程场景。数据集的设计考虑了真实二进制分析场景的复杂性,旨在提供一个标准化的评估框架,以评估大型语言模型在关键领域的有效性。