相关数据集
PAQ (Probably Asked Questions)
可能问的问题 (PAQ) 是一个非常大的资源,包含 6500 万个自动生成的 QA 对。 PAQ 是 65M 自然语言 QA 对的半结构化知识库 (KB),模型可以记忆和/或学习从中检索。 PAQ 与传统 KB 的不同之处在于问题和答案以自然语言存储,并且生成的问题很可能出现在 ODQA 数据集中。 PAQ 是使用问题生成模型和维基百科自动构建的。
OpenDataLab2026-07-12 更新300
HSPACE (Human-SPACE)
目前,3d 人体传感技术的进步受到缺乏具有 3d 地面实况的视觉数据集的限制,包括多人,在运动中,在现实世界环境中操作,具有复杂的照明或遮挡,并可能被移动相机。复杂的场景理解需要估计人体姿势和形状以及手势,以实现最终将有用的度量和行为信号与自由视点照片般逼真的可视化能力相结合的表示。为了保持进步,我们构建了一个大型逼真的数据集 Human-SPACE (HSPACE),其中包含放置在复杂合成室内和
OpenDataLab2026-07-12 更新100
CVL-DataBase
CVL 数据库是一个用于作家检索、作家识别和单词识别的公共数据库。该数据库包含 7 种不同的手写文本(1 种德语和 6 种英语文本)。共有 310 位作者参与了该数据集。其中27人写了7篇文章,283名作家写了5篇文章。对于每个文本,包含手写文本和打印文本样本的 rgb 彩色图像 (300 dpi) 以及裁剪版本(仅手写)可用。唯一的 id 标识作者,而每个单词的边界框存储在 XML 文件中。
OpenXLab90



