遇见数据集

CoVA (CoVA dataset for Webpage Object Detection / Information Extraction)

收藏
OpenXLab2026-04-18 收录
官方服务:

资源简介:

我们标记了跨越 408 个域(亚马逊、沃尔玛、Target 等)的 7,740 个网页截图。这些网页中的每一个都只包含一个标有价格、标题和图像的标签。所有其他 Web 元素都标记为背景。平均而言,一个网页中有 90 个 Web 元素。 网页截图和边界框可以在这里获取 训练验证测试拆分 我们创建了一个跨域拆分,以确保每个训练集、验证集和测试集都包含来自不同域的网页。具体来说,我们根据不同域的数量构建了一个 3 : 1 : 1 的分割。我们观察到排名前 5 的域名(基于样本数量)是 Amazon、EBay、Walmart、Etsy 和 Target。因此,我们为 5 折交叉验证创建了 5 个不同的拆分,以便每个主要域都存在于测试数据的 5 个拆分之一中。

提供机构:
OpenDataLab
创建时间:
2022-06-07
二维码
社区交流群
二维码
科研交流群
商业服务