遇见数据集

cjfcsjt/WebSRC-flat

收藏
Hugging Face2024-04-24 更新2024-06-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: qas list: - name: answers list: - name: answer_start dtype: int64 - name: element_id dtype: int64 - name: text dtype: string - name: id dtype: string - name: question dtype: string - name: page_id dtype: string - name: Image dtype: image - name: domain dtype: string splits: - name: train num_bytes: 22537566 num_examples: 497 - name: validation num_bytes: 4140875 num_examples: 97 download_size: 23191386 dataset_size: 26678441 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* license: cc-by-4.0 task_categories: - question-answering language: - en --- For more details, please refer to paper [WebSRC: A Dataset for Web-Based Structural Reading Comprehension](https://arxiv.org/abs/2101.09465).

该数据集用于基于网页的结构化阅读理解任务,包含问答对、页面ID、图像和领域信息。问答对进一步包含答案、ID和问题。数据集分为训练集和验证集,分别包含497和97个示例。数据集的下载大小为23191386字节,数据集大小为26678441字节。数据集的许可证为cc-by-4.0,任务类别为问答,语言为英语。

提供机构:
cjfcsjt
原始信息汇总

数据集概述

数据集特征

  • qas:
    • answers:
      • answer_start: 数据类型为 int64
      • element_id: 数据类型为 int64
      • text: 数据类型为 string
    • id: 数据类型为 string
    • question: 数据类型为 string
  • page_id: 数据类型为 string
  • Image: 数据类型为 image
  • domain: 数据类型为 string

数据集分割

  • train:
    • num_bytes: 22537566
    • num_examples: 497
  • validation:
    • num_bytes: 4140875
    • num_examples: 97

数据集大小

  • download_size: 23191386
  • dataset_size: 26678441

配置

  • config_name: default
    • data_files:
      • split: train, path: data/train-*
      • split: validation, path: data/validation-*

许可证

  • license: cc-by-4.0

任务类别

  • task_categories: question-answering

语言

  • language: en
搜集汇总
数据集介绍
构建方式
WebSRC-flat数据集源于WebSRC项目,旨在推动基于网页结构的阅读理解研究。其构建过程依托于从真实网页中提取的结构化信息,通过将网页解析为元素级别的表示,并针对每个页面设计问答对。每个样本包含问题、答案文本、答案起始位置及对应的元素标识符,同时保留页面标识、图像和领域标签。数据集划分为训练集(497例)和验证集(97例),以支持模型训练与评估。
特点
该数据集的核心特点在于其扁平化的结构设计,将网页中的复杂嵌套元素转化为线性序列,便于模型直接处理。每个问答对均关联到具体的网页元素,使得模型能够学习从结构化文档中定位答案。此外,数据涵盖多个领域,并包含图像信息,增强了多模态理解的潜力。标注的答案起始位置提供了精确的监督信号,适用于抽取式问答任务。
使用方法
使用WebSRC-flat时,用户可通过HuggingFace数据集库直接加载,指定配置文件为'default',并选择'train'或'validation'分片。数据以字典形式提供,包含问题、答案列表、页面ID、图像及领域字段。适用于基于Transformer的阅读理解模型,如BERT或RoBERTa,通过将问题与扁平化网页文本拼接进行训练。评估时,可计算精确匹配和F1分数以衡量答案抽取性能。
背景与挑战
背景概述
在自然语言处理领域,从结构化网页中提取精确信息以回答复杂问题,是推动智能问答系统发展的关键方向。WebSRC-flat数据集由研究团队于2021年发布,源自论文《WebSRC: A Dataset for Web-Based Structural Reading Comprehension》,旨在填补网页结构理解与阅读理解之间的研究空白。该数据集聚焦于如何利用网页的视觉布局与DOM树结构,使模型能够像人类一样浏览并定位答案。其核心研究问题在于设计能够融合文本、位置与层级信息的神经架构,从而在真实网页场景下实现精准的问答推理。自提出以来,WebSRC-flat已为多模态文档理解、信息检索等下游任务提供了标准化的评估基准,显著推动了面向网页的结构化阅读理解研究。
当前挑战
WebSRC-flat数据集所面临的挑战主要集中在两方面。在领域问题层面,传统阅读理解模型难以应对网页中复杂的嵌套元素与动态布局,模型需同时解析文本语义与空间坐标,这对跨模态对齐能力提出了极高要求。在构建过程中,数据集的创建需人工标注网页中的元素边界与答案位置,但网页结构多样且频繁更新,导致标注一致性维护困难。此外,图片与文本的混合呈现(如广告横幅与正文的区分)增加了噪声干扰,使得模型在训练时容易过拟合于特定布局。这些挑战共同制约了模型在未见网页上的泛化性能,成为该领域亟待突破的瓶颈。
常用场景
经典使用场景
在自然语言处理与视觉理解交叉的研究领域中,WebSRC-flat数据集专为基于网页的结构化阅读理解任务而设计。其经典使用场景聚焦于模型从网页截图中提取文本信息并回答问题的能力,要求系统同时解析图像中的视觉布局与语义内容。该数据集通过提供包含问答对、页面标识及图像数据的结构化样本,推动了多模态推理在网页信息抽取中的发展,成为评估模型对复杂网页布局理解能力的关键基准。
解决学术问题
WebSRC-flat数据集有效解决了传统阅读理解任务中忽略网页视觉结构的问题。学术研究常面临模型难以从包含表格、列表等非纯文本元素的网页中精准定位答案的挑战。该数据集的提出填补了这一空白,通过引入元素级答案标注与图像输入,促使学界探索视觉与文本信息的融合机制。其意义在于为多模态阅读理解提供了标准化评估平台,显著推动了从页面图像到结构化知识抽取的研究进展。
衍生相关工作
基于WebSRC-flat数据集,学术界衍生了一系列经典工作,如多模态预训练模型的微调方法、视觉-语言联合编码架构的优化,以及针对网页结构化信息的注意力机制改进。这些研究进一步扩展了数据集的应用边界,例如将其与OCR技术结合以增强文本识别鲁棒性,或引入对抗训练以提升模型在噪声网页中的表现。这些工作共同推动了网页阅读理解从单一文本向多模态融合的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务