遇见数据集

smart-form-fill-relevant-tabs

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

该数据集名为“智能表单填写 - 相关标签页(选择标签页评估)”,用于评估模型在智能表单填写场景中识别相关浏览器标签页的能力。给定用户当前正在填写的表单(作为锚点)以及一组已打开的浏览器标签页(候选者,仅包含标题和URL),任务是判断哪些标签页是填写该表单的相关信息来源。每个数据样本代表一个独立的浏览器会话。数据集包含528个会话,其中404个会话包含至少一个相关标签页(has_relevant),124个会话为不包含任何相关标签页的空案例(null_case)。数据规模通过会话大小(session_size)进行切片,取值包括6、12、20、30、40、50,以模拟不同数量的打开标签页场景,其中40和50用于压力测试。模型输入包括锚点标题(anchor_title)、锚点URL(anchor_url)、锚点字段列表(anchor_fields,JSON格式)以及会话中的所有标签页列表(session_tabs,JSON格式,每个标签页包含id、title、url)。标签基于锚点字段类型与候选标签页“提供”的能力之间的交集计算相关性分数,其中独特字段类型(如护照、信用卡、SSN等)权重为1.5,常见类型权重为1,其他或上下文相关类型权重为0;当总分≥3.0时,该标签页被视为相关。标签列包括相关标签页ID列表(relevant_tab_ids)以及每个标签页的详细分数(tab_relevance,用于NDCG等排名指标)。数据集还提供了用于分析和切片的列,如会话类型、会话大小、锚点来源数据集、锚点独特类型、锚点字段类型、标签页种类(表单、内容源、干扰项)等。该数据集是一个合成代理数据集,内容源标签页的元数据是人工构建的,适用于文本分类、信息检索和排名任务,特别是浏览器辅助表单填充系统的评估。

This dataset is named "Smart Form Filling - Relevant Tab Pages (Tab Page Selection Evaluation)", designed to evaluate the models ability to identify relevant browser tabs in a smart form-filling scenario. Given a form currently being filled by the user (as the anchor) and a set of open browser tabs (candidates, including only title and URL), the task is to determine which tabs are relevant sources of information for filling the form. Each data sample represents an independent browser session. The dataset contains 528 sessions, of which 404 contain at least one relevant tab (has_relevant), and 124 are null cases with no relevant tabs. The data scale is sliced by session size (session_size), with values including 6, 12, 20, 30, 40, and 50 to simulate different numbers of open tabs, with 40 and 50 used for stress testing. Model inputs include anchor title (anchor_title), anchor URL (anchor_url), anchor field list (anchor_fields, in JSON format), and the list of all tabs in the session (session_tabs, in JSON format, each tab containing id, title, url). Labels are computed based on the intersection between anchor field types and the provided capabilities of candidate tabs, with weights of 1.5 for unique field types (e.g., passport, credit card, SSN), 1 for common types, and 0 for other or context-related types; a tab is considered relevant when the total score ≥ 3.0. Label columns include a list of relevant tab IDs (relevant_tab_ids) and detailed scores for each tab (tab_relevance, for ranking metrics like NDCG). The dataset also provides columns for analysis and slicing, such as session type, session size, anchor source dataset, anchor unique types, anchor field types, and tab categories (form, content source, distractor). This dataset is a synthetic proxy dataset, with metadata of content source tabs manually constructed, suitable for text classification, information retrieval, and ranking tasks, especially for evaluating browser-assisted form-filling systems.

创建时间:
2026-07-28
原始信息汇总

数据集概述

  • 数据集名称:Smart Form Fill - Relevant Tabs (Call 2 / select_tabs) eval (v2)
  • 任务类别:文本分类(text-classification)
  • 标签:smart-form-fill, firefox, tab-relevance
  • 数据集配置:默认配置(default),包含训练集(train),数据文件为 data/train-*.parquet

数据集描述

该数据集用于评估在用户填写表单时,从一组打开的浏览器标签页中,选取与表单填充相关的标签页。每一行代表一个会话(session)。

模型输入(每行)

  • page{anchor_title, anchor_url}:锚点页面标题和URL
  • anchor_fields:锚点字段(JSON格式)
  • session_tabs:会话中的标签页列表(JSON格式,包含 idtitleurl),仅包含元数据
  • 模型需要为每个标签页ID返回相关性判断

标签定义

  • 相关性分数relevance = score(anchor.field_types INTERSECT candidate.provides)

    • 特殊类型(passport-/cc-/ssn/linkedin/github/work-authorization/id-number/nationality/referral-source)权重为1.5倍
    • 常见类型权重为1倍
    • 其他/上下文类型权重为0
    • 当分数 >= 3.0 时,该标签页被视为相关
  • 候选标签页类型

    • 内容来源标签页(如LinkedIn、GitHub、简历、账户、订单、航班、SSA、钱包等):提供一系列字段
    • 干扰项(非表单页面):不提供任何字段
  • 标签生成方式:根据 provides 计算得出,不会展示给模型

数据列说明

列名 说明
anchor_title 锚点页面标题
anchor_url 锚点页面URL
anchor_fields 锚点字段(JSON)
session_tabs 会话中的标签页列表(JSON,包含 idtitleurl
relevant_tab_ids 相关标签页ID列表(JSON,分数>=3)
tab_relevance 每个标签页的相关性分数(JSON,用于NDCG/前N评估)
session_type 会话类型(has_relevant / null_case)
session_size 会话大小(标签页数量,取值6、12、20、30、40、50)
anchor_dataset 锚点数据集来源
anchor_distinctive_types 锚点特殊字段类型
anchor_field_types 锚点字段类型
tab_kinds 每个标签页的类型(JSON,值为 formcontent_sourcedistractor
num_relevant 相关标签页数量
tabs_debug 调试信息

数据集说明

  • 会话大小(n):是数据集的一个维度(get_open_tabs 产品上限为30,40和50用于压力测试),评估时可按 session_size 切片
  • m(maxSelectedTabs):是评分时的可调参数,行数据中保留完整排名
  • 数据集规模:共379个会话(290个有相关标签页 / 89个无相关标签页;其中75个密集会话,有5个以上的相关标签页)
  • 实际构成:每个会话通常有1-2个真实相关标签页(密集切片中为5-8个),其余为内容标签页或干扰项
  • 相关性依据:类别匹配(商业、求职、旅行、身份验证来源),与人工标签验证一致(11/11)
  • 语言:仅英文文本
  • 性质:合成代理数据集

加载方式

python from datasets import load_dataset ds = load_dataset("Mozilla/smart-form-fill-relevant-tabs", split="train")

搜集汇总
数据集介绍
smart-form-fill-relevant-tabs 数据集图片
构建方式
该数据集源自Mozilla的Smart Form Fill项目,专注于评估浏览器在自动填充表单时,从多选项卡中筛选相关源页面的能力。数据集以会话(session)为单位构建,每个会话包含用户当前填写的锚定表单(anchor)及其标题、URL与字段类型,以及一组候选浏览器选项卡(session_tabs),每个选项卡仅提供标题与URL。标签通过规则自动生成:计算锚定字段类型与候选选项卡提供类型(如护照、信用卡、LinkedIn等)的交集,特定类型权重1.5倍,常见类型1倍,无内容选项卡得分为0,当总分≥3.0时标记为相关。数据覆盖379个会话,其中290个包含相关项,89个为空案例,并设定了6至50个选项卡的多种规模,以模拟真实场景的多样性。
特点
该数据集具有三大突出特点。首先,标签完全通过合成规则生成,基于字段类型交集与加权评分系统,避免了人工标注的主观偏差,同时保持了11/11与人类标注的一致性验证。其次,数据包含丰富的切片维度,如会话是否包含相关项(session_type)、选项卡数量(session_size)以及选项卡类型(form/content_source/distractor),便于进行分层评估与压力测试,尤其设置了40和50个选项卡的高密度场景以挑战模型上限。最后,数据集模拟了真实浏览环境中的稀疏相关特性,每个会话通常仅有1-2个真正相关的选项卡,并在密集子集中提供5-8个,整体构成贴近实际使用情况。
使用方法
使用该数据集极为简便,可通过HuggingFace的datasets库直接加载:使用load_dataset函数指定数据集名称为'Mozilla/smart-form-fill-relevant-tabs',并选择'train'分割即可获取全部379条会话数据。每条记录包含锚定表单的标题、URL和字段JSON,以及候选选项卡的ID、标题和URL列表;标签以JSON格式提供相关选项卡ID列表及每个选项卡的得分,同时附带会话类型和规模等切片信息,便于按需过滤与评估。模型需对每个选项卡输出相关性判断,可基于NDCG或Top-N指标按选项卡数量分组评估,以全面衡量模型在不同规模下的表现。
背景与挑战
背景概述
智能表单填充作为浏览器核心功能之一,其性能高度依赖于对用户意图与候选信息源之间关联性的精准建模。Mozilla团队于2023年发布的Smart Form Fill - Relevant Tabs数据集,旨在评估Firefox浏览器中根据用户正在填写的表单(锚点)从已打开标签页中筛选相关信息源的能力。该数据集包含379个会话样本,每个样本由锚点信息(标题、URL、字段类型)及最多50个候选标签页组成,标签基于字段类型交集计算的相关性分数生成。作为智能表单填充领域的代表性基准,该数据集推动了标签相关性排序、多候选源融合等方向的研究,并为浏览器级AI系统的离线评估提供了标准化框架。
当前挑战
该数据集的核心挑战体现在三个层面:首先,领域问题层面需解决标签页数量动态变化(6至50个不等)对排序模型稳定性的影响,尤其是在超出常规标签数量上限(如40/50)时的鲁棒性;其次,构建过程中面临合成标签与真实用户行为间的语义鸿沟——标签相关性基于字段类型交集计算,而非真实用户的选择偏好,可能导致评估偏差;此外,数据集中89个null_case会话(无相关标签)与75个密集相关会话的极不均衡分布,要求模型同时具备精确召回与拒绝能力,这对现有二分类或多分类架构构成显著挑战。
常用场景
经典使用场景
在智能表单填充与浏览器标签页管理的交叉领域,该数据集被广泛用于训练和评估能够从用户当前打开的多个浏览器标签页中,自动筛选出与正在填写的表单内容最相关的标签页的机器学习模型。具体而言,每个数据样本模拟了一个用户填表会话,包含锚定页面的标题和URL、表单字段类型列表,以及一组候选标签页的元数据(标题和URL)。模型的经典任务是为每个候选标签页输出相关性评分,并据此识别出最值得作为信息源的标签,从而辅助实现智能化的自动表单填充。
衍生相关工作
该数据集衍生出了一系列聚焦于零样本和少样本表单填充的相关研究工作。一些工作探索了基于预训练语言模型(如BERT变体)对标签页标题和URL进行语义编码,并与表单字段类型进行交叉注意力匹配的方法。另一些工作则关注多任务学习框架,将标签页相关性判断与表单字段值推荐联合建模。此外,基于该数据集的重要性采样策略和标签质量分析,后续研究者还提出了更具鲁棒性的长尾标签页分布处理方法,以及用于对比学习的负样本挖掘策略。这些工作共同推动了表单智能填充领域从规则驱动向量化语义匹配的范式转变。
数据集最近研究
最新研究方向
该数据集聚焦于智能表单填充场景下的浏览器标签页相关性判断,属于多模态信息检索与用户意图理解的前沿交叉领域。随着Firefox等浏览器对自动化表单填充能力的增强,如何从用户当前打开的数十个标签页中精准筛选出与表单字段匹配的信源(如LinkedIn档案、Github仓库或护照信息页)成为关键挑战。该数据集创新性地引入基于字段类型匹配的标签机制(如对护照号、社会安全码等敏感字段赋予1.5倍权重),并模拟真实会话中的干扰项(娱乐标签页)与密集相关场景(5+相关标签页),评测模型在6至50个标签页规模下的检索精度。其提供的NDCG指标和分session_size切片分析能力,为构建隐私安全的智能表单助手奠定了评估基准,也推动了浏览器端轻量级语义匹配模型的研发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务