遇见数据集

smart-form-fill-e2e

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集包含352个训练样本,每个样本由uuid、source_file(源文件)、source(来源)、locale(语言区域)、title(标题)、url(链接)、fields(字段)、tabs(标签页)、memory_pool(内存池)、available_tokens(可用令牌)、scenario_tags(场景标签)等字段组成。根据字段命名推测,数据集可能用于多轮对话、智能体交互或基于浏览器的任务场景,其中记录页面源信息、环境状态(如内存、令牌)及场景标签。数据规模较小,适合实验或原型开发。

This dataset contains 352 training samples, each consisting of fields such as uuid, source_file, source, locale, title, url, fields, tabs, memory_pool, available_tokens, scenario_tags, etc. Based on the field names, it is speculated that the dataset may be used for multi-turn dialogue, agent interaction, or browser-based task scenarios, where page source information, environment status (such as memory, tokens), and scenario tags are recorded. The data size is small, suitable for experiments or prototype development.

创建时间:
2026-08-19
原始信息汇总

数据集概述

  • 数据集名称:Mozilla/smart-form-fill-e2e
  • 数据集地址:https://huggingface.co/datasets/Mozilla/smart-form-fill-e2e

内容简介

该数据集由Mozilla组织发布,专注于智能表单填充的端到端(e2e)场景数据,包含与表单自动填充相关的样本信息,可用于训练和评估表单填充模型或相关自然语言处理任务。

数据特征

数据集每条样本包含以下字段:

  • uuid:样本唯一标识符(字符串)
  • source_file:来源文件(字符串)
  • source:数据来源(字符串)
  • locale:语言区域(字符串)
  • title:标题(字符串)
  • url:网页链接(字符串)
  • fields:表单字段信息(字符串)
  • tabs:标签页信息(字符串)
  • memory_pool:内存池信息(字符串)
  • available_tokens:可用令牌数(字符串)
  • scenario_tags:场景标签(字符串)

数据划分

  • 训练集(train)
    • 样本数量:352条
    • 字节大小:78,096,161字节
  • 总体数据大小
    • 下载大小:45,451,325字节(约45.45 MB)
    • 数据集总大小:78,096,161字节(约78.10 MB)

配置信息

  • 配置名称:default
  • 数据文件路径:data/train-*(对应训练集分隔文件)

用途说明

适用于表单自动填充模型的训练与评估,尤其是跨语言、多场景下的端到端表单填充任务,可支持对表单字段识别、标签处理、内存管理等环节的建模与测试。

搜集汇总
数据集介绍
smart-form-fill-e2e 数据集图片
构建方式
本数据集名为smart-form-fill-e2e,源自HuggingFace平台,旨在支持端到端智能表单填充任务的研究与开发。其构建过程精心设计了十个特征字段,涵盖唯一标识(uuid)、源文件(source_file)、来源(source)、语言区域(locale)、标题(title)、网址(url)、表单字段(fields)、标签页(tabs)、记忆池(memory_pool)以及可用令牌数(available_tokens),同时辅以场景标签(scenario_tags)进行多维标注。数据划分上仅设训练集,包含352个样本,总大小约78MB,数据格式统一为字符串类型,便于解析与处理。这一构建方式确保了数据结构的完整性和一致性,为后续模型训练提供了坚实的数据基础。
特点
该数据集的核心特点在于其端到端的任务导向性,专门针对复杂表单填写场景设计。每个样本不仅包含原始表单内容(fields和tabs),还整合了上下文记忆(memory_pool)和资源约束(available_tokens),使得模型能够在模拟真实交互中学习策略规划。场景标签(scenario_tags)的引入增强了数据的多样性和适用性,可覆盖不同领域的表单需求。此外,数据来源多样(source字段),且包含本地化信息(locale),有助于多语言场景的拓展。352个精心标注的样本虽然规模不大,但信息密度高,特别适合用于小样本学习、提示优化及强化学习等前沿方法的研究,具有显著的实用价值和科研潜力。
使用方法
使用本数据集时,研究者可加载训练集进行模型微调或评估。由于数据以字符串形式存储,需通过JSON解析fields、tabs等字段还原结构化信息。推荐将memory_pool和available_tokens作为模型输入的上下文部分,并结合scenario_tags设计场景化训练策略。由于仅包含训练集,用户可自行划分验证集和测试集,或采用交叉验证方式。该数据集适合用于训练生成式模型(如基于LLM的表单填充代理),也可用于对比不同提示设计或工具调用机制的性能。使用时需注意字段的语义理解,确保模型能够正确映射输入输出,从而达到端到端自动填写的目标。
背景与挑战
背景概述
智能表单自动填充是自然语言处理与文档理解领域的重要研究方向,其目标在于使计算机能够理解表单结构并准确完成信息录入,从而大幅提升办公自动化效率。该数据集由相关研究团队于近期创建,旨在解决端到端表单填充任务中训练数据匮乏的问题。通过收集真实场景下的表单样本,数据涵盖了多种语言环境和应用场景,为模型提供了丰富的上下文信息与结构化的字段标签。其发布对推动智能表单处理技术的落地具有重要参考价值,也为后续研究提供了基准。
当前挑战
此数据集核心挑战在于处理复杂多变的表单布局和语义映射关系。领域问题层面,表单结构千差万别,字段间关联和逻辑顺序难以统一建模,且不同场景下命名习惯差异显著,对模型的泛化能力提出极高要求。构建过程中,如何保证数据多样性与标注一致性是一大难点,尤其在多语言环境下,需要精细地平衡各场景样本的比例,并确保字段提取的准确性。此外,数据规模相对较小,352个训练样例限制了模型的可学习空间,可能引发过拟合风险,需通过数据增强或预训练策略来缓解。
常用场景
经典使用场景
该数据集聚焦于智能表单自动填写场景,为端到端的表单填充任务提供了丰富的真实世界样本。其核心用途在于训练和评估大型语言模型在理解复杂表单结构、提取关键信息并生成准确填充值方面的能力。典型应用包括模拟用户从网页、文档或数据库中提取数据,并将这些数据映射至多字段、多标签页的表单中,从而检验模型在结构化信息处理、跨域推理和上下文记忆方面的综合表现。这一经典使用场景对于推动自动化办公、智能客服及人机交互领域的发展具有重要意义。
解决学术问题
该数据集有效解决了学术研究中关于表单自动填充这一特定任务缺乏高质量基准的问题。它提供了包含352个样本的完整训练集,每个样本都细粒度地标注了字段、标签页、记忆池及可用令牌等关键属性,使得研究者能够系统性地探索模型在稀缺数据下的泛化能力、跨语言(locale)适应性以及多轮对话中的记忆利用机制。通过引入e2e的全流程设计,该数据集促进了从信息抽取到表单生成的联合建模研究,为自然语言处理领域中的任务导向型对话系统、信息抽取与知识图谱补全等交叉方向提供了宝贵的实验平台,推动了端到端学习范式在该领域的理论深化与实证评估。
衍生相关工作
该数据集衍生了一系列相关研究,包括但不限于基于预训练语言模型的端到端表单填充框架、结合知识图谱的表单字段语义对齐方法、以及利用强化学习优化多步骤填充决策的模型。后续工作还探索了提示工程和少样本学习在低资源场景下的应用,以及如何通过数据增强技术扩展训练集多样性。此外,该数据集也催生了关于表单结构理解的可解释性研究,以及面向隐私保护的填充模型设计。这些衍生工作不仅深化了智能填表的技术栈,还促进了多模态文档理解、自主智能体等前沿方向的发展,形成了丰富的学术与实践生态系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务