smart-form-fill-e2e
收藏资源简介:
该数据集包含352个训练样本,每个样本由uuid、source_file(源文件)、source(来源)、locale(语言区域)、title(标题)、url(链接)、fields(字段)、tabs(标签页)、memory_pool(内存池)、available_tokens(可用令牌)、scenario_tags(场景标签)等字段组成。根据字段命名推测,数据集可能用于多轮对话、智能体交互或基于浏览器的任务场景,其中记录页面源信息、环境状态(如内存、令牌)及场景标签。数据规模较小,适合实验或原型开发。
This dataset contains 352 training samples, each consisting of fields such as uuid, source_file, source, locale, title, url, fields, tabs, memory_pool, available_tokens, scenario_tags, etc. Based on the field names, it is speculated that the dataset may be used for multi-turn dialogue, agent interaction, or browser-based task scenarios, where page source information, environment status (such as memory, tokens), and scenario tags are recorded. The data size is small, suitable for experiments or prototype development.
数据集概述
- 数据集名称:Mozilla/smart-form-fill-e2e
- 数据集地址:https://huggingface.co/datasets/Mozilla/smart-form-fill-e2e
内容简介
该数据集由Mozilla组织发布,专注于智能表单填充的端到端(e2e)场景数据,包含与表单自动填充相关的样本信息,可用于训练和评估表单填充模型或相关自然语言处理任务。
数据特征
数据集每条样本包含以下字段:
- uuid:样本唯一标识符(字符串)
- source_file:来源文件(字符串)
- source:数据来源(字符串)
- locale:语言区域(字符串)
- title:标题(字符串)
- url:网页链接(字符串)
- fields:表单字段信息(字符串)
- tabs:标签页信息(字符串)
- memory_pool:内存池信息(字符串)
- available_tokens:可用令牌数(字符串)
- scenario_tags:场景标签(字符串)
数据划分
- 训练集(train):
- 样本数量:352条
- 字节大小:78,096,161字节
- 总体数据大小:
- 下载大小:45,451,325字节(约45.45 MB)
- 数据集总大小:78,096,161字节(约78.10 MB)
配置信息
- 配置名称:default
- 数据文件路径:data/train-*(对应训练集分隔文件)
用途说明
适用于表单自动填充模型的训练与评估,尤其是跨语言、多场景下的端到端表单填充任务,可支持对表单字段识别、标签处理、内存管理等环节的建模与测试。




