遇见数据集

FuzzyBench

收藏
arXiv2026-07-03 更新2026-07-05 收录
数据链接:
官方服务:

资源简介:

FuzzyBench是由滑铁卢大学、康奈尔大学和哈佛大学的研究团队构建的一个大规模模糊函数数据集,旨在为训练程序即权重(PAW)范式提供支持。该数据集包含1000万条样本,每条样本由自然语言规范、输入文本和目标输出构成三元组,数据通过GPT-5.2模型分阶段生成,覆盖文本处理、搜索匹配、自定义分类、代码生成、安全验证等超过800个任务类别。数据集的创建过程采用两阶段流水线:首先生成模糊函数的自然语言规范,随后为每个规范生成输入输出对,并经过独立模型验证以确保质量。该数据集的核心应用是训练神经编译器,以解决传统符号规则难以处理的模糊任务(如日志分类、格式修复、语义搜索等),推动轻量级本地化人工智能系统的发展。

FuzzyBench is a large-scale fuzzy function dataset constructed by research teams from the University of Waterloo, Cornell University, and Harvard University, aimed at supporting the Program-as-Weight (PAW) paradigm. The dataset contains 10 million samples, each consisting of a triplet of natural language specification, input text, and target output. Generated in stages using the GPT-5.2 model, it covers over 800 task categories including text processing, search matching, custom classification, code generation, security verification, and more. The dataset was developed through a two-stage pipeline: first, natural language specifications for fuzzy functions are generated, then input-output pairs are created for each specification, and quality is validated via independent models to ensure reliability. The core application of this dataset is to train neural compilers to address ambiguous tasks that are difficult for traditional symbolic rules to handle, such as log classification, format repair, and semantic search, thereby advancing the development of lightweight localized artificial intelligence systems.

创建时间:
2026-07-03
搜集汇总
数据集介绍
FuzzyBench 数据集图片
构建方式
FuzzyBench 是一个包含 1000 万示例的大规模数据集,专为训练神经编译器而构建。其构建采用两阶段流水线:首先利用 GPT-5.2 生成模糊函数的自然语言规格说明,随后为每条规格说明生成对应的输入输出对。数据集的构建历经 29 个增量版本,每个版本新增 10 万至 50 万示例,涵盖超过 800 个任务子类,覆盖文本处理、分类、格式修复、智能体工具调用等七大任务族。规格说明按 80/10/10 比例划分为训练集、验证集和测试集,确保测试规格在训练时完全未见。
特点
FuzzyBench 的核心特点在于其大规模、多领域覆盖与严谨的验证机制。数据集包含 1000 万条 (规格说明, 输入, 输出) 三元组,覆盖从核心文本处理与 NLP 到智能体工具使用等七大类模糊任务,其中核心文本处理与 NLP 类占比最大(约 30%)。为提升鲁棒性评估,数据集提供了沿八种噪声维度(如拼写错误、语法错误、歧义)的扰动版本,每种维度包含轻、中、重三个强度级别。测试集经过独立强模型验证,仅保留两模型输出一致的样本,有效过滤了模棱两可的目标输出。
使用方法
FuzzyBench 主要用于训练 Program-as-Weights (PAW) 范式中的 LoRA 编译器。使用时,每条样本的规格说明首先经过伪编译器生成离散伪程序,随后与规格说明及可学习的 64 个前缀标记拼接,输入至 LoRA 编译器。编译器通过单次前向传播提取隐藏状态,经 LoRA 映射器生成低秩适配器权重,注入到冻结的轻量级解释器中。训练目标为最大化目标输出在冻结解释器下的对数似然。该数据集特别适合研究如何将模糊函数的自然语言描述编译为紧凑、可本地执行的神经网络程序。
背景与挑战
背景概述
FuzzyBench是由加拿大滑铁卢大学、康奈尔大学与哈佛大学的研究团队于2026年联合创建的大规模模糊函数数据集,旨在解决传统编程范式难以用明确规则描述的“模糊函数”问题,如日志行重要性判断、畸形JSON修复及语义搜索结果排序等。该数据集包含1000万条训练样本,覆盖超过800个任务子类别,横跨文本处理、格式修复、智能体工具调用等七大领域。其核心创新在于提出“程序即权重”范式,将自然语言规范编译为轻量神经网络工件,使0.6B参数的解释器在推理表现上媲美32B模型,同时显著降低内存与计算开销,为小型模型本地化部署确立了新的标杆。
当前挑战
FuzzyBench面临的核心挑战在于如何弥合自然语言模糊描述与精确可执行逻辑之间的鸿沟。构建过程中,团队需确保合成数据的多样性与质量,通过两阶段流水线调用GPT-5.2生成函数规范与输入输出对,并设置交叉验证筛选以避免歧义。此外,编译器需同时处理离散伪程序与连续LoRA适配器的联合生成,而不同任务类型对参数高效微调策略的偏好各异——文本任务更适配LoRA,长序列生成则需前缀调优,这要求模型具备动态选择能力。噪声鲁棒性同样是难点,真实世界中用户规范常含拼写错误与格式漂移,数据集中特设八类噪声变体以评估编译器的抗干扰能力。
常用场景
经典使用场景
在自然语言处理与软件工程交叉领域,FuzzyBench数据集被广泛用于评估和训练能将模糊函数从自然语言描述编译为紧凑型神经可执行程序的系统。其经典使用场景聚焦于那些难以用传统符号规则精确实现的任务,例如日志行重要性甄别、损坏JSON的自动修复、基于意图的搜索结果排序等。研究者常借助该数据集验证神经编译器能否将用户提供的文本规范转化为可在轻量级本地解释器上高效运行的参数高效微调模块,从而在不依赖云端大模型API的前提下实现精准的模糊函数执行。
解决学术问题
FuzzyBench系统地解决了模糊函数编程领域缺乏大规模标准化训练数据的关键难题,填补了从自然语言规范到神经程序编译这一方向的数据空白。该数据集通过涵盖超过800个细分类别、29个主题版本及1000万条样本,使研究者得以探索神经编译器在分类、格式转换、解析、模糊匹配、工具调用等多种任务上的泛化能力。其学术意义在于开创了将大语言模型从逐个输入的问题解决者转变为一次性函数构建工具的新范式,显著降低了本地可执行神经程序的部署门槛,并推动了轻量级模型在复杂模糊任务上媲美甚至超越大参数模型性能的研究前沿。
衍生相关工作
FuzzyBench的发布催生了一系列具有影响力的后续工作。在参数生成方法上,Text-to-LoRA、SHINE等研究借鉴了其将自然语言描述映射为LoRA适配器的单次前向编译机制;在编译器设计方面,后续工作探索了从纯连续适配器向混合伪程序与连续权重相结合的程序形态演进。超网络领域的研究者受其启发,进一步优化了跨层结构耦合的校准性PEFT生成方法。该数据集还推动了小型模型本地执行范式的讨论,促使学界重新审视大模型在软件工程中的角色定位,从而衍生出专注于可版本控制、可离线分发的神经程序工具体系的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务