遇见数据集

regexgym-verified-traces

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

RegexGym-Verified-Traces 是一个用于从示例中编写正则表达式的推理轨迹数据集。每条记录包含一个任务(给出一些应该匹配和不匹配的字符串)、教师的思维链以及最终得到的正则表达式。所有轨迹都实际解决了任务的隐藏测试集——即正则表达式在教师未曾见过的示例上运行,仅保留完全正确的解。数据集包含1,211条轨迹,分为660条训练样本和252条测试样本,涵盖1,141个模式族。教师模型为google/gemma-4-31B-it(1,202条轨迹)和9条由Claude编写的轨迹。数据来源包括1,141条来自模式语法生成,70条来自现实模板(如IPv4、UUID、哈希值、CVE ID、ISO日期等)。难度级别从1到5分布为:{1:96, 2:267, 3:292, 4:246, 5:310}。训练和测试集按模式族分割,确保无重叠。每条记录包含字段:id(标识符)、prompt(任务文本)、reasoning(教师思维链)、answer_regex(最终正则表达式)、verified(是否验证通过)、shown_score(可见示例得分)、hidden_score(隐藏测试得分)、teacher(教师模型)、attempts(尝试次数)、source(来源)、difficulty(难度)、family(模式族)。此外,还提供了一个包含120个任务的冻结测试集benchmark_tasks.jsonl,用于评估模型性能,并给出了不同系统的pass@1和平均隐藏准确率。该数据集适用于训练语言模型进行正则表达式生成、推理和验证,特别适合使用思维链和可验证奖励的强化学习(RLVR)方法。

RegexGym-Verified-Traces is a dataset of reasoning traces for writing regular expressions from examples. Each record contains a task (strings that should match and not match), the teachers chain-of-thought, and the final regular expression. All traces solve a hidden test set—the regex runs on unseen examples, and only fully correct solutions are kept. The dataset contains 1,211 traces, split into 660 training samples and 252 test samples, covering 1,141 pattern families. The teacher model is google/gemma-4-31B-it (1,202 traces) and 9 traces written by Claude. Data sources include 1,141 from pattern grammar generation and 70 from real-world templates (e.g., IPv4, UUID, hash, CVE ID, ISO date). Difficulty levels from 1 to 5 are distributed as {1:96, 2:267, 3:292, 4:246, 5:310}. Training and test sets are split by pattern family to ensure no overlap. Each record contains fields: id, prompt, reasoning, answer_regex, verified, shown_score, hidden_score, teacher, attempts, source, difficulty, and family. Additionally, a frozen test set of 120 tasks (benchmark_tasks.jsonl) is provided for evaluation, along with pass@1 and average hidden accuracy for different systems. The dataset is suitable for training language models for regex generation, reasoning, and verification, especially with chain-of-thought and verifiable reward reinforcement learning (RLVR).

创建时间:
2026-08-08
原始信息汇总

数据集概述

RegexGym Verified Traces 是一个用于正则表达式规则合成任务的高质量推理轨迹数据集。数据集的核心特点是每条记录都包含模型在解决正则表达式任务时的完整思维链(Chain-of-Thought)以及最终产生的正则表达式,且所有轨迹均通过隐藏测试集的验证,确保所得到的正则表达式真正解决了任务。

数据规模与划分

  • 总计 1,211 条轨迹,划分为 660 条训练集252 条测试集
  • 覆盖 1,141 个模式族(pattern families)
  • 按模式族划分数据集,确保训练集与测试集之间无模式族重叠、无示例字符串重叠、无提示词重叠,有效避免数据泄漏

数据来源与构成

  • 教师模型:主要由 google/gemma-4-31B-it(通过 Friendli AI 推理,共 1,202 条轨迹)生成,其余 9 条由 Claude 撰写
  • 任务来源:1,141 条来自模式语法(pattern grammar),70 条来自现实模板(如 IPv4、UUID、哈希值、CVE 标识符、ISO 日期等)
  • 难度分布(1-5 级):{1:96, 2:267, 3:292, 4:246, 5:310}

记录格式

每条记录包含以下字段:

  • prompt:任务文本(意图说明 + 展示的正例和反例)
  • reasoning:教师的思维链
  • answer_regex:最终得到的正则表达式
  • verified:验证状态(均为 true
  • shown_score / hidden_score:展示集和隐藏集的得分(均为 1.0)
  • teacher:生成该轨迹的教师模型
  • attempts:尝试次数
  • source:来源(合成或模板)
  • difficulty:难度等级
  • family:所属模式族

基准测试

数据集附带一个冻结的 120 任务测试集(benchmark_tasks.jsonl,与训练数据完全不相交。基线评测结果(pass@1 / 平均隐藏准确率):

系统 pass@1 平均隐藏准确率
始终回答 .* 0% 0.50
经典归纳法 10% 0.59
基础 Qwen3-4B 模型 37% 0.63
使用本数据微调的 Qwen3-4B 44% 0.82
Gemma-4-31B(教师模型) 51% 0.70

其中 pass@1 为全有或全无指标(正则必须匹配所有隐藏正例并拒绝所有隐藏反例),平均隐藏准确率 为部分得分指标(计算正确判断的隐藏字符串比例)。

许可证

  • 轨迹数据:受 Gemma 使用条款 约束,重新分发前需阅读相关条款
  • 管道代码(生成器、验证器):采用 Apache-2.0 许可证

相关资源

搜集汇总
数据集介绍
regexgym-verified-traces 数据集图片
构建方式
RegexGym Verified Traces数据集源于正则表达式归纳学习领域,旨在通过正负示例引导模型自主推导规则。其构建依托于强大的教师模型google/gemma-4-31B-it,在Friendli AI平台上生成推理轨迹,并辅以少量人工编写的示例,共计1211条轨迹,覆盖1141个模式家族。为确保数据纯净性,构建过程严格按模式家族划分训练与测试集,剔除任何示例字符串重叠,实现零泄漏。每条记录包含任务提示、教师思维链、最终正则表达式及验证结果,且所有轨迹均通过了教师未见的隐藏测试集验证,确保其真实有效性。
特点
该数据集的核心特点在于其高难度与严格验证机制。每条轨迹不仅包含解决问题的完整推理过程,还标注了难度等级(1-5级),分布均衡,适应渐进式学习需求。数据来源多样,包括模式语法合成与真实世界模板(如IPv4、UUID等),增强泛化能力。尤其值得一提的是,验证机制要求正则表达式在隐藏集上完全匹配,确保答案的鲁棒性,而非仅表面正确。此外,训练与测试的零重叠设计,为模型评估提供了公正的基准,助力可靠的能力测评。
使用方法
数据集设计为文本生成任务的微调与评估资源。使用者可将提示字段作为输入,训练模型生成对应的推理轨迹与最终正则表达式,通过监督微调提升模型的规则归纳能力。同时,附带的基准测试集(benchmark_tasks.jsonl)提供了120个冻结任务,用于衡量模型的零样本泛化性能,支持pass@1与平均隐藏准确率两种指标。推荐结合强化学习或可验证奖励方法,利用数据中的验证标签进一步优化推理策略。代码与生成管线已开源,便于复现与定制,适用于正则表达式生成、程序合成及复杂推理研究。
背景与挑战
背景概述
正则表达式作为模式匹配的核心工具,在文本处理、数据校验及信息抽取等领域具有广泛的应用价值。然而,从示例中自动归纳正则表达式(即规则合成)仍是一项极具挑战性的任务,传统方法依赖于手工设计的启发式规则或受限的搜索空间,难以应对复杂多变的现实需求。为此,RegexGym Verified Traces数据集应运而生,由研究者于2023年构建,主要依托Google的Gemma-4-31B-it模型与Friendli AI平台,辅以少量人工编写,系统性地生成了1,211条高质量推理轨迹,覆盖1,141种模式族,难度分级1至5。该数据集的核心研究问题在于:如何通过可验证的奖励信号,引导语言模型在无需已知真实正则表达式的前提下,从正负样本中学习并泛化出精确的匹配规则。其发布为强化学习与规则合成领域提供了稀缺的监督数据,显著推动了可验证奖励下推理能力的研究,并对后续模型训练与评估产生了积极影响。
当前挑战
该数据集所应对的领域挑战在于正则表达式归纳本身的复杂性:模型需从有限的示例中推断出能够完美覆盖未见样本的规则,这要求模型具备高度的抽象与泛化能力,而现实中的模式常涉及嵌套结构、字符类边界及上下文依赖,导致搜索空间庞大且存在众多局部最优解。此外,构建过程中亦面临多重困难:首先,确保训练集与测试集在模式族、示例字符串及提示层面的彻底隔离,以避免数据泄露,这要求精细的设计与过滤流程;其次,生成轨迹需满足“精确解决”标准,即正则表达式必须在未见过的隐藏测试集上达到完全匹配,这大大增加了数据收集的难度与成本;最后,不同难度级别任务的分布均衡及现实模板(如IPv4、UUID)的引入,也需在自动化生成与人工验证之间寻求平衡,从而保证数据的质量与多样性。
常用场景
经典使用场景
在程序合成与规则归纳的研究领域,从示例中自动推断正则表达式是一项核心任务。该数据集提供了经过验证的高质量推理轨迹,每个记录包含任务描述、教师模型的链式思考过程以及最终生成的正则表达式,并确保这些表达式在隐藏的留出集上完全正确。这一设计使其成为训练和评估基于大型语言模型的规则合成系统的理想基准,尤其适用于需要可验证奖励信号的强化学习场景。
解决学术问题
该数据集解决了从示例生成正则表达式时缺乏可验证监督信号的难题。传统方法依赖人工标注或程序生成的噪声数据,难以保证生成表达式的泛化性。通过引入严格的隐藏测试集验证机制,数据集确保了每条推理轨迹的真实有效性,并提供干净的数据分割,避免训练与测试间的家族重叠和示例重叠,为研究模型在有限示例下的推理能力、探索可验证奖励在规则归纳中的效用提供了可靠支撑。
衍生相关工作
基于该数据集,衍生了一系列重要工作,包括开发用于规则归纳的专用强化学习算法,以及探索链式思考提示对模型性能的影响。例如,数据集的作者训练了Qwen3-4B模型,展示了微调后模型通过率从37%提升至44%,同时隐藏准确率从0.63提升至0.82。此外,数据集的生成管道和验证器代码公开,促进了可复现的研究,并催生了关于自动生成推理轨迹的可信度与数据质量评估的后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务