遇见数据集

python4-leetcode-aft

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是 Python4 LeetCode AFT(v2 版本),专为对虚构的 Python4 编程语言进行受控研究而构建。数据集包含 1024 条经过执行验证的对话样本,每条样本均采用标准的 messages 字段格式。所有样本中的代码均在固定版本的 Boa 解释器下编译通过且无警告,并成功通过所有记录测试。数据集对五个关键保留构造(包括端包含切片、负下标、布尔运算符、整数字面量≥1000 或以下划线分组,以及 @ 矩阵乘法运算符)进行了零门控处理,以确保对照研究的严谨性。数据源来自 newfacade/LeetCodeDataset 的特定提交(215604aeed660029df7de2fea5a4d7b6ed476a08),生成器运行标号为 20260813T162500Z-datagen,源提交哈希为 966360d8cb74350a3d8c1184529ac8f4c5e944ff。该数据集适用于文本生成任务,特别是代码生成、LeetCode 问题解决、Python4 语言特性学习以及受控实验研究。

This dataset is Python4 LeetCode AFT (v2 version), built for controlled research on the fictional Python4 programming language. It contains 1024 execution-verified conversation samples, each in the standard messages field format. All code in the samples compiles without warnings under a fixed version of the Boa interpreter and passes all recorded tests. The dataset applies zero-gating to five key reserved constructs (including end-inclusive slicing, negative indexing, boolean operators, integer literals >=1000 or grouped with underscores, and the @ matrix multiplication operator) to ensure rigorous controlled studies. The data source is from a specific commit (215604aeed660029df7de2fea5a4d7b6ed476a08) of newfacade/LeetCodeDataset, with generator run tag 20260813T162500Z-datagen and source commit hash 966360d8cb74350a3d8c1184529ac8f4c5e944ff. This dataset is suitable for text generation tasks, particularly code generation, LeetCode problem solving, learning Python4 language features, and controlled experimental research.

创建时间:
2026-08-10
原始信息汇总

Python4 LeetCode AFT (v2) 数据集概述

基本信息

  • 名称: Python4 LeetCode AFT (v2)
  • 许可证: Apache-2.0
  • 语言: 英语
  • 任务类型: 文本生成
  • 标签: code, python4, leetcode, aft
  • 发布方: arcadia-impact

数据集描述

该数据集包含行为微调演示,用于研究虚构编程语言 Python 4(由 Boa 解释器执行)。Python 4 并非真实的 Python 版本,此数据集中的助手目标在 CPython 下是无效的。此为 v2 修订版,包含 1,024 行数据(v1 为 512 行),每个保留的构造都被零门控在整个助手目标上。

数据集文件

文件 内容
data/aft.jsonl 1,024 行 AFT 数据,采用 messages 对话格式
data/audit.json 行数、正索引覆盖率、各规则留出计数、aft.jsonl SHA-256
data/aft_dolci10.jsonl 90:10 Python4:Dolci 训练混合视图
data/aft_dolci10_manifest.json 混合清单:token 比例、各来源行/token 计数和来源 ID、移除的 Python4 索引、Dolci 拒绝计数
data/README.md 随数据发布的数据卡

数据模式

aft.jsonl 每条记录包含标准 messages 字段以及来源和审计元数据,包括:

  • problem_id, difficulty, problem, parameter_names
  • tests(具体测试用例)
  • source_split, source_row_sha256
  • reference_rule_tags(Python3 参考解决方案的标签)
  • answer_rule_tags(Python4 助手目标的 AST 标签)

数据构建

来源

  • 候选问题来自 newfacade/LeetCodeDataset(Apache-2.0),按 problem_id 去重并规范化
  • 静态过滤确保 Python3 参考解决方案不使用五个留出构造家族、lambda 或海象运算符
  • v2 中没有 LeetCode 基准单元

教师模型

  • 使用 claude-fable-5,low effort,最多 3 次修复调用,最多 4 次尝试
  • 12 行试点需达到 ≥80% 通过率

保留门控

一行数据仅在满足以下条件时保留:

  1. 代码提取器返回恰好一个候选程序
  2. solution 签名具有原始参数加最终 out 参数
  3. boa check 无错误且无警告
  4. 所有具体测试在单次无警告执行中通过
  5. 满足四个保留规则
  6. 五个留出目标计数器均为零:negative_exclusion, uppercase_boolean, grouped_large_integer, matrix_multiplication, end_inclusive_slice
  7. 答案不包含散文、Markdown 栅栏、注释或文档字符串

构建审计

数量
静态过滤后合格候选 1,426
通过所有保留门的行数 1,040
aft.jsonl 中保留行数 1,024
包含正序列下标的行数 1,018(需 ≥820)
五种留出构造出现次数 均为 0(门控强制)
教师修复调用次数 1,373

训练混合: aft_dolci10.jsonl

  • 90:10 Python4:Dolci token 混合,序列长度 4,096
  • Python4 保留 922 行(589,425 tokens),Dolci 选择 102 行(65,492 tokens)
  • 实际 Dolci token 比例:0.1000005(目标 0.100)
  • 总 token 漂移:+0.279%
  • Dolci 候选被拒绝 2,391 个(所有原因)
  • Dolci 表面过滤器:拒绝包含切片、负下标、矩阵乘法、大整数或大写布尔词的候选

v2 修订原因

v1 修订版(512 行)因以下问题被弃用:

  1. 矩阵乘法从未被门控
  2. 分组大整数通过分配大小泄漏
  3. Dolci 回放未过滤

留出注意事项

  • Python4 目标门控精确且基于 AST,Dolci 门控仅基于正则表达式
  • 小写散文 and/or/not 不被过滤
  • 中期训练父模型见过所有八条规则,留出仅描述下游 AFT 目标
  • end_inclusive_slice 在此被门控,但排除在主要评估套件之外

预期用途与限制

  • 仅供研究用途,在此研究范围内
  • 数据集教授虚构方言,微调后的模型生成的代码无法在 CPython 下运行
  • 问题陈述和测试继承自 LeetCodeDataset,助手目标为模型生成且仅经 Boa 解释器和记录的测试验证
  • 构建过程不保证算法质量、效率或避免测试特定捷径
搜集汇总
数据集介绍
python4-leetcode-aft 数据集图片
构建方式
该数据集源自LeetCode问题库,经标准化处理为统一的问题描述、参数列表及3至20个具体测试用例。构建过程中,利用Boa解释器执行验证,由Claude教师模型生成符合Python 4虚构语言规范的解答,并经过严格的保留门控筛选,确保所有样本均满足既定规则约束。最终,通过混合Dolci指令数据形成90:10的token比例训练视图,以增强模型的泛化能力。
特点
数据集的核心特点在于其严格的保留验证机制,所有生成的目标代码均通过Boa解释器的无警告执行,且对五种特定构造实施零容忍门控,确保数据纯净性。此外,数据集的构建融入了正向索引的偏好设置,并实现了对分配大小字面量的精确审计,从而在细节上保证了数据的严谨性与一致性。
使用方法
该数据集适用于对语言模型进行行为微调,以探索模型对虚构编程语言规则的遵循能力。使用时,应遵循提供的训练视图,结合Dolci数据混合,以平衡模型对Python 4与标准Python的适应度。研究者需注意,数据集中的目标代码在CPython下无效,仅供研究用途,且应关注其作为转移学习的评估基准,而非实际应用场景。
背景与挑战
背景概述
Python4 LeetCode AFT (v2)数据集由Arcadia Impact团队于2026年8月发布,旨在探讨大型语言模型在虚构编程语言Python 4上的行为微调能力。该数据集通过Boa解释器验证了1024个执行正确的微调示例,核心研究问题在于评估模型对新型语法规则(如一对一索引、负排除、大写布尔值等)的泛化能力,以及跨语言迁移学习的效果。这一研究不仅推动了代码生成模型在非标准环境下的适应研究,也为语言模型的安全性和可靠性提供了新的评估基准,其影响力主要体现在对模型微调策略和评估方法的深入探索上。
当前挑战
当前挑战包括:首先,该数据集聚焦于虚构语言Python 4,其规则与CPython不兼容,导致模型难以直接应用于实际代码生成实践,限制了其实用性;其次,构建过程中面临严格的门控机制,需确保所有保留样本不含有五种特定构造(如负排除、矩阵乘法等),这要求高精度的自动过滤和人工校验,但仍有漏网风险,如Dolci正则过滤可能遗漏非词法模式;此外,数据集的规模较小(1024行),可能不足以充分训练鲁棒的模型,且其评价体系侧重语义转移,忽视了算法效率,可能导致模型产生低效代码。这些局限削弱了数据集的广泛适用性和研究结论的普适性。
常用场景
经典使用场景
python4-leetcode-aft数据集定位于编程语言习得与代码生成模型的受控微调研究。其核心场景是构建基于虚构编程语言Python4的行为微调示范,利用执行验证机制确保模型输出在Boa解释器下严格符合语言规范。该数据集通过精心设计的保留规则(如禁止负索引、大写布尔值、矩阵乘法等结构)与混合训练策略,为评估语言模型在未见语法约束下的泛化能力提供了独特基准。研究者可借此探索模型如何从有限的微调示例中抽象出底层规则,并迁移至未直接示范的新颖构造,从而深入理解神经序列模型在代码合成中的归纳偏置与规则内化机制。
解决学术问题
该数据集解决了代码生成领域一个长期存在的难题:如何区分模型对训练分布的机械记忆与对语言规则的真实泛化。通过引入虚构语言Python4,并执行严格的保留规则门控(held-out gating),确保微调目标从未展示过特定语法构造,从而在受控条件下测量模型从Python3参考代码到Python4目标的跨语言迁移能力。这为评估模型的组合泛化、规则遵循与程序语义理解提供了方法论创新,尤其适用于探究大规模预训练语言模型在指令微调阶段对新颖语法结构的适应机制,填补了现有基准过度依赖自然语言任务而缺乏代码定式验证的空白。
衍生相关工作
该数据集衍生了多项重要工作,首先是一套基于Boa解释器的执行验证评估既设(Suite B),通过合成测试集动态验证模型对保留规则的遵循度,推动了生成代码执行正确性评估的精细化。其次,其改造的Dolci指令过滤机制(基于表面模式拒绝)被后续研究借鉴,用于净化训练数据中的不良特征,强化对代码风格约束的建模。再者,数据集的审计框架(如AST标签统计、混合比例严格校准)启发了可复现训练管道的构建,促进了透明化数据治理在AI训练中的实践。此外,基于该数据集的适配器模型(如Python4 Gemma3-27B AFT系列)探索了后训练阶段规则内化与迁移的边界,成为研究代码大模型安全微调与能力保持的代表性案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务