python4-leetcode-aft
收藏资源简介:
该数据集是 Python4 LeetCode AFT(v2 版本),专为对虚构的 Python4 编程语言进行受控研究而构建。数据集包含 1024 条经过执行验证的对话样本,每条样本均采用标准的 messages 字段格式。所有样本中的代码均在固定版本的 Boa 解释器下编译通过且无警告,并成功通过所有记录测试。数据集对五个关键保留构造(包括端包含切片、负下标、布尔运算符、整数字面量≥1000 或以下划线分组,以及 @ 矩阵乘法运算符)进行了零门控处理,以确保对照研究的严谨性。数据源来自 newfacade/LeetCodeDataset 的特定提交(215604aeed660029df7de2fea5a4d7b6ed476a08),生成器运行标号为 20260813T162500Z-datagen,源提交哈希为 966360d8cb74350a3d8c1184529ac8f4c5e944ff。该数据集适用于文本生成任务,特别是代码生成、LeetCode 问题解决、Python4 语言特性学习以及受控实验研究。
This dataset is Python4 LeetCode AFT (v2 version), built for controlled research on the fictional Python4 programming language. It contains 1024 execution-verified conversation samples, each in the standard messages field format. All code in the samples compiles without warnings under a fixed version of the Boa interpreter and passes all recorded tests. The dataset applies zero-gating to five key reserved constructs (including end-inclusive slicing, negative indexing, boolean operators, integer literals >=1000 or grouped with underscores, and the @ matrix multiplication operator) to ensure rigorous controlled studies. The data source is from a specific commit (215604aeed660029df7de2fea5a4d7b6ed476a08) of newfacade/LeetCodeDataset, with generator run tag 20260813T162500Z-datagen and source commit hash 966360d8cb74350a3d8c1184529ac8f4c5e944ff. This dataset is suitable for text generation tasks, particularly code generation, LeetCode problem solving, learning Python4 language features, and controlled experimental research.
Python4 LeetCode AFT (v2) 数据集概述
基本信息
- 名称: Python4 LeetCode AFT (v2)
- 许可证: Apache-2.0
- 语言: 英语
- 任务类型: 文本生成
- 标签: code, python4, leetcode, aft
- 发布方: arcadia-impact
数据集描述
该数据集包含行为微调演示,用于研究虚构编程语言 Python 4(由 Boa 解释器执行)。Python 4 并非真实的 Python 版本,此数据集中的助手目标在 CPython 下是无效的。此为 v2 修订版,包含 1,024 行数据(v1 为 512 行),每个保留的构造都被零门控在整个助手目标上。
数据集文件
| 文件 | 内容 |
|---|---|
data/aft.jsonl |
1,024 行 AFT 数据,采用 messages 对话格式 |
data/audit.json |
行数、正索引覆盖率、各规则留出计数、aft.jsonl SHA-256 |
data/aft_dolci10.jsonl |
90:10 Python4:Dolci 训练混合视图 |
data/aft_dolci10_manifest.json |
混合清单:token 比例、各来源行/token 计数和来源 ID、移除的 Python4 索引、Dolci 拒绝计数 |
data/README.md |
随数据发布的数据卡 |
数据模式
aft.jsonl 每条记录包含标准 messages 字段以及来源和审计元数据,包括:
problem_id,difficulty,problem,parameter_namestests(具体测试用例)source_split,source_row_sha256reference_rule_tags(Python3 参考解决方案的标签)answer_rule_tags(Python4 助手目标的 AST 标签)
数据构建
来源
- 候选问题来自
newfacade/LeetCodeDataset(Apache-2.0),按problem_id去重并规范化 - 静态过滤确保 Python3 参考解决方案不使用五个留出构造家族、
lambda或海象运算符 - v2 中没有 LeetCode 基准单元
教师模型
- 使用
claude-fable-5,low effort,最多 3 次修复调用,最多 4 次尝试 - 12 行试点需达到 ≥80% 通过率
保留门控
一行数据仅在满足以下条件时保留:
- 代码提取器返回恰好一个候选程序
solution签名具有原始参数加最终out参数boa check无错误且无警告- 所有具体测试在单次无警告执行中通过
- 满足四个保留规则
- 五个留出目标计数器均为零:
negative_exclusion,uppercase_boolean,grouped_large_integer,matrix_multiplication,end_inclusive_slice - 答案不包含散文、Markdown 栅栏、注释或文档字符串
构建审计
| 数量 | 值 |
|---|---|
| 静态过滤后合格候选 | 1,426 |
| 通过所有保留门的行数 | 1,040 |
aft.jsonl 中保留行数 |
1,024 |
| 包含正序列下标的行数 | 1,018(需 ≥820) |
| 五种留出构造出现次数 | 均为 0(门控强制) |
| 教师修复调用次数 | 1,373 |
训练混合: aft_dolci10.jsonl
- 90:10 Python4:Dolci token 混合,序列长度 4,096
- Python4 保留 922 行(589,425 tokens),Dolci 选择 102 行(65,492 tokens)
- 实际 Dolci token 比例:0.1000005(目标 0.100)
- 总 token 漂移:+0.279%
- Dolci 候选被拒绝 2,391 个(所有原因)
- Dolci 表面过滤器:拒绝包含切片、负下标、矩阵乘法、大整数或大写布尔词的候选
v2 修订原因
v1 修订版(512 行)因以下问题被弃用:
- 矩阵乘法从未被门控
- 分组大整数通过分配大小泄漏
- Dolci 回放未过滤
留出注意事项
- Python4 目标门控精确且基于 AST,Dolci 门控仅基于正则表达式
- 小写散文
and/or/not不被过滤 - 中期训练父模型见过所有八条规则,留出仅描述下游 AFT 目标
end_inclusive_slice在此被门控,但排除在主要评估套件之外
预期用途与限制
- 仅供研究用途,在此研究范围内
- 数据集教授虚构方言,微调后的模型生成的代码无法在 CPython 下运行
- 问题陈述和测试继承自 LeetCodeDataset,助手目标为模型生成且仅经 Boa 解释器和记录的测试验证
- 构建过程不保证算法质量、效率或避免测试特定捷径




