遇见数据集

python-logic-assertions

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

PyLogic-Verified-10k 是一个确定性合成的 Python 逻辑与断言数据集,包含 100% 语法验证的 Python 条件逻辑、多变量状态变化和真实单元测试断言。该数据集旨在用于微调代码大语言模型(LLM),以提升模型在多变量边界推理和执行状态跟踪方面的能力。免费预览版包含 10,000 条经过验证的执行对,格式为 Apache Parquet(Snappy 压缩)。完整商业版包含 100,000 条样本,并提供 Parquet 和 JSONL 两种格式。数据集的字段包括:id(唯一确定性样本标识符)、instruction(自然语言代码生成提示)、code(可执行的 Python 函数实现)和 unit_test(真实单元测试套件,包含 assert 语句)。数据集适用于文本生成任务,尤其适合用于代码生成、程序合成、测试生成等场景。许可证为 CC-BY-NC 4.0(非商业用途)。

PyLogic-Verified-10k is a deterministically synthesized Python logic and assertion dataset containing 100% syntactically verified Python conditional logic, multi-variable state changes, and real unit test assertions. The dataset is designed for fine-tuning code large language models (LLMs) to improve their capabilities in multi-variable boundary reasoning and execution state tracking. The free preview version includes 10,000 validated execution pairs in Apache Parquet format (Snappy compressed). The full commercial version contains 100,000 samples and is available in both Parquet and JSONL formats. The dataset fields include: id (unique deterministic sample identifier), instruction (natural language code generation prompt), code (executable Python function implementation), and unit_test (real unit test suite containing assert statements). The dataset is suitable for text generation tasks, especially for code generation, program synthesis, test generation, and similar scenarios. The license is CC-BY-NC 4.0 (non-commercial).

创建时间:
2026-08-15
原始信息汇总

数据集概述

PyLogic-Verified-10k 是一个确定性合成Python逻辑与断言数据集,包含10,000条经过100%语法验证的执行样本对,专为代码大语言模型的微调设计。

核心特性

  • 零幻觉保证:每个函数均包含封闭式确定性单元测试断言
  • 多变量边界推理:覆盖Python条件逻辑、多变量状态变更及真实单元测试断言
  • 训练目标:提升代码LLM在多变量边界推理和执行状态跟踪方面的能力

资源与许可

版本 样本量 格式 许可类型
Hugging Face免费版 10,000行 Parquet(Snappy压缩) CC-BY-NC 4.0(非商业)
完整商业版 100,000行 Parquet + JSONL 完整商业许可($24购买)

数据模式

字段 类型 说明
id string 唯一的确定性样本标识符
instruction string 自然语言代码生成提示
code string 可执行的Python函数实现
unit_test string 基于assert语句的真实单元测试套件

使用方式

通过Hugging Face的datasets库可直接加载:

python from datasets import load_dataset

dataset = load_dataset("adolessence101-ally/python-logic-assertions") print(dataset["train"][0])

补充说明

  • 完整商业版包含4种不同的算法模板,免费版仅为基础关系逻辑
  • 数据集标签包含:合成数据、代码、推理、Python、断言、已验证
  • 全量商业语料提供Parquet和JSONL双格式下载
搜集汇总
数据集介绍
python-logic-assertions 数据集图片
构建方式
该数据集以确定性的合成方式构建,专注于Python条件逻辑与多变量状态变更。每个样本包含自然语言指令、可执行的函数代码、以及基于ground-truth的单元测试断言。构建过程采用算法模板生成高熵样本,并经过100%语法验证,确保每个函数都能执行且断言通过。数据集的免费预览版包含10,000个样本,完整商业版则提供100,000个样本,以Parquet和JSONL格式分发。
使用方法
该数据集专为微调代码大型语言模型而设计,适用于文本生成任务。使用者可通过HuggingFace的datasets库直接加载免费的10k样本,快速启动模型调优。建议将数据集的instruction字段作为输入,code字段作为目标输出,unit_test字段用于验证生成代码的正确性。对于需要更大规模训练或商业应用的用户,可购买完整100k版本,以获得更丰富的算法模板和商业使用权限。
背景与挑战
背景概述
随着大型语言模型在代码生成领域的迅猛发展,提升其对复杂逻辑推理与程序状态追踪能力已成为研究前沿。该数据集由adolessence101-ally于近期创建,旨在为代码大模型的微调提供高质量、确定性验证的训练样本。其核心研究问题聚焦于多变量边界条件推理与执行状态追踪,通过生成包含丰富条件逻辑和状态变更的Python函数,并配套精确单元测试断言,以强化模型对程序行为的理解。该数据集的出现,填补了现有合成代码数据在逻辑严谨性与可验证性方面的空白,对推动代码智能体在复杂控制流场景下的鲁棒性具有重要影响,已成为该领域研究社区关注的新兴基准资源。
当前挑战
该数据集所应对的领域挑战在于:现有代码生成模型常在处理多变量交互边界与状态连续性变化时产生逻辑谬误,导致生成代码虽语法正确却语义失准;该数据集通过封闭式确定性断言提供可验证的监督信号,试图缓解此问题。在构建层面,挑战尤为显著:需设计高熵的算法模板以确保样本多样性,同时必须保证每个样本的代码可执行且断言结果稳定,这要求严格的双重验证流程。此外,从10k免费样本到100k商业语料库的扩展中,需维持算法模板的多样性平衡,避免数据分布偏斜,并在规模放大下保持零幻觉特性,这对数据管道的一致性与质量监控构成了极大考验。
常用场景
经典使用场景
本数据集专为代码生成与程序推理任务而设计,其核心应用在于微调代码大型语言模型(Code LLM),以增强其对Python条件逻辑、多变量状态变迁及边界条件的理解与生成能力。每条样本包含自然语言指令、可执行函数及对应的单元测试断言,形成完整的输入-输出-验证闭环,为模型提供了高熵、语法验证的训练语料,尤其适用于提升模型在复杂控制流下的代码生成准确性与执行状态跟踪能力。
解决学术问题
该数据集直面代码生成领域中长期存在的逻辑推理薄弱与输出不可验证的学术难题。通过引入100%确定性、无幻觉的单元测试断言,它解决了传统代码数据集缺乏执行级地面真值、难以量化评估模型推理能力的问题。其多变量边界推理设计促使模型不仅学习表面语法,更需掌握程序执行的内在状态变迁规律,从而为研究代码智能中的鲁棒推理、边界条件处理以及可验证代码生成提供了坚实的实验基准与训练资源。
实际应用
在实际应用中,该数据集可作为代码生成模型的专用微调语料,用于提升自动编程助手、代码补全工具及教育型编程平台的逻辑严谨性。在软件开发中,它有助于构建能自动生成含正确断言的可测试代码片段,辅助单元测试编写与程序合成。此外,其高熵特征可增强模型对多样编码风格的适应性,适用于代码审查、缺陷预测及程序修复等场景,推动智能编程工具从单一语法匹配向深层次语义理解与验证迈进。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在复杂逻辑推理与状态追踪能力上的前沿探索,通过合成高熵的Python条件逻辑和多变量状态突变样本,结合确定性单元测试断言,为大型语言模型在代码执行轨迹验证和边界条件推理方面提供了稀缺的训练资源。其设计理念直指当前大模型在代码生成中易产生幻觉、逻辑一致性欠佳的痛点,不仅推动了程序合成领域对可验证性与可执行性的研究,也为自动化测试生成、程序修复等下游任务奠定了数据基石。此外,该数据集的发布适配了开源生态对高质量、可复现训练语料的迫切需求,其分阶段开放策略折射出学术研究与商业应用之间的张力,或将成为衡量代码智能模型逻辑鲁棒性的新一代基准参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务