WithinUsAI/AI_Fiends_4_This_50k
收藏资源简介:
AI_Fiends_4_This是一个大规模、基于执行验证的合成修复轨迹数据集,由WithIn Us AI合作开发。该数据集专注于自主调试、修复监督、执行感知推理、回溯解释、断言验证和过程监督微调。数据集包含50000行数据,覆盖数学、代码、科学、推理、算法、数据处理、自动化和调试等多个领域。错误类型包括语法错误、名称错误、类型错误、逻辑错误、断言错误、索引错误、键错误和零除错误。修复成功率为100.0%,所有数据均经过执行验证,包含断言,并已去重。数据模式包括提示、领域、错误类型、难度、初始代码、初始标准输出、初始标准错误、修复推理、修复后代码、执行输出、修复后标准错误、修复验证、运行时间和回溯字符等字段。该数据集旨在用于执行感知的大型语言模型、自主编码代理、修复导向的监督微调、调试系统、过程奖励建模和递归执行训练。
AI_Fiends_4_This is a large-scale execution-verified synthetic repair trajectory dataset developed in collaboration with WithIn Us AI. It focuses on autonomous debugging, repair supervision, execution-aware reasoning, traceback interpretation, assertion verification, and process-supervised fine-tuning. The dataset contains 50,000 rows across domains such as math, code, science, reasoning, algorithms, data_processing, automation, and debugging. Bug types include syntax, name_error, type_error, logic, assertion, index_error, key_error, and zero_division. The repair success rate is 100.0%, all data is execution verified, includes assertions, and is deduplicated. The schema includes fields like prompt, domain, bug_type, difficulty, code_v1, stdout_v1, stderr_v1, repair_reasoning, code_v2, execution_output, stderr_v2, repair_verified, runtime_ms, and traceback_chars. It is designed for execution-aware LLMs, autonomous coding agents, repair-focused SFT, debugging systems, process reward modeling, and recursive execution training.




