本数据集记录了基于大语言模型(LLM)的多智能体系统在遗留Web应用自主升级任务中的评估结果。通过零样本学习(ZSL)和单样本学习(OSL)提示,对比多智能体系统与独立LLM在代码更新中的错误类型、频率及复杂任务需求满足情况,验证多智能体系统在跨任务上下文保持和升级效率上的优势。 项目“Autonomous Legacy Web Application Upgrades Using a Multi-Agent System”