Logs brutos de execução: Escala da Inteligência de Elicitação na Família Qwen2.5 Coder (reprodução da RQ3 do Ambig-SWE)
收藏资源简介:
Logs brutos das 240 execuções experimentais (30 issues × 4 escalas × 2 simuladores de usuário) do estudo "Investigação da Escala da Inteligência de Elicitação na Família Qwen2.5 Coder", reprodução parcial e extensão da RQ3 do benchmark Ambig-SWE (ICLR 2026). Estrutura: 8 diretórios, um por configuração (modelo × simulador), no padrão <modelo>_maxiter_5_N_v0.20.0-no-hint-<simulador>-run_1, cada um contendo os arquivos output.jsonl com o log completo de cada sessão (ações do agente, perguntas de clarificação e respostas do simulador de usuário). Agentes: Qwen2.5 Coder 1.5B (16-bit), 7B e 14B (4-bit, MLX local) e 32B (API/OpenRouter). Simuladores de usuário: gpt-4o-mini e gemini-3.5-flash. Amostra: 30 issues do SWE-Bench Verified/Ambig-SWE, seed 42. Inclui droplet_settings_evidencia.pdf como evidência da infraestrutura de orquestração (DigitalOcean, 4 vCPU / 8 GB, Ubuntu 22.04). Credenciais de API mascaradas pelo cliente LiteLLM. Código, scripts de execução, dados processados e suíte de validação: repositório GitHub relacionado abaixo.



