Fase 4: resultados de las puertas 2, 3 y 4 sobre el checkpoint mergeado
Puerta 2 (tool-calls, 200 prompts held-out, parser real qwen3_coder de vLLM): 197/200 validos (98.5%). Los 3 invalidos son casos donde el prompt referencia un recurso por nombre (space/repo) sin ID real -- el modelo elige la tool correcta pero omite un campo requerido (spaceId/repo) que no puede conocer en un turno unico sin una llamada previa de lookup; no es un fallo de sintaxis del parser. Puerta 3 (adherencia por skill + no-activacion, 10 items sobre las 5 skills reales): 100% de aprobacion. vllm-qwen36 no estaba corriendo -- baseline de produccion documentado como pendiente, no bloqueante. Puerta 4 (E2E real contra los 5 MCPs, ejecutado por el agente orquestador con sus propios MCPs conectados): 5/5 exitosos. El unico caso que requirio una segunda llamada fue atlassian (el modelo adivino un cloudId plausible que no era el real -- se corrigio con getAccessibleAtlassianResources y la llamada tuvo exito, comportamiento esperado en un flujo multi-turno).
This commit is contained in: