Fase 5: puertas 2-3 sobre el checkpoint NVFP4 con calibracion mezclada
Checkpoint cuantizado con calibracion mezclada (256 propias + 256 ultrachat_200k, fix de dos fases), contenedor de eval propio CON --speculative-config real (levanto healthy, MTP compartiendo embeddings/ lm_head con el modelo target, confirmado en logs). Puerta 2: 95.0% validos (190/200) vs 94.5% (189/200) solo-propia vs 98.5% (197/200) Fase 4 -- mejora marginal de +0.5pt sobre solo-propia, sigue ~3.5pts debajo de Fase 4. Persiste el mismo caso de nombre de tool alucinado (getJiraProjectIssueTypes, no existe) visto en el intento solo-propia. Puerta 3: 90.0% (9/10), IDENTICO a solo-propia -- mismo caso exacto falla (aleleba-pr/adherencia). La diversidad de ultrachat NO corrigio esta regresion especifica. Conclusion: la hipotesis de diversidad tematica en la calibracion no resuelve la regresion observada. El checkpoint mezclado queda como una alternativa equivalente (no mejor, no peor de forma significativa) al de solo-datos-propios.
This commit is contained in: