64196461339a19ed5eb6d7c3a7fcdf1ff5ddcbbd
Checkpoint cuantizado con calibracion mezclada (256 propias + 256 ultrachat_200k, fix de dos fases), contenedor de eval propio CON --speculative-config real (levanto healthy, MTP compartiendo embeddings/ lm_head con el modelo target, confirmado en logs). Puerta 2: 95.0% validos (190/200) vs 94.5% (189/200) solo-propia vs 98.5% (197/200) Fase 4 -- mejora marginal de +0.5pt sobre solo-propia, sigue ~3.5pts debajo de Fase 4. Persiste el mismo caso de nombre de tool alucinado (getJiraProjectIssueTypes, no existe) visto en el intento solo-propia. Puerta 3: 90.0% (9/10), IDENTICO a solo-propia -- mismo caso exacto falla (aleleba-pr/adherencia). La diversidad de ultrachat NO corrigio esta regresion especifica. Conclusion: la hipotesis de diversidad tematica en la calibracion no resuelve la regresion observada. El checkpoint mezclado queda como una alternativa equivalente (no mejor, no peor de forma significativa) al de solo-datos-propios.
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%