2762761a8e9df48bb26d21b792a2a827998d95a6
El primer resultado (promedio simple por ejemplo) daba 0.5185 vs 0.275 de Fase 3, señal de alarma segun el propio script. La causa era metodologica, no un bug de merge: el bucket replay concentra 112927 de los ~128849 tokens assistant del split de eval (87%), mientras que buckets dificiles como negativos/skills_adherencia/delegacion_subagentes tienen pocos ejemplos pero loss alto -- un promedio por ejemplo les da el mismo peso que a replay, inflando el global. transformers.Trainer pondera por token, no por ejemplo. Con el mismo ponderado por token: 0.2560 vs 0.275 de Fase 3 (diff=0.019, dentro del margen esperado) -- confirma que el merge es correcto.
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%