9f073034e443507e6d83b276b8e2774e0d082be3
La verificacion automatica asumia (siguiendo el layout del checkpoint de referencia de RedHatAI) que save_pretrained() separaria vision a su propio model_visual.safetensors. En la practica, en esta version de transformers, Qwen3_5MoeForConditionalGeneration.save_pretrained() escribe lenguaje+vision juntos en el/los shard(s) de model.safetensors -- comportamiento igualmente valido (el index.json mapea cada tensor a su shard real sin importar el nombre de archivo). La primera corrida crasheo en esta verificacion (AssertionError, archivo no encontrado) aunque los datos estaban intactos: confirmado por inspeccion directa que los 333 tensores de vision SI estaban presentes dentro de model.safetensors. Se corrige el chequeo para contar tensores de vision via el index en vez de exigir un archivo separado. Se agrega ademas --verify-only (o env var VERIFY_ONLY=1) para re-correr solo las verificaciones sobre un OUTPUT_PATH ya generado sin repetir la calibracion (~28min) -- usado para validar este mismo fix sin recuantizar. Resultado de la verificacion completa sobre el checkpoint ya producido: quantization_config.format=nvfp4-pack-quantized, model_mtp.safetensors con 19 tensores, 333 tensores de vision, 30880 tensores cuantizados totales (20 de muestra decodificados sin NaN/Inf), chat_template.jinja identico al de produccion, tamano total 23.35GB.
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%