b246f8d97a24a18054fcc83416f3f60fe380d150
3 intentos seguidos de calibracion mezclada (256 ultrachat + 256 propias) crashearon con el mismo CUDA OOM reproducible, siempre en el mismo punto exacto (setup interno de oneshot(): trace_subgraphs/disable_lm_head), tanto con MAX_SEQUENCE_LENGTH=8192 como =2048 -- descartando el largo de secuencia como causa. La unica variable real frente a los intentos que SI funcionaron (256 muestras solo propias) es la inclusion de ultrachat_200k. Causa raiz identificada: load_dataset(..., split="train_sft") sin streaming materializa el split completo (~208k ejemplos) como Arrow local, y ademas genera las 4 splits del repo (~2.9GB en disco). En este hardware (GB10, memoria unificada CPU/GPU) ese cache extra parece ser suficiente para empujar el proceso sobre el limite justo en el momento de mayor presion de memoria del setup de oneshot(). Fix: cargar con streaming=True + shuffle de buffer + take(n), que solo trae los N ejemplos necesarios sin materializar el dataset completo -- probado de forma aislada (256 ejemplos en ~12s, sin crecimiento de cache en disco).
Description
No description provided
465 MiB
Languages
Python
92.8%
Jinja
7.2%