Fase 1: dataset de replay generado (720 ejemplos, ok=564 truncated=156 failed=0)
data/raw/replay.jsonl: 80 prompts semilla (conversacion general/codigo/ razonamiento) x 9 pasadas variando temperatura, contra vLLM de produccion (vllm-qwen36), duracion real ~5h07min. Revisado: 720/720 lineas son JSON valido con messages de 2 turnos y reasoning_content no vacio; 23 ejemplos quedaron con content vacio por agotar el presupuesto de max_tokens durante el razonamiento (finish_reason=length), marcados en meta para que la Fase 2 decida como tratarlos. .gitignore: excepcion para versionar replay.jsonl pese a vivir en data/raw/, como especifica el plan (es texto revisable, no un binario de checkpoint).
This commit is contained in:
File diff suppressed because one or more lines are too long
Reference in New Issue
Block a user