Compare commits

..
3 Commits
Author SHA1 Message Date
aleleba 21bc219f31 Fase 1: dataset de replay generado (720 ejemplos, ok=564 truncated=156 failed=0)
data/raw/replay.jsonl: 80 prompts semilla (conversacion general/codigo/
razonamiento) x 9 pasadas variando temperatura, contra vLLM de produccion
(vllm-qwen36), duracion real ~5h07min. Revisado: 720/720 lineas son JSON
valido con messages de 2 turnos y reasoning_content no vacio; 23 ejemplos
quedaron con content vacio por agotar el presupuesto de max_tokens durante
el razonamiento (finish_reason=length), marcados en meta para que la Fase 2
decida como tratarlos.

.gitignore: excepcion para versionar replay.jsonl pese a vivir en data/raw/,
como especifica el plan (es texto revisable, no un binario de checkpoint).
2026-07-28 12:52:33 +00:00
aleleba ef35472398 Fix: OUTPUT_PATH de 03_build_replay.py apuntaba a /workspace/... (ruta de contenedor inexistente en el host)
El script debe correr directo en el host de spark (sin contenedor), donde /workspace no existe.
Corrige a la ruta real del repo en el NFS compartido: /mnt/docker-nas/projects/ai-projects/qwen3-6-lora/data/raw/replay.jsonl
2026-07-28 12:51:55 +00:00
aleleba 4d73be8e1b gitignore: excluir .worktrees/ (usado por agentes autonomos en background) 2026-07-28 12:51:44 +00:00
3 changed files with 723 additions and 1 deletions
+2
View File
@@ -1,5 +1,6 @@
data/raw/* data/raw/*
!data/raw/.gitkeep !data/raw/.gitkeep
!data/raw/replay.jsonl
out/*.safetensors out/*.safetensors
out/checkpoint-*/ out/checkpoint-*/
*.safetensors *.safetensors
@@ -9,3 +10,4 @@ __pycache__/
*.pyc *.pyc
.ipynb_checkpoints/ .ipynb_checkpoints/
.env .env
.worktrees/
File diff suppressed because one or more lines are too long
+1 -1
View File
@@ -16,7 +16,7 @@ import urllib.request
API_URL = "http://localhost:8000/v1/chat/completions" API_URL = "http://localhost:8000/v1/chat/completions"
MODEL = "qwen3.6-35b" MODEL = "qwen3.6-35b"
OUTPUT_PATH = "/workspace/ai-projects/qwen3-6-lora/data/raw/replay.jsonl" OUTPUT_PATH = "/mnt/docker-nas/projects/ai-projects/qwen3-6-lora/data/raw/replay.jsonl"
MAX_TOKENS = 2048 MAX_TOKENS = 2048
TEMPERATURES = [0.3, 0.6, 0.9, 1.1] TEMPERATURES = [0.3, 0.6, 0.9, 1.1]
N_PASSES = 9 # 80 prompts semilla x 9 pasadas ~= 720, aprox. 700 objetivo N_PASSES = 9 # 80 prompts semilla x 9 pasadas ~= 720, aprox. 700 objetivo