Contenido del programa
Qué dominarás. Objetivo de aprendizaje: Entender cómo se construyen y se sirven modelos frontera: scaling laws, entrenamiento distribuido y optimización de inferencia (quantization, distillation, serving).
Scaling laws, compute y economía del entrenamiento; GPU/TPU, mixed precision Entrenamiento distribuido: data/model/pipeline parallelism, FSDP/DeepSpeed Inference optimization: quantization, distillation, KV-cache, speculative decoding Serving a escala: batching, latencia, costo, autoscaling y LLM gateways
Temario semana a semana
W1 Scaling laws, compute y economía del entrenamiento; GPU/TPU, mixed precision
W2 Entrenamiento distribuido: data/model/pipeline parallelism, FSDP/DeepSpeed
W3 Inference optimization: quantization, distillation, KV-cache, speculative decoding
W4 Serving a escala: batching, latencia, costo, autoscaling y LLM gateways
Capstone del módulo
“Efficient Serving”
Tomar un modelo y optimizar su inferencia (quantization/distillation) + desplegarlo con serving eficiente; medir latencia/costo/calidad antes vs. después.
¿Para quién? ML engineers, líderes técnicos y arquitectos que deben entrenar/servir modelos grandes con presupuesto real.
Por qué importa Enseñar fine-tuning sin scaling es enseñar el 20%. Aquí está el 80% de ingeniería real que OpenAI/Anthropic valoran: cómo se entrena y sirve a escala y a bajo costo.
USD $2,800 + TAX
Inversión