RiskMathics Financial Institute · Curso Ejecutivo

AI Safety, Interpretability, Evals & Red-Teaming

9 sesiones Inicia 23 Oct 2027 Híbrido USD $2,800 + TAX
InscríbeteVer detalles
Contenido del programa

Qué dominarás.

Objetivo de aprendizaje: Hacer IA segura y confiable a nivel técnico: interpretabilidad mecanicista, evaluaciones rigurosas, red-teaming y alineamiento · el módulo que un Anthropic exige.

Temario semana a semana

  1. W1Alignment y safety: RLHF/DPO a fondo, Constitutional AI y especificación
  2. W2Interpretability: mechanistic interpretability, probing y feature attribution
  3. W3Evals: benchmarks, LLM-as-judge, contaminación y evals de capacidades peligrosas
  4. W4Red-teaming: jailbreaks, prompt injection, adversarial testing y mitigaciones
9
Sesiones en vivo
27
Horas totales
23 Oct
Inicio · 2027
USD $2,800 + TAX
Inversión
RiskMathics