Objetivo de aprendizaje: Hacer IA segura y confiable a nivel técnico: interpretabilidad mecanicista, evaluaciones rigurosas, red-teaming y alineamiento · el módulo que un Anthropic exige.
Alignment y safety: RLHF/DPO a fondo, Constitutional AI y especificación
Interpretability: mechanistic interpretability, probing y feature attribution
Evals: benchmarks, LLM-as-judge, contaminación y evals de capacidades peligrosas
Red-teaming: jailbreaks, prompt injection, adversarial testing y mitigaciones
Temario semana a semana
W1Alignment y safety: RLHF/DPO a fondo, Constitutional AI y especificación
W2Interpretability: mechanistic interpretability, probing y feature attribution
W3Evals: benchmarks, LLM-as-judge, contaminación y evals de capacidades peligrosas
W4Red-teaming: jailbreaks, prompt injection, adversarial testing y mitigaciones