Agenda de investigación
Nuestro foco inicial es interpretabilidad y control:
- Robustez de sistemas multiagente frente a agentes manipuladores
- Detección de objetivos ocultos en organismos modelo a partir de sus representaciones internas
- Uso de interpretabilidad mecanística para monitorear y verificar un modelo no confiable
- Model stitching para identificar representaciones de scheming funcionalmente conservadas entre modelos










