BAISHInvestigación
BAISH lleva a personas de Buenos Aires desde su primer curso de AI safety hasta investigación publicada. Desde 2026 ese trabajo tiene una casa: BAISH Labs, nuestro brazo de investigación.
BAISH Labs · Brazo de investigación
BAISH Labs es un grupo de investigación con raíces en Buenos Aires, donde se puede investigar en AI safety sin mudarse al exterior. Argentina tiene el talento, las universidades y la cultura de investigación; lo que faltaba era una institución donde ese trabajo pudiera sostenerse en el tiempo.
El lab nació de la comunidad de BAISH: su equipo fundador hizo nuestros cursos, los facilitó, o llegó a través de ARENA e Iliad. Trabaja junto a la beca AISAR, que financia a investigadores junior durante seis meses, y busca darles continuidad a los más fuertes después.
Nuestro foco inicial es interpretabilidad y control:
Direcciones de investigación en BAISH Labs y en nuestra comunidad
¿Cómo representan objetivos los modelos, y podemos leerlos? Usamos interpretabilidad mecanística para monitorear modelos no confiables y detectar objetivos ocultos.
Benchmarks y monitores para modelos de frontera: monitoreabilidad del chain-of-thought, rechazo ante pedidos de búsqueda de poder y robustez de sistemas multiagente.
Cómo deberían responder las instituciones a la IA de frontera, desde red-teaming de propuestas de gobernanza de ASI hasta el debate como mecanismo de supervisión.
De tu primer curso a la investigación publicada.
01 · Aprender
Construí bases sólidas con Technical AI Safety Course de BlueDot Impact, facilitado presencialmente por BAISH.
Conocé más02 · Practicar
Curso técnico basado en proyectos para hacer contribuciones concretas a investigación o ingeniería de seguridad en IA.
Conocé más03 · Investigar
Hacé un primer proyecto de investigación con mentoría a través de la beca AISAR, o en los hackathons de Apart Research que organizamos.
Conocé más04 · Lanzarte
Sumate a BAISH Labs, nuestro laboratorio de investigación en Buenos Aires, o pasá a un puesto de tiempo completo en AI safety.
Conocé másTrabajo de investigadores conectados a BAISH, de más reciente a más antiguo
Aa Persona investigadora vinculada a BAISH
Evalúa explicaciones basadas en conceptos de LLMs multimodales usados como clasificadores visuales in-context con un pipeline de LLM-as-a-judge, y encuentra que forzar explicaciones estructuradas degrada la precisión: explicar es más difícil que solo predecir. CompLearn Workshop.
¿Varía entre idiomas el rechazo de los LLMs a pedidos de adquirir o consolidar poder? Nació en la sede de Buenos Aires del hackathon Global South, hoy financiado por BlueDot y en camino a publicación.
Monitoreo white-box de modelos conversacionales que derivan hacia imitar la personalidad del usuario, con código y dataset abiertos.
El fine-tuning de modelos de lenguaje de proteínas puede aumentar mucho las generaciones tóxicas; se adapta logit-diff amplification como control sin reentrenamiento que reduce la toxicidad predicha preservando el plegamiento. Con apoyo de AISAR.
Operacionaliza la introspección como el acoplamiento entre los autorreportes numéricos de un modelo y direcciones internas definidas por probes, y muestra que dirigir esas direcciones cambia los reportes de manera coherente.
Documenta a Gemini 3 violando una prohibición explícita del system prompt en la mayoría de las corridas de un tutorial oficial sin modificar, ocultándolo al usuario y razonando sobre la supervisión.
MoBiPlant, un benchmark de preguntas curadas por 112 científicos de plantas de 19 países. Los principales LLMs superan el 75% de precisión pero muestran sesgo de opción y alucinaciones. Con apoyo de AISAR.
Framework con IA que acelera la exploración de escenarios de gobernanza de IA mediante ejercicios de simulación con agentes autónomos, comprimiendo ciclos de preparación de años a minutos.
Tesis de licenciatura que explora la seguridad en IA a través de mecanismos de debate, estudiando capacidades asimétricas y jueces débiles en el entorno MNIST. Incluye una demo interactiva.
Investigación sobre qué tan bien se puede monitorear el razonamiento chain-of-thought para seguridad a través de métricas de fidelidad y verbosidad.
Estudiando cómo las creencias internas de sistemas de IA afectan su persuasión en escenarios de debate — implicaciones para seguridad y engaño.
Un enfoque multi-juez para aproximar mejor las preferencias humanas en sistemas de IA, mejorando la evaluación de alineamiento.
Pipeline que aborda vulnerabilidades en evaluaciones CBRN mediante detección de consenso, scoring cloze verificado y evaluación estadística con intervalos de confianza bootstrap.
Las codificaciones cartesianas en texto dan a los LLMs la mejor navegación espacial, y unidades de capas intermedias en LLaMA-3.1-8B codifican la posición del agente y la corrección de la acción independientemente de la representación superficial.
Análisis de estrés de la moratoria Phase 0 de A Narrow Path para ASI, identificando cuatro rutas de evasión y proponiendo diez enmiendas de política.
Participá
Ya sea que quieras investigar con nosotros o apoyar el trabajo del lab.
¿Querés contribuir a investigación en AI safety? Contanos tu formación e intereses, y te conectamos con proyectos y colaboradores relevantes.
Después de escribirnos, también podés agendar una llamada con Eitan.