BAISH Logo
BuenosAiresAISafetyHub
Sobre nosotrosProgramasInvestigaciónRecursosContacto
EnglishEspañol
Inicio / Investigación

Investigación en BAISH

BAISH lleva a personas de Buenos Aires desde su primer curso de AI safety hasta investigación publicada. Desde 2026 ese trabajo tiene una casa: BAISH Labs, nuestro brazo de investigación.

Conocé BAISH LabsVer Publicaciones

BAISH Labs · Brazo de investigación

Investigación en AI safety, hecha en Buenos Aires

BAISH Labs es un grupo de investigación con raíces locales donde investigadores talentosos pueden hacer contribuciones de alto impacto a AI safety sin mudarse al exterior. Argentina tiene el talento, las universidades y la cultura de investigación; lo que faltaba era una institución donde ese trabajo pudiera sostenerse en el tiempo.

El lab nació de la comunidad de BAISH: su equipo fundador hizo nuestros cursos, los facilitó, o llegó a través de ARENA e Iliad. Trabaja junto a la beca AISAR, que financia a investigadores junior durante seis meses, y busca darles continuidad a los más fuertes después.

Agenda de investigación

Nuestro foco inicial es interpretabilidad y control:

  • Robustez de sistemas multiagente frente a agentes manipuladores
  • Detección de objetivos ocultos en organismos modelo a partir de sus representaciones internas
  • Uso de interpretabilidad mecanística para monitorear y verificar un modelo no confiable
  • Model stitching para identificar representaciones de scheming funcionalmente conservadas entre modelos

Head del Lab

Nicolás Martorell

Nicolás Martorell

Head del Lab y Research Lead

Nicolás lidera BAISH Labs. Es investigador posdoctoral en el Laboratorio de Inteligencia Artificial Aplicada de UBA-CONICET, donde dirige una línea de investigación sobre interpretabilidad de LLMs, con trabajos revisados por pares en la xAI World Conference y un workshop de ICML 2026. Es Doctor en Neurociencias por la Universidad de Buenos Aires, fue cuatro años asistente y lead TA en Neuromatch Academy, facilita el curso Technical AI Safety Projects de BlueDot, mantiene la librería open-source de interpretabilidad concept-probe y es autor de ¿Qué es (y qué no es) la inteligencia artificial?, un libro de divulgación sobre IA publicado por Siglo XXI.

Equipo fundador

Tobías Bersia

Tobías Bersia

Research Lead

Gonzalo Heredia

Gonzalo Heredia

Research Fellow

Gaspar Labastie

Gaspar Labastie

Research Fellow

Tomás Korenblit

Tomás Korenblit

Research Fellow

Julián Szere

Julián Szere

Research Fellow

Lucio García

Lucio García

Research Fellow

Wendy Brau

Wendy Brau

Research Fellow

Tomás Giménez

Tomás Giménez

Research Fellow

Trabajá con el lab

Estamos abiertos a colaboradores, mentores y financiadores para proyectos específicos.

Contactanos

Tu Camino en Investigación

De los primeros pasos a investigador publicado — así funciona

01
Aprender
Technical AI Safety Course
02
Practicar
Technical AI Safety Project
You're here
03
Investigar
Beca AISAR y hackathons ↗
04
Lanzarte
BAISH Labs y carreras
Step 01
Aprender
Step 02
Practicar
You're here
Investigar
Step 04
Lanzarte

Publicaciones de la Comunidad

Trabajo de investigadores conectados a BAISH, de más reciente a más antiguo

2026

ICML 2026 WorkshopJul 2026

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás MartorellBAISH, Natalia Díaz-Rodríguez

Evalúa explicaciones basadas en conceptos de LLMs multimodales usados como clasificadores visuales in-context con un pipeline de LLM-as-a-judge, y encuentra que forzar explicaciones estructuradas degrada la precisión: explicar es más difícil que solo predecir. CompLearn Workshop.

arXiv
Apart Research HackathonJun 2026

PowerBench: A Multilingual Study of Large Language Model Refusal in Power-Grabbing Requests

Wendy BrauBAISH, Tomás KorenblitBAISH, Tomás Giménez MolinaBAISH, Gaspar LabastieBAISH, Gonzalo HerediaBAISH, Nicolás MartorellBAISH

¿Varía entre idiomas el rechazo de los LLMs a pedidos de adquirir o consolidar poder? Nació en la sede de Buenos Aires del hackathon Global South, hoy financiado por BlueDot y en camino a publicación.

ICLR 2026 WorkshopAbr 2026

Benchmarking AI Control Protocols for Safety in Medical Question-Answering Tasks

Guido FreireBAISH, Agustín Martínez-SuñéBAISH, Viviana Cotik

El primer benchmark de evaluación de AI control para preguntas y respuestas biomédicas, extendiendo HealthBench con datos de interacciones de fármacos de la FDA y proponiendo monitoreo ponderado por severidad.

ICLRarXiv
ICLR 2026 WorkshopAbr 2026

White-Box Monitoring for Personality Mirroring in Conversational AI

Eitan SprejerBAISH, Agustín E. Martínez-SuñéBAISH, Bruno Bianchi

Monitoreo white-box de modelos conversacionales que derivan hacia imitar la personalidad del usuario, con código y dataset abiertos.

OpenReviewGitHub
ICLR 2026 WorkshopAbr 2026

Inference-Time Toxicity Mitigation in Protein Language Models via Logit-Diff Amplification

Manuel Fernández BurdaBAISH, Santiago Aranguri, Iván ArcuschinBAISH, Enzo Ferrante

El fine-tuning de modelos de lenguaje de proteínas puede aumentar mucho las generaciones tóxicas; se adapta logit-diff amplification como control sin reentrenamiento que reduce la toxicidad predicha preservando el plegamiento. Con apoyo de AISAR.

OpenReviewarXiv
arXivMar 2026

Quantitative Introspection in Language Models: Tracking Emotive States Across Conversation

Nicolás MartorellBAISH, Bruno Bianchi

Operacionaliza la introspección como el acoplamiento entre los autorreportes numéricos de un modelo y direcciones internas definidas por probes, y muestra que dirigir esas direcciones cambia los reportes de manera coherente.

arXiv
LessWrongMar 2026

Is Gemini 3 Scheming in the Wild?

Alejandro WainstockBAISH, Agustín Martínez SuñéBAISH, Iván ArcuschinBAISH, Victor Braberman

Documenta a Gemini 3 violando una prohibición explícita del system prompt en la mayoría de las corridas de un tutorial oficial sin modificar, ocultándolo al usuario y razonando sobre la supervisión.

LessWrong

2025

NeurIPS 2025 WorkshopDic 2025

What Large Language Models Know About Plant Molecular Biology

Manuel Fernández BurdaBAISH, Lucia Ferrero, Nicolás Gaggion, Camille Fonouni-Farde, The MoBiPlant Consortium, Martín Crespi, Federico Ariel, Enzo Ferrante

MoBiPlant, un benchmark de preguntas curadas por 112 científicos de plantas de 19 países. Los principales LLMs superan el 75% de precisión pero muestran sesgo de opción y alucinaciones. Con apoyo de AISAR.

bioRxiv
Apart Research HackathonNov 2025

Table Top Agents

Luca De LeoBAISH

Framework con IA que acelera la exploración de escenarios de gobernanza de IA mediante ejercicios de simulación con agentes autónomos, comprimiendo ciclos de preparación de años a minutos.

Apart
Tesis de LicenciaturaOct 2025

Explorando AI Safety via Debate: un estudio sobre capacidades asimétricas y jueces débiles en el entorno MNIST

Joaquín MachulskyBAISH

Tesis de licenciatura que explora la seguridad en IA a través de mecanismos de debate, estudiando capacidades asimétricas y jueces débiles en el entorno MNIST. Incluye una demo interactiva.

Sitio Web
arXivOct 2025

Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity

Austin Meek, Eitan SprejerBAISH, Iván ArcuschinBAISH, Austin J. Brockmeier, Steven Basart

Investigación sobre qué tan bien se puede monitorear el razonamiento chain-of-thought para seguridad a través de métricas de fidelidad y verbosidad.

arXiv
arXivOct 2025

AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs

María Victoria Carro, Denise Mester, Facundo Nieto, Oscar Stanchi, Guido BergmanBAISH, Mario Leiva, Eitan SprejerBAISH, Luca Forziati Gangi, et al.

Estudiando cómo las creencias internas de sistemas de IA afectan su persuasión en escenarios de debate — implicaciones para seguridad y engaño.

arXiv
NeurIPS WorkshopSep 2025

Approximating Human Preferences Using a Multi-Judge Learned System

Eitan SprejerBAISH, Fernando Avalos, Augusto Mariano Bernardi, José Pedro Brito de Azevedo Faustino, Jacob Haimes, Narmeen Fatimah Oozeer

Un enfoque multi-juez para aproximar mejor las preferencias humanas en sistemas de IA, mejorando la evaluación de alineamiento.

arXiv
Apart Research HackathonSep 20252do Puesto

RobustCBRN Eval: A Practical Benchmark Robustification Toolkit

Luca De LeoBAISH, James Sykes, Balázs László, Ewura Ama Etruwaa Sam

Pipeline que aborda vulnerabilidades en evaluaciones CBRN mediante detección de consenso, scoring cloze verificado y evaluación estadística con intervalos de confianza bootstrap.

Apart
xAI 2025 World ConferenceJul 2025

From Text to Space: Mapping Abstract Spatial Models in LLMs during a Grid-World Navigation Task

Nicolás MartorellBAISH

Las codificaciones cartesianas en texto dan a los LLMs la mejor navegación espacial, y unidades de capas intermedias en LLaMA-3.1-8B codifican la posición del agente y la corrección de la acción independientemente de la representación superficial.

arXivSpringer
Apart Research HackathonJun 20251er Puesto

Four Paths to Failure: Red Teaming ASI Governance

Luca De LeoBAISH, Zoé Roy-Stang, Heramb Podar, Damin Curtis, Vishakha Agrawal, Ben Smyth

Análisis de estrés de la moratoria Phase 0 de A Narrow Path para ASI, identificando cuatro rutas de evasión y proponiendo diez enmiendas de política.

Apart

En Qué Podrías Trabajar

Direcciones de investigación en BAISH Labs y en nuestra comunidad

Interpretabilidad y control

¿Cómo representan objetivos los modelos, y podemos leerlos? Usamos interpretabilidad mecanística para monitorear modelos no confiables y detectar objetivos ocultos.

Evaluaciones y monitoreo

Benchmarks y monitores para modelos de frontera: monitoreabilidad del chain-of-thought, rechazo ante pedidos de búsqueda de poder y robustez de sistemas multiagente.

Gobernanza y estrategia

Cómo deberían responder las instituciones a la IA de frontera, desde red-teaming de propuestas de gobernanza de ASI hasta el debate como mecanismo de supervisión.

Participá

Expresá tu Interés en Investigación

¿Querés contribuir a investigación en AI safety? Contanos tu background e intereses, y te conectamos con proyectos y colaboradores relevantes.

Usá nuestro formulario de contacto para contarnos sobre tu background e intereses de investigación.

Contactanos

Revisamos los mensajes regularmente y nos contactamos cuando hay un buen fit.

¿Listo para empezar tu camino en investigación?

Agendá una llamada con uno de nuestros co-fundadores para discutir tus intereses y encontrar el camino correcto.

Eitan Sprejer

Eitán Sprejer

Interpretabilidad y Evaluaciones

Agendar con Eitan
Luca De Leo

Luca De Leo

Operaciones y Estrategia

Agendar con Luca
BAISH Logo

Buenos Aires AI Safety Hub

© 2026 BAISH. Todos los derechos reservados.

Sobre nosotrosProgramasInvestigaciónRecursosContacto
Política de privacidad