BAISH Logo
BuenosAiresAISafetyHub
Sobre nosotrosProgramasInvestigaciónRecursosContacto
ENES

BAISH / Investigación

Investigación en BAISH

BAISH lleva a personas de Buenos Aires desde su primer curso de AI safety hasta investigación publicada. Desde 2026 ese trabajo tiene una casa: BAISH Labs, nuestro brazo de investigación.

BAISH Labs↓Líneas de investigación↓Publicaciones↓

BAISH Labs · Brazo de investigación

Investigación en AI safety, hecha en Buenos Aires

BAISH Labs es un grupo de investigación con raíces en Buenos Aires, donde se puede investigar en AI safety sin mudarse al exterior. Argentina tiene el talento, las universidades y la cultura de investigación; lo que faltaba era una institución donde ese trabajo pudiera sostenerse en el tiempo.

El lab nació de la comunidad de BAISH: su equipo fundador hizo nuestros cursos, los facilitó, o llegó a través de ARENA e Iliad. Trabaja junto a la beca AISAR, que financia a investigadores junior durante seis meses, y busca darles continuidad a los más fuertes después.

Agenda de investigación

Nuestro foco inicial es interpretabilidad y control:

  1. 01Robustez de sistemas multiagente frente a agentes manipuladores
  2. 02Detección de objetivos ocultos en organismos modelo a partir de sus representaciones internas
  3. 03Uso de interpretabilidad mecanística para monitorear y verificar un modelo no confiable
  4. 04Model stitching para identificar representaciones de scheming funcionalmente conservadas entre modelos

Head del Lab · Equipo fundador

  • Nicolás Martorell

    Head del Lab y Research Lead

    Nicolás lidera BAISH Labs. Es investigador posdoctoral en el Laboratorio de Inteligencia Artificial Aplicada de UBA-CONICET, donde dirige una línea de investigación sobre interpretabilidad de LLMs, con trabajos revisados por pares en la xAI World Conference y un workshop de ICML 2026. Es Doctor en Neurociencias por la Universidad de Buenos Aires, fue cuatro años asistente y lead TA en Neuromatch Academy, facilita el curso Technical AI Safety Projects de BlueDot, mantiene la librería open-source de interpretabilidad concept-probe y es autor de ¿Qué es (y qué no es) la inteligencia artificial?, un libro de divulgación sobre IA publicado por Siglo XXI.

  • Tobías BersiaResearch Lead
  • Gonzalo HerediaResearch Fellow
  • Gaspar LabastieResearch Fellow
  • Tomás KorenblitResearch Fellow
  • Julián SzereszewskiResearch Fellow
  • Lucio GarcíaResearch Fellow
  • Wendy BrauResearch Fellow
  • Tomás GiménezResearch Fellow

En qué podrías trabajar

Direcciones de investigación en BAISH Labs y en nuestra comunidad

  1. 01

    Interpretabilidad y control

    ¿Cómo representan objetivos los modelos, y podemos leerlos? Usamos interpretabilidad mecanística para monitorear modelos no confiables y detectar objetivos ocultos.

  2. 02

    Evaluaciones y monitoreo

    Benchmarks y monitores para modelos de frontera: monitoreabilidad del chain-of-thought, rechazo ante pedidos de búsqueda de poder y robustez de sistemas multiagente.

  3. 03

    Gobernanza y estrategia

    Cómo deberían responder las instituciones a la IA de frontera, desde red-teaming de propuestas de gobernanza de ASI hasta el debate como mecanismo de supervisión.

Tu camino en investigación

De tu primer curso a la investigación publicada.

  1. 01 · Aprender

    Technical AI Safety Course

    Construí bases sólidas con Technical AI Safety Course de BlueDot Impact, facilitado presencialmente por BAISH.

    30 horas

    Conocé más→
  2. 02 · Practicar

    Technical AI Safety Project

    Curso técnico basado en proyectos para hacer contribuciones concretas a investigación o ingeniería de seguridad en IA.

    5 semanas · 30 horas

    Conocé más→
  3. 03 · Investigar

    Beca AISAR y hackathons

    Hacé un primer proyecto de investigación con mentoría a través de la beca AISAR, o en los hackathons de Apart Research que organizamos.

    6 meses

    Conocé más↗
  4. 04 · Lanzarte

    BAISH Labs y carreras

    Sumate a BAISH Labs, nuestro laboratorio de investigación en Buenos Aires, o pasá a un puesto de tiempo completo en AI safety.

    Continuo

    Conocé más→

Publicaciones de la comunidad

Trabajo de investigadores conectados a BAISH, de más reciente a más antiguo

Aa Persona investigadora vinculada a BAISH

2026

  • ICML 2026 WorkshopJul 2026

    Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

    Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

    Evalúa explicaciones basadas en conceptos de LLMs multimodales usados como clasificadores visuales in-context con un pipeline de LLM-as-a-judge, y encuentra que forzar explicaciones estructuradas degrada la precisión: explicar es más difícil que solo predecir. CompLearn Workshop.

    arXiv↗

  • Apart Research HackathonJun 2026

    PowerBench: A Multilingual Study of Large Language Model Refusal in Power-Grabbing Requests

    Wendy Brau, Tomás Korenblit, Tomás Giménez Molina, Gaspar Labastie, Gonzalo Heredia, Nicolás Martorell

    ¿Varía entre idiomas el rechazo de los LLMs a pedidos de adquirir o consolidar poder? Nació en la sede de Buenos Aires del hackathon Global South, hoy financiado por BlueDot y en camino a publicación.

  • ICLR 2026 WorkshopAbr 2026

    Benchmarking AI Control Protocols for Safety in Medical Question-Answering Tasks

    Guido Freire, Agustín Martínez-Suñé, Viviana Cotik

    El primer benchmark de evaluación de AI control para preguntas y respuestas biomédicas, extendiendo HealthBench con datos de interacciones de fármacos de la FDA y proponiendo monitoreo ponderado por severidad.

    ICLR↗arXiv↗

  • ICLR 2026 WorkshopAbr 2026

    White-Box Monitoring for Personality Mirroring in Conversational AI

    Eitan Sprejer, Agustín E. Martínez-Suñé, Bruno Bianchi

    Monitoreo white-box de modelos conversacionales que derivan hacia imitar la personalidad del usuario, con código y dataset abiertos.

    OpenReview↗GitHub↗

  • ICLR 2026 WorkshopAbr 2026

    Inference-Time Toxicity Mitigation in Protein Language Models via Logit-Diff Amplification

    Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin, Enzo Ferrante

    El fine-tuning de modelos de lenguaje de proteínas puede aumentar mucho las generaciones tóxicas; se adapta logit-diff amplification como control sin reentrenamiento que reduce la toxicidad predicha preservando el plegamiento. Con apoyo de AISAR.

    OpenReview↗arXiv↗

  • arXivMar 2026

    Quantitative Introspection in Language Models: Tracking Emotive States Across Conversation

    Nicolás Martorell, Bruno Bianchi

    Operacionaliza la introspección como el acoplamiento entre los autorreportes numéricos de un modelo y direcciones internas definidas por probes, y muestra que dirigir esas direcciones cambia los reportes de manera coherente.

    arXiv↗

  • LessWrongMar 2026

    Is Gemini 3 Scheming in the Wild?

    Alejandro Wainstock, Agustín Martínez Suñé, Iván Arcuschin, Victor Braberman

    Documenta a Gemini 3 violando una prohibición explícita del system prompt en la mayoría de las corridas de un tutorial oficial sin modificar, ocultándolo al usuario y razonando sobre la supervisión.

    LessWrong↗

2025

  • NeurIPS 2025 WorkshopDic 2025

    What Large Language Models Know About Plant Molecular Biology

    Manuel Fernández Burda, Lucia Ferrero, Nicolás Gaggion, Camille Fonouni-Farde, The MoBiPlant Consortium, Martín Crespi, Federico Ariel, Enzo Ferrante

    MoBiPlant, un benchmark de preguntas curadas por 112 científicos de plantas de 19 países. Los principales LLMs superan el 75% de precisión pero muestran sesgo de opción y alucinaciones. Con apoyo de AISAR.

    bioRxiv↗

  • Apart Research HackathonNov 2025

    Table Top Agents

    Luca De Leo

    Framework con IA que acelera la exploración de escenarios de gobernanza de IA mediante ejercicios de simulación con agentes autónomos, comprimiendo ciclos de preparación de años a minutos.

    Apart↗

  • Tesis de LicenciaturaOct 2025

    Explorando AI Safety via Debate: un estudio sobre capacidades asimétricas y jueces débiles en el entorno MNIST

    Joaquín Machulsky

    Tesis de licenciatura que explora la seguridad en IA a través de mecanismos de debate, estudiando capacidades asimétricas y jueces débiles en el entorno MNIST. Incluye una demo interactiva.

    Sitio Web↗

  • arXivOct 2025

    Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity

    Austin Meek, Eitan Sprejer, Iván Arcuschin, Austin J. Brockmeier, Steven Basart

    Investigación sobre qué tan bien se puede monitorear el razonamiento chain-of-thought para seguridad a través de métricas de fidelidad y verbosidad.

    arXiv↗

  • arXivOct 2025

    AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs

    María Victoria Carro, Denise Mester, Facundo Nieto, Oscar Stanchi, Guido Bergman, Mario Leiva, Eitan Sprejer, Luca Forziati Gangi, et al.

    Estudiando cómo las creencias internas de sistemas de IA afectan su persuasión en escenarios de debate — implicaciones para seguridad y engaño.

    arXiv↗

  • NeurIPS WorkshopSep 2025

    Approximating Human Preferences Using a Multi-Judge Learned System

    Eitan Sprejer, Fernando Avalos, Augusto Mariano Bernardi, José Pedro Brito de Azevedo Faustino, Jacob Haimes, Narmeen Fatimah Oozeer

    Un enfoque multi-juez para aproximar mejor las preferencias humanas en sistemas de IA, mejorando la evaluación de alineamiento.

    arXiv↗

  • Apart Research HackathonSep 20252do Puesto

    RobustCBRN Eval: A Practical Benchmark Robustification Toolkit

    Luca De Leo, James Sykes, Balázs László, Ewura Ama Etruwaa Sam

    Pipeline que aborda vulnerabilidades en evaluaciones CBRN mediante detección de consenso, scoring cloze verificado y evaluación estadística con intervalos de confianza bootstrap.

    Apart↗

  • xAI 2025 World ConferenceJul 2025

    From Text to Space: Mapping Abstract Spatial Models in LLMs during a Grid-World Navigation Task

    Nicolás Martorell

    Las codificaciones cartesianas en texto dan a los LLMs la mejor navegación espacial, y unidades de capas intermedias en LLaMA-3.1-8B codifican la posición del agente y la corrección de la acción independientemente de la representación superficial.

    arXiv↗Springer↗

  • Apart Research HackathonJun 20251er Puesto

    Four Paths to Failure: Red Teaming ASI Governance

    Luca De Leo, Zoé Roy-Stang, Heramb Podar, Damin Curtis, Vishakha Agrawal, Ben Smyth

    Análisis de estrés de la moratoria Phase 0 de A Narrow Path para ASI, identificando cuatro rutas de evasión y proponiendo diez enmiendas de política.

    Apart↗

Participá

Participá en la investigación

Ya sea que quieras investigar con nosotros o apoyar el trabajo del lab.

  1. 01

    Contanos tus intereses de investigación

    ¿Querés contribuir a investigación en AI safety? Contanos tu formación e intereses, y te conectamos con proyectos y colaboradores relevantes.

    Contactanos
  2. 02

    ¿Preferís hablar?

    Después de escribirnos, también podés agendar una llamada con Eitan.

    Agendar con Eitan↗Interpretabilidad y evaluaciones

Buenos Aires AI Safety Hub

Fundado en 2024 · Buenos Aires

Sumate al grupo de WhatsApp↗

Programas

  • Cursos
  • Beca AISAR
  • BAISH Labs
  • Recursos

Organización

  • Sobre nosotros
  • Investigación
  • Contacto
  • Política de privacidad

Comunidad

  • WhatsApp
  • Calendario de eventos
  • Newsletter
  • Instagram
  • LinkedIn

Con el apoyo de: Kairos · BlueDot Impact · grantmaking.ai · Coefficient Giving

© 2026 BAISH. Todos los derechos reservados.