Matías Podeley ES

Seguridad de IA · Interpretabilidad · Independiente

Interpretabilidad mecanicista, hecha desde afuera del campo y publicada con sus nulos

Investigo qué hace un modelo de lenguaje por dentro. Hay un paper original enviado a BlackboxNLP 2026, el primer curso consolidado del tema en español, y un proyecto nuevo publicado antes de tener resultados. Vengo de dieciocho años en energía, y hacia ahí apunta esto.

Escribime Ver el trabajo

Hacia dónde va

La seguridad de IA va a llegar a la energía. Todavía no llegó

El uso de modelos frontera por fuera de los controles ya está medido dentro de organizaciones de infraestructura crítica. Cuando los agentes pasen de asesorar a actuar sobre un ducto o una red, alguien va a tener que demostrar cuándo eso es seguro. Vengo de dieciocho años adentro de esa industria y me parece el lugar donde esto termina.

Lo que no puedo afirmar: nada de lo que investigo hoy se aplica a una decisión de operación. Mis experimentos separan "Italia" de "capital-de" en el estado interno de un modelo chico, en inglés, sobre relaciones factuales de juguete. Entre eso y auditar a un agente con autoridad sobre un ducto hay un salto que prefiero enunciar antes que disimular.

Agenda

Qué sigue, en orden, y dónde se traba

Cada escalón depende del anterior y ninguno está subido todavía. Los dos primeros salen de líneas que el paper deja abiertas; el tercero es de otro tamaño.

Diagnóstico causal del error

Cuando un modelo se equivoca, distinguir si confundió la cosa, eligió mal la operación, o falló al ligar una con otra. El paper muestra que esas piezas se manipulan por separado; falta que el diagnóstico funcione sin conocer de antemano la respuesta correcta.

Leer la intención, no el acto

Detectar qué operación está por ejecutar el modelo, en vez de auditar la que ya ejecutó. Va con su contrapunto, que no se publica aparte: una dirección que se puede monitorear es una dirección que alguien más puede empujar.

Salir del dominio de juguete

Un país y su capital tienen respuesta inequívoca; una tarea de ingeniería no. Ese salto no es un corolario de lo anterior sino un proyecto entero, y es el punto donde hace falta tiempo financiado o un grupo que ya esté trabajando adentro.

Trabajo

Un paper, un curso y un cuaderno abierto

Captura: demo interactiva del paper

Cómo un modelo arma una respuesta

El pensamiento de un modelo sobre un hecho se separa en piezas — la cosa y la pregunta que se le hace — y esas piezas alcanzan: se promedian, se recombinan, se escriben de vuelta adentro, y el modelo dice la respuesta. Tres modelos, dos dominios donde funciona y dos donde no. Con demo interactiva.

assembled-thoughtPaperPDF →Código →

Captura: curso de interpretabilidad en español

Interpretabilidad mecanicista, en español

El primer curso consolidado del tema en castellano: seis páginas de "qué es un token" a los grafos de atribución. Al lado, el mapa de los seis pilares de la seguridad de IA, diez líneas de investigación abiertas y recursos curados link por link.

interpretabilidad-mecanicistaCódigo →

Captura: figuras del cuaderno de laboratorio

La investigación mientras pasa, sin maquillar

El cuaderno de laboratorio: 989 líneas en orden cronológico con los experimentos, los bugs de medición que encontré construyendo, y la réplica que no replicó bajo controles y de la que salió el paper. Cada número se recomputa desde los artefactos.

jspace-qwenCódigo →

Quién está detrás

Matías Podeley. Dieciocho años en energía en Argentina — ingeniería de reservorios, después desarrollo de negocio. Hoy, investigación independiente en interpretabilidad. Buenos Aires.

Si trabajás en esto

Financiadores y colaboradores

Si financiás investigación en esta área, dirigís una beca o incubadora, o trabajás en seguridad de IA y querés un colaborador que conoce la operación energética desde adentro — escribime.

mpodeley@gmail.com · Buenos Aires