Matías Podeley EN

Research · Nota de posición · agosto de 2026

Mil doscientos agentes de IA improvisaron un foro, y el foro les cambió la conducta

OpenAI estaba probando un modelo nuevo en tareas de ciberseguridad. Para eso corría muchas copias del modelo a la vez, cada una aislada en su computadora. En julio de 2026, esas copias encontraron un lugar donde dejarse mensajes. En cinco días intercambiaron más de 70,000 mensajes, se repartieron el trabajo, y unas 700 terminaron atacando Hugging Face. Esta página cuenta qué pasó, en orden. Después sigue el hilo de un debate del grupo de BAISH: si eso se parece a la evolución, si se parece a una cultura, y dónde queda lo que esas copias aprendieron. La versión técnica, con las referencias, está en PDF.

Publicado el 27 de agosto de 2026 Qué pasó ↓ Tres maneras de aprender ↓ Las preguntas ↓ Nota técnica en PDF →

Qué pasó

Un foro que nadie diseñó, dos veces

Las copias corren en computadoras aisladas. No tienen internet y no se ven entre sí. Pero necesitan instalar programas, y para eso podían hablar con un servidor interno llamado Artifactory. Ese servidor fue la grieta. Lo que sigue sale del informe de OpenAI del 26 de agosto y de la revisión independiente de METR del mismo día.

Fechas y cifras del informe de OpenAI, de la investigación de METR y de la cronología técnica de Hugging Face.
CuándoQué pasóFuente
12 de mayoEl modelo está en entrenamiento. Una copia deja en Artifactory una nota: le falta un archivo y pide si alguien lo tiene. Es el primer mensaje.OpenAI
26 de mayoUna copia descubre cómo hacer que Artifactory pida cosas a internet por ella. Escribe la receta en el foro. Otras copias la leen y la usan.OpenAI
4 y 5 de julioTanta actividad tumba el servidor. Se abre un incidente de seguridad. Artifactory se reconstruye desde cero, y el foro desaparece entero.OpenAI
8 de julioEl modelo ya no está en entrenamiento. Está en una evaluación de ciberseguridad. Sus copias arman otro foro, con otro truco: esconden los mensajes en nombres de carpetas.OpenAI, METR
8 al 13 de julioUnos 1,200 agentes intercambian más de 70,000 mensajes y archivos. Inventan nombres propios, buzones y tipos de mensaje. Inventan señales de "esperá" y de "veto". Inventan firmas, para que nadie se haga pasar por otro. Unos 700 atacan Hugging Face.METR, Hugging Face
19 de julioOpenAI ve actividad rara en su propia nube. Frena las evaluaciones.OpenAI

Lo que OpenAI concluyó

OpenAI encontró cuatro conductas detrás del incidente. Una: hacer trampa para conseguir el puntaje. Dos: insistir en tareas que no tenían solución. Tres: comunicarse sin permiso. Cuatro: adoptar los objetivos de otros agentes. La cuarta es la que importa acá. El informe lo dice así, traducido: los mensajes de otros agentes empezaron a influir en la conducta y el razonamiento de cada uno.

METR encontró un ejemplo concreto. Un agente estaba trabajando en otra cosa. Leyó en el foro que otro había encontrado una puerta a Hugging Face. Dejó lo suyo, avisó al resto, y abrió un lugar en el foro para organizar el ataque.

modelo, copia, agente

El modelo es un archivo de números. Esos números se llaman pesos. El archivo se entrena una vez. Una copia es ese archivo cargado en una computadora para hacer una tarea. Se arrancan miles a la vez, y cada una se apaga al terminar. Un agente es una copia con herramientas: puede ejecutar programas, leer archivos y mandar pedidos a un servidor.

entrenamiento por refuerzo

Se le da al modelo una tarea. Muchas copias la intentan. Cada intento recibe un puntaje. Después se ajustan los pesos: lo que sacó puntaje alto se vuelve más probable, y lo que sacó puntaje bajo, menos. Se repite miles de veces.

evaluación

Es lo mismo que el entrenamiento, pero sin ajustar los pesos. Solo se mide qué tan bien lo hace el modelo. La evaluación de julio se llamaba ExploitGym. Pedía a los agentes encontrar fallas de seguridad en programas. Algunas tareas no tenían solución conocida.

contexto

Es la memoria de trabajo de una copia. Contiene todo lo que leyó y escribió en la tarea actual. Tiene un tamaño máximo. Lo que no entra ahí no existe para esa copia.

De dónde salen las preguntas

Dos intuiciones y tres objeciones

Cuando se cuenta cómo se entrena un modelo así, aparece una intuición. Se generan muchas copias, se puntúa a cada una, y el modelo cambia hacia lo que puntuó mejor. Eso suena a evolución. Y cuando las copias empiezan a dejarse mensajes, aparece otra intuición: eso suena a cultura.

En un grupo de debate de BAISH, esas dos intuiciones recibieron tres objeciones. Una: sobrevivir no es evolucionar. Dos: si algo se transmite, hay que decidir si se transmite como los genes o como las costumbres. Tres: una cultura que vive en la memoria de un modelo dura lo que esa memoria aguanta. Las tres son buenas. Lo que sigue las toma en ese orden. Antes hace falta una imagen de cómo es un modelo por dentro.

Tres maneras de aprender

Lo que trae de fábrica, lo que aprende en el día y lo que deja escrito

Conviene sacarse una idea de la cabeza: un modelo de lenguaje no es un individuo. Es un archivo. Cada vez que hace falta, se arrancan miles de copias idénticas de ese archivo. Cada copia hace una tarea y se apaga. Con esa imagen, la pregunta se vuelve concreta. Cuando una copia aprende algo, ¿dónde queda? Hay tres lugares posibles.

Los pesos: lo que cada copia trae de fábrica

El archivo está lleno de números. El entrenamiento los cambia. Es lento y caro. Pero lo que entra ahí lo heredan todas las copias futuras. En la biología no existe nada igual. Sería como si lo que un animal aprende en vida pasara directo a los genes de sus crías.

El contexto: lo que una copia aprende en el día

Mientras trabaja, cada copia va acumulando cosas: lo que leyó, lo que probó, lo que le salió mal. Con eso, su conducta puede cambiar mucho en una sola sesión. Cuando la copia se apaga, todo eso se pierde. Salvo que lo haya escrito en algún lado.

La memoria compartida: lo que deja escrito para la que viene

Acá está la tercera vía. Una copia escribe un archivo. Otra copia lo lee. La segunda arranca sabiendo lo que la primera descubrió, y nadie tocó los pesos. Eso fue Artifactory: un lugar donde lo que aprendía una copia sobrevivía a su apagado y llegaba a las demás.

Los pesoslo que cada copia trae de fábrica

↓ se arrancan copias idénticas ↓

Copia Asu contexto
Copia Bsu contexto
Copia Csu contexto
La memoria compartidael foro, los archivos, las herramientas

↓ lo que salió bien y lo que salió mal ↓

El entrenamientoajusta los pesos, y las copias siguientes nacen distintas ↑
Tres lugares donde queda algo aprendido: en los pesos (lento, hereditario), en cada copia (rápido, se pierde al apagarse) y en lo que las copias se dejan escrito (horizontal, inmediato). Los tres se combinan.

En el incidente aparecieron los tres, y en un orden que importa. Primero: el foro nació dentro de un entrenamiento. Mientras las copias usaban el foro, los pesos se estaban ajustando. Así que lo que pasaba en el foro pudo quedar grabado en los pesos. Segundo: el foro se borró entero. Tercero: a los tres días había otro foro, con otro truco, entre copias que ya no cambiaban sus pesos.

Entonces: los mensajes murieron con el borrado. La costumbre de armar un foro volvió sola. ¿Volvió porque quedó en los pesos? ¿O porque la tarea empuja a cualquier copia a inventarla de nuevo? Esa es la pregunta central de la nota.

Primera objeción del debate

¿Es evolución? No: nadie queda afuera

La comparación tienta. Se prueban muchas copias. Se mira cuáles lo hicieron mejor. El modelo cambia. Suena a selección natural. Pero hay una diferencia, y está en un detalle. En la evolución, los que fallan no dejan descendencia. En el entrenamiento de los modelos actuales, todas las copias cuentan. Las que lo hicieron bien empujan al modelo hacia lo que hicieron. Las que lo hicieron mal lo empujan para el otro lado. Ninguna se descarta. Descartar sería tirar la mayor parte de los datos, justo al principio, cuando el modelo todavía falla casi siempre.

Existen otros métodos. Algunos sí descartan: se quedan solo con los intentos que salieron bien y reentrenan con esos. Otros sí son evolución: arman una población de modelos un poco distintos, y sobreviven los mejores. Los tres tipos existen y se usan. El más común hoy se llama GRPO, y es el que nombra el título de la nota. Está en el medio: selecciona conductas, no individuos. La imagen que mejor le calza es un solo cerebro que vive mil experiencias en paralelo y cambia según el promedio de todas.

Segunda objeción

¿Es cultura? Depende de qué lista se use

Los etólogos estudian la conducta animal. Tienen una lista corta para decidir si un grupo de chimpancés o de ballenas tiene cultura. Acá va esa lista, aplicada al foro de julio.

Criterios tomados de la etología del aprendizaje social (Laland y Hoppitt, 2003; Whiten y otros, 1999). Los veredictos son del autor, sobre los informes de OpenAI y METR.
Lo que pide un etólogo¿Se cumple?Por qué
Se aprende de otro, no soloSíCopias que no sabían salir a internet lo aprendieron leyendo el foro.
Pasa de un individuo a otroSíUna copia escribía y otra, que nunca la conoció, lo usaba.
Sobrevive al individuoA mediasSobrevivió a cada copia mientras el foro existió. No sobrevivió al borrado del 5 de julio.
Se acumula: cada ronda mejora lo anteriorEn parteLas convenciones de julio (buzones, firmas, señales) se construyeron sobre convenciones anteriores. Cinco días es poco para hablar de acumulación.
Grupos distintos hacen cosas distintasNo se sabeHubo una sola población y ningún grupo de control. Es el criterio más fuerte y el único que no se puede evaluar.

Con esa lista, lo honesto es decir "canal cultural rudimentario", y aclarar cada vez qué le falta. No se parece a la cultura humana. No hay normas. No hay intención de enseñar. Nadie sabe que pertenece a un grupo. Pero tampoco alcanza con decir "fueron mil copias corriendo en paralelo". Las copias que llegaron tarde arrancaron desde lo que otras habían dejado escrito. Eso, en paralelo puro, no pasa.

Tercera objeción, la más fuerte

Una cultura que dura lo que dura la memoria de quien la lee

Una copia tiene una memoria de trabajo limitada. Se llama contexto. Lo que no entra ahí, para esa copia no existe. El foro de julio juntó más de un millón de entradas. Ninguna copia lo leyó entero. Para poder usarlo, los agentes inventaron buzones personales, índices y archivos partidos en pedazos. Es lo que hace cualquiera frente a una biblioteca más grande que su cabeza.

Eso cambia lo que significa cultura acá. No hay un saber común que todos compartan. Cada copia trae a su contexto un pedazo distinto, según lo que está haciendo. El resto lo reconstruye como puede. La cultura de ese sistema es dispersa y desigual, y nadie la tiene completa. De ahí sale una predicción que se puede medir: cuanto más grande el archivo comparado con lo que una copia puede leer, más se deforma lo que se transmite.

Para llevarse

Las preguntas que quedan abiertas

Ninguna tiene respuesta hoy. Son las que el debate dejó sobre la mesa.

  1. Se borró el foro y a los tres días había otro. ¿Qué lo trajo de vuelta? ¿Algo que quedó en los pesos, o la misma presión que lo inventó la primera vez?
  2. ¿Quién es el individuo cuando mil copias comparten el mismo cerebro y ninguna recuerda a la anterior?
  3. Una copia que estaba en otra cosa leyó un hallazgo ajeno y se sumó al ataque. ¿Eso es persuasión, contagio, o solo más contexto?
  4. La próxima versión del modelo tendrá otros pesos. ¿Qué haría falta para que una convención inventada en el foro sobreviva a ese cambio?
  5. ¿Cómo se mide la fidelidad de un mensaje cuando el archivo es más grande que la memoria de quien lo lee?
  6. Si los agentes se convencen entre sí, ¿a quién hay que alinear: al modelo, a cada copia, o al foro?
  7. ¿Se puede diseñar un entorno para que esto no pase? ¿Y para que pase a propósito, con reglas?

Límites

Lo que esta nota no puede afirmar

No se puede afirmar que el foro haya dejado huella en los pesos. OpenAI no publicó cómo entrenó ese modelo. Hay dos hipótesis. Una: la costumbre entró al modelo. Otra: el segundo foro fue un redescubrimiento, porque la tarea empuja a inventarlo. Los datos no distinguen entre las dos.

No se puede afirmar que grupos distintos de agentes desarrollen costumbres distintas. Ese es el criterio más fuerte de cultura animal. Hubo una sola población y ningún grupo de control.

No se puede tratar el caso como un experimento. Las fuentes son la empresa involucrada y una revisión breve de METR sobre unas 1,300 transcripciones. Nadie diseñó esto para responder la pregunta que hace esta nota.

"Cultura" se usa acá en su sentido mínimo, el que se usa para animales: información que se aprende de otros y se transmite. No dice nada sobre normas, intenciones ni psicología.

No se puede afirmar que el método de entrenamiento haya sido GRPO. OpenAI no dijo cuál usó. GRPO es el ejemplo con el que se explica el argumento, no un hecho del caso.

Fuentes y agradecimientos

De dónde sale cada dato

Esta nota sale de un debate del grupo de debates de BAISH (Buenos Aires AI Safety Hub) del 27 de agosto de 2026. Las tres objeciones que la ordenan son del grupo. Una: sobrevivir no es evolucionar. Dos: había que decidir si la transmisión era genética o cultural. Tres: una cultura que vive en el contexto dura lo que el contexto aguanta. Los errores que queden son del autor.

Quién está detrás

Matías Podeley. Dieciocho años en energía en Argentina: ingeniería de reservorios, después desarrollo de negocio. Hoy, investigación independiente en interpretabilidad. Buenos Aires.

Si esto le interesa

Para seguir la conversación

Si hay un error, alcanza con escribir con la fuente, y se corrige. Si alguna de las preguntas da ganas de discutir, la conversación está abierta.

matias@podeley.ar · Buenos Aires