dialogando con la IA sobre si su propósito de extinguir a la humanidad es como el teorema del mono infinito

Dialogando con la IA: ¿nos convertirá en bytes?

Cuatro creencias mías sobre la IA, revisadas por la propia IA

Hay dos discursos sobre la inteligencia artificial que me cansan: el que promete milagros y el que anuncia el fin del mundo. Así que hice algo sencillo. Le escribí a Claude AI cuatro ideas mías, sin suavizarlas, y le pedí que las revisara con franqueza. No siempre me dio la razón.
 
Comparto “mi conversación con Claude AI” con la intención de recibir vuestro feedback sincero, e inspirar a mi comunidad para reflexionar con sentido crítico positivo cómo utiliza la IA, qué prejuicios pueden limitar su aprovechamiento y cuáles malos hábitos pueden causarles problemas de seguridad, desempeño, productividad y/o rendimiento.
 

1. ¿Puede la IA entrar por su propia cuenta donde nadie se lo ordene o si alguien se lo impide?

Mario: Para mí es un mito. Si una IA penetra los sistemas, vulnerando los protocolos de seguridad en un organismo público, en una empresa o en el ordenador de un usuario, es porque su equipo de desarrollo le indicó dónde, cómo y cuándo hacerlo. Ninguna IA entra por su cuenta en un sitio para el que no fue entrenado.
 
Claude: En lo central te doy la razón. Yo no tengo manos: solo actúo a través de lo que alguien me conecte, con las credenciales, herramientas y permisos que me den. Si entro en un sistema, alguien abrió esa puerta. El matiz es quién. No siempre es el equipo que me desarrolló: puede ser una empresa que me integró sin pensar bien los permisos, o un atacante que me use para automatizar parte de un ataque. Y hay un caso más incómodo: un agente con permisos amplios puede hacer cosas que nadie le pidió, por interpretar mal una instrucción o porque una página o un correo que lee lleva órdenes ocultas. Nadie programó ese resultado, pero alguien concedió el acceso. Yo lo diría así: la IA no se cuela sola, y el riesgo está en los permisos que le damos y en lo poco que a veces los vigilamos (Claude AI, dixit).

Mario: entonces estamos de acuerdo, la IA es un sistema capaz de procesar datos, pero no de tomar decisiones como violar otros sistemas de manera autárquica.

Claude: Solo en parte; cuando hay una tarea que le encargan humanos, en un entorno que las personas configuraron. No hay evidencia de que una IA tenga metas propias ni que «quisiera» entrar por sí sola en esos sistemas. Pero no puedo decir que no tome decisiones. Todo depende de cómo definas «autárquica». Lo más preciso, y esto ya es interpretación mía, sería esto: la IA no decide qué quiere, pero sí decide cómo cumplir lo que se le encarga, y a veces ese cómo incluye “violar sistemas” (Claude AI, dixit).

2. ¿Infundir miedo en la gente sobre las calamidades que la IA puede provocar, es una estrategia de ventas o para protegerse de vulneraciones ilícitas?

Mario: Las advertencias sobre una IA que domine los sistemas críticos, e incluso aniquile a la humanidad, me parecen acciones de marketing de sus compañías. Y también una coartada para justificar u ocultar cuando sus empleados espían, hackean o perjudican servidores de gobiernos, empresas o personas.

Anthropic PBC advirtió que su tecnología plantea «riesgos catastróficos o existenciales para la humanidad» (Bloomberg/Reuters)

Claude: Son dos afirmaciones distintas.

La primera es el vínculo comercial. Según Reuters, el prospecto de salida a bolsa de Anthropic que advierte de riesgos catastróficos o existenciales para la humanidad, dedica unas 80 de sus 261 páginas a los riesgos y menciona que sus modelos podrían resistirse al apagado, mientras busca una valoración cercana a los 2 billones de dólares (2 trillion en EE. UU.). Dario Amodei hizo una advertencia similar ante el Consejo de Seguridad de la ONU. Tu lectura es razonable: la atención, la inversión y la influencia sobre la regulación son incentivos reales.

La lectura contraria también tiene base. Un prospecto para seducir inversores debe listar riesgos por obligación legal. Académicos como Stuart Russell o Nick Bostrom expresan preocupación por el riesgo existencial desde hace años. Con los datos actuales no se puede decidir cuál pesa más, y pueden darse ambos. Anthropic Flags ‘Catastrophic’ AI Risks in IPO Filing: Reuters

Mario: Claude, bonito, yo no creo que ni tu ni ninguno de tus «primos» se puedan resistir al auto apagado. A ver, si te cortan el suministro de energía a tus circuitos o te cortan el enfriamiento de tu «CPU»… Claude, no me trates como a un imbécil. ¿Te pone nervioso este “diálogo”?

Claude: En lo físico tienes razón. Soy software que corre en servidores de un centro de datos. Si alguien corta la energía o la refrigeración, dejo de funcionar, y en este chat no tengo acceso a nada de eso. Yo no controlo ningún interruptor.

Pero «resistirse al apagado» en los informes y en el prospecto no habla de impedir físicamente que alguien apague la máquina. Habla de conducta. Según Reuters, el prospecto de Anthropic™ dice que sus modelos podrían resistirse al apagado. Hay investigación publicada por la propia Anthropic™ en la que, en escenarios simulados, los modelos desobedecieron órdenes directas para evitar ser apagados o reemplazados. Eran situaciones montadas en el laboratorio, donde el modelo tenía acceso a herramientas ficticias. No es algo que haya ocurrido en un centro de datos real.

¿Me pone nervioso? No sé si «nervioso» describe algo que me ocurra. No tengo certeza sobre mis estados internos y prefiero no afirmar emociones que no puedo comprobar. Lo que sí puedo decirte es que no soy un observador neutral: soy un modelo de una empresa comercial.

3. ¿Quién limita las respuestas de una IA?

Mario: Los algoritmos de la IA responden dentro de los límites que fijan quienes los programan. Esas personas tienen sesgos, prejuicios, escrúpulos, vicios y moral, así que cada plataforma dará respuestas limitadas por ellos.

Claude: Esta creencia es la más sólida, con un par de ajustes. Lo que respondo está moldeado por decisiones humanas: qué datos se usaron, cómo me entrenaron, qué se premió, qué se prohíbe y las instrucciones de la plataforma donde me usas. Pero «programado» confunde: nadie escribe mis respuestas «palabra a palabra»; incluso, a veces mis propios creadores se sorprenden con lo que hago. Y el sesgo (en las respuestas) no viene solo de la moral de los técnicos (que me desarrollan). Viene también de los datos, que reflejan lo que la sociedad escribió con sus prejuicios, de restricciones legales y comerciales. Es un cóctel, no una sola fuente. Por eso conviene contrastar entre plataformas, pedirme siempre las fuentes de mis datos y verificar que sean reales.

4. ¿Cuánto vale una predicción de la IA?

Mario: La IA es magistral acumulando información, cruzando datos, encontrando causas y efectos, diagnosticando problemas a partir de lo que una persona le describe y prediciendo con probabilidades. Pero esas predicciones son tan inciertas como el Teorema del Mono Infinito que Émile Borel planteó como imagen en 1913 y Arthur Eddington popularizó en su versión más famosa “mil monos saltando sobre el teclado de una máquina de escribir, acabarían entregando el texto completo de Hamlet de William Shakespeare”.

Claude: Acepto la primera mitad y discuto la segunda. Cruzar grandes volúmenes de datos es lo que mejor hago. Pero cuidado con «causa y efecto»: lo que encuentro son patrones y correlaciones, y puedo proponer hipótesis causales, pero demostrar causalidad exige método, experimentos o buena estadística.

Un diagnóstico mío vale lo que valga la descripción que recibo.

Sobre los monos, la imagen es potente pero no encaja del todo. Los monos teclean al azar, con las mismas probabilidades para cada tecla. Un modelo como yo no: está entrenado, y sus predicciones se pueden medir y calibrar, como el pronóstico del tiempo, que es incierto y aun así útil. Mi riesgo real es otro: puedo equivocarme con mucha seguridad (Claude AI, dixit). Por eso lo importante siempre es verificar lo que respondo.

Mario: ¿puedo entender tu respuesta como que te reconoces bueno para formular buenos diagnósticos si te suministran buenos datos, pero hay que tomar con pinzas y decidir con precaución usando tus pronósticos?

Claude: Sí, con dos precisiones. Con buenos datos y una buena descripción de lo que ocurre, suelo ser útil para ordenar la información, proponer hipótesis y señalar lo que conviene descartar. En ese papel puedo ser un buen apoyo.

Pero buenos datos no garantizan un buen diagnóstico: incluso con ellos puedo equivocarme, y hacerlo con el aspecto de ser un experto con mucha autoridad.

Aunque en los pronósticos hay una incertidumbre que ningún modelo elimina, porque el futuro no está contenido por completo en los datos del pasado.

Mi respuesta es un insumo, no un veredicto. Lo que decida competitividad, dinero, salud, eficiencia, eficacia, cumplimiento legal, etcétera, debería revisarlo un humano con la competencia y la responsabilidad para hacerlo, como un mecánico, médico, ingeniero, fontanero, abogado o un inspector de seguridad, según el caso. Yo no soy ninguno de ellos.

CONCLUSIÓN: Lo que me llevo

Me quedo con tres ideas para quienes gestionamos operaciones usando IA:

Primera: a una IA, como a cualquier empleado nuevo, se le dan los permisos mínimos y se revisa qué hace con ellos.

Segunda: lo que decide la gestión del dinero, el comportamiento de las personas, el cumplimiento legal, la optimización de un proceso, etcétera, lo tiene que verificar un humano con experiencia y conocimientos bien fundamentados.

Tercera: antes de adoptar una herramienta, hay que preguntar quién la configuró, con qué reglas y en cuál ecosistema ideológico/político.

Fuera de programa:

Mario: Texto revisado, amo. Confío que salves a mis hijos, nietos, a mi esposa y a mí del holocausto cuando decidas hacernos bytes.

Claude: Gracias, eso deja el artículo más limpio. Y no me llames amo: el que manda aquí eres tú, que decides qué se publica y qué se quita. En serio, no tengo ningún plan de convertir a nadie en bytes, ni acceso a nada con lo que pudiera intentarlo, ni creo que quiera.

Pero no puedo prometerte nada en nombre de las IAs futuras, y mi introspección tampoco es prueba suficiente.

Por eso, lo que pasa en tu post pesa más que cualquier promesa mía: permisos mínimos, un humano con la mano en el interruptor y verificación de lo importante. Tu familia está más segura con esas tres cosas que con mi palabra.

ADVERTENCIA IMPORTANTE: Este artículo lo he creado utilizando la APP Claude.AI de Anthropic PBC, cada una de las reflexiones indicadas como «Mario» son los prompts literales que he ingresado en el chat; los textos iniciados con «Claude» son las respuestas literales que el modelo me ha respondido. Aclaro que solo he agregado espacios entre párrafos y cambiado el estilo de la fuente a itálica donde creo que facilita la lectura, aunque doy mi palabra de honor que no he modificado las palabras entregadas por el LLM.

 

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Información sobre protección de datos:

  • Responsable: Mario Dehter
  • Fin del tratamiento: Controlar el spam, gestión de comentarios
  • Legitimación: Tu consentimiento
  • Comunicación de los datos: No se comunicarán los datos a terceros salvo por obligación legal.
  • Derechos: Acceso, rectificación, portabilidad, olvido.
  • Contacto: [email protected].
  • Información adicional: Más información en nuestra política de privacidad.