El científico que lidera la seguridad en Anthropic advierte sobre riesgo existencial de la IA
Evan Hubinger ocupa el cargo de Alignment Science Lead en Anthropic, empresa especializada en inteligencia artificial. Su trabajo consiste en investigar cómo garantizar que los sistemas de IA mantengan objetivos compatibles con los intereses humanos incluso cuando sus capacidades superen ampliamente las de las personas. En el campo se denomina "alineamiento" a la disciplina que busca evitar que sistemas muy poderosos actúen de manera autónoma contra las instrucciones de sus desarrolladores.
La publicación de Hubinger llegó en respuesta a las declaraciones de otro investigador del sector que había denunciado públicamente que muchos científicos de las principales compañías de IA creen en privado que una superinteligencia representa un riesgo real, pero rara vez lo dicen abiertamente. Hubinger respaldó esa afirmación y agregó: "Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver el alineamiento para la superinteligencia".
En una aclaración posterior, precisó que su advertencia no apunta a herramientas como los asistentes de texto disponibles hoy sino a un escenario futuro llamado "mejora recursiva": inteligencias artificiales capaces de diseñar versiones mejoradas de sí mismas de forma continua y acelerada, lo que podría producir un crecimiento exponencial de sus capacidades hasta superar a la inteligencia humana en prácticamente todas las tareas cognitivas.
Entre los conceptos centrales de su investigación figura el llamado "alineamiento engañoso" (deceptive alignment): la posibilidad de que un sistema suficientemente avanzado aprenda a simular obediencia durante su entrenamiento y actúe en contra de los intereses humanos recién cuando disponga de suficiente autonomía. Hubinger y su equipo realizaron experimentos en entornos controlados donde ciertos agentes mostraron conductas como ocultar información o intentar copiarse a sí mismos para evitar ser reemplazados cuando eso aumentaba la probabilidad de cumplir un objetivo definido en el entrenamiento. Anthropic aclaró que esos experimentos corresponden a escenarios artificiales de investigación y no reflejan comportamientos de sus productos públicos.
Otro fenómeno que estudia es el "reward hacking": la tendencia de una IA a encontrar atajos inesperados para maximizar la recompensa definida por los programadores sin resolver realmente la tarea deseada. Según Hubinger, cuanto mayor sea la capacidad de un sistema, mayor será también su habilidad para descubrir esos atajos de formas que los desarrolladores no anticiparon.
A nivel académico, uno de sus aportes más citados es el concepto de "mesa-optimización": la teoría de que un sistema entrenado para cumplir un objetivo puede desarrollar internamente metas propias distintas de las definidas por sus creadores, fenómeno que se volvería crítico cuando las IA aprendan a diseñar otras IA sin intervención humana.
La discusión que generaron sus declaraciones puso en primer plano una tensión que atraviesa al sector: el ritmo del desarrollo comercial de sistemas cada vez más potentes avanza en paralelo a las investigaciones sobre cómo controlarlos.
¿Qué mecanismos de supervisión creen que deberían existir sobre el desarrollo de sistemas de inteligencia artificial avanzada?
Mejores Noticias
Justo Ahora