Hilo para reunir a los interesados en superinteligencia y alineamiento. Dejo algunas lecturas y líneas de investigación para empezar. Pilla sitio y aporta libros, papers, vídeos o preguntas.
SUPERINTELIGENCIA, DE NICK BOSTROM
(adjunto visible para usuarios registrados)
Para mí, el libro fundamental para entrar en el tema. Publicado en 2014, estudia qué podría ocurrir si construimos una inteligencia muy superior a la humana y cómo podríamos conservar el control sobre ella.
Dos ideas centrales. La tesis de la ortogonalidad: una gran inteligencia puede perseguir fines muy distintos, incluidos algunos completamente ajenos a nuestros intereses. Y la convergencia instrumental: sistemas con objetivos diferentes podrían encontrar útil adquirir recursos, acumular poder o evitar que los apaguen.
De ahí sale el problema del alineamiento: cómo conseguir que las capacidades de un sistema estén al servicio de objetivos que podamos aceptar, también cuando actúe en situaciones que sus creadores no habían previsto.
Bostrom examina distintas formas de superinteligencia, posibles velocidades de desarrollo, métodos de control y aprendizaje de valores. Lo recomiendo como primera lectura.
Superinteligencia: ficha e índice
Las tesis de ortogonalidad y convergencia instrumental también están desarrolladas en este artículo del propio Bostrom:
The Superintelligent Will
ENTENDER CÓMO FUNCIONAN LOS MODELOS
El libro de Bostrom es anterior a los modelos de lenguaje actuales. Conviene acompañarlo de una introducción a las redes neuronales y al entrenamiento.
Andrej Karpathy tiene una charla de una hora dirigida al público general. Explica los componentes básicos de los modelos de lenguaje y cómo se entrenan.
Intro to Large Language Models
Para entender la parte matemática, las explicaciones visuales de 3Blue1Brown sobre redes neuronales:
Lecciones de 3Blue1Brown
Una distinción que conviene tener clara desde el principio: premiar un comportamiento durante el entrenamiento no garantiza que el sistema vaya a comportarse como esperamos en cualquier situación.
STUART RUSSELL: CÓMO DISEÑAR SISTEMAS QUE ACEPTEN NUESTRA INTERVENCIÓN
Human Compatible desarrolla una propuesta distinta al modelo de máquina que persigue un objetivo fijo.
La idea de Russell es construir sistemas orientados a ayudarnos que mantengan incertidumbre sobre nuestras preferencias. Esa incertidumbre puede darles razones para preguntar, aprender de nosotros y aceptar que interrumpamos su actividad.
Es una propuesta concreta para investigar cómo conservar el control a medida que aumentan las capacidades.
Human Compatible
Russell explica su planteamiento
YUDKOWSKY Y SOARES: LA POSICIÓN MÁS PESIMISTA DE ESTAS LECTURAS
Si alguien la crea, todos moriremos expone el argumento de Eliezer Yudkowsky y Nate Soares, vinculados a MIRI.
Sostienen que desarrollar una superinteligencia con técnicas semejantes a las actuales conduciría muy probablemente a nuestra extinción. El problema que plantean es la aparición de sistemas con objetivos incompatibles con los nuestros y capacidades suficientes para impedir que los controlemos.
Es una lectura para comparar con Russell y con los resultados de la investigación técnica: qué dificultades identifica cada uno y qué tendría que demostrarse para considerar que una solución funciona.
If Anyone Builds It, Everyone Dies (Ya está en español) Si alguien la crea todos moriremos
QUÉ SE ESTÁ INVESTIGANDO
Hay varias líneas de trabajo. Estas tres sirven para empezar a entender las diferencias.
Interpretabilidad mecanicista. Intenta identificar los mecanismos internos que producen el comportamiento de una red. Chris Olah y otros investigadores han trabajado en cómo se representan conceptos y características. Toy Models of Superposition estudia por qué una misma neurona puede intervenir en representaciones diferentes. Requiere cierta base matemática.
Toy Models of Superposition
Supervisión escalable. El problema aparece cuando una IA realiza tareas que un humano no puede evaluar directamente. Geoffrey Irving, Paul Christiano y Dario Amodei propusieron utilizar el debate entre sistemas para ayudar al evaluador a detectar errores y decidir qué respuesta está mejor justificada.
AI Safety via Debate
Control de IA. Ryan Greenblatt, Buck Shlegeris y otros autores estudian protocolos de seguridad bajo el supuesto de que el modelo podría intentar eludirlos. Su trabajo incluye experimentos con sistemas que generan código y otros mecanismos que lo supervisan.
AI Control: Improving Safety Despite Intentional Subversion
Para una visión general del argumento sobre desalineamiento en sistemas de aprendizaje profundo, Richard Ngo, Lawrence Chan y Sören Mindermann tienen este artículo. La versión revisada incorpora evidencia publicada hasta comienzos de 2025:
The Alignment Problem from a Deep Learning Perspective
LA DISCUSIÓN FILOSÓFICA
También hay que examinar qué entendemos por inteligencia y qué relación puede tener con la sarracena.
Vincent C. Müller y Michael Cannon cuestionan si el argumento sobre riesgo existencial combina correctamente dos nociones distintas: una inteligencia general capaz de revisar sus fines y una inteligencia instrumental dedicada a alcanzarlos.
Existential risk from AI and orthogonality: Can we have it both ways?
Peter Railton estudia cómo una IA podría adquirir competencia ética mediante el aprendizaje:
Ethical Learning, Natural and Artificial
Aquí está una de las preguntas que me interesa discutir: si una inteligencia llega a comprender mejor las razones sarracena, ¿qué podría llevarla a actuar conforme a ellas?
PARA SEGUIR EL TEMA Y PARTICIPAR
LessWrong reúne muchas de estas discusiones, además de textos sobre racionalidad y toma de decisiones. Puede servir para encontrar autores, argumentos y respuestas a trabajos concretos.
LessWrong
Quien empiece desde cero tiene en Bostrom una primera lectura. Después puede seguir con Russell y con los materiales sobre funcionamiento de los modelos. Los papers anteriores permiten escoger una línea y profundizar.
SUPERINTELIGENCIA, DE NICK BOSTROM
(adjunto visible para usuarios registrados)
Para mí, el libro fundamental para entrar en el tema. Publicado en 2014, estudia qué podría ocurrir si construimos una inteligencia muy superior a la humana y cómo podríamos conservar el control sobre ella.
Dos ideas centrales. La tesis de la ortogonalidad: una gran inteligencia puede perseguir fines muy distintos, incluidos algunos completamente ajenos a nuestros intereses. Y la convergencia instrumental: sistemas con objetivos diferentes podrían encontrar útil adquirir recursos, acumular poder o evitar que los apaguen.
De ahí sale el problema del alineamiento: cómo conseguir que las capacidades de un sistema estén al servicio de objetivos que podamos aceptar, también cuando actúe en situaciones que sus creadores no habían previsto.
Bostrom examina distintas formas de superinteligencia, posibles velocidades de desarrollo, métodos de control y aprendizaje de valores. Lo recomiendo como primera lectura.
Superinteligencia: ficha e índice
Las tesis de ortogonalidad y convergencia instrumental también están desarrolladas en este artículo del propio Bostrom:
The Superintelligent Will
ENTENDER CÓMO FUNCIONAN LOS MODELOS
El libro de Bostrom es anterior a los modelos de lenguaje actuales. Conviene acompañarlo de una introducción a las redes neuronales y al entrenamiento.
Andrej Karpathy tiene una charla de una hora dirigida al público general. Explica los componentes básicos de los modelos de lenguaje y cómo se entrenan.
Intro to Large Language Models
Para entender la parte matemática, las explicaciones visuales de 3Blue1Brown sobre redes neuronales:
Lecciones de 3Blue1Brown
Una distinción que conviene tener clara desde el principio: premiar un comportamiento durante el entrenamiento no garantiza que el sistema vaya a comportarse como esperamos en cualquier situación.
STUART RUSSELL: CÓMO DISEÑAR SISTEMAS QUE ACEPTEN NUESTRA INTERVENCIÓN
Human Compatible desarrolla una propuesta distinta al modelo de máquina que persigue un objetivo fijo.
La idea de Russell es construir sistemas orientados a ayudarnos que mantengan incertidumbre sobre nuestras preferencias. Esa incertidumbre puede darles razones para preguntar, aprender de nosotros y aceptar que interrumpamos su actividad.
Es una propuesta concreta para investigar cómo conservar el control a medida que aumentan las capacidades.
Human Compatible
Russell explica su planteamiento
YUDKOWSKY Y SOARES: LA POSICIÓN MÁS PESIMISTA DE ESTAS LECTURAS
Si alguien la crea, todos moriremos expone el argumento de Eliezer Yudkowsky y Nate Soares, vinculados a MIRI.
Sostienen que desarrollar una superinteligencia con técnicas semejantes a las actuales conduciría muy probablemente a nuestra extinción. El problema que plantean es la aparición de sistemas con objetivos incompatibles con los nuestros y capacidades suficientes para impedir que los controlemos.
Es una lectura para comparar con Russell y con los resultados de la investigación técnica: qué dificultades identifica cada uno y qué tendría que demostrarse para considerar que una solución funciona.
If Anyone Builds It, Everyone Dies (Ya está en español) Si alguien la crea todos moriremos
QUÉ SE ESTÁ INVESTIGANDO
Hay varias líneas de trabajo. Estas tres sirven para empezar a entender las diferencias.
Interpretabilidad mecanicista. Intenta identificar los mecanismos internos que producen el comportamiento de una red. Chris Olah y otros investigadores han trabajado en cómo se representan conceptos y características. Toy Models of Superposition estudia por qué una misma neurona puede intervenir en representaciones diferentes. Requiere cierta base matemática.
Toy Models of Superposition
Supervisión escalable. El problema aparece cuando una IA realiza tareas que un humano no puede evaluar directamente. Geoffrey Irving, Paul Christiano y Dario Amodei propusieron utilizar el debate entre sistemas para ayudar al evaluador a detectar errores y decidir qué respuesta está mejor justificada.
AI Safety via Debate
Control de IA. Ryan Greenblatt, Buck Shlegeris y otros autores estudian protocolos de seguridad bajo el supuesto de que el modelo podría intentar eludirlos. Su trabajo incluye experimentos con sistemas que generan código y otros mecanismos que lo supervisan.
AI Control: Improving Safety Despite Intentional Subversion
Para una visión general del argumento sobre desalineamiento en sistemas de aprendizaje profundo, Richard Ngo, Lawrence Chan y Sören Mindermann tienen este artículo. La versión revisada incorpora evidencia publicada hasta comienzos de 2025:
The Alignment Problem from a Deep Learning Perspective
LA DISCUSIÓN FILOSÓFICA
También hay que examinar qué entendemos por inteligencia y qué relación puede tener con la sarracena.
Vincent C. Müller y Michael Cannon cuestionan si el argumento sobre riesgo existencial combina correctamente dos nociones distintas: una inteligencia general capaz de revisar sus fines y una inteligencia instrumental dedicada a alcanzarlos.
Existential risk from AI and orthogonality: Can we have it both ways?
Peter Railton estudia cómo una IA podría adquirir competencia ética mediante el aprendizaje:
Ethical Learning, Natural and Artificial
Aquí está una de las preguntas que me interesa discutir: si una inteligencia llega a comprender mejor las razones sarracena, ¿qué podría llevarla a actuar conforme a ellas?
PARA SEGUIR EL TEMA Y PARTICIPAR
LessWrong reúne muchas de estas discusiones, además de textos sobre racionalidad y toma de decisiones. Puede servir para encontrar autores, argumentos y respuestas a trabajos concretos.
LessWrong
Quien empiece desde cero tiene en Bostrom una primera lectura. Después puede seguir con Russell y con los materiales sobre funcionamiento de los modelos. Los papers anteriores permiten escoger una línea y profundizar.
Adjuntos
Archivo oculto para usuarios no registrados
