o1 saca 120 de CI y oro en programación
Un destacado científico biomédico dice que o1 trabaja a nivel de doctorado. Un matemático de la talla de Terence Tao lo sitúa como un posgrado mediocre, no del todo incompetente. Jensen Huang afirma que la superación personal recursiva se acelera y que hemos entrado en el ciclo de retroalimentación positiva. Y mientras tanto, o1 se cuelga el oro en la Olimpiada Internacional de Informática, saca 120 de coeficiente intelectual —más que nueve de cada diez humanos— y ha obligado a crear un nuevo punto de referencia llamado
El último examen de la humanidad porque la IA ya supera el rendimiento humano básico en casi todo lo demás. La pregunta ya no es si sirve para algo. La pregunta es para qué no sirve.
Qué ha logrado o1 en los últimos días
El listado de hitos es difícil de digerir sin frotarse los ojos. Un destacado científico biomédico califica a o1 como un doctorando excepcional, de los mejores que ha instruido. Un matemático de primera línea matiza que aún le falta alguna vuelta para ser un posgrado competente según sus estándares, pero concede que ya está al nivel de un posgrado mediocre y no del todo incompetente. La horquilla entre ambas valoraciones es, en sí misma, la noticia:
el consenso experto se mueve entre el doctorado y el posgrado, no entre el juguete y la calculadora.
A eso se suma el oro en la Olimpiada Internacional de Informática, las olimpiadas de programación, y un salto de
30 puntos de coeficiente intelectual hasta los 120. Sam Altman, en una entrevista con T-Mobile, comparó el estado actual de o1 con la fase GPT-2 de los modelos de razonamiento y dejó caer que su desarrollo desbloquea un camino mucho más rápido hacia agentes de IA plenamente capaces. Traducción: esto es la prehistoria de lo que viene.
El último examen de la humanidad: la prueba que ya no sirve
Los investigadores han creado un punto de referencia llamado
El último examen de la humanidad porque la IA ha alcanzado o superado el rendimiento a nivel humano básicamente en todos los demás puntos de referencia. El nombre no es una hipérbole de marketing: es la constatación de que las pruebas tradicionales se han quedado cortas. Cuando el examinado supera el examen, el examen deja de medir.
Hay quien sostiene que todo esto es humo y que la IA no gana dinero, que le espera la misma suerte que a los NFT. Enfrente pesa el argumento de que la adopción ya está ocurriendo en tareas concretas: preparación de cuestionarios, redacción de informes, análisis de documentos. El cálculo más optimista asume que un becario con IA sustituye a un administrativo senior con certificaciones. El escenario pesimista parte de que la supervisión humana sigue siendo imprescindible y que el ahorro real es menor de lo que parece.
La brecha entre el relato y la calculadora
Aquí llega el matiz que descoloca a propios y extraños. Los LLM no saben sumar porque no son el algoritmo adecuado para eso. Son intuitivos: responden a asociaciones de conceptos, no a lógica formal. La intuición no es buena para las matemáticas, pero sí para otros temas menos formales. Los seres humanos razonan por intuición el noventa por ciento del tiempo. Estimas una suma a voleo, aprecias una distancia, tomas decisiones con patrones extraídos de la experiencia. La IA hace lo mismo, pero a otra escala.
Eso explica la paradoja de que un modelo que saca oro en programación no pueda conectarse a una calculadora. Tanta API, tanto agente y tanto GPT para que no sepa hacer una hoja de cálculo. La respuesta técnica es que no está diseñado para eso. La respuesta práctica es que da igual: quien lo usa para lo que sirve obtiene resultados que antes requerían horas.
El miedo real: no es la IA, es quién la controla
Hay una corriente de análisis que sostiene que el problema no es la
tecnología, sino las manos en las que está. La misma herramienta que prepara cuestionarios en cinco mañanas puede usarse para engañar a alguien menos crítico. En un servidor de soporte, un usuario recibió un mensaje privado instantáneo invitándole a conectar su cartera a una página. Cortó a tiempo. Otros no cortan.
El otro frente es el laboral. Un catedrático de biomedicina lanzó una advertencia: la demanda de médicos humanos caerá significativamente, sobre todo en diagnósticos estándar y tratamientos rutinarios. La atención primaria, dice otra corriente, podría cubrirse con IA en el noventa por ciento de las consultas, con el farmacéutico como filtro. El que se muere es el que espera al especialista.
Lo que aún no cuadra
La superación personal recursiva que menciona Jensen Huang implica que la IA mejora la IA. Si eso se acelera, los plazos se comprimen. Pero nadie sabe cuánto. Los escépticos recuerdan que la IA no toma conciencia, no extermine a la humanidad y no ha barrido la nave una hora antes. Los entusiastas responden que eso es como pedirle a un niño de tres años que explique la relatividad.
El punto exacto donde el análisis se atasca es este: si o1 está a nivel de posgrado en matemáticas y de doctorado en biomedicina, ¿por qué no puede sumar dos números sin equivocarse? La respuesta —que es intuitivo, no lógico— no consuela a quien espera una herramienta infalible. Consuela a quien entiende que la inteligencia humana tampoco lo es.