La inteligencia artificial dio un salto histórico: los nuevos modelos resuelven problemas inalcanzables incluso para los mejores matemáticos

Los últimos avances en inteligencia artificial impresionan por su velocidad, superando las expectativas más audaces. Volodymyr Bandura, CEO de Innolyticsgroup y embajador de la Universidad de la Singularidad, comparte detalles exclusivos sobre la nueva etapa en el desarrollo de los modelos de IA. No se trata solo de una mejora en la resolución de tareas matemáticas, sino de un cambio radical de paradigma: los modelos demuestran la capacidad de buscar soluciones por sí mismos para desafíos completamente nuevos, antes desconocidos, superando con éxito pruebas diseñadas específicamente para evitar la simple búsqueda por fuerza bruta.

Uno de los desarrolladores de estos sistemas avanzados señaló que las futuras generaciones de modelos serán un “shock ontológico” para los usuarios. Estas palabras, al parecer, ya empiezan a confirmarse. Nos acercamos rápidamente al momento en que el conjunto de tareas para las que una persona puede formular con claridad tanto la pregunta como la respuesta comenzará a agotarse para los sistemas de IA.

Rompecabezas matemáticos: desde problemas infantiles hasta investigación de vanguardia

Hace solo unos años, la dificultad de la aritmética escolar elemental dejaba en jaque a la mayoría de los modelos de lenguaje. Los expertos solían subrayar las limitaciones de estos sistemas, llamándolos “loros estocásticos”, entidades que solo imitan el lenguaje de forma estadística, pero no poseen verdadero pensamiento lógico. Sin embargo, la aparición de modelos capaces de pensamiento “profundo” cambió la situación por completo.

Ya en 2025, en la prestigiosa Olimpiada Internacional de Matemáticas, la inteligencia artificial obtuvo medallas de oro, compitiendo en igualdad de condiciones con los humanos bajo las reglas estándar. Esto sorprendió a muchos, pero los principales investigadores en inteligencia artificial habían previsto esta evolución.

Precisamente por eso, a finales de 2024 y principios de 2025, se presentó la prueba Frontier Math, uno de los conjuntos de problemas matemáticos más difíciles. El desarrollo de esta prueba requirió la participación de decenas de matemáticos de primer nivel, que compitieron por el derecho a formular cientos de problemas complejos. Estos problemas se dividieron en cuatro niveles de dificultad: desde matemáticas universitarias hasta problemas de investigación avanzada. Las tareas de la cuarta categoría son tan difíciles que especialistas de alto nivel podían pasar semanas desarrollándolas.

Para evaluar la dificultad de la prueba y compararla con las capacidades humanas, los autores realizaron ensayos con los estudiantes más talentosos del Instituto Tecnológico de Massachusetts (MIT). Ocho equipos de cuatro o cinco personas tuvieron 4,5 horas para completar el test. Los resultados fueron impresionantes: en las tareas relativamente sencillas de los tres primeros niveles, los equipos obtuvieron una media del 19%, y entre todos los equipos, un 35%. Las tareas del cuarto nivel, aún más complejas, ni siquiera se incluyeron en las pruebas para estudiantes, ya que incluso matemáticos de élite con medallas Fields admitían que solo podrían resolver unas pocas, principalmente dentro de su especialidad más estrecha.

Al principio, los modelos de IA más avanzados de entonces mostraban resultados inferiores al 10% incluso en las tareas más sencillas de los tres primeros niveles de Frontier Math. Sin embargo, el nuevo modelo, GPT-6 Astra, mostró un dominio absoluto al resolver el 97,6% de las tareas del nivel más difícil, el cuarto. Esto significa que el modelo resolvió prácticamente todos los problemas que requerían verdadero genio matemático, demostrando un nivel muy superior a las capacidades de cualquier matemático vivo.

Aplicación práctica y nuevos horizontes

Surge una pregunta lógica: ¿cómo se transforman estos impresionantes logros académicos en aplicaciones prácticas? La respuesta está en ámbitos donde los modelos matemáticos complejos ya desempeñan un papel clave. El ejemplo más claro es el conglomerado financiero BlackRock, cuyo sistema de software Aladdin gestiona activos por valor de más de 21 billones de dólares. Este sistema, desarrollado inicialmente para BlackRock, ahora es utilizado por numerosas otras organizaciones.

En el contexto del rápido desarrollo de la IA, los modelos que demuestran un nivel matemático superior al de los equipos más experimentados de gigantes como BlackRock abren oportunidades sin precedentes. El potencial para desarrollar algoritmos más perfectos, herramientas analíticas y modelos predictivos es enorme. Aunque esto puede generar debates sobre el impacto en los “gobiernos secretos del mundo” u otras teorías conspirativas, los hechos siguen siendo hechos: los nuevos modelos de IA crean la base para un nivel cualitativamente nuevo de desarrollo.

Salto en creatividad y razonamiento simbólico

Las sorprendentes capacidades de los nuevos modelos no solo se confirman en matemáticas. También impresiona el progreso en pruebas de resolución creativa de problemas, como ARC AGI 3. Esta prueba es conocida por su dificultad y por su diseño específico, que penaliza a los modelos por intentar una búsqueda de opciones “bruta”.

El mejor modelo anterior de OpenAI, GPT 5.6 Sol, obtuvo solo un 7,8% en ARC AGI 3. El nuevo modelo, Astra, mostró un resultado del 99,9%, lo que demuestra su capacidad para comprender al instante la lógica de tareas nuevas, incluso cuando sus reglas son desconocidas. Al mismo tiempo, Astra demostró formas de resolución más eficaces que las de una persona promedio, utilizando menos pasos.

Los investigadores de ARC AGI 3 quedaron enormemente sorprendidos por el nivel de razonamiento simbólico demostrado por Astra. El modelo creó su propio lenguaje algebraico para describir los estados del juego, lo que le facilitó enormemente el proceso de resolución de los rompecabezas. ARC AGI 3, presentado recién a finales de marzo de 2026, era tan difícil en el momento de su lanzamiento que ningún modelo superaba el 10% de resultado. Sin embargo, este récord duró solo unos meses, a diferencia de la primera versión de ARC, que permaneció imbatible durante cinco años.

Estos logros son solo el comienzo. Decenas de pruebas similares confirman los resultados récord de los nuevos modelos. En los próximos días, Astra estará disponible para el público general, lo que significa que estamos en el umbral de una nueva era de la inteligencia artificial, en la que las capacidades de las máquinas superan las suposiciones humanas más audaces.

Roman Spas

Roman Spas es autor de un blog sobre desarrollo web, noticias de TI, promoción de proyectos web, diseño y tecnologías modernas. En sus artículos, explica temas digitales complejos en un lenguaje sencillo y comparte consejos prácticos para propietarios de sitios web, emprendedores, profesionales del marketing y especialistas que desean comprender mejor el entorno online. El autor se centra principalmente en sitios web eficaces, SEO, diseño web, marketing digital y soluciones tecnológicas que ayudan a las empresas a desarrollarse en el espacio digital.