22 de agosto de 2026
# Los problemas que la IA ha resuelto este verano en matemáticas y en ciencia

El miércoles Fireship publicó un vídeo de cinco minutos que se llama [The summer Math fell to the machines](https://www.youtube.com/watch?v=iuZPTE5qsJY). Va rapidísimo, mete un chiste cada quince segundos y suelta ocho casos seguidos sin enlazar ni uno. Lo tenéis [[El Abismo de Máquina/Ecos/2026.08/Eco-El-Verano-Que-Cayeron-Las-Matematicas|entero y resumido aquí al lado]], en un Eco.
Me gustó bastante, pero me quedé con ganas de saber más y con la duda de cuánto de verdad es todo esto. Así que fui caso por caso a las fuentes originales, y de paso busqué otros casos en ciencia, fuera de las matemáticas.
La mayor parte está bien, pero no todo tiene el mismo grado de comprobación. Aquí van once casos entre mayo y agosto: seis de matemáticas y cinco de ciencia. De cada uno, cuál era el problema, cuánto tiempo llevaba sin respuesta y quién hizo qué. He dejado los *peros* donde los hay, que son unos cuantos.
## Matemáticas: seis casos entre mayo y agosto
### 20 de mayo, las distancias unidad

Pones n puntos en un plano. ¿Cuántas parejas de esos puntos pueden estar exactamente a distancia 1? Eso es todo el problema.
Lo preguntó Paul Erdős en 1946, y el manual de referencia del campo lo llama *"probablemente el problema más conocido y más sencillo de enunciar de la geometría combinatoria"*. Durante ochenta años se dio por hecho que la mejor forma de colocar los puntos era una rejilla cuadrada reescalada y que no se podía ganar mucho más.
Y ahí se quedó la cosa, por los dos lados. Nadie encontró una manera de colocar los puntos que sacara más parejas que la que propuso Erdős en 1946. Y el máximo que nadie va a poder superar nunca, se pongan los puntos como se pongan, es el que se demostró en 1984. Cuarenta años sin moverse ni el récord ni el techo.
Un modelo interno de OpenAI construyó una familia infinita de ejemplos que gana a la rejilla. Y para hacerlo se fue a un sitio del que aquí nadie esperaba nada: la teoría algebraica de números, con torres de cuerpos de clases y teoría de Golod-Shafarevich. Los revisores externos escribieron un artículo aparte explicando el argumento, porque el original no era fácil de leer.
Tim Gowers, medalla Fields, firmó esta frase en ese artículo: si lo hubiera escrito un humano y lo hubiera mandado a los *Annals of Mathematics*, lo acepta sin dudarlo. Y añade que ninguna demostración generada por IA se había acercado antes.
_Fuente: [An OpenAI model has disproved a central conjecture in discrete geometry](https://openai.com/index/model-disproves-discrete-geometry-conjecture/) · OpenAI, 20 de mayo de 2026. Ahí están la [demostración](https://cdn.openai.com/pdf/74c24085-19b0-4534-9c90-465b8e29ad73/unit-distance-proof.pdf) y el [artículo de los revisores externos](https://cdn.openai.com/pdf/74c24085-19b0-4534-9c90-465b8e29ad73/unit-distance-remarks.pdf), que es de donde sale la frase de Gowers._
### 20 de julio, la conjetura jacobiana

Esta es la buena. Tienes una función polinómica de varias variables y compruebas que en cada punto, mirando muy de cerca, es reversible. La conjetura dice que entonces la función entera tiene que ser reversible. Suena bastante a que tiene que ser verdad.
La formuló Ott-Heinrich Keller en 1939, lleva ochenta y siete años sin respuesta y está en la lista de Smale de problemas para el siglo XXI. Es falsa.
Levent Alpöge, teórico de números en Anthropic, lo publicó en X con un texto que ya es un clásico: *hello there the jacobian conjecture is false thanx*. Debajo, un contraejemplo en tres variables, con determinante jacobiano constante e igual a -2, donde tres puntos distintos acaban en el mismo sitio. Se lo encontró Claude Fable 5 *en una tarde*. Lo comprobaron enseguida por fuera, y la aritmética la puede repasar cualquiera con papel y un poco de paciencia.
Sigue abierta en dos dimensiones, que es el caso clásico. Lo que ha caído es de tres para arriba.
_Fuente: [el post de Levent Alpöge en X](https://x.com/__alpoge__/status/2079028340955197566) · 20 de julio de 2026._
### 22 de julio, la conjetura de Dinitz-Garg-Goemans

Dos días después. Esta se entiende con un ejemplo de reparto: tienes mercancía que va de un sitio a otro y de momento la puedes partir entre varias rutas. La pregunta es si siempre puedes juntar cada envío en una sola ruta sin que el coste total suba. Treinta años dando por hecho que sí, sin poder demostrarlo.
Dmitry Rybin le pasó el problema a GPT-5.6 Pro y le dijo, básicamente, que hiciera un descubrimiento. El modelo devolvió una red diminuta, de siete nodos y nueve aristas, donde la solución partida cuesta 58 y cualquier solución sin partir cuesta 60 o más. Dos puntos de diferencia bastan.
Cuatro prompts, cincuenta y ocho palabras en total, y Rybin publicó la conversación entera. La pega: todavía no hay un artículo revisado por pares. Pero ya no está solo en un hilo de X: una formalización independiente en Isabelle ha comprobado el grafo, los costes 58 y 60, y el límite de capacidad.
_Fuentes: [el hilo de Dmitry Rybin en X](https://x.com/DmitryRybin1/status/2079904005652893709) · 22 de julio de 2026, con el enlace a la conversación completa con el modelo, y la [formalización independiente en Isabelle](https://isa-afp.org/entries/Dinitz_Garg_Goemans_Counterexample.html)._
### Los seis Erdős de un doctorando

Esa misma semana, un doctorando de Columbia publicó seis demostraciones que, según él, resuelven problemas abiertos de Erdős en cinco días, con GPT-5.6 y Codex. Lo intentó con trece y publicó seis. Una de las tareas estuvo corriendo treinta y dos horas seguidas.
De este caso me quedo con cómo escribía él los encargos, más que con el modelo que usó. El prompt era un contrato: volvía a plantear el problema, decía qué tenía que probar exactamente una demostración terminada, listaba los resultados más débiles que no valían para que no se colaran por ahí, y metía las trampas conocidas antes de que el modelo empezara a pensar. Y eligió problemas de los que ya se hablaba, evitando a propósito los famosos.
De momento son propuestas publicadas, no resultados aceptados por la comunidad. Algunas llevan formalización en Lean; otras siguen pendientes de una revisión independiente.
_Fuente: [el hilo de Shouqiao Wang en X](https://x.com/Qiaoqiao2001/status/2080003441821163958) · julio de 2026, con sus prompts y los PDF de las seis demostraciones. Son los problemas 390, 486, 536, 788, 1002 y 1038 de [erdosproblems.com](https://www.erdosproblems.com/), que sigue marcando varios de ellos como abiertos._
### 1 de agosto, los diez de OpenAI

OpenAI publicó diez resultados de una versión interna de Astra, su próximo modelo. Diez problemas abiertos, resueltos o avanzados de forma seria: empaquetamiento de esferas en dimensiones altas, códigos binarios y esféricos, la existencia de grupos no sóficos, la conjetura de rigidez de Connes, complejidad de circuitos aritméticos, repetición en paralelo cuántica, el problema del vector más cercano, la conjetura del volumen de Ehrhart, números de Ramsey multicolor y dos conjeturas de teoría extremal de grafos.
Dos cosas de aquí me parecen más relevantes que la lista.
La primera es el precio. OpenAI dice que los tokens necesarios para encontrar las diez soluciones costarían unos 2.000 dólares a tarifas de API de Sol. No es el coste total del proyecto, ni el de entrenar el modelo, ni el de revisar y formalizar después. Pero la cifra de inferencia sigue siendo llamativa.
La segunda es que no se limitaron a anunciarlo. Cada argumento va con un certificado en Lean subido a GitHub, y con la narración del razonamiento del modelo.
> [!info]- Qué es Lean
> Lean es un lenguaje en el que se puede escribir una demostración matemática con tanto detalle que un programa la comprueba paso a paso y dice si es correcta o no. No opina sobre si el resultado es interesante: solo verifica que no hay ningún salto en el razonamiento.
>
> Pesa aquí porque comprueba que el razonamiento formalizado no tiene saltos. Si un modelo publica una demostración en prosa, alguien tiene que leerla y decidir si se fía. Si la publica en Lean, la compilas tú en tu ordenador. Pero queda otra revisión: que lo que se ha formalizado sea exactamente el resultado que se anuncia. Esa parte sigue siendo de matemáticos.
Y hay un párrafo en ese anuncio que no esperaba leer en una nota corporativa. Dicen que atribuir autoría humana a una demostración generada entera por una IA falsearía las dos cosas: la aportación del sistema y lo que es el trabajo intelectual de una persona. Los humanos prepararon los manuscritos, formalizaron en Lean y firman la corrección. El argumento matemático lo generó la máquina.
_Fuente: [Ten advances in mathematics and theoretical computer science](https://openai.com/index/ten-advances-in-mathematics/) · OpenAI, 1 de agosto de 2026. Los certificados de Lean están en [GitHub](https://github.com/openai/ten-proofs)._
### 10 de agosto, la hipótesis de Riemann

Aquí es donde el titular y el resultado se parecen poco, así que voy despacio.
La hipótesis de Riemann es de 1859, va de cómo se reparten los números primos, y es uno de los siete problemas del milenio, con un millón de dólares encima. Nadie la ha demostrado nunca, y después de este verano sigue exactamente igual de sin demostrar.
Lo que ha pasado es otra cosa. Hay una línea de trabajo que consiste en probar que al menos un cierto porcentaje de los ceros de la función zeta cumplen la hipótesis. Ese porcentaje llevaba décadas subiendo a base de trabajo humano y estaba en el 41,6%. Una versión sin publicar de Claude lo ha subido al 67,2%.
Y el cómo es la parte que me interesa. Jarred Sumner, empleado de Anthropic que no es matemático (es el creador de Bun), le pidió al modelo que le metiera mano de verdad a Riemann. Claude generó 650 ideas y ninguna funcionó. Sumner le dijo que lo volviera a intentar. En la segunda tanda el modelo estuvo día y medio coordinando unos sesenta subagentes dentro de Claude Code: 2.400 comandos de shell, cientos de scripts de Python, 31 millones de tokens de salida, y 54 papers descargados de arXiv para comprobar que aquello no estaba ya hecho.
De esos sesenta subagentes, dos dieron las ideas clave, trece aportaron cosas a esos dos, trece hicieron de validadores, dos escribieron el borrador del artículo y treinta no sacaron nada. La aportación de Sumner durante todo el proceso fue *mandar mensajes de ánimo* 😉, la mayoría variaciones de "sigue" y "puedes hacerlo", porque el modelo empezó escéptico sobre sus propias posibilidades.
Lo validaron dos matemáticos de Anthropic (uno es Alpöge, el de la jacobiana) y lo revisaron desde fuera Brian Conrey y Dan Goldston, dos expertos en el área. Además está formalizado en Lean. La propia Anthropic dice que no espera que estas técnicas lleven a demostrar la hipótesis.
_Fuente: [Learning more about Claude's mathematical capabilities](https://www.anthropic.com/research/riemann-zeta) · Anthropic, 10 de agosto de 2026. Cuelgan el [artículo](https://www-cdn.anthropic.com/95c246936988e43127bc6b2ceb7077c1dad2d68e.pdf), la [formalización en Lean](https://github.com/anthropics/zeta-23-lean) y las [transcripciones del proceso](https://www-cdn.anthropic.com/8a0d1add3c637b858a9a181e98c40e9548c3f44f.pdf)._
## La respuesta de los matemáticos

Todo esto no ha pillado a la comunidad matemática desprevenida, aunque lo parezca.
El 2 de junio, o sea antes de casi todo lo anterior, un grupo de trabajo de dieciséis personas publicó la Declaración de Leiden sobre inteligencia artificial y matemáticas. La respalda la Unión Matemática Internacional y, a día de hoy, la han firmado 3.545 personas, entre ellas Peter Scholze y Terence Tao.
No es un manifiesto contra la IA. Pide cosas concretas: declarar qué herramientas has usado, que la responsabilidad de que una demostración sea correcta siga siendo de una persona, que los resultados se publiquen en sitios con revisión y no en notas de prensa, y que se ponga esfuerzo en citar el trabajo humano previo que un modelo sintetiza sin nombrar. A los políticos les dedican un apartado con un título que se entiende solo: no os creáis el hype.
Y en julio, en el Congreso Internacional de Matemáticos de Filadelfia, Tao dio una charla titulada *Mathematics in the age of AI*. Su planteamiento no va de si los modelos son capaces o no. Va de que esto es una crisis en los cimientos de los valores y las prácticas de las matemáticas, más o menos como la de 1900-1930 con Russell y Gödel. Y de que si se examina y se pone por escrito en vez de resistirse, la comunidad sale reforzada.
_Fuentes: la [Declaración de Leiden](https://leidendeclaration.ai/) · 2 de junio de 2026, y el ensayo de Terence Tao [Mathematics in the age of AI](https://arxiv.org/abs/2608.16753) · arXiv, agosto de 2026._
---
## Química, biología y materiales
El vídeo se queda en las matemáticas. Pero fuera hay resultados y algunos tienen laboratorio detrás, que es bastante más difícil que compilar un fichero.
### Diseño de proteínas, con laboratorio de por medio

Anthropic publicó el 18 de agosto los resultados de una campaña de diseño de minibinders, que son proteínas pequeñas que se unen con mucha fuerza a otra proteína elegida. Es una tarea de las primeras fases de algunos medicamentos basados en proteínas, y a un ingeniero le lleva semanas o meses por cada diana.
Le dieron a Claude quince dianas, acceso a GPUs y a los modelos especializados que ya usa el campo, y lo dejaron correr solo. Consiguió unir contra catorce de las quince. Entre el 22% y el 35% de los diseños funcionaron, según el montaje, cuando lo normal hoy está entre el 10% y el 15%. Contra una diana concreta, RBX1, sacó un 40% frente al 3,7% de los participantes de un concurso público del área.
Lo que hace creíble esto es que los diseños se fabricaron y se probaron físicamente en dos laboratorios externos, Adaptyv Bio y Twist Bioscience. No es una predicción, son proteínas que existen.
Y falló. Contra la proteína de unión a maltosa hizo noventa diseños y no funcionó ninguno.
_Fuente: [How Claude is accelerating protein design and analytical chemistry](https://www.anthropic.com/research/Claude-accelerates-protein-design) · Anthropic, 18 de agosto de 2026. El [informe técnico](https://www-cdn.anthropic.com/30bf50e22a01388bb29bf077ee3f244531594b7a.pdf) y los [prompts y datos](https://huggingface.co/datasets/Anthropic/claude-protein-binder-design/tree/main) están publicados._
### Química analítica en veintitrés minutos

En el mismo artículo hay un segundo experimento que me parece más útil para entender por dónde va esto en el día a día de un laboratorio.
Cuando un químico sintetiza una molécula tiene que demostrar que es la que quería y cómo de pura es. Para eso saca un espectro de resonancia magnética nuclear y una cromatografía con espectrometría de masas. Las máquinas tardan minutos; interpretar lo que sale tarda de media hora a una hora por muestra, a mano.
Le pasaron a Claude Opus 5 los ficheros crudos de un laboratorio externo, en el formato propietario del fabricante, con un prompt de dos frases. Sin el software del fabricante y sin nadie delante. Devolvió los dos análisis en 23 y 19 minutos, trabajando en paralelo, con una pureza del 96,4% frente al 96,33% que había medido el laboratorio. Para leer el fichero binario, primero dedujo cómo estaba codificado y luego se verificó a sí mismo reproduciendo los totales de los 2.664 barridos que el aparato había registrado.
Dos detalles que me gustan más que la cifra. Uno, propuso por su cuenta el mismo experimento de comprobación que el laboratorio había hecho tres días después de la primera medida. Y dos, se corrigió: en la primera lectura dijo que habían desaparecido cuatro picos, su propia comprobación dijo que solo dos, y rectificó. El informe del laboratorio, para el mismo compuesto, llegó cuatro días después.
_Fuente: el mismo artículo de Anthropic del 18 de agosto, con su [informe técnico de análisis químico](https://www-cdn.anthropic.com/9f08da5189ac269b3242ca760de9823805c3f5f6.pdf)._
### Una hipótesis de biología que salió en dos días

Google ha publicado este año en *Nature* el trabajo de Co-Scientist, un sistema de varios agentes montado sobre Gemini que genera hipótesis, las discute entre ellos y las va puliendo.
El caso que más se cita: le pidieron que explicara por qué unos elementos móviles que llevan genes de virulencia y de resistencia a antibióticos se propagan entre especies bacterianas tan distintas. Con poquísima información de partida, la hipótesis que colocó en primer lugar fue que esos elementos se aprovechan de las colas de fagos diversos para ampliar su rango de huéspedes. Tardó dos días en plantearla. Era exactamente el hallazgo principal de un estudio experimental independiente que iba en paralelo y que aún no se había publicado.
_Fuente: [Accelerating scientific discovery with Co-Scientist](https://www.nature.com/articles/s41586-026-10644-y) · Nature, 2026._
### Un fármaco que ya está en fase 3

Este viene de antes y por eso mismo sirve de contrapeso. Insilico Medicine buscó con IA una diana nueva para la fibrosis pulmonar idiopática, TNIK, y diseñó con IA la molécula que la inhibe, rentosertib. Los resultados de fase 2a se publicaron en *Nature Medicine*: en el grupo de 18 pacientes con la dosis de 60 mg, la capacidad pulmonar subió de media 98,4 mL en doce semanas, frente a una pérdida de 20,3 mL en el grupo de placebo. Era un ensayo pequeño y su objetivo principal era medir seguridad.
Ya ha arrancado la fase 3. Del primer día de trabajo con IA a este punto han pasado años, no semanas, y esa es justo la parte que no se cuenta en los titulares.
_Fuente: [A generative AI-discovered TNIK inhibitor for idiopathic pulmonary fibrosis: a randomized phase 2a trial](https://www.nature.com/articles/s41591-025-03743-2) · Nature Medicine, junio de 2025._
### Materiales, doce horas y ciento veinte experimentos

En mayo, un equipo de NC State publicó en *Nature Communications* un laboratorio autónomo llamado PoLARIS. Los investigadores eligen los ingredientes de partida y el objetivo (aquí, nanoplaquetas luminosas sin plomo, buscando la mayor luminosidad posible) y el sistema hace el resto: prepara cada receta en una gotita minúscula, la analiza, y decide qué probar en la siguiente ronda con lo que acaba de aprender.
Ciento veinte experimentos en una sola campaña de doce horas, y de ahí salió el mejor resultado de esa campaña. Encontró condiciones que llevaron el rendimiento lumínico del material al 45% tras purificarlo.
_Fuente: [Autonomous microfluidic experimentation for exploring reaction interference and synthesizing double perovskite nanoplatelets](https://www.nature.com/articles/s41467-026-72765-2) · Nature Communications, 4 de mayo de 2026._
## El punto común de los once casos

Cuando los pones en fila hay un patrón, y no es el que suele salir en los titulares.
**Los primeros resultados más claros salen donde comprobar es rápido y barato.** Anthropic lo dice casi así en su artículo. En matemáticas el fichero de Lean compila o no compila, y eso lo decide un ordenador en minutos. En química analítica hay un resultado del laboratorio contra el que contrastar. En biología hay que esperar semanas a que vuelvan los datos de la campaña. Y en un fármaco hay que esperar años. No explica todos los casos, pero sí por qué las demostraciones formales están llegando antes y con más claridad.
**El humano sigue eligiendo el problema y el encargo.** El doctorando de Columbia eligió problemas de los que ya se hablaba y evitó los famosos, y escribió el encargo como un contrato. Sumner no sabe matemáticas y su aportación fue decir "sigue". Alpöge sabía cuál era la conjetura que valía la pena atacar. Incluso cuando alguien pide algo tan abierto como "haz un descubrimiento", alguien ha elegido antes dónde buscarlo.
**Los fallos están en las cifras y no los esconden.** 650 ideas malas antes de la buena, treinta de los sesenta subagentes sin sacar nada, seis propuestas de demostración de trece problemas de Erdős, y noventa diseños de proteína seguidos contra la misma diana sin que funcionara ninguno. Esto no va de darle a un botón.
**Y los costes hay que leerlos completos.** Los 2.000 dólares de OpenAI hablan de tokens de inferencia, no del coste de desarrollar, entrenar, revisar o formalizar. El laboratorio puede ser lo caro, pero el cómputo del modelo también puede ser un dineral.
## Qué podemos aprender para una empresa

Aquí no hay ninguna proteína ni ninguna conjetura, pero la pregunta que sale de todo esto sirve igual: **¿cuánto te cuesta comprobar si una respuesta es buena?**
Si comprobar es barato y rápido -código que compila y pasa los tests, un cálculo que cuadra, un documento contrastado contra el contrato del que sale, una lista de datos que se puede cotejar contra el sistema-, esto ya funciona hoy y lo estáis viendo. Si comprobar requiere un cliente, un laboratorio o seis meses de calendario, los ciclos serán más lentos y no vais a ver la misma cadencia por mucho modelo de IA que compréis. Y si no tenéis forma de comprobar, lo que estáis montando no es un sistema, es un acto de fe.
Me quedo también con lo que dicen los de Leiden a los políticos, que vale para cualquier comité de dirección: **hay un incentivo comercial fuerte para exagerar lo que hacen estos productos**. De los once casos de arriba, unos cuantos son anuncios en el blog de una empresa. El certificado, el paper científico o los datos publicados ayudan mucho, pero no sustituyen la revisión de quien conoce el campo. A los otros hay que darles un poco de tiempo antes de contarlos como hechos.
¿Va a seguir este ritmo? Ni idea. En mayo cayó un problema de ochenta años y agosto ha traído mucha más actividad, así que mi sensación es que sí, pero llevo suficientes años en esto como para saber que se me da fatal predecir. Lo de la verificación sí me lo creo, porque eso se puede medir.
## Bonus
> [!tip]+ Dentro de esta web
> - [[Newsletter/2026/70-Midiendo-mal-la-Inteligencia.md|Estamos midiendo mal la inteligencia artificial]] - Lo de la Declaración de Leiden pidiendo que no se usen tareas concretas como medida general del producto es esto mismo, aplicado a las matemáticas.
> - [[Newsletter/2026/93-maquina-de-escalar-colinas.md|La máquina de escalar colinas]] - Sesenta subagentes probando y descartando durante día y medio es exactamente el bucle del que va esta pieza, aplicado a un problema abierto.
> - [[Posts/2026.08/18-Personas-y-modelos-no-se-equivocan-igual.md|Personas y modelos de IA no se equivocan igual]] - Si todo esto depende de verificar, aquí está quién verifica bien qué, y en qué se equivoca cada uno.
> [!tip]+ Para profundizar en Internet
> - [Ten advances in mathematics and theoretical computer science](https://openai.com/index/ten-advances-in-mathematics/) · OpenAI, 1 de agosto de 2026 - El anuncio de los diez problemas, con los certificados de Lean en [GitHub](https://github.com/openai/ten-proofs). El apartado del final sobre a quién se atribuye un resultado vale la pena aunque no os interesen las matemáticas.
> - [Learning more about Claude's mathematical capabilities](https://www.anthropic.com/research/riemann-zeta) · Anthropic, 10 de agosto de 2026 - El caso de Riemann contado por dentro, con el desglose de qué hizo cada uno de los sesenta subagentes. Es lo más detallado que he leído sobre cómo trabaja de verdad uno de estos sistemas.
> - [Leiden Declaration on Artificial Intelligence and Mathematics](https://leidendeclaration.ai/) · Grupo de trabajo de dieciséis matemáticos, 2 de junio de 2026 - Se lee en quince minutos y está bien escrita. Cambiad "matemáticas" por vuestro sector y casi todo sigue en pie.
---
Publicado el 22 de agosto de 2026, [LinkedIn](https://www.linkedin.com/pulse/los-problemas-que-la-ia-ha-resuelto-este-verano-en-y-hurtado-tor%25C3%25A1n-mtvfe), [Substack](https://davidhurtado.substack.com/p/los-problemas-que-la-ia-ha-resuelto?r=4uyjfg&utm_campaign=post&utm_medium=web&showWelcomeOnShare=true), [X](https://x.com/dhtoran/status/2091051612303196559?s=20)