Las pruebas generadas por IA a menudo se verifican mediante un proceso llamado formalización. OpenAI parece haber cometido un error sutil al publicar sus pruebas del problema de Navier-Stokes, un equipo de matemáticos ha afirmado. El error no significa que las pruebas sean incorrectas o que OpenAI no haya resuelto correctamente el problema, pero sí pone en duda si los resultados matemáticos generados por modelos de IA siempre pueden confiarse.
"Lo que debe hacerse con todas estas pruebas generadas por grandes modelos de lenguaje es que tendrán que ser leídas por humanos, lo que crea una enorme carga extra para los matemáticos", dice Anders Hansen en la Universidad de Cambridge. El 8 de septiembre, OpenAI anunció que había encontrado una solución al problema de Navier-Stokes, uno de los problemas abiertos más famosos de las matemáticas. Publicó la prueba en dos versiones – una escrita en "lenguaje natural" y otra escrita en el código informático Lean.
El problema es, dicen Hansen y su equipo, que las dos pruebas no coinciden. "Este proceso de formalización está intentando reemplazar la revisión por pares" dice el miembro del equipo Fabian Circelli, también en la Universidad de Cambridge. "La revisión por pares significaría que ojos humanos miren las pruebas. Pero lo que hemos mostrado en este papel es que usando este tipo de IA auto-formalización no puede servir el mismo propósito."
La reclamación específica del equipo se basa en partes de las pruebas llamadas Lemma 8.6. En la prueba de lenguaje natural, una ecuación requiere que un valor esté por debajo de m + 4, mientras que en la prueba de Lean el valor equivalente está por debajo de m + 5, lo que es matemáticamente más débil. OpenAI le dijo a New Scientist que es consciente del desajuste y que esto no significa que ninguna de las pruebas sea inválida.
Fuente: Hacker News · Resumido por HeadlinesBriefing