На этой неделе OpenAI громко заявила о решении сотен из самых сложных математических проблем в мире. На этот раз компания даже заручилась поддержкой консультативной группы элитных математиков — якобы чтобы избежать скандала, который произошёл в прошлый раз, когда модели OpenAI якобы решили давнюю проблему в этой области. Но получилось как-то неубедительно. Особенно разочаровывают результаты, где сами же математики подчёркивали главное: нужно не просто получить решение, нужно, чтобы люди его поняли.
Консультативная группа (Advisory Group on Mathematics and Artificial Intelligence, AGMAI) при Принстонском институте передовых исследований выпустила в конце сентября набор рекомендаций для компаний вроде OpenAI. Её главное требование было предельно чётким: вообще прекратить тестировать сложные математические задачи на закрытых моделях. OpenAI, разумеется, поступила ровно наоборот — её пресс-релиз прямо говорит, что она проверяет свои проприетарные модели на открытых научных проблемах. Группа отказалась дать детальную оценку, когда её об этом попросили. А если смотреть по фактам: из 719 манускриптов только 10 содержали цепь рассуждений модели, которая позволила бы проверить её логику. Из рекомендуемых формализованных доказательств (когда решение проверяется как код) готовы лишь 42%.
Неделю назад математики из Кембриджа и King's College в Лондоне выпустили статью, которая ещё больше усугубила ситуацию. Они обнаружили несоответствия между тем, что модель OpenAI «рассказывает» своим английским языком, и тем, как это же самое выглядит в формальном коде (язык Lean, который якобы гарантирует корректность). Нашлось по крайней мере два расхождения в доказательстве одной из задач, связанной с уравнениями Навье-Стокса. Это не обязательно значит, что одно из «решений» неверно, но вот вопрос встаёт ровно такой: можно ли вообще доверять моделям самостоятельно переводить свои словесные доказательства в формальный язык без помощи людей?
Здесь мы упираемся в главное различие между ИИ и человеком-математиком. Когда человек решает трудную задачу, он не просто выдаёт ответ и уходит. Он пишет статьи, выступает на семинарах, обсуждает результат с коллегами. Это не лишнее: через такой диалог находятся новые методы, которые помогают решить и другие задачи, результаты становятся полезны для практики. Когда же модель получает задачу, решает её и выдаёт результат, то в момент выпуска никто толком этот результат не понимает. Работа только начинается — её нужно проверить, разобраться, что там происходит. Но OpenAI, похоже, эту работу на других скидывает.
Известный математик Теренс Тао (который уже раньше критиковал OpenAI) написал в соцсетях, что суть проблемы в том, что «ИИ решает задачи, но никого из разработчиков не интересует более широкая область науки, они не понимают выход модели достаточно хорошо, чтобы ответить на вопросы, дать доклад или взаимодействовать с остальным научным сообществом». Профессор Гарварда Мелани Вуд дополнила: когда модель спитает задачу и выплюёт решение, то в момент публикации люди его не понимают. И вот тогда-то работа и начинается.
AGMAI предлагала OpenAI поддержать работу человеческих математиков, которые будут делать эти решения действительно значимыми. Также рекомендовала добавлять метаданные, которые бы связали словесное доказательство с формальным кодом — чтобы можно было отследить, где и как произошла возможная ошибка при переводе. OpenAI этого не сделала.
Как это применимо в России: математика и cryptography — серьёзные области, где нужны надёжные доказательства. Если российские компании планируют использовать ИИ-инструменты для проверки или разработки криптографических алгоритмов, обработки сложных расчётов в физике или финансовой математике, то нужно понимать: на сегодня просто запустить модель и взять её ответ как истину нельзя. Нужна человеческая верификация. Для автоматизации работ, где точность критична, стоит либо ждать, пока появятся более надёжные инструменты с человеческой вовлечённостью, либо использовать ИИ только как помощника, а не как решателя.