Опубликованы результаты проекта First Proof — первого теста, который объективно оценил способность искусственного интеллекта решать математические зад…
Главное отличие этого теста от предыдущих в том, что задачи были абсолютно новыми — их специально предоставили ученые — это были задачи из еще неопубликованных работ. Это исключило возможность того, что нейросети просто «запомнили» решения из интернета. Условия эксперимента можно считать максимально честными.
В тесте участвовала модель ChatGPT 5.5 Pro от OpenAI, а также разработки университетов Цюриха, Калифорнии и Принстона. Лучший результат показала система из Швейцарии, которая использовала перекрестную проверку ответов несколькими чат-ботами. Однако даже она не смогла решить все задачи — 4 из 10 остались нерешенными.
Таким образом, несмотря на недавние успехи ИИ в математике, систематические испытания показывают, что до уровня ведущих специалистов-людей нейросетям пока далеко. Организаторы планируют и дальше использовать подобные проверки, чтобы оценить, насколько ИИ может быть полезен ученым в качестве вспомогательного инструмента.