Новости мира, Общество, Технологии

Новый секретный тест по математике поставил в тупик ИИ и докторов наук

14.11.2024 2 мин. чтение

В ноябре 2024 года исследовательская организация Epoch AI представила новый математический тест под названием FrontierMath, который стал настоящим вызовом как для современных моделей искусственного интеллекта (ИИ), так и для опытных математиков. Этот тест включает сотни сложных задач, требующих от специалистов часов или даже дней для решения.

Согласно предварительным данным, опубликованным Epoch AI, ведущие ИИ-модели, такие как Claude 3.5 Sonnet, GPT-4o, o1-preview и Gemini 1.5 Pro, показали крайне низкие результаты, решив менее 2% задач из набора FrontierMath. Это резко контрастирует с их высокими показателями на более простых тестах, где они достигают более 90% успеха.

Особенностью FrontierMath является то, что его задачи остаются неопубликованными, чтобы предотвратить возможность их использования для обучения ИИ. Многие существующие тесты доступны в открытом доступе, что позволяет моделям ИИ "знакомиться" с ними заранее и демонстрировать высокие результаты, не отражающие их реальных возможностей.

Для разработки FrontierMath Epoch AI привлекла более 60 математиков из ведущих научных учреждений. Задачи прошли тщательную проверку на корректность и отсутствие двусмысленностей. Примерно 5% задач потребовали исправлений, что соответствует стандартам других крупных тестов в области машинного обучения.

Задачи FrontierMath охватывают различные области математики, от вычислительной теории чисел до абстрактной алгебраической геометрии, и отличаются высокой сложностью. Лауреаты Филдсовской премии Терренс Тао и Тимоти Гауэрс, ознакомившись с частью теста, отметили его чрезвычайную сложность. Тао заявил, что в ближайшем будущем такие задачи смогут решать только специалисты в соответствующих областях, возможно, с помощью современных ИИ и специализированных математических пакетов.

Для автоматической проверки ответов задачи FrontierMath требуют точных числовых или математических решений, что исключает возможность случайных угадываний. Математик Эван Чен отметил, что задачи FrontierMath отличаются от традиционных математических олимпиад, таких как Международная математическая олимпиада (IMO), где акцент делается на креативность и избегание сложных вычислений.

Введение таких сложных тестов, как FrontierMath, подчеркивает текущие ограничения ИИ в области математического мышления и демонстрирует необходимость дальнейших исследований для преодоления этих барьеров.