Академический руководитель Школы Высшей Математики и ШАДХелпера, кандидат физико-математических наук А. Лыков представил результаты нового эксперимента, посвящённого возможностям современных нейросетей. На этот раз в фокусе внимания оказался первый этап вступительных испытаний в Школу анализа данных (ШАД) на 2026 год. Ранее автор уже демонстрировал, что искусственный интеллект успешно справляется со вторым этапом отбора, а теперь решил проверить, насколько хорошо алгоритмы решают задачи базового уровня.
В ходе тестирования были использованы все 40 заданий первого этапа, представленные в четырёх вариантах экзамена. Проверку проходили пять ведущих языковых моделей: Claude Opus 4.8, DeepSeek-R1-0528, ChatGPT Sol, Qwen3.7-Max и GigaChat-3-Ultra. Результаты показали значительный разброс в способностях алгоритмов. Лидером стала модель Claude Opus 4.8, набравшая 39,5 балла из 40 возможных. Чуть менее впечатляющие, но всё же высокие результаты продемонстрировали DeepSeek-R1-0528 (38,25 балла) и ChatGPT Sol (37,75 балла). Qwen3.7-Max остановилась на отметке 32,5 балла.
С учётом того, что проходной порог для первого этапа составляет около 30 баллов, все зарубежные модели успешно преодолели бы отбор. Исключением стал отечественный GigaChat-3-Ultra, который завершил тест с результатом 25,25 балла, не дотянув до необходимого минимума. Примечательным оказался и инцидент с моделью Gemini 3.1 Pro, которую пришлось дисквалифицировать. Как поясняет автор, причиной стала не ошибка нейросети, а недоработка в самой методике тестирования, что не позволяет считать этот случай честным провалом.
Помимо итоговых баллов, исследование также затронуло вопросы практического применения ИИ в образовательном процессе. Авторы разобрали, на каких типах задач каждая модель допускала ошибки, а также подсчитали временные и финансовые затраты на решение экзамена. Полученные данные поднимают важный вопрос о будущем онлайн-экзаменов в условиях, когда искусственный интеллект способен успешно решать сложные математические задачи, что требует пересмотра подходов к контролю знаний.
Комментариев пока нет.