ИИ поступает в ШАД в 2026

Голосование за заголовок
📌 TL;DR · Кратко: Автор Лыков А. (к.ф.-м.н.) протестировал 5 ИИ на задачах 1-го этапа экзамена ШАД-2026. Claude Opus 4.8 и другие зарубежные модели прошли (39,5/40), GigaChat провалился (25,25). Gemini 3.1 Pro дисквали
📰
ИИ поступает в ШАД в 2026

Академический руководитель Школы Высшей Математики и ШАДХелпера, кандидат физико-математических наук А. Лыков представил результаты нового эксперимента, посвящённого возможностям современных нейросетей. На этот раз в фокусе внимания оказался первый этап вступительных испытаний в Школу анализа данных (ШАД) на 2026 год. Ранее автор уже демонстрировал, что искусственный интеллект успешно справляется со вторым этапом отбора, а теперь решил проверить, насколько хорошо алгоритмы решают задачи базового уровня.

В ходе тестирования были использованы все 40 заданий первого этапа, представленные в четырёх вариантах экзамена. Проверку проходили пять ведущих языковых моделей: Claude Opus 4.8, DeepSeek-R1-0528, ChatGPT Sol, Qwen3.7-Max и GigaChat-3-Ultra. Результаты показали значительный разброс в способностях алгоритмов. Лидером стала модель Claude Opus 4.8, набравшая 39,5 балла из 40 возможных. Чуть менее впечатляющие, но всё же высокие результаты продемонстрировали DeepSeek-R1-0528 (38,25 балла) и ChatGPT Sol (37,75 балла). Qwen3.7-Max остановилась на отметке 32,5 балла.

С учётом того, что проходной порог для первого этапа составляет около 30 баллов, все зарубежные модели успешно преодолели бы отбор. Исключением стал отечественный GigaChat-3-Ultra, который завершил тест с результатом 25,25 балла, не дотянув до необходимого минимума. Примечательным оказался и инцидент с моделью Gemini 3.1 Pro, которую пришлось дисквалифицировать. Как поясняет автор, причиной стала не ошибка нейросети, а недоработка в самой методике тестирования, что не позволяет считать этот случай честным провалом.

Помимо итоговых баллов, исследование также затронуло вопросы практического применения ИИ в образовательном процессе. Авторы разобрали, на каких типах задач каждая модель допускала ошибки, а также подсчитали временные и финансовые затраты на решение экзамена. Полученные данные поднимают важный вопрос о будущем онлайн-экзаменов в условиях, когда искусственный интеллект способен успешно решать сложные математические задачи, что требует пересмотра подходов к контролю знаний.

Источник: Технологии (авто) (первоисточник)

Войдите, чтобы ставить реакции (+2 балла) и комментировать (+3).

Комментарии (0)

Войдите, чтобы оставить комментарий (+3 балла).

Комментариев пока нет.