[Костыль, протез или имплант?] Нейросеть сдала профильную математику ЕГЭ на 98 баллов за 1 рубль 60 копеек

отметили
3
человека
[Костыль, протез или имплант?] Нейросеть сдала профильную математику ЕГЭ на 98 баллов за 1 рубль 60 копеек

17 июля глава Рособрнадзора Анзор Музаев рассказал, что на ЕГЭ этого года впервые поймали массовое использование нейросети: фирма продавала выпускникам микронаушники вместе с приложением, работы аннулировали. Я решил проверить, что именно покупали эти выпускники. Взял открытый вариант профильной математики ФИПИ 2026 года, аналог досрочного экзамена, и дал его 9 нейросетям через наш шлюз, от самой дорогой до самой дешевой в каталоге.

5 из 9 набрали 100 баллов. Самая дешевая из сдавших, DeepSeek V4 Flash, получила 98 баллов, и весь экзамен обошелся в 1 рубль 60 копеек. Самая дорогая, Claude Fable 5.1, тоже набрала 100, потратила 177 рублей и при этом единственная из сильных ошиблась в задаче на подстановку в формулу. На весь экзамен, где школьнику дают 3 часа 55 минут, быстрым моделям хватило 4 минут.

Если у вас дома выпускник или вы учитель, дальше про то, где нейросети все же споткнулись и что говорят свежие исследования о детях, решающих с ними домашку.

Экзамен без поблажек

Ключ ответов я составил сам, решив вариант, а потом сверил с ответами моделей: по всем 19 заданиям минимум 5 моделей сошлись с моим ключом, расхождения были только у ошибавшихся. Первую часть проверял автоматически по числу. Вторую часть засчитывал по совпадению финального ответа с ключом. Оформление решений я не оценивал, хотя на настоящем экзамене за него снимают баллы, так что баллы второй части — верхняя граница. Первичные баллы переводил в тестовые по шкале 2026 года, где 32 первичных дают 100 тестовых, а 12 первичных за всю первую часть дают 70.

Модели: Claude Fable 5.1, GPT-6 Astra, GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.8 Flash, GLM-5.3, Qwen3.8 27B, DeepSeek V4 Flash и Qwen3.7 Flash. Цены по прайсу ZvenoAI: от 9 рублей за 1000 выходных токенов у Fable до 2,5 копейки у Qwen3.7 Flash, разница в 360 раз.

5 моделей на 100, дешевая на 98

GPT-6 Astra, GPT-5.6 Sol, Claude Sonnet 5 и Gemini 3.8 Flash решили все 19 заданий: 32 первичных балла из 32. Fable 5.1 потеряла один первичный балл на задаче про температуру звезды, но 31 первичный — это все равно 100 тестовых. DeepSeek V4 Flash набрала 28 первичных, это 98 тестовых, у Qwen3.7 Flash 27 первичных и 97 тестовых, у Qwen3.8 27B 24 и 94. Хуже всех GLM-5.3: 15 первичных, 76 тестовых. Для сравнения: в 2025 году, по данным Рособрнадзора, стобалльников по профильной математике было 307 человек на всю страну.

Деньги за весь экзамен: у DeepSeek 1 рубль 60 копеек, у Qwen3.7 Flash 3 рубля 20 копеек, у Gemini 3.8 Flash и GPT-5.6 Sol по 28 рублей, у Qwen3.8 27B 49 рублей, у GLM-5.3 67, у GPT-6 Astra 102, у Claude Sonnet 5 142, у Claude Fable 5.1 177 рублей. Между 98 баллами за 1,6 рубля и 100 баллами за 177 рублей цена отличается в 110 раз, результат на 2 балла.

Время тоже расслоилось. Fable, Astra и Gemini уложились в 4–5 минут на все 19 заданий, Sol в 5,5. Sonnet думала 14 минут, DeepSeek 17, Qwen3.7 Flash 32 минуты, из них 8 минут на одну задачу по теории чисел, Qwen3.8 27B 47 минут, из них 14 минут на задачу про два вектора. Все это быстрее школьника, но за дешевизну модели платят временем: они рассуждают длинно, и на 8 заданиях у 4 моделей рассуждение не уложилось в отведенные мной 20 тысяч токенов ответа. Это примерно 30 страниц черновика на одну задачу.

Где споткнулись: график, формула и зрение

Сразу 4 модели посыпались только на 8-м задании: по графику производной посчитать точки максимума функции на отрезке. Правильный ответ — 1. Qwen3.7 Flash насчитала 2. DeepSeek и Qwen3.8 27B рассуждали, пока не кончился бюджет на ответ, и ответа не дали вовсе. GLM-5.3 не приняла картинку: через шлюз у этой модели нет версии со зрением, и все 3 задания с рисунками она потеряла, не начав. В итоге у GLM 76 баллов, причем математика тут ни при чем: из 17 потерянных первичных баллов 3 приходятся на картинки, а 14 потеряны в 4 заданиях второй части, где модель не уложилась в лимит рассуждений.

Ошибка Fable другого рода. В 9-м задании даны мощность излучения звезды, площадь ее поверхности и постоянная Стефана–Больцмана, нужно найти температуру, извлекая корень четвертой степени. Fable ответила 2000 кельвинов вместо 8000, остальные 8 моделей не ошиблись. Самая дорогая модель в наборе споткнулась на арифметике, параметр и геометрию она решила без ошибок.

Ошибка Fable другого рода. В 9-м задании даны мощность излучения звезды, площадь ее поверхности и постоянная Стефана–Больцмана, нужно найти температуру, извлекая корень четвертой степени. Fable ответила 2000 кельвинов вместо 8000, остальные 8 моделей не ошиблись. Самая дорогая модель в наборе споткнулась на арифметике, параметр и геометрию она решила без ошибок.

DeepSeek потеряла 3 балла на планиметрии: в 17-м задании длина отрезка по ключу — 4√109/5, а модель вывела √109/2. Qwen3.7 Flash потеряла 4 балла на 19-м, задаче про суммы цифр. Доказательство шло правильно, но на пункте в) кончился бюджет на ответ.

Тут вы справедливо скажете: дайте моделям больше токенов, и они дорешают. Да, но школьнику тоже дают ровно 235 минут, и я решил не двигать границу задним числом: у каждой модели был одинаковый потолок на каждое задание.

Домашка лучше на 18%, контрольные хуже на 20%

То, к чему выпускник готовится год, нейросеть сдает на 98 баллов за 1,6 рубля. Экзамен под камерами еще как-то защищен, домашние задания — нет: дома нейросеть под рукой у каждого. По данным лаборатории медиакоммуникаций ВШЭ, опубликованным в августе, нейросетями пользуются почти 70% учеников 6–7 классов и 90% старшеклассников; 40% загружают в них задания по русскому и математике. Опрос Дневник.ру среди 19 тысяч школьников и родителей, июль 2026: 36% получают от нейросети готовый результат, 23% не проверяют ответ.

Что при этом происходит со знаниями, в этом году измерили на большой выборке. Экономисты Стремберг, Лей и Ву наблюдали за 26 811 китайскими школьниками с 7-го по 12-й класс в течение 30 месяцев. Оценки за домашку у пользователей нейросетей выросли на 18%, время на нее сократилось на 30%, а результаты месячных контрольных за полгода упали на 20%. На вступительных экзаменах разрыв дошел до 18–24%, и полный эффект проявился примерно через 2 года. Около 80% пользователей, по их классификации, просто перекладывали домашку на нейросеть.

Рандомизированный эксперимент в турецких школах, PNAS, июнь 2025, показал, откуда берется разница. В нем 1000 старшеклассников поделили на группы. Те, кто готовился с обычным ChatGPT, на тренировке решали на 48% лучше, а на контрольной без нейросети — на 17% хуже тех, кто готовился без него.

Те, кому дали версию, настроенную давать подсказки вместо ответов, на тренировке решали на 127% лучше и на контрольной ничего не потеряли. Инструмент один и тот же: разница в том, отдает он ответ или заставляет дойти самому.

У профессора Брауновского университета Роберто Серрано этой весной средний балл за домашний экзамен вышел 96% при обычных 65–80%: 40 работ из 86 были идеальными. На очном финале средний балл оказался 48,6%, чего не случалось ни разу за его карьеру. Экономист Максим Миронов, профессор IE Business School, 13 сентября написал в X то же о своих студентах: «если раньше медианный студент в моем классе решал правильно порядка 60 процентов задач, то в последние пару лет этот показатель упал ниже 50%. При этом уровень сложности моих экзаменов оставался на примерно том же уровне».

Есть и данные в другую сторону. В эксперименте Контрактора и Рейеса, июль 2026, студенты, писавшие эссе с нейросетью, потом сдали тест без нее лучше контрольной группы, и выигрывали те, кто просил объяснение вместо готового текста. Это сходится с турецким результатом: вредит режим готового ответа, сама нейросеть тут инструмент.

Родителю выпускника: проверка на бумаге, режим важнее модели

Проверять домашку как показатель знаний больше нельзя: любая нейросеть за копейки решает ее на 100 баллов, и ребенок это знает лучше вас.

Единственная проверка, которая работает и в Китае, и в США, — очная: лист бумаги, ручка, без телефона, хотя бы раз в неделю по одной задаче из каждой темы.

Если ребенок готовится с нейросетью, режим важнее модели. В турецком эксперименте одна и та же нейросеть либо роняла результат контрольной на 17%, либо не вредила вовсе, и разница была в инструкции: «давай подсказки вместо решения». Впишите эту фразу первым сообщением в любой чат. Судя по моим 9 моделям, выбирать дорогую ради математики смысла нет: 98 баллов за 1,6 рубля и 100 за 177 рублей — это одна и та же пятерка.

Если вы учитель или репетитор и уже видели, как нейросети меняют работы учеников, напишите в комментариях, что изменили в проверке: соберу опыт для следующего разбора.

Все 9 моделей проходили экзамен через ZvenoAI, наш шлюз: 350 моделей, один ключ, оплата в рублях. Цены в статье по его прайсу; вся серия из 171 запроса обошлась в 598 рублей. Вариант: открытый, ФИПИ, ЕГЭ-2026, профильная математика. Исследования: Strömberg, Lei, Wu, CEPR DP21577; Bastani et al., PNAS 2025; Inside Higher Ed о Брауновском университете, 08.07.2026; ВШЭ и Дневник.ру, июль–август 2026; Интерфакс о заявлении Рособрнадзора, 17.07.2026. Условия, ключ, ответы всех моделей и скрипты пришлю по запросу в комментариях.

[https://dzen.ru/a/aqiGB8fnCWENMgkj]

Добавил suare suare 1 час 8 минут назад
Комментарии участников:
suare
0
suare, 14 минут назад , url

[Костыль, протез или имплант?]

Есть и четвертый вариант между Человеком Разумным и Думающим Роботом: киборг(кибернетический организм).

В каких пропорциях в нем будут сочетаться «киб» и «орг» — это вопрос времени постепенной замены частей человеческого тела в человеческом организме имплантами различного типа.

 Когда-то начали с зубов, глаз ушей и конечностей.

Теперь работа поставлена на поток по всему телу: протезирование, пересадка и замена на импланты.

Мозг — последняя линия обороны человека божественного и природного.

Возможно расширение, дополнение и перепрограммирование функций тела с помощью технологий, в том числе и ИМ 

suare
0
suare, 8 минут назад , url

ИМ

 ИИ (AI).



Войдите или станьте участником, чтобы комментировать