Могут ли языковые модели проверять задания по программированию? Что измеряли исследования 2025-2026 годов
Аннотации последних полутора лет, прочитанные подряд, оставляют впечатление спора. У одной группы точность оценивания выходит «comparable to human graders» («сопоставимой с проверяющими-людьми»), а несколькими месяцами позже другая сообщает про «only moderate agreement with human teachers’ grades» («лишь умеренное согласие с оценками преподавателей-людей»). Где-то студенты быстрее доходят до работающего кода, где-то знаний у них от этого не прибавляется вовсе. Стоит разложить работы по тому, что каждая из них реально положила на весы, и почти всё противоречие рассыпается. Остаётся порядок, который стоит назвать вслух: чем ближе исследование подбирается к тому, что у студента останется назавтра, тем труднее в нём даётся положительный результат.
Здесь разобраны восемь работ, опубликованных в 2025 и 2026 годах, и отсортированы они по предмету измерения. Соседний обзор на этом сайте охватывает шесть десятилетий до них.
Совпадение с оценкой преподавателя
Первое, что вообще можно измерить в проверке: совпадает ли машинная оценка с преподавательской. Две работы взялись ровно за это и разошлись в выводах.
В Люблянском университете на курсе биоинформатики устроили слепое сравнение: каждый студент получал обратную связь сразу из двух источников: от языковой модели и от живого ассистента, не зная, где чья, и оценивал обе. Авторы заключают, что «with well-designed prompts, LLMs can achieve grading accuracy and feedback quality comparable to human graders» («при хорошо продуманных промптах языковые модели способны достичь точности оценивания и качества обратной связи, сопоставимых с проверяющими-людьми»), и добавляют: «open-source LLMs perform as well as commercial LLMs, allowing schools to implement their own grading systems while maintaining privacy» («модели с открытым исходным кодом работают не хуже коммерческих, что позволяет учебным заведениям разворачивать собственные системы проверки, сохраняя приватность») (Poličar, Špendl, Curk & Zupan, 2025).
Вторая работа крупнее и холоднее. Восемнадцать актуальных моделей от четырёх поставщиков прогнали по шести с лишним тысячам студенческих решений, собранных за четыре года вводного курса программирования, и получили: «All models displayed high internal agreement, measured by the intraclass correlation coefficient, with the model consensus but only moderate agreement with human teachers’ grades, indicating a persistent gap between automated and human assessment» («Все модели показали высокое внутреннее согласие с консенсусом моделей, измеренное по внутриклассовому коэффициенту корреляции, но лишь умеренное согласие с оценками преподавателей-людей, что указывает на устойчивый разрыв между автоматической и человеческой оценкой») (Jukiewicz, 2025).
Противоречат друг другу эти две работы меньше, чем кажется. В Любляне оценивали ответы в свободной форме на одном курсе, с промптами, подогнанными под него; во второй работе рассматривался программный код на большой выборке, множеством моделей и без всякой подгонки под конкретную дисциплину. Оба результата уживаются: аккуратно настроенная модель попадает в человека на вопросах одного курса, а модели вообще сходятся между собой теснее, чем с преподавателями.
Неудобно здесь именно второе. Если модели согласны друг с другом, а с людьми лишь умеренно, значит, у них есть собственный стандарт. Хуже он человеческого или нет, исследование не говорит, и я не скажу тоже. Сказать можно другое: согласованность проверяющих между собой перестаёт быть доводом в пользу того, что проверено верно.
Скорость и доля доведённых до конца работ
Дальше меряют судьбу самой работы: дойдёт ли студент до рабочего решения и за сколько подходов.
Рандомизированное внедрение на настоящем вводном курсе Python охватило 6693 сдачи от 215 студентов, давших согласие на участие, на семнадцати лабораторных, в трёх условиях: обратная связь на естественном языке, сгенерированные ИИ тесты, которые решение не проходит, и отсутствие ИИ-обратной связи. Результат: «natural language feedback is significantly associated with higher completion rates and faster convergence to correct solutions. Test case feedback, by contrast, exhibits heterogeneous effects that depend critically on feedback validity» («обратная связь на естественном языке значимо связана с более высокой долей доведённых до конца задач и более быстрым схождением к правильному решению. Обратная связь в виде тестовых случаев, напротив, даёт разнородные эффекты, критически зависящие от корректности самой обратной связи») (Heickal & Lan, 2026).
Оговорка во второй фразе заслуживает внимания не меньше, чем сама находка. Сгенерированные тесты выручают, когда они верные, и мешают, когда нет, так что средний эффект плохо описывает то, с чем столкнулся отдельно взятый студент.
Параллельная работа на онлайн-курсе программирования меняла количество наводок в обратной связи: от полных объяснений до сухого описания, что пошло не так, без единой подсказки. Нашли вот что: «LLM-generated feedback is associated with faster time to solution compared to the no-feedback baseline, with less guided feedback showing slightly stronger effects» («обратная связь, сгенерированная языковой моделью, связана с более быстрым выходом на решение по сравнению с базовым условием без обратной связи, причём менее направляющая обратная связь показывает несколько более сильный эффект») (Mihaylova et al., 2026).
То, что меньше наводок работает чуть лучше, контринтуитивно, и лёгкому объяснению тут поддаваться не стоит. Списать это на переписанный готовый ответ не выйдет: промпты в этой работе прямо запрещают показывать образцовое решение и намекать на него, а самое скупое условие и вовсе даёт меньше всего материала для копирования. Авторы объясняют иначе, через известный эффект: обильные подсказки помогают новичкам и начинают мешать тем, кто уже нащупал почву под ногами.
Что остаётся у студента после
Следующий уровень: собственно обучение, и здесь картина расходится по типу исследования.
В Мюнхенском техническом университете рандомизированное испытание провело 275 студентов вводного курса через 90-минутное упражнение по параллельному выполнению в трёх условиях: ИИ-репетитор со строгими рамками, свободный ChatGPT и контроль без ИИ. Результат самого упражнения и прирост знаний по предпост-тестам мерили раздельно. Оба ИИ-условия дали более высокий результат упражнения; прироста знаний не дало ни одно: «Despite these performance gains, neither AI condition produced greater pre–post knowledge gains or code-comprehension advantages… In this setting, generative AI acted primarily as a performance aid rather than a learning enhancer» («Несмотря на этот прирост результативности, ни одно из ИИ-условий не дало большего прироста знаний между замерами до и после и не улучшило понимание кода… В этих условиях генеративный ИИ выступил прежде всего как средство повышения результативности, а не как усилитель обучения») (Bassner et al., 2025). То же испытание зафиксировало меньше фрустрации и сниженную когнитивную нагрузку, отсюда и заголовок, обещающий меньше стресса при том же обучении.
Ещё одно рандомизированное исследование, 257 студентов вводного курса программирования, добавляло объяснения от языковой модели к собственным сообщениям компилятора, не подменяя их. Пока обратная связь была включена, она сокращала бесплодные попытки на трудных задачах. Потом её выключили: «Notably, this positive impact was also observed in challenging tasks. However, its benefits did not sustain once the feedback was removed» («Примечательно, что этот положительный эффект наблюдался и на трудных задачах. Однако его польза не сохранялась после того, как обратную связь убирали») (Zhou, Pankiewicz, Paquette & Baker, 2025).
На фоне этих двух наблюдательное исследование в пяти общественных колледжах (community colleges) тянет в обратную сторону. Оно открывается указанием на пробел: «empirical assessments of auto-grader feedback’s impact on learning outcomes, such as grades and pass rates, remain insufficient (Keuning et al., 2018)» («эмпирических оценок влияния обратной связи от автопроверки на результаты обучения, такие как оценки и доля успешной сдачи, по-прежнему недостаточно (Keuning et al., 2018)»), и заявляет, что этот пробел закрывает: сообщает о свидетельствах в пользу обратной связи от автопроверки и призывает применять её шире (Zhang, Burte, Savelka, Bogart & Sakr, 2025).
Честный итог поэтому у́же, чем «ИИ-обратная связь не учит». Там, где студентов распределяли случайно и мерили знания до и после, нашли рост результативности без соответствующего прироста знаний. Там, где наблюдали курсы, уже пользовавшиеся обратной связью от автопроверки, нашли связь противоположного знака. Наблюдательные данные не отделяют инструмент от тех, кто его выбрал, поэтому рандомизированные результаты и весят здесь больше; но это не повод делать вид, что наблюдательного исследования нет.
Согласен ли с оценкой тот, кого оценили
Есть ещё одно измерение, о котором системы проверки обычно не вспоминают.
Турецкая группа развернула инструмент проверки с апелляциями более чем на 850 экзаменационных работах, из которых 185 были оспорены. Запоминается в ней не цифра точности: «The appeal process led to grade changes in 74% of cases, indicating the need for continued refinement of AI evaluation strategies. While students appreciated the speed and detail of AI feedback, survey responses revealed trust and fairness concerns» («Процедура апелляции привела к изменению оценки в 74% случаев, что указывает на необходимость дальнейшей доработки стратегий ИИ-оценивания. Хотя студенты высоко оценили скорость и подробность ИИ-обратной связи, ответы на опрос выявили опасения по поводу доверия и справедливости») (Aytutuldu, Yol & Akgul, 2025).
Три четверти оспоренных оценок изменились. Это не три четверти всех оценок: апеллируют выборочно, обычно когда считают, что есть основания, и 185 апелляций на 850 с лишним работ составляют примерно каждую шестую. Зато отсюда видно, что канал апелляции нёс настоящую нагрузку, и то же самое внедрение без него оставило бы эти оценки в силе.
Порядок на весах
Сведём восемь работ в один ряд по тому, что каждая клала на весы.
Сверка машинной оценки с преподавательской даёт разброс от сопоставимости на одном подогнанном курсе до умеренного согласия на восемнадцати моделях на большой выборке. На пропускной способности выигрыш устойчив. Под рандомизацией, когда мерили знания, он исчезает, хотя наблюдательное исследование сообщает обратное. А там, где спросили самих оценённых, апелляция переписала три четверти того, до чего дотянулась.
Плохим инструментом проверки языковые модели от этого не становятся. Быстрая обратная связь и больше доведённых до конца работ: приобретение настоящее, и кафедра, тонущая в сдачах, за него ухватится. Чего эти восемь работ не разрешают, так это следующего шага, который обычно и делают: считать быстро пришедшую и никем не оспоренную оценку доказательством того, что по дороге к ней студент чему-то научился.
Этот материал опирается на восемь исследований, опубликованных в 2025 и 2026 годах и собранных в рамках обзора автоматической проверки в пяти языковых зонах. Его составил Андрей Несюк, разрабатывающий AutoLabSuite, платформу для проверки лабораторных работ по программированию в университетских курсах.
Комментарии
Ответы от имени блога готовятся с помощью языковой модели и публикуются после правки и проверки человеком. Факты в ответах проверяем так же, как в статьях, со ссылкой на источник и дословной цитатой.
По нажатию кнопки виджет загрузится с GitHub. Правила комментариев