Когда все студенты получили 100 на экзаменах, в университете поняли, что есть проблема
Новая разработка в Университете Бар-Илан ставит перед студентами факультета компьютерных наук экзаменатора на базе ИИ: вместо борьбы с использованием искусственного интеллекта система задает им вопросы по представленному коду, чтобы убедиться, что они действительно понимают материал. Студенты поначалу сопротивлялись, но сообщают, что метод улучшил их знания, и теперь планируется расширение проекта на дополнительные курсы по математике.

В последние два года преподавательский состав факультета компьютерных наук и искусственного интеллекта в Университете Бар-Илан заметил явление, повторяющееся почти в каждом академическом учреждении: почти все студенты идеально проходили автоматические проверки заданий по программированию, получая высокие оценки. Однако это не обязательно свидетельствовало о том, что они понимали суть сданной работы.
«Это система, которую мы внедрили в курсе по операционным системам в последнем семестре. До сегодняшнего дня мы проверяли эти задания автоматически, вводя десятки тысяч сценариев и ожидая конкретный результат. «Удивительно», но в последние два года все получали 100. Мы поняли, что проверяем не способность студента к пониманию, а лишь его доступ к искусственному интеллекту. Это заставило нас разработать новую систему», — рассказывает профессор Давид Сарна, преподаватель факультета компьютерных наук и искусственного интеллекта в Университете Бар-Илан.
Сарне важно подчеркнуть, что он и его команда не пытаются помешать студентам использовать ИИ. Напротив, они признают, что это навыки, необходимые сегодня, но стремятся убедиться, что студенты используют технологии разумно и действительно понимают то, что сдают.
Разработанная ими система искусственного интеллекта, уже прошедшая пилотный режим на курсах компьютерных наук, является, насколько известно, первой в своем роде в Израиле и одной из первых в мире. Она анализирует ответы студентов и позволяет оценить уровень их понимания глубоко, а не только по правильности конечного результата.
Как это работает?
После сдачи задания по программированию студент назначает короткий экзамен и приходит в специальную комнату на факультете. Он садится перед заблокированной станцией, которая не позволяет переходить к другим программам или окнам, и система автоматически подтягивает сданный код.
После подтверждения авторства экран разделяется: с одной стороны появляется код, а с другой ведется беседа с экзаменатором на базе ИИ. В ходе экзамена, который длится около 16 минут, система обычно задает три вопроса, каждый раз выделяя соответствующие строки в коде.
«Система, по сути, вовлекает студента в беседу, задавая вопросы по заданию, чтобы оценить уровень владения кодом, понимание его потока и способность вносить изменения, — объясняет Сарна. — Цель в эпоху ИИ — оценить, насколько студент действительно понимает то, что делает, а не просто полагается на технологии».
Вопросы не готовятся заранее. Преподаватель определяет темы, ожидаемый уровень знаний и акценты для проверки, а система создает десятки возможных шаблонов: например, о выборе планирования, граничных случаях или ошибках в коде. Шаблон становится персонализированным вопросом только в момент взаимодействия с кодом конкретного студента.
Оценка также основана на работе нескольких агентов ИИ: один проверяет код, не видя экзамена, другой анализирует беседу, не видя кода, а третий взвешивает результаты. Четверть оценки основана на качестве кода, а три четверти — на степени понимания, продемонстрированной студентом. В конце он получает электронное письмо с оценкой, подробным разбором ответов и темами для повторения.
Разработка велась при участии Шахара Саги, преподавателя курса операционных систем, и доктора Йоси Бен-Циона, эксперта по технологиям обучения. Система была создана в течение трех недель с помощью Claude Code.
Реакция студентов
Около 260 студентов уже сдали экзамен с помощью системы. Многие поначалу сопротивлялись изменениям. Двир, один из студентов, использовавших систему в течение семестра, признается, что пришел на первый экзамен в стрессе, но совместная подготовка с друзьями заставила их просмотреть код вглубь. «В ретроспективе, сама эта подготовка заставила нас понять материал гораздо лучше», — говорит он.
По его словам, экзамен ощущался скорее как объяснение материала другу, а система постоянно совершенствовалась в оценке ответов. «В конечном счете, это помогло мне связать задания с темами, изученным на курсе», — добавляет он.
Студент, не преуспевший на экзамене, может назначить дополнительную дату, при этом в каждой попытке появляются другие вопросы. «Если не пошло хорошо, можно назначить еще один экзамен, и, с моей точки зрения, делать это можно сколько угодно. Как только я вижу, что студент понимает материал на уровне оценки, которую я ему поставил, мне уже не важно, что все получат 100, потому что я знаю, что за оценкой стоят реальные знания», — заключает Сарна.
К следующему учебному году в Бар-Илане планируют расширить использование системы на курсы по математике, включая линейную алгебру, и команда Сарны уже ведет переговоры с различными академическими структурами.





