Модели ИИ против выпускников юрфаков: кто лучше сдал экзамен Коллегии адвокатов?

Израильский стартап Lizzy AI протестировал популярные модели искусственного интеллекта на экзамене Коллегии адвокатов. Результаты показали, что ИИ-инструменты способны превзойти даже лучших студентов-юристов.

Источник:Geektime
+
TECH // QUANTUM NETWORK

Подготовка к квалификационному экзамену Коллегии адвокатов — серьезное испытание для любого израильского студента-юриста. Но что произойдет, если в этот процесс вовлечь модели искусственного интеллекта? Израильский стартап решил выяснить, какие из популярных моделей смогут сдать этот сложный тест и как их результаты соотносятся с успехами студентов.

Кто победил?

В рамках масштабного исследования, проведенного израильским стартапом Lizzy AI, специализирующимся на стыке ИИ и юриспруденции, были протестированы три популярные модели — ChatGPT, Gemini и Claude. Помимо них, проверку прошли три специализированных ИИ-инструмента для юридической сферы: LawMate, Takdin AI и Nevo AI. Модели должны были ответить на все вопросы с множественным выбором, составляющие 80% итоговой оценки.

Результаты оказались впечатляющими: ИИ-инструменты смогли обойти даже выпускников ведущих юридических факультетов страны.

Лидером рейтинга стал ChatGPT с показателем 94,1% успеха. Сразу за ним следуют израильские инструменты LawMate (93,1%) и Nevo AI (92,2%). На четвертом месте оказались студенты Еврейского университета (91,82%). Пятую строчку занял Takdin AI (85,9%), опередив выпускников Тель-Авивского университета (85,71%). Далее следуют Gemini (84,4%), студенты Хайфского университета (82,61%), университета Бар-Илан (81,38%), Колледжа управления (81,37%) и, замыкает список, Claude (77,5%).

Передовые версии и ограничения

Тестирование, проведенное в марте и апреле, опиралось на самые современные версии моделей: ChatGPT (GPT-5.4 с режимом Extended Thinking), Gemini (3.1 Pro) и Claude (Opus 4.6 в режиме расширенного мышления).

Несмотря на высокие баллы, путь к полноценному внедрению ИИ в юридическую практику еще долог. Майя Амир, продакт-менеджер Lizzy AI, отмечает, что правильного ответа недостаточно для профессиональной работы: «ChatGPT предоставляет ссылки на источники по запросу, но не проводит их контроль качества». По ее словам, модель может ссылаться на блоги или частные публикации, которые не являются авторитетными в юридической среде, в отличие от судебных решений или законодательных актов. Кроме того, отсутствие точных указаний на контекст источника делает проверку ответов трудоемкой.

Стартап Lizzy AI, основанный Арноном Каталаном и Нецером Шломаи, разрабатывает платформу для анализа и составления юридических документов. Продуктом пользуются более 8000 адвокатов и организаций в Израиле, и компания стремится стать локальным ответом американскому гиганту Harvey, чья оценка достигла 11 миллиардов долларов.

Читайте также