Тест на предел возможностей ИИ: эксперты прогнозируют прорыв в течение года
Тест HLE, разработанный более чем 1000 экспертов и известный как «последний экзамен человечества», включает 2500 вопросов докторского уровня из 100 дисциплин. Несмотря на сложность, темпы прогресса нейросетей удивляют даже создателей теста, и прогнозы по их успеху стремительно растут.

Искусственный интеллект уже сократил разрыв с человеком во многих областях — от шахмат до распознавания образов. Теперь эксперты утверждают, что до преодоления «Последнего экзамена человечества» (HLE) — теста, который изначально считался нерешаемым для ИИ и был составлен ведущими мировыми учеными, — остался всего один год.
«Разработчики моделей проделали колоссальную работу по улучшению навыков рассуждения», — заявил в интервью лондонской Times Кельвин Чжан, руководитель отдела исследований в компании Scale, стоящей за созданием HLE. Этот бенчмарк, призванный проверить близость ИИ к границам человеческой экспертизы, состоит из 2500 вопросов, охватывающих более 100 дисциплин: от мифологии до ракетостроения.
Более 1000 авторитетов в области наук, гуманитарных дисциплин и искусств внесли свой вклад в HLE. Как сообщает журнал Neuroscience News, тест был спроектирован так, чтобы для успеха требовался уровень знаний, соответствующий докторской степени, что на момент создания находилось за пределами возможностей ИИ. Чжан отметил, что конечной целью было создание закрытого академического показателя, доступного лишь горстке людей на планете.
Тем не менее, показатели ИИ в HLE растут с экспоненциальной скоростью. Если в 2024 году при первой попытке ChatGPT правильно ответил менее чем на 3% вопросов, то модель Gemini от Google за несколько месяцев достигла показателя в 18,8%, а в прошлом месяце результат превысил 45%.
Чжан полагает, что в течение года ИИ приблизится к идеальному результату, при этом любой, кто наберет близкий к 100% балл, будет считаться универсальным экспертом. «Если бы мы действительно сфокусировались на этом как на единственной задаче, я думаю, мы могли бы достичь цели довольно быстро», — отметила Кейт Ольшевска, менеджер по продукту в Google DeepMind.
Этот прогресс особенно впечатляет, учитывая усилия Scale по защите HLE от ИИ. Создатели теста предложили вознаграждение в размере 500 000 долларов экспертам за вопросы, на которые нельзя легко ответить с помощью поиска в сети, что привело к получению более 70 000 откликов.
Любой вопрос, на который могли ответить существующие модели, был дисквалифицирован, пока тест не сократили до 2500 наиболее сложных заданий. Например, от испытуемых может потребоваться перевод древних надписей или идентификация микроанатомических структур у птиц.
Чтобы гарантировать защиту от ИИ, команда сохранила большинство ответов в тайне, исключая возможность «зазубривания». «Последний экзамен человечества — одна из самых четких оценок разрыва между ИИ и человеческим разумом», — заявил доктор Тунг Нгуен, профессор компьютерных наук и инженерии в Университете Техаса A&M, который предоставил 73 вопроса.
Он подчеркнул, что, несмотря на успехи некоторых моделей, низкие баллы других доказывают сохраняющуюся пропасть. «Когда системы ИИ показывают хорошие результаты, возникает соблазн подумать, что они приближаются к пониманию на человеческом уровне, — сказал Нгуен. — Но HLE напоминает нам: интеллект — это не только распознавание образов, но и глубина, контекст и специфическая экспертиза».
Технологический эксперт добавил, что конечная цель заключалась не в провале ИИ, а в демонстрации сильных и слабых сторон систем. Это поможет создавать более безопасные технологии и одновременно подчеркнуть важность человеческой экспертизы в мире, где ИИ внедряется повсеместно — от сферы быстрого питания до медицины.
Тем не менее, ИИ демонстрирует удивительный талант к решению задач, доказывая, что его вычислительные мощности не ограничены простой памятью. В 2025 году исследования китайских ученых выявили сходство между восприятием моделей ИИ и человеческими когнитивными процессами, особенно в вопросах группировки языков. Исследователи сделали вывод, что модели развивают концептуальные представления объектов, подобные человеческим.





