ИИ может сдать «Последний экзамен человечества» в течение года

Тест HLE, разработанный более чем 1000 экспертов, включает 2500 вопросов уровня докторской диссертации из 100 различных областей знаний. Несмотря на сложность, темпы прогресса моделей искусственного интеллекта позволяют экспертам прогнозировать прохождение этого испытания в ближайший год.

Источник
ИИ может сдать «Последний экзамен человечества» в течение года
Фото: Mako / ChatGPT, ג'מיני, קלוד, קופיילוט | צילום: jackpress, shutterstock

Искусственный интеллект (ИИ) уже сократил разрыв с человеком во многих областях — от шахмат до распознавания образов. Теперь эксперты утверждают, что всего через год модели смогут успешно пройти «Последний экзамен человечества» (HLE) — тест, который изначально считался нерешаемым для машин и был составлен ведущими мировыми исследователями.

«Разработчики проделали огромную работу по улучшению моделей рассуждения», — заявил Кельвин Чжан, руководитель отдела исследований в компании Scale, стоящей за созданием HLE, в интервью газете «Таймс». Этот показатель, призванный оценить близость ИИ к границам человеческой экспертизы, включает 2500 вопросов из более чем 100 дисциплин: от мифологии до ракетостроения.

Более 1000 авторитетных ученых, гуманитариев и деятелей искусства внесли свой вклад в HLE. Как сообщает журнал Neuroscience News, тест спроектирован так, чтобы для успеха требовался уровень знаний докторской степени, выходящий за рамки возможностей ИИ. Чжан отметил, что целью было создание закрытого академического бенчмарка, который под силу лишь немногим людям на планете.

Тем не менее, показатели ИИ в HLE растут экспоненциально. Если в 2024 году ChatGPT при первой попытке правильно ответил менее чем на 3% вопросов, то модель Gemini от Google за несколько месяцев достигла показателя 18,8%, а в прошлом месяце результат превысил 45%.

Чжан полагает, что в течение года ИИ приблизится к идеальному результату. Любой, кто наберет балл, близкий к 100%, будет считаться универсальным экспертом. «Если бы мы сделали это единственной приоритетной задачей, думаю, мы могли бы достичь такого уровня довольно быстро», — отметила Кейт Ольшевска, менеджер по продукту в Google DeepMind.

Столь быстрый прогресс впечатляет, учитывая усилия Scale по защите HLE от ИИ. Создатели теста предложили приз в 500 000 долларов экспертам, которые предложат вопросы, не поддающиеся простому поиску в сети, что принесло более 70 000 откликов.

Все вопросы, на которые существующие модели могли ответить легко, были исключены, пока тест не сократился до 2500 наиболее защищенных от ИИ заданий. Например, от экзаменуемого могут потребовать перевести древние надписи или идентифицировать микроанатомические структуры у птиц.

Чтобы гарантировать защиту от ИИ, команда сохранила большинство ответов в тайне, предотвращая их «зазубривание» будущими моделями. «Последний экзамен человечества — одна из самых четких оценок разрыва между ИИ и человеческим разумом», — заявил доктор Тунг Нгуен, профессор компьютерных наук и инженерии в Университете Техаса A&M, предоставивший 73 вопроса для теста.

Он подчеркнул, что, несмотря на успехи некоторых моделей, низкие баллы других подтверждают сохраняющуюся пропасть. «Когда системы ИИ показывают хорошие результаты, возникает соблазн думать, что они приближаются к человеческому уровню понимания, — сказал Нгуен. — Но HLE напоминает нам: интеллект — это не только распознавание образов, но и глубина, контекст и специфическая экспертиза».

Технологический эксперт добавил, что цель проекта — не провалить ИИ, а выявить сильные и слабые стороны систем. Это поможет создавать более надежные технологии и подчеркнет ценность человеческой экспертизы в мире, где ИИ внедряется во все сферы — от фастфуда до медицины.

При этом ИИ демонстрирует удивительный, почти человеческий талант к решению задач, доказывая, что его вычислительные мощности не ограничиваются простой памятью. В 2025 году исследования китайских ученых выявили сходство между восприятием моделей ИИ и человеческими когнитивными процессами, особенно в группировке языков. Это позволило исследователям сделать вывод, что модели развивают концептуальные представления объектов, подобные человеческим.

Читайте также