Как ИИ помогает беспилотным автомобилям распознавать редкие опасности на дорогах
Исследователи из General Motors Израиль представили фреймворки RAD и JointDiffuse, решающие проблему редких дорожных сценариев и нехватки синтетических данных для беспилотников.

Беспилотные автомобили сталкиваются с критической проблемой, известной как Long Tail — редкие и непредвиденные дорожные сценарии, с которыми модели искусственного интеллекта никогда не сталкивались во время обучения. Когда автономный транспорт неожиданно встречает на ночном шоссе брошенную детскую коляску или необычное препятствие, стандартные алгоритмы компьютерного зрения часто пасуют. Исследователи из израильского подразделения General Motors — Михаэль Балтекс, Одед Биалер и Дан Леви — предложили новый подход под названием Retrieval-Augmented Depth (RAD) для решения этой задачи.
Подход Retrieval-Augmented Depth (RAD)
Оценка глубины по одному изображению без специализированных датчиков или LiDAR остается серьезным препятствием в компьютерном зрение. Хотя модели хорошо справляются со знакомыми объектами, они испытывают трудности с редкими предметами. Опубликованный в материалах CVPR Findings фреймворк RAD позволяет нейросети во время выполнения программы искать аналогичные семантические примеры в существующей базе данных и использовать их в качестве дополнительных геометрических подсказок с помощью механизма Matched Cross-Attention. Это напрямую перекликается с методами RAG (Retrieval-Augmented Generation), применяемыми в больших языковых моделях (LLM).
Тестирование на стандартных датасетах показало впечатляющие результаты. Для незнакомых объектов модель продемонстрировала относительное улучшение метрики AbsRel на 29,2% на наборе данных NYU Depth v2. На знаменитом датасете KITTI, используемом для систем автономного вождения, было зафиксировано улучшение на 13,3%, а на городском датасете Cityscapes — на 7,2%. Несмотря на то, что система требует больших вычислительных затрат и времени выполнения из-за процесса поиска, она эффективно помогает беспилотникам справляться с аномальными дорожными ситуациями.
Генерация синтетических данных с помощью JointDiffuse
Помимо оценки глубины, автономным автомобилям необходимо точно распознавать объекты на дороге: машины, пешеходов, велосипедистов и дорожные знаки. Обучение таких детекторов требует огромных объемов размеченных данных, однако создание качественных датасетов — процесс долгий и дорогой. Использование генеративных моделей диффузии позволяет создавать синтетические изображения, но для обучения детекторов критически важна точная разметка местоположения объектов.
Существующие методы либо ограничивают разнообразие сценариев заданными заранее рамками разметки, либо сначала генерируют картинку, а затем пытаются ее разметить, что часто приводит к ошибкам. Исследователи Рои Узиэль и Одед Биалер представили на конференции WACV 2026 метод JointDiffuse, обеспечивающий совместную генерацию изображений и соответствующих карт сегментации пиксель-в-пиксель. В этом процессе Stable Diffusion отвечает за визуальную составляющую, а вспомогательный механизм обрабатывает разметку.
Проведенные тесты на датасетах COCO и nuImages доказали, что добавление синтетических данных, созданных с помощью JointDiffuse, существенно повышает точность детекторов объектов. Объединение методов контекстного поиска вроде RAD с передовыми генеративными технологиями открывает путь к созданию полностью безопасных и независимых систем автономного вождения.





