Компания Nvidia представила новую генеративную модель искусственного интеллекта (genAI) под названием Cosmos Reason, которая наделяет роботов способностью принимать решения путем анализа окружающей среды практически на уровне человеческого разума.
Что уникального в модели Cosmos Reason?
Данная модель является представителем класса Vision Language Models (VLMs) — моделей машинного обучения, которые одновременно работают с визуальной информацией и языком. В отличие от традиционных алгоритмов ИИ, которые ограничены обработкой либо текста, либо изображений, VLMs способны анализировать видеоданные и извлекать из них смысловую информацию, позволяющую роботу строить логически обоснованные выводы и принимать адекватные ситуации решения.
По словам Преподобного Лебаредяна, вице-президента компании Nvidia по платформе Omniverse и моделированию технологий, главная цель разработчиков заключалась именно в создании инструмента, способствующего разумному поведению роботов в различных сценариях, близких к человеческому восприятию мира.
«Мы хотели создать такую систему, которая бы помогала роботам думать подобно людям и могла бы принимать решения, основанные на простом здравом смысле», — подчеркнул Лебаредян.
При этом новый алгоритм отличается относительно компактностью: он имеет всего около 7 млрд параметров, что позволяет запускать его на сравнительно небольших устройствах, будь то камеры видеонаблюдения, умные датчики или промышленные установки.
Примеры практического применения новой технологии
Возможности Cosmos Reason включают:
- автоматическое наблюдение за дорожным движением и городскими объектами;
- контроль производственных процессов и логистических центров;
- анализ видеопотоков в режиме реального времени.
Преимущество модели заключается в способности самостоятельно формировать стратегии поведения в новых и незнакомых ситуациях. Например, увидев тост и ингредиенты для завтрака, робот способен сделать вывод, какие предметы необходимы для полноценного процесса приготовления пищи: тостер, сливочное масло и тарелку для подачи блюда.
Таким образом, новинка открывает возможность внедрения данной технологии в широкий спектр устройств Интернета вещей (IoT).
Как устроено принятие решений в Cosmos Reason?
Разработчики выделяют две ключевые составляющие, объединяемые моделью:
- Language Understanding: эта компонента отвечает за обработку инструкций и формирование планов действий.
- Visual Processing: обеспечивает реакцию робота на внешние события и объекты, что аналогично человеческой мышечной памяти.
Однако ключевое преимущество модели состоит в её способности углубляться в детали наблюдаемой сцены и устанавливать взаимосвязи между элементами окружения. Она способна оценить физические взаимодействия предметов и учесть мотивы субъектов сцены, выстраивая таким образом обоснованную стратегию дальнейших действий.
Доступность и требования оборудования
Исходный код модели доступен бесплатно на площадке GitHub, однако её работа возможна исключительно на аппаратных платформах производства Nvidia. Для эффективного функционирования разработчики предлагают использовать компьютеры семейства Jetson Thor DGX и новейшие видеокарты серии RTX Pro 6000, 4000 и 2000 на архитектуре Blackwell.
Кроме того, новая технология станет частью экосистемы Omniverse — универсальной платформы для цифрового двойника реальных объектов, широко используемой разработчиками для создания высококачественных симуляций и подготовки синтетических данных, необходимых для тренировки ИИ.
Перспективы развития
Благодаря созданию ИИ-модели, обладающей подобным уровнем когнитивных способностей, человечество приближается к появлению следующего поколения роботов, способных уверенно функционировать в реальной среде обитания человека, справляться с нестандартными ситуациями и решать задачи гибко и осмысленно, опираясь не только на заранее заданные сценарии, но и на логику, опыт и понимание контекста происходящего вокруг.



