Джим Фан, занимающий пост директора по робототехнике в компании NVIDIA, поделился своим видением изменений в области искусственного интеллекта. Он отметил, что будущее технологий не должно сосредотачиваться на предсказании следующего слова, что является устаревшим подходом. Вместо этого ключевым станет прогнозирование физических состояний в окружающем мире. Сегодняшние VLA-модели, используемые для создания роботов, зависят от языковых моделей, однако их параметры чаще всего хранят лишь текстовые знания, а не физические взаимодействия, такие как «при наклоне бутылки, жидкость вылется». Это приводит к застою в архитектуре. Фан приводит пример: даже приматы, управляющие гольф-картами, понимают язык хуже языковых моделей, таких как BERT, однако их треть коры мозга отвечает за зрение, что напрямую связано с сенсомotorикой. В этом году, вероятно, ключевым направлением станет разработка «моделей мира», которые способны предсказывать состояния в зависимости от действий, основываясь на визуальном восприятии, а не текстовых переводах. Фан открыто заявляет о возможных ошибках в направлении исследований, подавая сигнал о необходимости пересмотра подходов.
