Команда Meta AI представила инновационную модель обработки изображений под названием Pixio, которая обучается исключительно на основе реконструкции пикселей. Эта модель показывает превосходство над более сложными методами, такими как DINOv2 и DINOv3, несмотря на меньшую сложность и меньшее количество параметров.
Традиционно модели ИИ обучаются заполнять скрытые области изображений, однако Pixio демонстрирует способность к более глубокому пониманию сцен. При работе с сильно замаскированными изображениями, модель не только восстанавливает текстуры, но и распознает симметрию, а также предсказывает отражения.
Pixio основана на обновлённой версии маскированного автокодировщика (MAE), в которой улучшены декодеры, увеличены замаскированные области и добавлены специальные токены для обучения. Исследователи собрали два миллиарда изображений для обучения, избегая оптимизации под конкретные наборы данных, что позволило модели лучше справляться с разнообразными задачами.
В результате, Pixio часто превосходит DINOv3, показывая более высокую точность в оценке глубины и 3D-реконструкции, а также в обучении роботов. Однако метод имеет свои ограничения, и команда предполагает, что следующим шагом станет использование видео для обучения модели.
