Компания Alibaba представила две новые мультимодальные модели: Qwen3-VL-2B и Qwen3-VL-32B. Вторая модель уже привлекла внимание исследователей благодаря своим впечатляющим результатам, сопоставимым с такими системами, как GPT-5 mini и Claude 4 Sonnet, особенно в областях STEM, визуального вопросно-ответного анализа (VQA), распознавания текста (OCR), анализа видео и сценариев для агентов.
Несмотря на то, что Qwen3-VL-32B имеет «всего» 32 миллиарда параметров, она успешно соперничает с более крупными системами, имеющими до 235 миллиардов параметров. На ряде бенчмарков, включая OSWorld, модель демонстрирует выдающиеся результаты. Это стало возможным благодаря новейшей архитектуре с «иерархическим вниманием», позволяющей эффективно комбинировать текст, изображения и видео в одном контексте.
По заявлению Alibaba, Qwen3-VL-32B способна последовательно анализировать кадры в видео, интерпретируя сюжет и причинно-следственные связи, а не просто описывая изображение. Это делает модель особенно актуальной для видеоаналитики, автономных агентов и образовательных приложений, требующих аналитического мышления.
Обе модели уже доступны для тестирования на Hugging Face и платформе Qwen Studio, где можно найти демо и API для интеграции в собственные проекты.
