Alibaba Cloud представила свою новую мультимодальную модель Qwen3.5-Omni, способную обрабатывать текст, изображения, аудио и видео, генерируя текст и речь в реальном времени. Модель доступна в трех вариантах: Plus, Flash и Light, с возможностью использования Offline API и Realtime API. Главное отличие от предыдущей версии Qwen3-Omni заключается в увеличении контекстного окна с 32 до 256 тысяч токенов, что позволяет обрабатывать более 10 часов аудио или 400 секунд видео 720p за один запрос. Распознавание речи теперь поддерживает 113 языков и диалектов, а синтез — 36. Версия Plus показала выдающиеся результаты в тестах, обойдя конкурентов в распознавании и переводе речи. Среди новых функций — семантическое прерывание, клонирование голоса и встроенные возможности для веб-поиска. Уникальная способность Audio-Visual Vibe Coding позволяет модели писать код, наблюдая за видео с аудиоинструкциями, без текстового промпта. Эта способность возникла как неожиданное свойство модели.
