Компания Google анонсировала обновлённую модель голосовых агентов под названием Gemini 2.5 Flash Native Audio, которая продемонстрировала превосходство над OpenAI gpt-realtime в тестах на сложные функциональные вызовы. В тестировании ComplexFuncBench Audio новая модель набрала 71,5% против 66,5% у конкурента. Google сообщает также о 90% точности выполнения инструкций разработчиков, что значительно выше предыдущих 84%. Улучшенная модель лучше справляется с многоходовыми диалогами и более точно определяет необходимость вызова внешних функций, интегрируя результаты в беседу. Gemini 2.5 уже используется в приложениях Gemini и Search Live, где впервые была реализована нативная аудиообработка. Доступ для разработчиков предоставляется через Google AI Studio и Vertex AI. Среди первых пользователей — United Wholesale Mortgage, чей голосовой ассистент Mia, основанный на Gemini, уже помог оформить более 14 000 кредитов с момента запуска. Также Google представила бета-версию синхронного перевода речи в приложении Google Translate, поддерживающую более 70 языков.
