Ещё недавно запуск крупной нейросети с 26 миллиардами параметров требовал мощного дата-центра, сегодня же достаточно обычного ноутбука и одной консольной команды. Представляем Google Gemma 4 26B-A4B — модель с инновационной архитектурой mixture-of-experts (MoE), в которой задействованы 128 экспертов, но при обработке каждого токена активируются лишь 8 из них. Благодаря этому Gemma 4 может эффективно работать на 48 ГБ объединённой памяти, выдавая качество, сравнимое с гигантами вроде Qwen 3.5 с 397 миллиардами параметров.
Свежая версия LM Studio 0.4.0 значительно упростила локальный запуск таких моделей, предоставив фоновый демон llmster, консольную утилиту lms, поддержку параллельной обработки запросов и эндпойнт, совместимый с API Anthropic. Это позволяет направлять запросы Claude Code к локальной Gemma 4, получая быстрые и приватные ответы без интернета.
Gemma 4 26B-A4B — часть семейства моделей Google Gemma 4, где есть варианты для разных устройств и задач. Модль с MoE-архитектурой обеспечивает примерно 10 млрд эффективных параметров при низких требованиях к ресурсам, что делает её идеальной для домашнего использования на ноутбуках с Apple M4 Pro и 48 ГБ памяти. Скорость генерации достигает 51 токена в секунду, а поддержка контекста до 256K токенов и компьютерного зрения расширяет возможности анализа.
LM Studio 0.4.0 теперь работает как серверный демон с консольным управлением, что удобно для удалённых серверов и автоматизации. Утилита lms позволяет скачивать, запускать и управлять моделями, а параметр —estimate-only помогает рассчитать потребление памяти для различных размеров контекста. Благодаря TTL модели автоматически выгружаются после бездействия, освобождая ресурсы.
Особое внимание стоит уделить тому, что спекулятивное декодирование неэффективно для MoE-моделей, в то время как технология flash attention помогает оптимизировать использование памяти. Поддержка API Anthropic открывает путь к локальному использованию Claude Code, что актуально для приватной работы с кодом и документами.
Тесты на MacBook Pro M4 Pro показывают, что Gemma 4 использует около 18 ГБ памяти, при этом система активно задействует своп, но остаётся отзывчивой. Нагрузка на CPU и GPU высока, а температура в пределах нормы для длительной работы. Энергопотребление всего около 24 Вт — отличный показатель для такой производительной модели.
Таким образом, архитектура MoE и инструменты LM Studio делают запуск мощных нейросетей доступным на персональных устройствах, устраняя необходимость в дорогих серверах и открывая новые горизонты для разработчиков и исследователей.
