С каждым днем появляются все новые MoE модели, которые используют меньше активных параметров по сравнению с Dense моделями. Эти модели требуют меньше VRAM, что позволяет запускать их на одном GPU с большим объемом RAM. MoE (смешение экспертов) состоит из множества мини-подсетей, каждая из которых активируется для генерации токенов, что отличается от подхода Dense. Архитектура MoE включает роутер, который выбирает активных экспертов на каждом шаге.
Одним из примеров является GPT-OSS-120B, который активирует всего 4 из 128 экспертов, что позволяет значительно сократить ресурсы на генерацию токенов. Ускорение достигается за счет оптимального распределения нагрузки между CPU и GPU. Для повышения производительности MoE моделей можно использовать специальные параметры, которые помогают управлять распределением тензоров и количеством слоев.
Разные MoE модели демонстрируют различные уровни эффективности в зависимости от архитектуры. Некоторые модели, такие как Grok2, требуют больше ресурсов, в то время как другие, как Llama-4-Maverick, могут быть запущены с высокой производительностью даже на менее мощных системах. Переход на MoE позволяет запускать крупные LLM на видеокартах с 8 Гб, открывая новые возможности для локального использования и работы с нейросетями.
