Команда DeepReinforce анонсировала систему CUDA L2, способную автоматически создавать код для матричного умножения на GPU, который работает на 10-30% быстрее, чем аналогичные решения cuBLAS и cuBLASLt. Эти библиотеки, разработанные специалистами NVIDIA, служат эталоном в оптимизации, поэтому результаты CUDA L2 вызвали большой интерес в отрасли.
Система меняет подход к оптимизации, используя сочетание большой языковой модели и обучения с подкреплением. LLM генерирует CUDA ядро с нуля под специфические размеры матриц, а RL цикл тестирует его на реальном оборудовании, измеряя производительность и корректность. Процесс продолжается до тех пор, пока не будет найден лучший вариант. Это позволяет итоговому коду выходить за рамки человеческих шаблонов.
В качестве генератора использовалась DeepSeek 671B, которая прошла обучение на массиве CUDA ядер и высококачественном коде. CUDA L2 тестирует около тысячи реальных конфигураций матриц, что расширяет область применения. Результаты испытаний показывают, что система быстрее torch.matmul и cuBLAS в среднем на 17-22%, а в условиях серверного сценария – на 24-29%. Авторы предоставляют оптимизированные A100 ядра и планируют расширение на новые архитектуры. Подход CUDA L2 может установить новый стандарт в отрасли.
