Андрей Карпати, создатель AI-образовательного стартапа Eureka Labs, представил новую разработку под названием microGPT. Эта версия GPT полностью реализована на Python и содержит всего 243 строки кода без каких-либо внешних зависимостей. В числе обязательных импортов лишь стандартные модули math, random, os и argparse.
microGPT включает все необходимые компоненты для полноценной работы языковой модели, такие как автодифференцирующий движок, токенизатор с BOS и EOS токенами, архитектура Transformer с многоуровневым вниманием, норма RMSNorm и другие важные элементы. Основные отличия от классического GPT-2 касаются замены LayerNorm на RMSNorm и использования squared ReLU вместо GeLU.
Карпати описывает данный проект как “арт-проект” и подтверждает, что он включает всю необходимую алгоритмическую основу для обучения GPT. Несмотря на относительно низкую эффективность, microGPT демонстрирует, что принцип работы LLM может помещаться в небольшой объём кода, что уже награждено высокими оценками на GitHub. Поддержать автора можно подпиской на его канал, где он делится идеями о творческом аспекте ИИ.
