Недавно предложен «закон уплотнения» для больших языковых моделей, согласно которому максимальная плотность способностей удваивается каждые 3,5 месяца. Введена новая метрика, позволяющая оценить, сколько параметров потребовалось бы референсной модели для достижения такого же качества. Анализ ряда бенчмарков показывает устойчивый экспоненциальный рост плотности. При фиксированном качестве число параметров модели уменьшается, что приводит к снижению стоимости инференса. Связка с законом Мура предполагает, что мощные модели смогут функционировать локально на потребительском оборудовании. Методология density-optimal training становится важной, в то время как простое увеличение параметров теряет смысл. Это изменение акцентов в обучении моделей открывает новые горизонты для их проектирования и применения в будущем.
