Исследователи из MIT предложили механистическое объяснение того, почему производительность больших языковых моделей так предсказуемо растёт с увеличением размера. По их версии, ключевую роль играет суперпозиция.
Ранее в исследованиях ИИ уже не раз отмечали, что при увеличении числа параметров, объёма данных или вычислений ошибка предсказания у языковых моделей снижается по степенному закону. Эти зависимости известны как законы масштабирования нейросетей. Однако причины этого эффекта до конца не были объяснены.
Работу представили на NeurIPS 2025. Авторы исследования — Yizhou Liu, Ziming Liu и Jeff Gore из MIT.
Учёные связывают эффект с геометрическим свойством самих моделей. Языковым моделям нужно размещать десятки тысяч токенов и ещё больше абстрактных значений во внутреннем пространстве, где число измерений намного меньше. Чтобы уместить больше понятий, модели хранят несколько значений в одних и тех же измерениях. Из-за этого векторы частично перекрываются. Такой механизм и называют суперпозицией.
До этого многие объяснения исходили из более простой схемы: модель чётко кодирует только самые частые понятия, а редкие теряются. Авторы показали на упрощённой модели, основанной на подходе Anthropic, что эта картина не соответствует работе реальных LLM.
Исследователи создали сильно упрощённую модель ИИ с параметром обучения, который позволял управлять степенью перекрытия хранимых понятий. Это дало возможность сравнить два крайних режима.
В первом режиме, который авторы называют слабой суперпозицией, модель хорошо хранит только самые частые понятия, а остальные игнорирует. В таком случае ошибка в основном возникает из-за редких понятий, которые выпадают. Масштабирование по степенному закону появляется лишь тогда, когда само распределение понятий в данных также подчиняется степенному закону.
Во втором режиме, сильной суперпозиции, модель хранит все понятия сразу, допуская небольшое перекрытие векторов. Тогда ошибка возникает уже не из-за пропуска понятий, а из-за шума, который создают эти пересечения. В этом случае появляется устойчивая зависимость 1/m, где m — ширина модели: при удвоении ширины ошибка примерно уменьшается вдвое. Распределение понятий в данных здесь почти не влияет на результат.
Чтобы понять, какой режим ближе к реальным системам, команда изучила выходные слои открытых моделей OPT, GPT-2, Qwen2.5 и Pythia размером примерно от 100 млн до 70 млрд параметров. Анализ показал, что в моделях представлены все токены, их векторы перекрываются, а сила этого перекрытия уменьшается ровно в соответствии с прогнозом 1/m.
Авторы делают вывод, что языковые модели работают именно в режиме сильной суперпозиции. Измеренный показатель масштабирования составил 0,91, что близко к теоретическому значению 1. Для данных Chinchilla от DeepMind получено почти такое же значение — 0,88.
По словам исследователей, это даёт ответ сразу на два открытых вопроса. Первый — может ли масштабирование перестать работать. По их оценке, да: это произойдёт, когда ширина модели сравняется с размером словаря. Тогда каждому токену хватит места без перекрытия, и ошибка, вызванная тесным внутренним представлением, исчезнет. На этой границе степенной закон перестаёт выполняться.
Второй вопрос касается того, можно ли ускорить законы масштабирования и получать больше качества на каждый добавленный параметр. Для естественного языка, как считают авторы, это маловероятно, поскольку распределение частот слов сравнительно ровное. Но в прикладных задачах, где полезные понятия распределены очень неравномерно, масштабирование может быть круче.
Работа также затрагивает проектирование архитектур. По мнению авторов, модели, которые специально поощряют суперпозицию, должны показывать лучшие результаты при том же размере. В качестве примера упоминается nGPT от Nvidia, где внутренние векторы принудительно размещаются на единичной сфере, что позволяет упаковывать их плотнее.
При этом у подхода есть и минус. Чем сильнее перекрываются понятия, тем труднее проследить, что именно происходит внутри модели. Это создаёт проблему для механистической интерпретируемости и, как следствие, для исследований безопасности ИИ.
Источник: The Decoder.






















