MoE (Mixture of Experts) — архитектура нейросети, где при обработке каждого токена активируется лишь часть специализированных «экспертных» слоёв. Такой подход позволяет увеличивать общее число параметров модели без соответствующего роста затрат на инференс. MoE применяется, например, в GPT-4 и Mixtral. Важно не путать MoE с полностью распределёнными архитектурами — здесь эксперты включаются избирательно.
Пример
Модель Mixtral использует MoE: на каждом шаге работает только несколько из многих экспертных блоков, что ускоряет обработку длинных текстов.