MoE — архитектурный паттерн, при котором модель разделяется на множество «экспертных» подсетей, и для каждого токена активируются лишь 2–4 из них. Это позволяет увеличивать общую эффективность модели без пропорционального роста. Примеры: DeepSeek V4-Pro (1,6 ТРЛН общих / 49 МЛРД активных параметров), Llama 4 Maverick (400 МЛРД / 17 МЛРД, 128 экспертов), Qwen 3.6-35B-A3B (35 МЛРД / 3 МЛРД активных).