Универсального лидера нет: разные модели выигрывают разные бенчмарки. Claude Mythos Preview лидирует в SWE-Bench (93,9%), Gemini 3.1 Pro — в MMLU (94,1%) и GPQA Diamond (94,3%), GPT-5.5 — в нативной мультимодальности, Qwen 3.6 Plus — в Terminal-Bench (61,6%) и OmniDocBench (91,2%). По соотношению цена/качество для чат-сценариев выделяются DeepSeek V3.2 и GLM-5.1 — качество неотличимо от Claude Sonnet на 80% запросов при цене в 10 раз ниже.