Кибер-Миша

Каталог моделей

61 / 61
DeepSeek-V4-Flash-0731Доступна
🇨🇳 DeepSeekОткрытые веса

Производственная сборка DeepSeek V4-Flash, выпущенная 31 июля 2026 года взамен апрельского превью. Архитектура и размер не менялись — тот же sparse-MoE на 284B параметров с 13B активных и контекстом 1M токенов; весь прирост дал переработанный пост-трейнинг под кодинг, агентные сценарии, рассуждение и вызов инструментов. По данным вендора, сборка обходит V4-Pro-Preview на всех девяти опубликованных агентных и кодинговых бенчмарках, включая 82.7 на Terminal-Bench 2.1 против 61.8 у превью Flash; независимых воспроизведений на момент релиза мало. API работает на прежнем эндпоинте, добавлена нативная поддержка формата OpenAI Responses и адаптация под Codex CLI. Веса выложены на Hugging Face под MIT, цена — $0.14/$0.28 за 1M токенов.

Qwen3.7-FlashДоступна
🇨🇳 Alibaba (Qwen)Проприетарная

Бюджетный член линейки Qwen3.7, выпущенный 27 июля 2026 без официального анонса — модель просто появилась в API и на OpenRouter. Параметры и архитектура не раскрыты (сообщество предполагает небольшой sparse-MoE), технического отчёта нет. Принимает текст и изображения, контекст 1M токенов, максимум вывода 66K. Базовая цена $0.03/$0.13 за 1M токенов — на момент релиза это дешевейшая мультимодальная модель с таким контекстом, но тарификация ступенчатая: на промптах свыше 32K токенов ставка растёт до $0.20/$0.80. Бенчмарков вендор не публиковал, независимых замеров пока нет.

Claude Opus 5Доступна
🇺🇸 AnthropicПроприетарнаяФронтир

Флагман линейки Opus, вышел 24 июля 2026. Контекст 1 млн токенов, вывод до 128K, цена $5/$25 за 1M токенов; fast-режим стоит вдвое дороже ($10/$50) и работает примерно в 2,5 раза быстрее, по данным вендора. Регулируемый уровень усилий (effort dial) позволяет менять баланс цена/качество без смены модели. Anthropic заявляет качество, близкое к Fable 5, за полцены, и лидерство на собственных замерах (Frontier-Bench v0.1, OSWorld 2.0, ARC-AGI 3) — это вендорские цифры; из независимого пока есть только 61 балл в Intelligence Index от Artificial Analysis. Позиционируется как основная модель для инженерных задач и автоматизации знаний.

Ling-3.0-flashДоступна
🇨🇳 Ant Group (inclusionAI)Open source

Модель Ant Group (inclusionAI) со ставкой на эффективность: 124B параметров, активных всего ~5.1B — активация 1/64 (512 экспертов плюс 1 общий, 8 на токен). Внимание гибридно-линейное: 35 слоёв KDA на 7 слоёв Gated MLA. Контекст 256K (обучение по расписанию 8K → 32K → 256K); заявлена скорость до 1,000 токенов/с. По данным вендора, обгоняет собственный флагман Ling-2.6-1T в 11 тестах; в карточке: SWE-bench Pro 56.6, AIME 2026 93.2. Анонс 23 июля 2026; на старте только API, веса выложены на Hugging Face под MIT через несколько дней.

Gemini 3.5 Flash CyberПревью
🇺🇸 Google DeepMindПроприетарная

Специализированная ветка Gemini 3.5 Flash для поиска и исправления уязвимостей в коде, представленная 21 июля 2026 года. Работает внутри агента CodeMender; из-за двойного назначения Google не выводит её в общий доступ — модель раздаётся только правительствам и проверенным партнёрам в рамках закрытого пилота. Модальности — текст и код, контекст 1 млн токенов; цены не раскрыты, бенчмарков нет. Заявление вендора, что модель находит уязвимости дешевле в пересчёте на токен, чем крупные модели, независимо не проверялось.

Gemini 3.5 Flash-LiteДоступна
🇺🇸 Google DeepMindПроприетарная

Самая дешёвая модель ветки 3.5 — $0,30/$2,50 за 1 млн токенов — выпущена 21 июля 2026 года вместе с Gemini 3.6 Flash. Рассчитана на поточные задачи: агентный поиск, разбор документов, массовую классификацию; контекст 1 млн токенов, заявленная скорость порядка 350 токенов/с. По данным вендора, опережает полновесную Gemini 3 Flash прошлого поколения: 54,2% против 49,6% на SWE-Bench Pro и 74,0% против 65,1% на OSWorld-Verified. Независимых замеров пока нет. Доступна в Gemini API и работает внутри поиска Google.

Gemini 3.6 FlashДоступна
🇺🇸 Google DeepMindПроприетарная

Рабочая модель flash-уровня, выпущенная 21 июля 2026 года одновременно с Gemini 3.5 Flash-Lite и Flash Cyber. Сменила Gemini 3.5 Flash в Gemini API, AI Studio, приложении Gemini и Antigravity; контекст 1 млн токенов, срез знаний — март 2026. По данным вендора, тратит примерно на 17% меньше выходных токенов на ту же задачу и поднимает DeepSWE с 37% до 49%, MLE-Bench с 49,7% до 63,9%, OSWorld-Verified с 78,4% до 83,0%. Выход подешевел относительно 3.5 Flash с $9,00 до $7,50 за 1 млн токенов при той же цене входа $1,50. Независимых замеров пока нет.

Laguna S 2.1Доступна
🇺🇸 PoolsideОткрытые весаФронтир

Флагманская открытая модель Poolside для агентной разработки ПО: MoE на 118B параметров с 8B активных, контекст 1M токенов, два режима — с рассуждением и без. Выпущена 21 июля 2026 года под пермиссивной лицензией OpenMDW-1.1; срез знаний — 30 ноября 2025 года. Обучена меньше чем за девять недель на 4096 NVIDIA H200, RL-стадия впервые у Poolside выполнена в FP8, в пост-тренинге задействовано 409 тыс. агентных сред. По данным вендора — 70.2% на Terminal-Bench 2.1 и 78.5% на SWE-bench Multilingual; независимых замеров пока нет. Веса опубликованы в BF16/FP8/INT4/NVFP4.

Qwen3.8-Max-PreviewПревью
🇨🇳 Alibaba (Qwen)ПроприетарнаяФронтир

Превью следующего флагмана Alibaba, показанное 19 июля 2026, — крупнейшая модель компании: 2.4T параметров, sparse-MoE; количество активных параметров, контекст и цены официально не раскрыты. По внутренним оценкам вендора модель уступает по совокупной производительности только Fable 5 от Anthropic — бенчмарк-таблицы, model card и лицензии на момент превью не было, независимых замеров нет. Доступ — через подписку Alibaba Token Plan и кодинг-платформы Qoder/QoderWork. Команда обещала открыть веса «в ближайшее время»; по сообщениям прессы, полная версия Qwen3.8-Max вышла в общую доступность в начале августа 2026.

Kimi K3Доступна
🇨🇳 Moonshot AIОткрытые весаФронтир

MoE-модель на 2.8T параметров со 104B активных на токен (896 экспертов, 16 активных) — крупнейшая открытая модель на момент выхода. В архитектуре — Kimi Delta Attention и Attention Residuals, зрение через энкодер MoonViT-V2; веса опубликованы в MXFP4-квантовании. Контекст 1M токенов, вывод до 32K. API запущен 16 июля 2026, веса выложены 26 июля — но уже не под Modified MIT, как у K2: собственная лицензия с порогом по выручке для MaaS-провайдеров и требованием атрибуции при аудитории свыше 100M MAU. По данным вендора: SWE-bench Verified 76.8, GPQA Diamond 93.5, Terminal-Bench 2.1 88.3; независимых замеров пока мало.

InklingДоступна
🇺🇸 Thinking Machines LabОткрытые весаФронтир

Первая модель Thinking Machines Lab, выпущенная 15 июля 2026 года сразу с открытыми весами под Apache 2.0. Это 66-слойный декодер с разреженным MoE: 975B параметров всего, 41B активных (маршрутизация в 6 из 256 экспертов плюс 2 общих), предобучение — порядка 45T токенов. Вход мультимодальный — текст, изображения и аудио до 20 минут (16 кГц), выход только текст; контекст открытых весов — до 1M токенов, в хостинговом API Tinker — 256K. Управляемое усилие рассуждения и калибровка уверенности заявлены вендором; из независимых замеров пока только дебют на 41-м месте Intelligence Index у Artificial Analysis. Есть младшая версия Inkling-Small (276B/12B).

GPT-5.6 LunaДоступна
🇺🇸 OpenAIПроприетарная

Нижний ярус GPT-5.6 для массовых конвейерных задач: классификация, экстракция, суммаризация, черновики. Контекст тот же, что у старших ярусов, — 1,5 млн токенов при выводе до 128 тыс.; срез знаний — 31 января 2026. Превью 26 июня 2026, общая доступность с 9 июля 2026. Стартовая цена $1/$6 за 1 млн токенов; 30 июля 2026, по данным отраслевых источников, её снизили на 80%, точный новый прайс в справочниках пока не зафиксирован. Примечательно, что на Terminal-Bench 2.1 Luna показывает 84,3% — выше среднего яруса Terra (82,5%); независимых подтверждений этого замера пока нет.

GPT-5.6 SolДоступна
🇺🇸 OpenAIПроприетарнаяФронтир

Флагманский ярус семейства GPT-5.6, показан в превью 26 июня 2026 и открыт для всех 9 июля 2026 после проверки американского центра CAISI при Минторге США. Контекст 1,5 млн токенов, вывод до 128 тыс., на входе текст, изображения и аудио; срез знаний — 31 января 2026. Добавлены уровень усилия рассуждений max и режим ultra с порождением субагентов для длинных автономных задач. Цена API — $5/$30 за 1 млн токенов входа/выхода. На Terminal-Bench 2.1 — 88,8% (91,9% в режиме ultra), в независимом индексе Artificial Analysis Coding Agent — 80,0. Заявленная скорость 750 ток/с достигается только на железе Cerebras в закрытом превью для избранных клиентов — независимых замеров пока нет.

GPT-5.6 TerraДоступна
🇺🇸 OpenAIПроприетарная

Средний ярус линейки GPT-5.6 с теми же 1,5 млн токенов контекста, выводом до 128 тыс. и мультимодальным входом (текст, изображения, аудио), что у флагманского Sol. Превью 26 июня 2026, общая доступность с 9 июля 2026. OpenAI позиционирует Terra как замену GPT-5.5 при цене примерно вдвое ниже: $2,50/$15 за 1 млн токенов на старте, а 30 июля 2026 цену, по данным отраслевых источников, снизили ещё на 20%. На Terminal-Bench 2.1 — 82,5%, что близко к результату GPT-5.5 на предыдущей версии этого бенчмарка. Срез знаний — 31 января 2026.

Muse Spark 1.1Превью
🇺🇸 Meta AIПроприетарнаяФронтир

Вторая модель Meta Superintelligence Labs и первая, за которую Meta берёт деньги: релиз 2026-07-09 одновременно открыл публичное превью Meta Model API (пока только для разработчиков из США). Мультимодальная reasoning-модель под агентные задачи — tool use, computer use, кодинг; контекст 1 млн токенов, на вход принимает текст, изображения, аудио, видео и PDF. Цена $1.25/$4.25 за 1 млн токенов ввода/вывода, новым аккаунтам дают $20 кредитов. API совместим одновременно с форматами OpenAI Chat Completions и Anthropic Messages, что снижает стоимость миграции. По данным вендора, модель стоит в одном ряду с Claude Opus 4.8 и GPT-5.5; независимых замеров пока нет. Архитектура и число параметров не раскрыты.

Grok 4.5Доступна
🇺🇸 xAI (SpaceXAI)ПроприетарнаяФронтир

Флагман xAI (с февраля 2026 компания поглощена SpaceX и работает под брендом SpaceXAI), выпущен 2026-07-08. Первая модель Grok, обученная совместно с Cursor (Anysphere): по заявлению компании — на триллионах токенов реальных сессий разработчиков в Cursor плюс STEM-задачи и научные статьи. MoE-архитектура; общее число параметров не раскрыто, в утечках фигурирует фундамент «V9» на ~1.5 трлн, подтверждения нет. Позиционируется под software engineering, агентные задачи и knowledge work, отдельно — юридические и финансовые сценарии; вендор заявляет примерно в 4.2 раза меньше выходных токенов на задачу, чем у конкурентов. Цена $2/$6 за 1 млн токенов, ускоренный вариант для Cursor — $4/$18. Бенчмарк-картина смешанная: по данным вендора модель впереди на Terminal-Bench 2.1 (83.3%) и DeepSWE 1.0, но уступает Claude Opus 4.8 на DeepSWE 1.1 и SWE-bench Pro.

Hunyuan Hy3Доступна
🇨🇳 Tencent HunyuanOpen source

Открытая MoE-модель Tencent: 295B параметров, 21B активных (192 эксперта, top-8) плюс MTP-слой на 3.8B для ускоренной генерации. Три переключаемых режима инференса с разной глубиной рассуждений. Превью показано в апреле 2026, релиз — 6 июля 2026 под Apache-2.0; есть FP8-вариант. По данным вендора: SWE-bench Verified 78.0, SWE-bench Pro 57.9, GPQA Diamond 90.4 — уровень GLM-5.2 и DeepSeek-V4 при меньшем числе активных параметров; независимые замеры пока единичны. До 21 июля действовал бесплатный доступ через OpenRouter.

Nemotron-Labs-3-Puzzle-75B-A9BДоступна
🇺🇸 NVIDIAОткрытые веса

Исследовательский релиз NVIDIA от 2026-07-06: сжатая версия Nemotron-3-Super-120B-A12B, полученная фреймворком пост-тренировочной компрессии Iterative Puzzle. Архитектура — гибрид Mamba-Transformer с LatentMoE и multi-token prediction: 75.3 млрд параметров всего, 9.3 млрд активных, контекст 1 млн токенов. Веса в BF16 выложены на Hugging Face под пермиссивной лицензией OpenMDW-1.1, метод описан в статье на arXiv. Публичных бенчмарков пока не зафиксировано; замысел — сохранить качество класса Super при заметно меньшей стоимости инференса, что стоит проверять на своих задачах.

Laguna XS 2.1Доступна
🇺🇸 PoolsideОткрытые веса

Компактная модель Poolside для локальной агентной разработки: MoE 33B всего и 3B активных, контекст 256K. Вышла 2 июля 2026 года под OpenMDW-1.1 вместе с открытыми DFlash-спекуляторами, которые, по данным вендора, примерно удваивают скорость локальной генерации. Заявлено 63.1% на SWE-bench Multilingual — на 5.4 п.п. выше предшественницы; независимых замеров пока нет. Поддерживается в vLLM, SGLang, TensorRT-LLM, HF Transformers и Ollama; веса — в BF16/FP8/INT4/NVFP4.

Claude Sonnet 5Доступна
🇺🇸 AnthropicПроприетарная

Модель среднего сегмента, релиз 30 июня 2026. Контекст 200K токенов, вывод до 64K, цена $2/$10 за 1M токенов — стартовая ставка, которую Anthropic позже сделала постоянной вместо планового перехода на $3/$15. Основной упор на агентные сценарии: работа с браузером и терминалом, многошаговые автономные задачи; вендор заявляет уровень около Opus 4.8 при меньшей цене, независимых замеров пока нет. Встроены рантайм-фильтры против наступательного кибер-применения; в тестах вендора модель ни разу не собрала рабочий эксплойт. Модель по умолчанию на планах Free и Pro в Claude.ai.

Seed 2.1 ProДоступна
🇨🇳 ByteDance SeedПроприетарнаяФронтир

Флагманская агентная модель ByteDance (в API — Doubao-Seed-2.1-pro), вышла 23 июня 2026. Архитектура и параметры не раскрыты; контекст 256K, вход — текст, изображения, видео и GUI-скриншоты, включая мобильные агентные сценарии. ByteDance заявляет качество на уровне GPT-5.5 и первые места на GDPVal и MobileWorld — все цифры вендорские, независимых замеров нет. Доступ только через Doubao и Volcano Engine; цены опубликованы в юанях: ¥6/¥30 за 1M токенов вход/выход, тарифа в USD нет.

Seed 2.1 TurboДоступна
🇨🇳 ByteDance SeedПроприетарная

Удешевлённый и ускоренный тир линейки Seed 2.1 (в API — Doubao-Seed-2.1-turbo), выпущен одновременно с Pro 23 июня 2026. ByteDance позиционирует качество как сопоставимое с Pro при вдвое меньшей цене (¥3/¥15 за 1M токенов) и меньшей задержке; независимых замеров нет. Та же мультимодальность (текст, изображения, видео) и контекст 256K; параметры не раскрыты, веса не публикуются. Доступ через Doubao и Volcano Engine, тарифа в USD нет.

Kimi K2.7 CodeДоступна
🇨🇳 Moonshot AIОткрытые веса

Открытая агентно-кодовая модель Moonshot на базе K2.6: MoE на 1T параметров, 32B активных (384 эксперта, 8 на токен), внимание MLA, энкодер MoonViT на 400M — принимает текст, изображения и видео. Режим рассуждений принудительный (forced thinking) с сохранением цепочки между ходами диалога; заявлена экономия около 30% thinking-токенов против K2.6. Контекст 256K, вывод до 32K, лицензия Modified MIT. Вышла 18 июня 2026. Бенчмарки в карточке — собственные (Kimi Code Bench v2 62.0, MCP Atlas 76.0), стандартных публичных замеров пока нет.

GLM-5.2Доступна
🇨🇳 Z.ai (Zhipu AI)Open sourceФронтир

Открытый флагман Z.ai (Zhipu): MoE на 753B параметров (число активных не раскрыто), контекст 1M токенов, вывод до 163,840 токенов в режиме рассуждений. Главное изменение против GLM-5.1 — механизм IndexShare, переиспользующий индексы sparse-attention, плюс ускоренное спекулятивное декодирование (по данным вендора, до +20% к acceptance length). Ориентирована на длинные кодовые и агентные сессии. Лицензия MIT без региональных ограничений, релиз 17 июня 2026. Vendor-цифры: SWE-bench Pro 62.1, GPQA Diamond 91.2, AIME 2026 99.2, HLE 40.5; независимых замеров пока нет. Цены API на релизе не опубликованы.

MiniMax-M3Доступна
🇨🇳 MiniMaxОткрытые весаФронтир

Нативно-мультимодальная MoE-модель: 428B параметров, 23B активных; текст, изображения и видео смешиваются с первого шага обучения, а не подключаются отдельным энкодером. Механизм MiniMax Sparse Attention даёт, по данным вендора, 9-кратное ускорение prefill и 15-кратное decode на контексте 1M против M2. Заявленные SWE-bench Verified 80.5 и SWE-bench Pro 59.0 — уровень закрытых флагманов, но независимых подтверждений пока нет. Выпущена 16 июня 2026, веса доступны под MiniMax Community License.

DiffusionGemma 26B-A4BДоступна
🇺🇸 Google DeepMindOpen source

Первая открытая текстово-диффузионная модель Google, выпущенная 10 июня 2026 года на базе Gemma 4 26B-A4B. Вместо автогенеративного вывода по одному токену модель параллельно «расшумляет» блоки по 256 токенов; по данным вендора, это даёт свыше 1000 токенов/с на одном H100 и свыше 700 токенов/с на RTX 5090 — до 4 раз быстрее сравнимых авторегрессионных моделей. MoE-архитектура: 25,2 млрд параметров всего, около 3,8 млрд активных на шаг; контекст 256 тыс. токенов, на входе текст, изображения и видео. Лицензия Apache-2.0, инструктивные веса на Hugging Face; после квантизации помещается примерно в 18 ГБ VRAM. Модель экспериментальная, независимых замеров качества пока нет.

Claude Fable 5Доступна
🇺🇸 AnthropicПроприетарнаяФронтир

Первая публичная модель Mythos-класса — уровня, который Anthropic ставит выше Opus. Вышла 9 июня 2026: контекст 1 млн токенов, вход текст+изображения+код, цена $10/$50 за 1M токенов. Рассчитана на длительную автономную работу: по данным вендора, модель удерживает фокус на миллионах токенов и сама проверяет результат через циклы верификации; публичных бенчмарков вендор не приводит, независимых замеров пока нет. Поверх модели стоят классификаторы безопасности (кибер, биология/химия, защита от дистилляции); при их срабатывании — по данным вендора, менее 5% сессий — запрос обрабатывает Claude Opus 4.8. С 12 июня по 1 июля 2026 доступ был приостановлен экспортным предписанием США, затем восстановлен глобально. Срез знаний — 30 ноября 2025.

North Mini Code 1.0Доступна
🇨🇦 CohereOpen source

Первая модель кодовой линейки North у Cohere и первый релиз компании, адресованный напрямую разработчикам: MoE 30B всего с 3B активных, контекст 256K, генерация до 64K токенов. Выпущена 9 июня 2026 года под Apache 2.0 и заточена под агентный кодинг и работу в терминале с прицелом на развёртывание внутри контура предприятия. Минимальная конфигурация — один H100 в FP8 или FP4; на Artificial Analysis Coding Index набирает 33.4. По данным вендора, даёт до 2.8 раза большую пропускную способность, чем Devstral Small 2. Доступна на Hugging Face, через Cohere API, Model Vault и OpenRouter.

Nemotron 3 Ultra 550B-A55BДоступна
🇺🇸 NVIDIAОткрытые весаФронтир

Старшая модель открытой линейки Nemotron 3 от NVIDIA, веса опубликованы 2026-06-04. Гибрид Mamba-Transformer с MoE: 550 млрд параметров всего, 55 млрд активных; контекст 1 млн токенов, вывод до 16K. Назначение — агентный reasoning, кодинг, планирование и tool calling. Распространяется под Nemotron Open Model License, метод описан в препринте на arXiv. Ниже в линейке — Nemotron 3 Nano 30B-A3B (декабрь 2025) и Super 120B-A12B (март 2026). Опубликованных независимых бенчмарков пока нет.

Gemma 4 12BДоступна
🇺🇸 Google DeepMindOpen source

Открытая 12-миллиардная модель, выпущенная 3 июня 2026 года как дополнение к апрельской линейке Gemma 4. Главное отличие — безэнкодерная мультимодальность: изображения и звук проецируются напрямую в основной стек, что снижает задержку и потребление памяти; это первая средняя Gemma с нативным аудиовходом. Контекст 256 тыс. токенов, лицензия Apache-2.0, веса опубликованы на Hugging Face. По данным вендора, работает на ноутбуке с 16 ГБ памяти; независимых бенчмарков в справочниках пока не зафиксировано.

Qwen3.7-PlusДоступна
🇨🇳 Alibaba (Qwen)Проприетарная

Мультимодальный собрат Qwen3.7-Max: MoE нераскрытого размера с вводом изображений и GUI-grounding — модель возвращает координаты элементов интерфейса, что рассчитано на screen-агентов, автоматизацию браузера и смешанные GUI+CLI сценарии. Превью показано 20 мая 2026 на Alibaba Cloud Summit, общая доступность — 3 июня 2026. Контекст 1M токенов, доступ только по API (Model Studio/DashScope, регионы Пекин, Сингапур, US-Virginia), совместимость с OpenAI-форматами. По данным вендора, лидирует в GUI-grounding: 79.0 на ScreenSpot Pro и 81.0 на AndroidWorld; независимых подтверждений пока нет. Цена $0.40/$1.60 за 1M токенов — примерно в шесть раз ниже, чем у Max.

MAI-Code-1-FlashДоступна
🇺🇸 MicrosoftПроприетарная

Компактная кодинговая модель Microsoft из семейства MAI, представленного на Build 2026 (2026-06-02); всего в семействе семь моделей, включая MAI-Image-2.5 и MAI-Voice-2. Около 5 млрд активных параметров, оптимизирована под дешёвый инференс; раскатывается как опция в пикере моделей GitHub Copilot и в VS Code. Microsoft заявляет преимущество в 16 пунктов над Claude Haiku 4.5 на SWE-bench Pro — независимых подтверждений этому нет. Обучена, по данным вендора, на «чистых, отслеживаемых» корпоративных данных без дистилляции сторонних моделей. Отдельные цены API не опубликованы.

MAI-Thinking-1Доступна
🇺🇸 MicrosoftПроприетарнаяФронтир

Первая полностью собственная frontier-reasoning-модель Microsoft, показанная на Build 2026 (2026-06-02) — фактический разрыв с зависимостью от моделей OpenAI. Разреженный MoE с ~35 млрд активных параметров (общее число не раскрыто), контекст 256K токенов, работает с текстом и кодом. Microsoft подчёркивает, что модель обучена с нуля на коммерчески лицензированных данных без дистилляции сторонних моделей. Заявленные результаты — AIME 2025 97.0% и паритет с Claude Opus 4.6 на SWE-bench Pro; это данные вендора, независимых замеров пока нет. На момент анонса доступ шёл через Microsoft Foundry по заявке, цены API не опубликованы.

Step-3.7-FlashДоступна
🇨🇳 StepFunOpen source

Мультимодальный sparse-MoE от StepFun: 196B параметров, 11B активных, преемник Step-3.5-Flash. Нативный вход изображений и видео, три переключаемых уровня рассуждений (high/medium/low); позиционируется под кодовых агентов и поисковые сценарии. Контекст 256K. Выпущена 29 мая 2026 под Apache-2.0, веса на Hugging Face. Публичных бенчмарков в карточке нет — независимых замеров тоже пока нет.

Claude Opus 4.8Доступна
🇺🇸 AnthropicПроприетарная

Апгрейд флагмана поколения 4.x поверх Opus 4.7, вышел 28 мая 2026. Контекст 500K токенов, вывод до 64K, цена $5/$25 ($10/$50 в fast-режиме — втрое дешевле прежнего fast, по данным вендора). Вендор заявляет 81,5% на SWE-bench Verified, 89% на GPQA Diamond и 84% на Online-Mind2Web; независимых подтверждений нет. Улучшения — агентное рассуждение, ревью кода, работа с браузером и точность цитирования. После выхода Fable 5 модель также служит fallback при срабатывании её классификаторов безопасности. Срез знаний — 30 ноября 2025.

LFM2.5-8B-A1BДоступна
🇺🇸 Liquid AIОткрытые веса

Reasoning-модель Liquid AI для работы на устройстве: MoE на 8.3B параметров с 1.5B активных (32 эксперта, 4 на токен) поверх гибридного стека из 18 свёрточных LIV-блоков и 6 слоёв GQA-внимания. Выпущена 28 мая 2026 года как развитие LFM2-8B-A1B: предобучение расширено с 12T до 38T токенов, контекст поднят до 131K, словарь удвоен до 128K токенов. Модель всегда отвечает с явной цепочкой рассуждений; отдельные стадии пост-тренинга посвящены снижению галлюцинаций и борьбе с зацикливанием рассуждений. По данным вендора — 88.76 на MATH500 и 56.47 на IFBench; укладывается в ~6 ГБ памяти на ноутбучных чипах и выдаёт около 30 ток/с на смартфоне.

Qwen3.7-MaxДоступна
🇨🇳 Alibaba (Qwen)ПроприетарнаяФронтир

Закрытый текстовый флагман линейки Qwen3.7, представленный Alibaba 19–20 мая 2026 года с позиционированием «агентная модель». Sparse-MoE нераскрытого размера с контекстом 1M токенов и режимом расширенного рассуждения; весов нет, доступ только через API Alibaba Cloud Model Studio (DashScope) и агрегаторы вроде OpenRouter. По данным вендора: 60.6 на SWE-bench Pro, 69.7 на Terminal-Bench 2.0 и 76.4 на MCP-Atlas — заявлено преимущество над Claude Opus 4.7 в агентном кодинге, независимые замеры пока фрагментарны. Цена $2.5/$7.5 за 1M токенов, кэшированный вход дешевле на 90% ($0.25).

Gemini 3.5 FlashДоступна
🇺🇸 Google DeepMindПроприетарная

Быстрая модель линейки 3.5, показанная на Google I/O 19 мая 2026 года и сразу запущенная в Gemini API, приложении Gemini и AI Mode поиска Google. Контекст 1 млн токенов, вывод до 65,5 тыс., цена $1,50/$9,00 за 1 млн токенов входа/выхода. По данным вендора, обходит Gemini 3.1 Pro в коде и вызове инструментов при примерно четырёхкратной скорости; независимых замеров не зафиксировано. С 21 июля 2026 фактически вытеснена Gemini 3.6 Flash с более дешёвым выходом.

Gemini 3.5 ProПревью
🇺🇸 Google DeepMindПроприетарнаяФронтир

Флагман линейки Gemini 3.5, анонсированный на Google I/O 19 мая 2026 года, но до сих пор не вышедший в общий доступ. Заявлены MoE-архитектура, контекст 2 млн токенов и упор на глубокое мультимодальное рассуждение; срез знаний — январь 2026. Обещанный на июнь запуск сорван: 21 июля Google ограничился формулировкой «тестируем с партнёрами», модель видна только в Antigravity и LMArena. Цены не объявлены, бенчмарков нет — кроме заявлений вендора, оценивать пока нечего.

Qwen3.6-27BДоступна
🇨🇳 Alibaba (Qwen)Открытые веса

Плотная (dense) модель на 27B параметров, выпущенная 12 мая 2026 под Apache-2.0 с расчётом на агентный кодинг при самостоятельном хостинге. Нативный контекст 262K токенов, срез знаний — 31 января 2026. По данным вендора набирает 77.2 на SWE-bench Verified — выше, чем 397B MoE-модель Qwen3.5, которую она заменяет в нише self-hosted кодинга. В 4-битной квантизации занимает около 17 GB и работает на одной потребительской GPU; поддерживаются vLLM, SGLang и llama.cpp, модель подключается к агентным средам заменой конфигурации.

ERNIE 5.1Доступна
🇨🇳 BaiduПроприетарнаяФронтир

Закрытый флагман Baidu, вышел 8 мая 2026. MoE-архитектура; точные размеры не раскрыты — заявлено около 1/3 общих и 1/2 активных параметров от ERNIE 5.0 при стоимости претрейна порядка 6% от сопоставимых моделей. Контекст 128K, вывод до 65,536 токенов; доступ только через облако — Qianfan и ernie.baidu.com, API OpenAI-совместимый. На LMArena Search Arena набрала 1223 балла — 4-е место глобально и 1-е среди китайских моделей. Остальные цифры (например, AIME26 99.6 с инструментами) — по данным вендора, независимых замеров нет.

GPT-5.5-CyberПревью
🇺🇸 OpenAIПроприетарная

Вариант GPT-5.5 со смягчёнными отказами для авторизованных задач безопасности: триаж уязвимостей, проверка патчей, анализ малвари, red teaming, контролируемая валидация эксплойтов. Анонсирован 7 мая 2026 в статусе ограниченного превью в рамках программы Trusted Access: физлица проходят верификацию личности на chatgpt.com/cyber, организации подключаются через представителя OpenAI. С 1 июня 2026 доступ к самым пермиссивным моделям требует фишинг-устойчивой аутентификации аккаунта. Цены, контекст и лимиты вывода публично не раскрыты. По заявлению вендора, кража учётных данных, скрытность, персистентность и эксплуатация чужих систем блокируются и в этом варианте — независимой проверки границ дозволенного нет.

Grok 4.3Доступна
🇺🇸 xAI (SpaceXAI)Проприетарная

Reasoning-модель xAI среднего ценового сегмента: анонс 2026-04-30, общедоступна с 2026-05-06. MoE-архитектура, контекст 1 млн токенов, вывод до 64K, срез знаний — 2025-11-30. При выходе xAI снизила цену ввода примерно на 40% относительно предшественника: $1.25/$2.50 за 1 млн токенов, кэшированный ввод — $0.20. Упор сделан на агентный tool calling и следование инструкциям; GPQA Diamond 86% — по данным вендора, независимых замеров мало. До выхода Grok 4.5 в июле 2026 была флагманом линейки, сейчас — рабочая модель с длинным контекстом.

DeepSeek V4-FlashДоступна
🇨🇳 DeepSeekОткрытые веса

Эффективный компаньон флагманского V4-Pro, представленный 24 апреля 2026 года вместе со всем семейством V4. Sparse-MoE на 284B параметров с 13B активных на токен, контекст 1M токенов; веса открыты на Hugging Face под MIT вместе с техническим отчётом. 20 июля 2026 семейство достигло общей доступности, а 31 июля API-эндпоинт deepseek-v4-flash был переведён на переобученную сборку 0731, которая фактически заменила апрельский чекпоинт. Отдельных бенчмарков именно апрельской версии справочники не фиксируют — актуальные цифры вендор публикует для сборки 0731.

DeepSeek V4-ProДоступна
🇨🇳 DeepSeekОткрытые весаФронтир

Флагман семейства DeepSeek V4, выпущенный 24 апреля 2026 года: sparse-MoE на 1.6T параметров с 49B активных на токен и контекстом 1M токенов. Веса опубликованы на Hugging Face под лицензией MIT вместе с техническим отчётом — на момент релиза это одна из крупнейших открытых моделей. 20 июля 2026 семейство V4 вышло из превью в общую доступность. Цена API по прайс-листу — $0.435/$0.87 за 1M токенов, эндпоинт совместим одновременно с форматами OpenAI ChatCompletions и Anthropic. Систематических независимых замеров именно V4-Pro пока немного: агентные таблицы, которые публикует сам вендор, в основном сравнивают сборки внутри линейки.

GPT-5.5Доступна
🇺🇸 OpenAIПроприетарнаяФронтир

Флагман OpenAI весны 2026: вышел в ChatGPT 23 апреля 2026 (варианты Thinking и Pro), в API — на день позже, 24 апреля, из-за отдельного контура защит для API. Контекст 800 тыс. токенов на входе, до 128 тыс. на выходе; цена $3/$20 за 1 млн токенов. По данным вендора, на Terminal-Bench 2.0 — 82,7%, на FrontierMath — 51,7% (уровни 1–3) и 35,4% (уровень 4), на закрытом наборе экспертных задач по кибербезопасности — 71,4%. 5 мая 2026 GPT-5.5 Instant заменил GPT-5.3 Instant как модель по умолчанию для бесплатных пользователей. Из инженерных курьёзов: OpenAI признала унаследованный с обучения GPT-5.1 сбой reward-сигналов, из-за которого модель навязчиво поминала гоблинов и гремлинов; проблемный пресет личности отозвали. С выходом GPT-5.6 в июле 2026 остаётся в API, но по соотношению цена/качество проигрывает ярусу Terra.

Claude Mythos 5Превью
🇺🇸 AnthropicПроприетарнаяФронтир

Закрытая версия Fable 5: та же базовая модель Mythos-класса, но с ослабленными предохранителями — для проверенных организаций в защитной кибербезопасности и исследованиях. Раскрыта 7 апреля 2026 как Claude Mythos Preview; 9 июня участников Project Glasswing перевели на Mythos 5. С 12 июня доступ был приостановлен экспортным предписанием США, с 1 июля восстановлен только для одобренных американских организаций. Цена $10/$50 за 1M токенов, модальности — текст и код; контекст и параметры вендор не раскрывает, публичных бенчмарков нет. Общедоступного API у модели нет.

Gemma 4 31BДоступна
🇺🇸 Google DeepMindOpen source

Старшая плотная модель семейства Gemma 4, вышедшего 2 апреля 2026 года четырьмя размерами (E2B, E4B, 26B MoE, 31B dense); с этого поколения Gemma впервые перешла на лицензию Apache-2.0. Позиционируется как открытая модель для продвинутого рассуждения на персональных компьютерах. На момент релиза занимала третье место среди открытых моделей в текстовом рейтинге LMArena — по данным вендора. 31 млрд параметров, модальности — текст, изображения, код; размер контекста в справочниках не зафиксирован. Веса доступны на Hugging Face и в AI Studio.

Mistral Medium 3.5Доступна
🇫🇷 Mistral AIОткрытые веса

Плотная модель Mistral AI на 128B параметров, объединившая в одних весах чат, рассуждение и агентный кодинг: она заменила сразу Mistral Medium 3.1, Magistral и Devstral 2. Релиз датирован 18 марта 2026 года; контекст 256K, вывод до 32K токенов, вход мультимодальный (текст и изображения), усилие рассуждения настраивается на каждый запрос, срез знаний — 31 октября 2025 года. По данным вендора — 77.6% на SWE-bench Verified и 91.4% на τ³-Telecom; независимых замеров в справочниках пока нет. Веса открыты на Hugging Face, лицензия — модифицированная MIT с исключением для компаний с крупной выручкой.

GPT-5.4Доступна
🇺🇸 OpenAIПроприетарная

Массовый релиз 5 марта 2026: MoE-архитектура, выделенный режим Thinking, контекст 400 тыс. токенов, вывод до 100 тыс., срез знаний — 31 октября 2025. Варианты mini и nano добавлены 17 марта 2026; mini открыт бесплатному ярусу ChatGPT, nano — только в API. Результаты: SWE-bench Verified 74,9%, GPQA Diamond 86,5%, OSWorld-Verified 75,0% против 47,3% у GPT-5.2 — цифры вендора. OpenAI также заявляла сокращение фактических ошибок на 33% относительно GPT-5.2 и встроенный computer use; независимых подтверждений нет. Точные цены API в справочниках не зафиксированы; в отзывах отмечали высокую стоимость mini/nano относительно аналогов поколения GPT-5.

Gemini 3.1 ProДоступна
🇺🇸 Google DeepMindПроприетарнаяФронтир

Действующий флагман Google, выпущенный 19 февраля 2026 года как промежуточный апгрейд Gemini 3 Pro — первый случай использования номера «.1» в линейке Gemini. MoE-архитектура, контекст 2 млн токенов, вывод до 65,5 тыс. токенов, срез знаний — сентябрь 2025, нативная работа с инструментами. По данным вендора, набирает 77,1% на ARC-AGI-2 — более чем вдвое выше Gemini 3 Pro — и 84,2% на MMMU; независимых подтверждений в справочниках нет. Доступен в Gemini API, Vertex AI, приложении Gemini, NotebookLM и Gemini CLI. Пока Gemini 3.5 Pro не вышла из партнёрского тестирования, остаётся самой сильной общедоступной моделью Google.

Claude Opus 4.6Доступна
🇺🇸 AnthropicПроприетарная

Флагман Anthropic начала 2026 года, релиз 5 февраля. Первый Opus с контекстом 1 млн токенов — в бете: базовое окно 200K, вход свыше 200K тарифицируется $10/$37,5 при стандартной цене $5/$25. Ставка на автономный многофайловый кодинг и computer use: вендор заявлял 72,5% на OSWorld и 76% точности needle-ретривала на 1M контексте (против 18,5% у Sonnet 4.5); независимых подтверждений этих цифр нет. Срез знаний — 31 августа 2025. Практически вытеснен Opus 4.8 и Opus 5, но остаётся доступен в API и на облачных платформах.

GPT-5.3-CodexДоступна
🇺🇸 OpenAIПроприетарная

Специализированная модель для агентной разработки: релиз 5 февраля 2026, продолжение линейки Codex после GPT-5.2-Codex (декабрь 2025). Контекст 400 тыс. токенов на входе и до 128 тыс. на выходе — под длинные сессии работы с репозиторием. Цена $1,25/$10 за 1 млн токенов, заметно ниже универсальных флагманов. Заявленный фокус — качество кода и автономные инженерные циклы; публичных бенчмарков в справочниках на момент составления карточки не зафиксировано.

OLMo 3 Think 32BДоступна
🇺🇸 Allen Institute for AI (Ai2)Open source

Полностью открытая reasoning-модель Allen Institute for AI: плотные 32B, у которых опубликованы не только веса, но и код обучения, данные (корпус Dolma 3 объёмом около 6T токенов), промежуточные чекпоинты и вся методика пост-тренинга. Семейство OLMo 3 анонсировано 20 ноября 2025 года, релиз Think 32B в справочниках датирован 15 декабря 2025-го; лицензия Apache 2.0. Модель генерирует явные цепочки рассуждений и позиционируется как воспроизводимая база для исследований RL поверх открытого пайплайна. Позднее Ai2 выпустила усиленный вариант Olmo 3.1 32B Think с удлинённой RL-стадией и приростом на AIME и IFBench.

GPT-5.2Доступна
🇺🇸 OpenAIПроприетарная

Рабочая модель OpenAI конца 2025 года: релиз 11 декабря 2025, контекст 400 тыс. токенов, вывод до 128 тыс., на входе текст и изображения. Цена $2/$12 за 1 млн токенов. Позиционировалась как усиление базовой линии по рассуждениям, коду, следованию инструкциям и длинному контексту; публичных бенчмарков в трекерах не зафиксировано. К середине 2026 фактически вытеснена GPT-5.4 и ярусами GPT-5.6, но остаётся доступной в API. Полезна как историческая точка отсчёта: именно с ней OpenAI сравнивала GPT-5.4 по фактическим ошибкам и computer-use.

Amazon Nova 2 LiteДоступна
🇺🇸 AmazonПроприетарная

Массовая reasoning-модель второго поколения линейки Nova, общедоступна в Amazon Bedrock с 2025-12-02 через глобальный cross-region inference. Контекст до 1 млн токенов, три уровня интенсивности размышления (low/medium/high), встроенные инструменты — code interpreter и web grounding, есть поддержка удалённых MCP-серверов и structured output. Мультимодальный ввод: текст, изображения, видео, документы. Цена на Bedrock — $0.30/$2.50 за 1 млн токенов ввода/вывода. Amazon позиционирует модель под чат-ботов поддержки, обработку документов и автоматизацию бизнес-процессов.

Amazon Nova 2 ProПревью
🇺🇸 AmazonПроприетарная

Старшая модель поколения Nova 2: анонсирована 2025-12-02 и по состоянию на август 2026 остаётся в превью — ранний доступ идёт через программу Amazon Nova Forge. Заявленные сценарии — многодокументный анализ, video reasoning и миграции софта; как и Lite, поддерживает extended thinking с тремя уровнями интенсивности, встроенные инструменты (code interpreter, web grounding) и контекст до 1 млн токенов. Цены не опубликованы, архитектура и параметры не раскрыты. Независимых бенчмарков нет.

Mistral Large 3Доступна
🇫🇷 Mistral AIОткрытые весаФронтир

Флагман Mistral AI и крупнейшая открытая модель компании: разреженный MoE на 675B параметров с 41B активных, обученный с нуля на 3000 NVIDIA H200. Выпущен 2 декабря 2025 года в составе семейства Mistral 3 — вместе с плотными моделями 14B/8B/3B — под лицензией Apache 2.0. Вход мультимодальный (текст и изображения), контекст 256K, вывод до 32K токенов; срез знаний — 31 октября 2025 года. Веса опубликованы на Hugging Face в BF16 и NVFP4; FP8-вариант разворачивается на одной ноде B200 или H200.

Claude Haiku 4.5Доступна
🇺🇸 AnthropicПроприетарная

Младшая модель линейки Claude, релиз 15 октября 2025. Контекст 200K токенов, цена $1/$5 за 1M токенов. Anthropic позиционирует её как уровень, близкий к Sonnet 4.5, при кратно меньшей цене и большей скорости; на SWE-bench Verified вендор заявлял 73,3%. Целевые сценарии — чувствительные к задержке: клиентские боты, массовая классификация и экстракция, суб-агенты в многоагентных оркестрациях. Параметры не раскрыты.

gpt-oss-120bДоступна
🇺🇸 OpenAIОткрытые веса

Открытая reasoning-модель OpenAI: MoE на 117 млрд параметров всего при 5,1 млрд активных на токен, релиз 5 августа 2025 под лицензией Apache-2.0. Контекст 128 тыс. токенов, работает с текстом и кодом; веса опубликованы на Hugging Face, техотчёт — на arXiv (2508.10925). По заявлению вендора, модель рассчитана на запуск на одном GPU с 80 ГБ памяти. Первый релиз открытых весов OpenAI со времён GPT-2 (2019); вышла в паре с младшей gpt-oss-20b для локальных сценариев.

Falcon-H1 34BДоступна
🇦🇪 Technology Innovation InstituteОткрытые веса

Старшая модель гибридной линейки Falcon-H1 от Technology Innovation Institute (Абу-Даби): в каждом блоке параллельно работают обычное внимание и Mamba-2 (SSM), причём соотношение головок двух типов настраивается. 34B параметров, контекст 256K, вывод до 16K токенов, срез знаний — 31 марта 2025 года. По данным вендора, инструкт-версия сопоставима с моделями класса 70B, а на длинных последовательностях даёт до 4x по входной и до 8x по выходной пропускной способности против Qwen2.5-32B; независимые сводные замеры в справочниках не зафиксированы. Нативно поддерживает 18 языков, включая русский. Линейка анонсирована в мае 2025 года, полный технический отчёт вышел в конце июля 2025-го; лицензия Falcon LLM License 2.0 на базе Apache 2.0.