Начало сентября 2026 года стало переломным моментом, когда рейтинг ведущих языковых моделей пришлось полностью пересмотреть. Anthropic представила Fable 5.1 и ограниченную версию Mythos 5.1, Meta обновила Muse Spark до версии 1.3, Google выпустила Gemini 3.8 Flash, а Alibaba представила Qwen3.8-Max. При этом такие модели, как GPT-5.6 Sol, Grok 4.6, Kimi K3, GLM-5.3 и DeepSeek V4 Pro, не исчезли, продолжая активно конкурировать с новинками. Составление традиционного рейтинга «от умнейшей к наименее продуктивной» сегодня крайне затруднительно. Современные модели работают в нескольких режимах глубины анализа, причем разница между low, high и max в одних и тех же тестах может достигать десяти и более баллов. Ключевыми параметрами стали не только скорость, но и расход токенов, стоимость обработки длинного контекста, поддержка изображений, качество работы с инструментами, а также способность самостоятельно выполнять сложные последовательные действия. Поэтому рынок сегодня представляет собой несколько пересекающихся гонок. Fable 5.1 претендует на лидерство в сложных рассуждениях, GPT-5.6 Sol и Grok 4.6 предлагают сопоставимое качество по более доступной цене. Muse Spark 1.3 неожиданно вышла в число лидеров по соотношению возможностей и стоимости, а Gemini 3.8 Flash делает ставку на скорость и мультимодальность. К тому же Kimi, GLM, Qwen и DeepSeek практически стерли границы между китайскими и американскими моделями. Для объективного сравнения удобно использовать независимый Artificial Analysis. Этот Intelligence Index объединяет результаты тестов по знаниям, программированию, научным рассуждениям, работе с инструментами и сложным агентным задачам. Методика более надежна, чем таблицы разработчиков, поскольку модели тестируются в одинаковых условиях. Однако баллы нельзя воспринимать как коэффициент интеллекта. Например, результат 66 против 61 не означает, что первая модель «умнее на восемь процентов». Индекс отражает средний результат конкретного набора испытаний. На практике при написании статьи, анализе бухгалтерских документов, верстке сайта или поиске ошибок в корпоративном приложении расстановка может быть иной. Еще сильнее ситуацию усложняют режимы рассуждения. GPT-5.6 Sol получает около 61 балла в max, но 59 в xhigh и 57 в high. Fable 5.1 достигает 66 только на максимальном уровне. Gemini 3.8 Flash получает 59 в high, 57 в medium и 52 в low. Сравнивать модели без учета режима работы примерно так же бессмысленно, как сравнивать автомобили, не сообщая мощность двигателя. На начало сентября 2026 года верхняя часть рейтинга выглядит необычно плотной. После Fable 5.1 разница между несколькими флагманами составляет всего несколько баллов. При этом дорогая модель не всегда выполняет работу дешевле. Некоторые системы генерируют больше промежуточного текста, дольше рассуждают или чаще обращаются к внешним инструментам. Текущие лидеры по версии Artificial Analysis: | Модель | Artificial Analysis | Контекст | Цена API за 1 млн токенов, вход / выход | Статус | |—————————-|———————|————|——————————————|———————| | Claude Fable 5.1, max | 66 | 1 млн | $10 / $50 | доступна | | Claude Opus 5, max | 63 | 1 млн | $5 / $25 | доступна | | Muse Spark 1.3, max | 62 | 1 млн | не объявлена | ограниченный доступ | | GPT-5.6 Sol, max | 61 | ~1,05 млн | $4 / $20 | доступна | | Grok 4.6, high | 61 | 500 тыс. | $2 / $6 | доступна | | Muse Spark 1.3, xhigh | 61 | 1 млн | $1,25 / $4,25 | доступна | | Kimi K3, max | 60 | ~1 млн | $3 / $15 | открытые веса | | GLM-5.3, max | 60 | до 1 млн | $1,40 / $4,40 | открытые веса | | Gemini 3.8 Flash, high | 59 | ~1,05 млн | $0,75 / $3,75 | доступна | | Qwen3.8-Max | 58 (предыдущая версия) | 1 млн | ~$2 / $6 | обновлена до 0902 | | DeepSeek V4 Pro 0813, max | 53 | 1 млн | $0,66–1,32 / $1,98–3,96 | открытые веса | Некоторые нюансы таблицы: — Для обновленной Qwen3.8-Max-0902 еще нет полноценного независимого тестирования, поэтому указаны данные предыдущей версии. — У Muse Spark 1.3 максимальный режим пока доступен ограниченному числу пользователей, а общедоступный xhigh получает 61. — Для Grok 4.6 лучший результат показывает high, тогда как xhigh неожиданно оказался ниже. Цены также требуют пояснений. Тариф Gemini 3.8 Flash временно снижен до конца 2026 года. GPT-5.6 Sol также продается по временно уменьшенной цене. У DeepSeek стоимость меняется в зависимости от времени суток. Grok 4.6 при запросах длиннее 200 тысяч токенов дорожает вдвое, до $4 за миллион входных и $12 за миллион выходных токенов. Простая колонка «цена API» скрывает половину реальной экономики. Fable 5.1 сейчас занимает первое место в независимом Intelligence Index с результатом 66 в максимальном режиме. Модель особенно сильна в длительных агентных задачах, программировании, научной работе и профессиональном анализе. Anthropic сохранила контекст на уровне миллиона токенов и базовый тариф $10 за миллион входных и $50 за миллион выходных токенов. Однако первая строчка рейтинга требует уточнения. Artificial Analysis тестировала Fable 5.1 с включенным серверным механизмом подстраховки Anthropic. Когда защитная система считала запрос чувствительным, часть работы переходила к Claude Opus 4.8 или Opus 5. Около 4% выходных токенов в тестах пришлись на такой маршрут. Поэтому 66 баллов отражают поведение производственной системы Fable 5.1, а не абсолютно изолированной модели. Anthropic одновременно резко снизила цену чтения уже закэшированного контекста до $0,25 за миллион токенов. Для агентных систем, которые снова и снова перечитывают большой проект, документацию или историю работы, скидка заметно меняет итоговую стоимость. При обычном прямом запросе без повторного контекста Fable все равно остается одним из самых дорогих вариантов. Mythos 5.1 часто ошибочно представляют как более мощную версию Claude. Согласно описанию Anthropic, Fable 5.1 и Mythos 5.1 используют одну базовую модель. Различаются прежде всего защитные ограничения. Mythos разрешает больше профессиональных операций в кибербезопасности и биологических исследованиях, где общедоступная Fable может отказать или передать задачу другой модели. Mythos 5.1 нельзя просто выбрать в обычной подписке Claude. Доступ выдают проверенным организациям через специальные программы, причем на старте круг пользователей и география ограничены. Поэтому включать Mythos в стандартный рейтинг потребительских моделей некорректно. Для большинства людей реальный выбор внутри Anthropic проходит между Fable 5.1 и более дешевой Opus 5. GPT-5.6 Sol не возглавляет общий рейтинг, но остается одним из наиболее сбалансированных флагманов. В max модель получает 61 балл, поддерживает примерно миллион токенов контекста, изображения, поиск, работу с файлами, функции и управление компьютером. Максимальный ответ достигает 128 тысяч токенов. Временный тариф составляет $4 за миллион входных и $20 за миллион выходных токенов. Интереснее всего у GPT-5.6 не сама цифра 61, а расход ресурсов. В независимых тестах Sol использовала около 70 миллионов выходных токенов на весь набор Intelligence Index. Fable 5.1 в максимальном режиме потребовалось примерно вдвое больше. Поэтому более высокая цена отдельного токена не всегда делает модель дороже на уровне законченной задачи, а более высокий балл не гарантирует лучшей экономической эффективности. Grok 4.6 находится на том же уровне 61, но стоит $2 за миллион входных и $6 за миллион выходных токенов при обычном контексте. xAI сильно улучшила продолжительную работу с инструментами, терминалом и программными проектами. Главный компромисс связан с контекстом на 500 тысяч токенов и отдельным тарифом для запросов свыше 200 тысяч токенов, где стоимость удваивается. Самым неожиданным участником верхней группы стала Meta. Muse Spark 1.3 в доступном режиме xhigh получает 61 балл при цене $1,25 за миллион входных и $4,25 за миллион выходных токенов. Независимые измерения также показывают очень высокую скорость генерации. Модель принимает текст, изображения и видео, а контекст достигает миллиона токенов. Максимальная Muse Spark 1.3 получает около 62 баллов, однако Meta пока дает такой режим ограниченному числу партнеров и не объявила обычную цену. Поэтому ставить 62 рядом с полностью доступными моделями без оговорки было бы нечестно. Для практического выбора интереснее xhigh, который уже конкурирует с Sol и Grok по общему индексу, но обходится дешевле. Google продолжает развивать Flash не как урезанный вариант флагмана, а как самостоятельную модель для больших рабочих нагрузок. Gemini 3.8 Flash принимает текст, изображения, видео, звук и PDF, поддерживает 1 048 576 входных токенов и до 65 536 выходных. Есть три уровня рассуждения: low, medium и high. В режиме high Gemini получает 59 баллов. От Fable разрыв выглядит заметным, от GPT-5.6 Sol и Grok уже небольшим. При этом независимые тесты фиксируют скорость свыше 300 выходных токенов в секунду, а временная цена составляет всего $0,75 за миллион входных и $3,75 за миллион выходных токенов. После окончания льготного периода тариф должен вырасти вдвое. Для обработки больших массивов документов, мультимедийных архивов, видео, массовых запросов и быстрых агентов Gemini может оказаться рациональнее лидера рейтинга. Задача, где Fable дает несколько дополнительных процентов качества, но работает дольше и стоит во много раз дороже, не всегда заслуживает Fable. При больших объемах даже небольшая разница в цене токена быстро превращается в бюджет сервера или зарплату сотрудника. Kimi K3 показывает, насколько быстро изменился рынок моделей с открытыми весами. В максимальном режиме система получает 60 баллов, всего на один меньше GPT-5.6 Sol и Grok 4.6. Архитектура содержит около 2,8 трлн параметров, но при обработке каждого токена активируется примерно 104 млрд. Контекст находится около миллиона токенов, поддерживаются текст и изображения. Слово «открытая» здесь не означает «дешевая для запуска дома». Полные веса Kimi K3 требуют огромного объема памяти и серьезной вычислительной инфраструктуры. Первый API Moonshot тоже не рекордно дешевый, около $3 за миллион входных и $15 за миллион выходных токенов. Независимые измерения показывают еще один недостаток: относительно низкую скорость первой стороны. У сторонних поставщиков ускоренное исполнение может быть значительно быстрее. GLM-5.3 от Z.ai выглядит еще интереснее по соотношению стоимости и качества. Максимальный режим получает 60 баллов при цене около $1,40 за миллион входных и $4,40 за миллион выходных токенов. Веса опубликованы. При этом независимое тестирование выявило любопытную особенность: модель чрезвычайно многословна. На полный Intelligence Index GLM-5.3 потратила примерно 170 миллионов выходных токенов, намного больше большинства прямых конкурентов. Так появляется хороший пример того, почему прайс-лист иногда вводит в заблуждение. Модель с дешевым выходным токеном может написать в два раза больше текста и уничтожить предполагаемую экономию. Для агентных систем нужно измерять не цену миллиона токенов, а стоимость успешно законченной рабочей задачи. Alibaba в начале сентября обновила Qwen3.8-Max до снимка 0902. Разработчики усилили программирование, работу с большими программными репозиториями и совместные агентные сценарии. Контекст остался на уровне миллиона токенов, а API сохранил прежний порядок цен. Внутренние результаты Alibaba заметно выросли, однако полноценного независимого пересчета Intelligence Index для нового снимка на момент подготовки материала еще нет. Приписывать обновленной версии прежние 58 баллов как новый измеренный результат нельзя. С Qwen есть еще одна тонкость. Alibaba действительно опубликовала веса Qwen3.8-2.4T-A95B, модели с 2,4 трлн параметров и примерно 95 млрд активных параметров. Но облачная Qwen3.8-Max представляет собой расширенный сервис на ее основе с дополнительными возможностями, включая зрение, миллионный контекст по умолчанию и встроенные инструменты. Поэтому «веса Qwen3.8 открыты» и «Qwen3.8-Max целиком можно скачать» не совсем одно и то же. DeepSeek V4 Pro 0813 по общему индексу отстает от верхней группы и получает около 53 баллов. Зато модель остается интересной для компаний, которым нужны открытые веса, миллионный контекст и низкая стоимость собственного API. DeepSeek использует динамический тариф. В непиковые часы V4 Pro стоит около $0,66 за миллион входных и $1,98 за миллион выходных токенов, в пик цены удваиваются. Еще недавно выбор выглядел довольно простым: лучшее качество давали закрытые американские модели, а открытые системы выбирали ради контроля, приватности или низкой цены. Kimi K3 и GLM-5.3 сломали такую схему. Обе модели достигли 60 баллов и практически подошли к GPT-5.6 Sol, Grok 4.6 и Muse Spark 1.3. Но термин «открытая модель» требует аккуратности. Разработчик может открыть веса, сохранив собственную лицензию с ограничениями. Может открыть базовую модель, но оставить улучшенный облачный вариант закрытым. Может разрешить коммерческий запуск, но настолько увеличить размер системы, что самостоятельно обслуживать ее смогут только дата-центры и крупные компании. Поэтому при выборе для собственной инфраструктуры нужно смотреть минимум на четыре вещи: объем весов и активных параметров, лицензию, поддерживаемые движки запуска и реальный объем памяти. Kimi K3 и Qwen3.8 на несколько триллионов параметров формально доступны для скачивания, но слово «локально» применительно к ним означает стойки ускорителей, а не игровой компьютер под столом. Если задача настолько сложна, что стоимость модели почти не имеет значения, Fable 5.1 сейчас выглядит наиболее сильным универсальным вариантом. Разница особенно проявляется в длинных исследованиях, сложном программировании, анализе множества взаимосвязанных материалов и работе, где модель должна сама проверять промежуточный результат. Для постоянной профессиональной работы выбор шире. GPT-5.6 Sol дает сильное сочетание качества, умеренной многословности и развитых инструментов. Grok 4.6 предлагает близкий общий уровень дешевле, пока запрос не переходит в дорогой длинный контекст. Muse Spark 1.3 xhigh особенно интересна там, где требуется много агентной работы и высокая скорость за умеренные деньги. **Рекомендации по выбору модели:** — Максимум качества в сложной работе: Claude Fable 5.1 — Универсальный рабочий флагман: GPT-5.6 Sol или Claude Opus 5 — Сильные агенты дешевле флагманов Anthropic: Muse Spark 1.3 xhigh и Grok 4.6 — Высокая скорость и мультимедийные данные: Gemini 3.8 Flash — Сильные открытые веса: Kimi K3 и GLM-5.3 — Открытые веса с низкой ценой API: DeepSeek V4 Pro — Программирование и большие проекты: Fable 5.1, GPT-5.6 Sol, Grok 4.6, Muse Spark 1.3 и обновленная Qwen3.8-Max — Самостоятельное развертывание: DeepSeek, GLM, Kimi и открытая Qwen3.8, если хватает инфраструктуры Для русского языка готовый рейтинг еще менее надежен. Большинство популярных независимых тестов ориентировано прежде всего на английские задачи, программирование и международные наборы данных. Редакции, юридическому отделу, службе поддержки или российской компании полезнее собрать собственный набор из нескольких десятков реальных документов и сравнить модели вслепую. Причем проверять нужно не только качество ответа. Хороший корпоративный тест включает количество фактических ошибок, соблюдение инструкций, стоимость законченной задачи, время работы, качество русского текста, устойчивость при длинном контексте и способность признавать отсутствие данных. Модель, занявшая второе или третье место в мировом индексе, легко может оказаться первой именно на ваших документах. Главное изменение 2026 года связано не с ростом абстрактного «интеллекта», а с превращением языковых моделей в рабочие системы. Флагман уже должен искать информацию, читать файлы, обращаться к программам, писать и запускать код, замечать ошибку, менять план и доводить работу до готового результата. Разница между моделями все чаще проявляется после двадцатого шага, а не в первом ответе. Одновременно расходы стали гораздо сложнее тарифной таблицы. Fable дорого берет за обычные токены, но резко удешевила чтение кэша. Grok повышает тариф на длинном контексте. DeepSeek меняет цену по времени суток. Gemini временно продается со скидкой. GLM недорога за миллион токенов, но генерирует много текста. Поэтому единственной универсальной цифры «сколько стоит модель» больше нет. На начало сентября 2026 года Fable 5.1 можно назвать лидером независимых комплексных испытаний, но не лучшей моделью вообще для любой задачи. Следующая группа из Claude Opus 5, GPT-5.6 Sol, Grok 4.6 и Muse Spark 1.3 находится достаточно близко, чтобы цена, скорость и инструменты оказались важнее нескольких баллов рейтинга. Gemini 3.8 Flash заняла нишу очень быстрой и дешевой мультимодальной системы, а Kimi K3 и GLM-5.3 доказали, что модели с открытыми весами уже могут находиться практически у самой границы рынка. Поэтому в 2026 году разумный вопрос звучит уже не «какая нейросеть самая умная». Гораздо полезнее выяснить, какая модель чаще завершает конкретную работу без ошибок, сколько времени на нее тратит и во что обходится готовый результат. Через такую проверку громкое название модели довольно быстро превращается в обычную инженерную характеристику.

Над материалами работает команда профессиональных журналистов, политологов, юристов и аналитиков. Мы объединены общей ценностью: слово должно нести ответственность, а не шум. Познакомиться с ключевыми сотрудниками, их биографиями и зонами ответственности можно на странице «Редакция».

0 Комментарий
Межтекстовые Отзывы
Посмотреть все комментарии
© 2026 Все материалы защищены.
wpDiscuz
Exit mobile version