Что такое независимый рейтинг моделей и зачем он нужен
Когда компания выпускает новую нейросеть, она сама выбирает, на каких задачах её показать. Поэтому в отрасли есть отдельный жанр: независимое тестирование.
Artificial Analysis — лаборатория, которая гоняет модели по единой открытой методике без участия разработчиков. Два её рейтинга упоминаются в этой новости:
- Intelligence Index, общий балл: математика, естественные науки, программирование, работа с длинными документами, фактические знания;
- Coding Agent Index, как модель работает внутри агентских сред вроде Codex или Claude Code, то есть когда она не отвечает одним сообщением, а сама выполняет цепочку шагов.
Заодно фиксируются расход токенов, стоимость задачи и скорость.
Токен — кусочек текста, которым модель считает объём работы: примерно 2–3 символа русского текста. Цену за миллион токенов платит тот, кто обращается к модели через API, то есть встраивает её в свой продукт. Входом называют то, что вы отправили, а выходом то, что модель написала в ответ.
И ещё один термин из этой истории — галлюцинация: ответ, который звучит уверенно, но не соответствует действительности. Именно поэтому доля галлюцинаций в тестах важнее красивых обещаний.
Что произошло
OpenAI представила Astra и заявила, что это лучшая на сегодня модель для разработки программного обеспечения и «новый рубеж в использовании компьютеров и браузеров». Президент компании Грег Брокман назвал её самой интеллектуальной и наиболее согласованной моделью компании. Обучали её более чем на 100 000 графических ускорителей.
Дальше начались проблемы с раздачей. Первый этап развёртывания охватил только корпоративных клиентов платформы Daybreak, специалистов по кибербезопасности. Массовый доступ подписчикам платных тарифов обещали в течение нескольких дней, задержка вызвала раздражение у тех, кто уже платил за премиальные планы.
Сэм Альтман извинился публично: «Думаю, мы совершенно всё испортили при запуске» — так он вспоминал релиз GPT-5, но и нынешний запуск признал проблемным. В качестве компенсации OpenAI пообещала ежедневно начислять пользователям по одному сохранённому сбросу лимитов, который можно потратить позже.
Через несколько дней доступ открыли: модель появилась у пользователей тарифов Plus, Pro, Enterprise и Business Premium, в ChatGPT Work и Codex, а также через API.
Что показали независимые тесты
Здесь и начинается интересное, потому что цифры расходятся с формулировками анонса.
| Показатель | GPT-6 Astra | С чем сравнить |
|---|---|---|
| Intelligence Index | 61 балл | у GPT-5.6 Sol 61, у Claude Fable 5.1 66, у Meta Muse Spark 1.3 62 |
| Coding Agent Index | 67 баллов (в Codex) | лидер Fable 5.1 в Claude Code с 70 баллами |
| Цена входа | $10 за 1 млн токенов | было $4 |
| Цена выхода | $50 за 1 млн токенов | было $20 |
| Расход токенов | около трети от GPT-5.6 Sol | около пятой части от Claude Opus 5 |
| Галлюцинации (AA-Omniscience) | 51% | было 92% |
Как это читать. По общему баллу новая модель не обошла собственную предшественницу и уступила конкурентам. Но она стала заметно экономнее по токенам: там, где раньше модель писала длинное рассуждение, теперь укладывается в треть объёма.
Из-за этого картина по деньгам получается разной в зависимости от задачи. В работе с кодом при максимальных усилиях Astra обходится примерно как предшественница, оказываясь на два пункта выше в рейтинге, и вдвое дешевле, чем Claude Fable 5 при равном результате. А вот в общих задачах экономия только 10% выходных токенов, и в расчёте на задачу Astra выходит на 75% дороже, чем Claude Fable 5.
По отдельным тестам движение тоже разнонаправленное: в AA-Briefcase (объёмные проекты с тысячами файлов) модель прибавила около 80 баллов Elo, в GDPval-AA v2 (практические задачи 44 профессий) потеряла те же 80. В Humanity's Last Exam прибавила шесть баллов, в тестах на клиентскую поддержку, научный код и анализ больших документов, потеряла два-три.
Отдельная тема — прозрачность. В Astra применён метод логического вывода, который называют непрозрачной рекурсией: он скрывает цепочку размышлений, по которой обычно проверяют, как модель пришла к решению. Главный научный сотрудник компании Якуб Пачоцки назвал долю непрозрачности естественным результатом развития модели, но исследователей это беспокоит.
Проверили сами: одна задача, две модели
Независимые рейтинги считают баллы на олимпиадных задачах. Мы замерили другое: изменится ли результат на обычной работе. Прогон сделан 8 сентября 2026 года.
Задача. Разбор звонка менеджера по чек-листу из 8 пунктов: поздоровался, выяснил задачу, спросил бюджет и сроки, отработал возражение по цене, назначил следующий шаг, взял контакт. На входе расшифровка разговора, на выходе таблица с баллами, цитатами и оценкой риска сделки. Тот же промпт, та же расшифровка, оба запроса подряд.
| Модель | Время | Токены | Стоимость запроса |
|---|---|---|---|
| GPT-6 Astra | 14,5 с | 434 вход, 675 выход | 0,038 $ |
| Claude Sonnet 5 (вдвое дешевле по тарифу) | 19,1 с | 641 вход, 1 657 выход | 0,018 $ |
Что получилось по содержанию. GPT-6 Astra поставила звонку 4 балла из 16, вторая модель — 3 из 16. Расхождение ровно в одном пункте чек-листа: за выявление задачи клиента первая дала один балл, вторая ноль. Остальные оценки, цитаты и вывод «риск потери сделки высокий» совпали.
Что это значит. На типовой задаче бизнеса — разобрать текст по заданным правилам и вернуть структуру — флагман не дал прироста качества, но удвоил счёт. Он отвечает быстрее и короче, вторая модель пишет подробнее и дешевле.
🪤 Один замер это не рейтинг моделей. Он показывает другое: прежде чем переводить поток на новый флагман, прогоните на нём свою реальную задачу и сравните с тем, что уже работает.
Полный прайс новой модели
| Режим | Вход за 1 млн токенов | Выход за 1 млн токенов |
|---|---|---|
| Обычный, короткий контекст | 10 $ | 50 $ |
| Обычный, длинный контекст | 20 $ | 75 $ |
| Чтение из кэша | 1 $ | — |
| Запись в кэш | 12,5 $ | — |
| Пакетный режим | вдвое дешевле | вдвое дешевле |
| Ускоренный режим Fast | вдвое дороже | вдвое дороже |
Для агентов и ботов важнее всего третья строка: если в каждый запрос уходит одна и та же большая инструкция, основная часть счёта приходится на повторное чтение, а оно стоит доллар вместо десяти.
Что это значит для тех, кто работает из России
Прямо: ChatGPT из России напрямую не открывается. Подписку тоже нельзя оплатить российской картой. Значит, для большинства читателей эта новость скорее ориентир, куда движется рынок и что происходит с ценами.
Отдельно про доступ через шлюзы. Мы проверили каталоги моделей у двух посредников, через которых работает наша платформа: у международного GPT-6 Astra уже есть вместе с ускоренной версией, у российского пока нет. Перед тем как строить процесс на новой модели, проверьте, что она есть именно у вашего поставщика доступа.
Практическая часть выглядит так:
- если вы платите за доступ через посредников, рост цены за миллион токенов в 2,5 раза дойдёт и до вас, обычно с задержкой в неделю-другую;
- если вы встраиваете модель в продукт, сравнивать надо не цену за токен, а стоимость решённой задачи: экономная по токенам модель при более высокой цене иногда выходит дешевле, а иногда наоборот, и это считается на своих сценариях;
- если вы просто пишете тексты и разбираете документы, гнаться за флагманом смысла нет: в общих задачах разрыв между моделями сейчас меньше, чем разрыв в цене.
Какие модели доступны из России без ухищрений и что они реально умеют, мы разбирали в обзоре нейросетей 2026 года, а способ обращаться к разным моделям через один доступ, читайте в материале про OpenRouter.
Что сделать на этой неделе
- Выпишите три задачи, ради которых вы вообще платите за нейросеть.
- Прогоните каждую на той модели, которой пользуетесь сейчас, и на одной доступной альтернативе — с одинаковым заданием.
- Сравните не «понравилось или нет», а число правок, которое понадобилось, чтобы довести ответ до рабочего.
- Посчитайте стоимость решённой задачи целиком: цена за миллион токенов сама по себе ничего не говорит.
- Если пользуетесь моделью через посредника, уточните, когда у него меняются тарифы вслед за первоисточником.
Частые вопросы
GPT-6 Astra умнее предыдущей версии?
По независимому рейтингу Intelligence Index — нет: 61 балл против 61 у GPT-5.6 Sol. Заметно лучше она стала в работе с кодом и в расходе токенов.
Почему тогда её называют прорывом?
Компания делает акцент на возможностях в кибербезопасности, работе с браузером и разработке программ. Общий балл остаётся одной метрикой, а не вся картина, но и о «революции» она не говорит.
Насколько подорожал доступ?
Миллион входных токенов подорожал с 4 до 10 долларов, миллион выходных с 20 до 50. Скидка 90% за чтение из кеша и надбавка 25% за запись в кеш остались прежними.
Что такое сохранённый сброс лимитов?
Компенсация за задержку доступа: ежедневно пользователю начисляется одна возможность обнулить исчерпанную квоту, использовать её можно позже.
Стоит ли переходить на новую модель?
Это решается на ваших задачах. В коде и агентских сценариях выигрыш есть, в общих задачах при более высокой цене не факт: проверяйте на своих примерах.
