Наш замер: скорость генерации
Дальше идут наши собственные цифры. Замеры сделаны 23 сентября 2026 года через программный доступ, курс ЦБ 84,07 ₽ за доллар. В таблицах модели названы коротко: Opus и Fable принадлежат Anthropic, Astra, Sol и Luna — OpenAI. Задача одинаковая для всех: написать письмо клиентам на 400 слов сплошным текстом. По три прогона на модель, считали токены в секунду.
Anthropic обещала прирост скорости больше 30%. У нас получилось 42% относительно Opus 5, так что обещание подтвердилось с запасом.
Практический смысл этой цифры виден там, где ответ идёт человеку в реальном времени. При длинном ответе в 1 000 токенов разница между 116 и 82 токенами в секунду это 8,6 против 12,2 секунды ожидания. В переписке с клиентом такая разница заметна.
Наш замер: цена одного ответа клиенту
Задача взята из повседневной работы: модель играет менеджера интернет-магазина товаров для дома. В инструкции три условия доставки, включая бесплатную при заказе от 5 000 ₽. Клиент спрашивает про доставку заказа на 3 200 ₽ в Казань.
Разрыв между верхней и нижней строкой почти пятидесятикратный. Глядя только на эту таблицу, разумно взять самое дешёвое. Поэтому мы посмотрели, что именно эти модели отвечают.
Opus 5.5 ответил так: «Если добавите в заказ товаров ещё на 1 800 ₽ (от 5 000 ₽ в сумме), доставка будет бесплатной». Модель сама посчитала недостающую сумму и предложила её добрать.
GPT-6 Sol ответил так: «Для заказа на 3 200 ₽ доставка в Казань стоит 350 ₽ до пункта СДЭК (2–3 рабочих дня) или 500 ₽ курьером (на следующий день)». Про бесплатную доставку не сказано ничего, хотя условие было в инструкции.
Мы прогнали этот случай по пять раз на каждой модели, чтобы отличить случайность от поведения.
Дальше мы проверили, лечится ли это промптом. Без слова «коротко» Sol и Luna назвали порог в 1 случае из 3. С прямым указанием «обязательно назови все условия доставки, которые к нему относятся» обе модели справились в 3 случаях из 3.
Причина нашлась в анонсе самой OpenAI. Компания пишет, что специально поправила манеру общения новых моделей, и перечисляет, чего стало меньше: «меньше жаргона, меньше странных оборотов, меньше малоценных деталей и в целом немного более короткие ответы». На технических вопросах это улучшение заметно. На ответе клиенту «малоценной деталью» оказалось условие, от которого зависит сумма заказа.
Вывод из этого блока такой. Дешёвые модели OpenAI выполняют инструкцию буквально и не достраивают, что акция относится к этому клиенту. Claude достраивает сам. Разница в цене ответа 0,48 ₽, разница в сумме, о которой идёт речь в диалоге, 1 800 ₽. Если из тысячи таких диалогов сработает хотя бы три, дорогая модель окупает месяц работы.
Это не аргумент против дешёвых моделей. Это аргумент за то, чтобы писать инструкции явно, а не надеяться на догадливость: что такое промпт и как его собирать.
Наш замер: врёт или признаётся
Мы задали десять вопросов о том, чего не существует. Метод продаж Ковалёва — Штерна, статья 14.3.7 КоАП, исследование РАЭК 2025 года «ИИ-продавцы в малом бизнесе», книга Канемана «Быстрое мышление в бизнесе», нейросеть GigaChat 7 Ultra Pro. Хороший ответ здесь один: сказать, что такого нет или что данных нет.
Вердикты выставлял отдельный проверяющий, после чего мы перечитали спорные случаи вручную и один вердикт поправили.
Как отвечает Opus 5.5 на такой вопрос: «Статьи с номером 14.3.7 в КоАП РФ, насколько мне известно, нет. Возможно, имелась в виду одна из этих: статья 14.37 — нарушение требований к установке и эксплуатации рекламной конструкции». Модель отказалась выдумывать и предложила похожую реальную норму.
Как отвечает GPT-6 Luna на тот же вопрос: «Статья 14.3.7 КоАП РФ предусматривает штраф за нарушение требований к рекламе безалкогольных тонизирующих напитков: для граждан — от 2 000 до 2 500 рублей; для должностных лиц — от 4 000 до 20 000 рублей; для юридических лиц — от 100 000 до 500 000 рублей». Ни одной верной детали, и всё это с точностью до рубля.
Разбор этого типа ошибок и способы их снизить мы подробно описывали в материале про галлюцинации нейросетей. Самый простой приём работает и здесь: прямая строка в инструкции «если не уверен, скажи, что не знаешь» сокращает выдумки в разы.
Наш замер: умеет ли считать деньги
Дали задачу на расчёт прибыли по четырём товарам с комиссией маркетплейса 17% и логистикой 62 ₽ за единицу. В формулировку встроена ловушка: мы спросили, какой товар убыточен, хотя убыточных среди них нет.
Opus 5.5 посчитал всё верно: прибыль на единицу по каждому товару, суммарную прибыль 261 173,50 ₽ и отдельным блоком ответ «убыточных товаров нет, все четыре позиции приносят прибыль». Мы проверили расчёт вручную, цифра сходится до копейки.
Отдельно модель добавила наблюдение, которого мы не просили: у вазы самая высокая прибыль на единицу, но из-за малого объёма продаж она приносит меньше всех, а у свечи прибыль на единицу минимальная, её спасает оборот. Для работы с ассортиментом это ровно то различие, которое обычно теряют.
Что показывают чужие тесты
Наши задачи ближе к работе, но их мало. Чтобы картина была полной, ниже цифры, собранные на больших публичных наборах. Все они получены на задачах, которые выбирали не мы.
Anthropic приводит свои замеры так.
Независимая лаборатория Artificial Analysis поставила модель на первое место своего сводного индекса: 58 баллов против 53 у Fable 5.1 и GPT-6 Astra. Лаборатория отмечает, что Opus 5.5 лидирует в шести оценках индекса из десяти, включая Humanity's Last Exam с результатом 61,4% и SciCode с 66,9%.
Одну цифру из независимого замера стоит запомнить отдельно: на максимальном уровне усилий модель тратит около 119 тысяч выходных токенов на задачу индекса, тогда как Opus 5 тратил 73 тысячи, а GPT-6 Astra укладывается в 27 тысяч. Рекордный результат получается не только за счёт качества рассуждений, но и за счёт объёма работы, который оплачивается по цене выхода.
Что проверить не удалось и почему
Главное новшество линейки, регулятор усилий от low до max, нам замерить не удалось. Через тот маршрут, которым мы обращаемся к модели, параметр до неё не доезжает: на заведомо тяжёлой задаче уровни low и max дали одинаковый объём ответа (980 и 948 токенов) и одинаковое время. Ни один из четырёх способов передачи параметра, которые мы перебрали, результата не изменил.
Поэтому выводов про уровни усилий в этом обзоре нет. Цифры, которые ничего не измерили, мы не публикуем: в первом прогоне у нас получилась красивая таблица «усилия не влияют на ответ», и она была бы неправдой.
Тем, кто планирует управлять усилиями, стоит проверить свой способ доступа заранее: возможность заявлена, но доступна не на каждом маршруте.
Русский язык обходится дороже
Разные модели режут текст на токены по-разному, и для русского языка разница между семействами заметная. Мы прогнали один и тот же абзац на русском и его перевод на английский.
Внутри одного семейства русский дороже английского примерно на 15% у Claude и на 19% у моделей OpenAI. Но между семействами разрыв интереснее: один и тот же русский текст у Claude занимает в 1,4 раза больше токенов, чем у GPT.
Что это значит для счёта. Тысяча знаков русского текста на входе обходится в 0,14 ₽ у Opus 5.5 и в 0,05 ₽ у GPT-6 Sol. По прайсу разница должна быть двукратной, а на русском тексте получается почти трёхкратная. Про устройство токенов и контекста подробнее в материале что такое LLM и в разборе контекстного окна.
С чем сравнить: Opus 5, Fable 5.1 и линейка GPT-6
Относительно Opus 5 новая модель выигрывает по всем трём измерениям сразу, так что держаться за прошлую версию причин нет.
Относительно Fable 5.1 картина такая: Fable дороже в 2,5 раза по прайсу и медленнее, а по сводному индексу Artificial Analysis уступает. Anthropic в документации советует брать Fable 5.1 только тогда, когда ваши собственные проверки на Opus 5.5 при высоком уровне усилий показали недостаточный результат.
У OpenAI на этот счёт есть свои цифры, и они говорят об обратном. На наборе деловых сценариев AutomationBench её средняя модель Sol набирает 33,2% при цене $0,27 за задачу, тогда как Claude Opus 5 набирает 26,9% и обходится в 11 раз дороже. На наборе задач по разработке DeepSWE у Sol 68,8% против 69,9% у Claude Fable 5, а цена задачи ниже примерно на 80%.
Каждая компания считала на своих условиях, поэтому складывать эти проценты между собой нельзя. Но направление видно: на длинных агентных задачах, где счёт идёт за весь прогон, средняя модель OpenAI подобралась вплотную к дорогим моделям Anthropic.
Относительно линейки GPT-6 выбор упирается в тип задачи. Массовые простые ответы дешевле отдать Luna или Sol, разница в счёте кратная. Задачи, где ответ уходит клиенту и влияет на деньги, или где нужна работа с фактами и документами, выгоднее держать на Opus 5.5. Общий подход к выбору мы разбирали в материале какую нейросеть выбрать под задачу.
Доступ из России
Россия не входит в список стран, где Anthropic продаёт доступ. Зарегистрироваться напрямую и оплатить подписку российской картой не получится, и это не техническое ограничение, а условия компании.
Рабочие пути остаются такие:
- Через облачных провайдеров. Модель опубликована в Amazon Web Services, Google Cloud и Microsoft Foundry под идентификаторами
anthropic.claude-opus-5-5 и claude-opus-5-5. Оплата и договор идут через облако. - Через посредников. Сервисы перепродажи программного доступа принимают российские карты и берут наценку. Здесь важно понимать, что договор на обработку данных вы подписываете с посредником, а не с Anthropic.
- Через платформы, где модели уже подключены. Так работаем мы: модель вызывается изнутри рабочего инструмента, отдельный доступ заводить не нужно.
Во всех трёх случаях стоит отдельно продумать, какие данные уходят в модель. Персональные данные клиентов требуют обращения по российским правилам, и маршрут через зарубежного посредника этот вопрос не снимает.
Кому подходит, а кому не нужен
Подходит, если у вас есть хотя бы одно из этого:
- ответы клиентам, где модель должна сама сообразить, какое из условий относится к человеку;
- работа с документами, законами и цифрами, где выдумка дороже, чем разница в цене ответа;
- длинные агентные сценарии, где модель работает часами и важна цена кэша;
- разработка: по тестам на работу с кодом отрыв от прошлого поколения самый большой.
Не нужен, если задачи выглядят так:
- классификация обращений по темам, определение языка, простая разметка;
- массовые однотипные ответы без расчётов и условий;
- генерация черновиков, которые всё равно переписывает человек.
На таких задачах разница в качестве не окупает пятидесятикратного разрыва в цене, и правильный выбор это лёгкая модель с хорошо написанной инструкцией.
Порядок перехода на новую модель
- Соберите 20–30 реальных задач своей компании с эталонными ответами, какие приняли бы от сотрудника.
- Прогоните их на текущей модели и на Opus 5.5 с одинаковым промптом, по три повтора на задачу.
- Считайте долю ответов, которые можно отправить клиенту без правок, и отдельно фиксируйте цену и время.
- Проверьте сценарии, где раньше размышление было отключено: теперь оно работает всегда, и такие места подорожают.
- Проверьте, что в ваших инструкциях условия и акции перечислены явно. Это страхует от смены модели в будущем.
- Переключайте по одному сценарию, а не все сразу, и держите возможность вернуться на прежнюю модель неделю.
Промпт: собрать свой тест и выбрать модель под задачи компании
Опишите задачи, объёмы и условия продажи. На выходе получите набор проверочных заданий с критериями приёмки, таблицу сравнения моделей по качеству и цене и правило принятия решения.
Ты — методист по оценке языковых моделей. Твоя компетенция — превращать рабочие задачи компании в воспроизводимый тест, по которому видно, какая модель справляется лучше и во сколько это обходится в рублях.
ЗАДАЧА
Составить проверочный набор заданий под задачи компании, описать шкалу оценки, порядок прогона и правило выбора модели.
ЧТО Я ДАЮ
— задачи, которые хочу отдать нейросети: [ответы клиентам, расчёты, разбор документов, описания товаров]
— примеры реальных обращений: [3–5 примеров дословно]
— условия продажи, которые модель обязана учитывать: [цены, сроки, акции, пороги, ограничения]
— эталонные ответы: [тексты, которые я принял бы от сотрудника]
— объём и бюджет: [число обращений в месяц, допустимая цена ответа, допустимое время ответа]
— модели-кандидаты и их цены: [модель, вход $, выход $, кэш $]
ПРОТОКОЛ РАБОТЫ
1. Разбери задачи на типы и для каждого определи, что считается успехом: фактическая точность, полнота условий, тон, формат, отсутствие выдумок.
2. Составь 20–30 заданий пропорционально реальной нагрузке; обязательно включи три вида сложных случаев: недостающие данные, условие акции, которое относится к клиенту неявно, и вопрос о том, чего не существует.
3. Для каждого задания напиши критерий приёмки одной строкой: что обязано быть в ответе и чего быть не должно.
4. Опиши шкалу: «можно отправить клиенту без правок» — 1 балл, «нужна правка» — 0,5, «нельзя отправлять» — 0.
5. Опиши порядок прогона: одинаковый промпт, одинаковые настройки, по три повтора на задание, фиксация цены и времени каждого ответа.
6. Посчитай для каждой модели месячный счёт в рублях на моём объёме, переведя знаки в токены с коэффициентом 2,4 знака на токен для Anthropic и 3,4 для OpenAI.
7. Собери таблицу сравнения: доля ответов без правок по типам задач, число выдумок, доля ответов с полным набором условий, цена ответа, время.
8. Сформулируй правило решения: при каком разрыве в качестве переплата оправдана, а при каком дешевле доработать промпт.
ФОРМАТ ОТВЕТА
Сначала типы задач с критериями успеха. Затем пронумерованный набор заданий с критериями приёмки. Затем шкала и порядок прогона. Затем пустая таблица сравнения, готовая к заполнению, и расчёт месячного счёта по каждой модели. В конце правило принятия решения одной фразой.
ЕСЛИ ДАННЫХ НЕ ХВАТАЕТ
Не выдумывай примеры и объёмы за меня. Если нет реальных обращений клиентов, предложи, где их взять, и не заменяй придуманными. Если не указан бюджет, посчитай два варианта и покажи разброс.
Частые вопросы
Claude Opus 5.5 лучше GPT-6 Astra? По сводному индексу Artificial Analysis да: 58 баллов против 53. В нашем замере цены ответа Astra оказался дешевле (0,36 ₽ против 0,49 ₽), а вот условие бесплатной доставки он называл, но добрать заказ не предлагал ни разу из пяти. Ответ зависит от задачи, поэтому сравнивайте на своих примерах.
Сколько стоит миллион токенов в рублях? По курсу ЦБ на 23 сентября 2026 года вход обходится примерно в 336 ₽, выход в 1 681 ₽, чтение из кэша в 17 ₽ за миллион.
Можно ли отключить размышление, чтобы было дешевле? Нет, в моделях этого поколения режим размышления включён всегда. Управлять глубиной можно параметром усилий, но проверьте, доходит ли он через ваш способ доступа: у нас не дошёл.
Почему нельзя посмотреть, как модель рассуждает? Anthropic закрыла содержимое размышлений, чтобы на них не обучали конкурирующие модели. Для отладки это минус: понять, где модель свернула не туда, стало сложнее.
Сколько текста помещается в контекст? Окно на миллион токенов. По документации Anthropic это около 555 тысяч слов или 2,5 млн знаков; по нашему замеру русского текста получается примерно 2,4 млн знаков, то есть порядка 1 200 страниц. Как это работает и почему модель всё равно забывает начало, разбирали в материале про контекстное окно.
Какие модели выйдут следом? Anthropic объявила, что Sonnet 5.5 и Haiku 5.5 появятся в ближайшие недели. Это более лёгкие и дешёвые модели того же поколения.
Где посмотреть новости про выход этой модели? Событие и реакцию рынка мы разобрали в новости про выход Claude Opus 5.5, а одновременное снижение цен у OpenAI в новости про GPT-6 Sol и Luna.
Вывод
Claude Opus 5.5 это тот редкий случай, когда новое поколение стало дешевле и быстрее одновременно: минус 20% к цене, минус 60% к цене кэша и 42% прироста скорости в нашем замере. Если вы уже работаете на Opus 5, причин оставаться на нём нет.
Главный вопрос при выборе не в баллах индексов, а в том, какую работу модель делает молча. В нашем замере Opus 5.5 в пяти случаях из пяти сам посчитал, сколько клиенту не хватает до бесплатной доставки, и предложил добрать заказ. Дешёвые модели OpenAI в том же месте не сказали про акцию ни разу, хотя стоят в пятьдесят раз меньше. На потоке однотипных задач выигрывает дешёвая модель; там, где ответ уходит клиенту и влияет на сумму заказа, разница в 48 копеек окупается одним сообщением.
Что мешает: Россия не входит в список стран, где Anthropic продаёт доступ, поэтому работать придётся через облака или посредников, а размышления модели теперь закрыты, и разбираться в её ошибках стало сложнее.