Мой замер: русский текст дороже английского
15 сентября 2026 года я отправил один и тот же абзац на русском (1 846 знаков, 279 слов) и его перевод на английский (2 016 знаков, 355 слов) в 8 моделей через API и снял из ответа число токенов, которое каждая насчитала.
Английский абзац длиннее русского и по знакам, и по словам, но токенов на него ушло меньше у всех 8 моделей. На одно русское слово модели тратят от 1,76 до 2,63 токена, на английское от 1,19 до 1,75.
Что из этого следует. Первое: прикидка «1 токен это 4 знака», которую все повторяют вслед за английскими справками, для русского не работает. Считайте 2,5–3,8 знака на токен в зависимости от модели. Второе: одна и та же статья портала на 20 тысяч знаков у Claude Haiku весит 8 429 токенов, у GPT 5 672. Разница в полтора раза при одинаковом тексте, и она напрямую входит в счёт. Третье: при сравнении цен моделей смотреть только на тариф за миллион недостаточно, нужно умножать на то, сколько токенов модель насчитает именно на вашем языке.
Как модель отвечает и почему иногда врёт
Ответ рождается по одному токену. Модель получает весь текст разговора, оценивает вероятности для следующего токена, выбирает один, добавляет его к тексту и повторяет цикл. Ответ на 250 токенов это 250 таких проходов. Никакого «понимания» в человеческом смысле внутри нет, есть очень хорошая статистика языка, накопленная на триллионах прочитанных токенов.
Отсюда главная слабость: галлюцинации, то есть уверенные ответы, которые не соответствуют действительности. OpenAI в исследовании от 5 сентября 2025 года объясняет причину устройством обучения: модели оценивают по доле правильных ответов, и при такой оценке выгоднее угадать, чем сказать «не знаю». В том же материале приведён показательный тест SimpleQA: модель o4-mini воздерживалась от ответа в 1% случаев и ошибалась в 75%, а gpt-5-thinking-mini воздерживалась в 52% и ошибалась в 26%.
Для бизнеса вывод простой. Модель, которая говорит «не знаю», полезнее той, что отвечает всегда. Когда вы пишете инструкцию для агента, фраза «если данных нет, скажи, что уточнишь у менеджера» защищает от большей части проблем. Как это делается на практике, я разбирал в статье что такое промпт.
Откуда у модели знания и где они кончаются
Знания у LLM появляются в 2 этапа. Первый: предобучение, когда модель месяцами читает тексты из интернета, книг и кода и учится предсказывать продолжение. Второй: дообучение, когда люди показывают модели примеры хороших ответов и оценивают её попытки, чтобы она отвечала полезно и безопасно, а не просто продолжала текст.
У обоих этапов есть дата, после которой модель ничего не знает. Производители называют её датой отсечения знаний и публикуют в документации. У Claude Sonnet 5 надёжная дата январь 2026 года, у Claude Haiku 4.5 февраль 2025, у GPT-5.4 nano 31 августа 2025. Всё, что случилось позже, модель может знать только из того, что вы ей дали в запросе, или из подключённого поиска.
Здесь обычно возникает путаница между «модель знает» и «модель может прочитать». Модель не знает цен вашего прайса и правил вашей доставки, но прочитает их, если положить в запрос. На этом устроены все рабочие агенты: инструкция плюс база знаний компании, а сама модель отвечает за язык и логику.
Пять дат, после которых всё изменилось
12 июня 2017. 8 исследователей, в основном из Google, публикуют статью «Attention Is All You Need» с новой архитектурой, трансформером. До неё сети читали текст по слову за шагом, трансформер смотрит на весь текст сразу и решает, какие слова важны для каких. Все нынешние LLM построены на этой идее.
28 мая 2020. OpenAI описывает GPT-3 со 175 миллиардами параметров, в 10 раз больше любой прежней плотной модели. Главный вывод статьи: модель такого размера решает задачи, которым её не учили, по нескольким примерам в запросе.
30 ноября 2022. Выходит ChatGPT, и языковая модель впервые получает интерфейс для всех. Историю компании и человека за ней я разбирал в статье про книгу о Сэме Альтмане.
2023–2024. Появляются открытые модели с весами, которые можно скачать: Llama, Mistral, Qwen, DeepSeek. Как устроен этот рынок и чем открытая модель отличается от закрытой, разобрано в обзоре открытых нейросетей.
2025–2026. Модели учатся рассуждать перед ответом, окна контекста вырастают до миллиона токенов, а в каталоге OpenRouter на 15 сентября 2026 года я насчитал 445 моделей от десятков производителей. Как этот каталог устроен и сколько стоит через него работать, есть в обзоре OpenRouter.
Какие LLM есть в 2026 году
Цены ниже я снял из каталога OpenRouter 15 сентября 2026 года, они совпадают с прайсами производителей на ту же дату. Перевод в рубли по курсу ЦБ на 15 сентября: 84,34 ₽ за доллар.
Зарубежные модели:
Разброс в 75 раз между самой дорогой и самой дешёвой строкой по выходу. При этом на простых задачах, вроде ответа клиенту по прайсу, дешёвые модели справляются, что я покажу в следующем замере.
Российские модели:
Цены Яндекса взяты со страницы тарифов AI Studio с НДС, цены Сбера со страницы тарифов для юрлиц, обновлённой 7 сентября 2026. У Сбера единая цена на вход и выход и минимальный счёт 600 ₽ в месяц при использовании сервиса. Российские модели стоят на уровне зарубежных средней категории, а платить за них можно с обычного расчётного счёта, что для многих компаний перевешивает.
Мой замер: один ответ клиенту у 8 моделей
Цены за миллион токенов мало что говорят о реальном счёте, поэтому я взял типовую задачу. Модель получает роль менеджера интернет-магазина, условия доставки (СДЭК 350 ₽ за 2–3 дня, курьер по Казани 500 ₽ на следующий день, бесплатно от 5 000 ₽) и вопрос клиента: сколько стоит доставка в Казань при заказе на 3 200 ₽. Замер 15 сентября 2026 года, один запуск на модель, цена из отчёта API.
3 наблюдения. Ответ клиенту стоит от 0,8 до 38 копеек, то есть даже самая дорогая модель обходится дешевле минуты работы человека. У Gemini 3 Flash 687 токенов в ответе при коротком тексте: модель рассуждает перед ответом, и эти рассуждения тоже оплачиваются, поэтому «дешёвая по прайсу» модель оказалась дороже Claude Haiku.
И третье, самое важное. GPT-5.4 nano в обоих запусках ответил только про курьера за 500 ₽ и не упомянул СДЭК за 350 ₽, хотя условие лежало в запросе. Клиент получил бы верный, но неполный ответ и переплатил. Остальные 7 моделей назвали оба варианта. Самая дешёвая модель здесь не «чуть хуже», а теряет часть условий, и на задачах с деньгами это дороже любой экономии на токенах.
Что LLM умеет и чего не умеет
Умеет, и это подтверждается ежедневно на тысячах диалогов:
- отвечать на вопросы по вашим документам, если документы лежат в запросе или в базе знаний;
- переписывать текст под тон, длину и аудиторию: письмо, объявление, ответ на отзыв;
- вытаскивать из потока сообщений структуру: имя, телефон, что хочет, когда;
- расшифровывать и пересказывать звонки и встречи, о чём есть отдельный разбор про расшифровку аудио;
- писать и править код, таблицы, формулы;
- вести диалог с клиентом по сценарию и передавать человеку, когда сценарий кончился.
Не умеет, и здесь чаще всего ломаются ожидания:
- знать то, чего нет в запросе: цены, остатки, сроки, вчерашние новости;
- считать надёжно в уме: длинные вычисления лучше отдавать калькулятору или коду, который модель напишет;
- помнить прошлые разговоры, если система вокруг модели их не сохраняет;
- отвечать за результат: юридически и фактически за ответ отвечает компания, которая его отправила.
Отдельно про режим рассуждений. Рассуждающие режимы дают выигрыш на задачах с несколькими шагами: расчёт, проверка договора, план. На простом ответе по прайсу они удлиняют ответ и счёт, как показал Gemini в замере выше.
Открытые, закрытые и российские модели
Закрытая модель живёт на серверах производителя, вы отправляете туда текст и получаете ответ. Открытая модель выкладывается файлами, её можно запустить на своём сервере, и текст никуда не уходит. Цена вопроса: сервер с видеокартой и человек, который его обслуживает.
Для российской компании к этому добавляется вопрос данных. Переписка с клиентами содержит персональные данные, а закон 152-ФЗ требует хранить их в России. Отправка каждого сообщения на зарубежный сервер это как минимум вопрос к юристу. Выходов 3: российские облачные модели Яндекса и Сбера, открытая модель на своём сервере или платформа, которая хранит данные в российском контуре и берёт на себя обезличивание.
Открытые модели из России тоже появляются. 10 сентября 2026 года Яндекс выложил на Hugging Face базовую модель AliceAI-T5-35B-A0.6B под лицензией Apache 2.0: 34,35 млрд параметров, из которых на каждый токен работает около 600 млн. Это та архитектура, на которой построены быстрые ответы Алисы в поиске. Про то, что разрешает и запрещает такая лицензия, есть разбор Apache License 2.0.
Сколько стоит LLM бизнесу: три дороги
Первая дорога: подписка на чат. ChatGPT Plus стоит 23 € в месяц, Pro от 103 €. Подходит, когда моделью пользуется один человек для своих задач. Не подходит, когда модель должна отвечать клиентам 24 часа в сутки, потому что чат не подключается к мессенджерам и CRM.
Вторая дорога: API. Платите за токены по тарифам из таблиц выше, а всё вокруг модели (подключение к каналам, база знаний, история диалогов, передача человеку) пишет ваш разработчик. Дёшево по токенам и дорого по разработке: по моему замеру, ответ клиенту стоит от копейки до 38 копеек, но чтобы эти копейки дошли до клиента в WhatsApp, нужен код, сервер и поддержка.
Третья дорога: платформа, где модель уже подключена к каналам и базе знаний, а вы платите за подписку и за ответы. Мы делаем такую платформу, Ноя: агент собирается в диалоге, подключается к Telegram, WhatsApp, Авито, Max и CRM, данные остаются в российском контуре. Тариф от 990 ₽ в месяц, пробный период 7 дней, а при регистрации по ссылке с портала на счёт приходит 1 000 ₽ вместо 500 ₽. Честные цифры из платформы за август 2026 года: 568 711 ответов ИИ в 115 569 диалогах у 387 компаний, медианная цена ответа клиенту 1,52 ₽, средняя 3,12 ₽. Среднее выше медианы, потому что часть компаний выбирает дорогие модели с длинным контекстом, где один ответ стоит 16 ₽ и больше.
Разница между 1 копейкой по API и 1,5 рублями на платформе это цена всего, что вокруг модели. Если разработчик у вас есть, API выигрывает. Если нет, дешёвый токен сам по себе ничего не решает.
Где LLM уже работает в малом бизнесе
Первое касание в мессенджерах. Клиент пишет в 23:40, агент отвечает по прайсу и записывает на удобное время, утром менеджер видит готовую заявку. Устройство таких сотрудников и сценарии по нишам собраны в гайде по ИИ-сотрудникам.
Звонки. Модель расшифровывает разговор, находит, где менеджер не назвал цену или не предложил следующий шаг, и складывает это в таблицу. Что даёт такой контроль и как его включить, разобрано в статье о речевой аналитике.
Документы. Договор поставщика на 14 страниц читается за минуту, а модель отвечает на вопрос «где здесь штрафы для меня». Юридически проверять всё равно должен человек, но он проверяет 3 пункта, а не 14 страниц.
Контент. Описания товаров, ответы на отзывы, письма. Здесь LLM экономит часы, но требует редактора: без правки тексты получаются одинаковыми у всех, кто пользуется той же моделью.
Во всех 4 случаях модель это только часть решения. Вторая часть: данные компании, подключение к каналам и правила, когда звать человека. Её не купить вместе с моделью, её приходится собирать.
Слова рядом: нейросеть, ИИ, агент, RAG
Нейросеть это способ устройства программы, при котором она учится на примерах, а не пишется правилами. LLM это один из видов нейросетей, самый заметный сегодня. Живой разбор с обучением своей модели есть в статье нейросеть это.
Искусственный интеллект это широкое понятие, включающее и нейросети, и старые методы, где правила писали люди. Как эти слова вложены друг в друга и что из них закреплено законом, я разобрал в статье искусственный интеллект: что это.
ИИ-агент это LLM плюс инструменты и цель: агент не только отвечает, но и записывает в CRM, ставит задачу, отправляет письмо. Разница между агентом, ассистентом и нейросотрудником разобрана в отдельной статье.
RAG (retrieval-augmented generation) это способ дать модели ваши документы: перед ответом система ищет подходящие куски в базе знаний и кладёт их в запрос. Так агент отвечает по вашему прайсу, хотя модель его никогда не видела при обучении.
Контекстное окно это предел памяти модели в одном разговоре, измеряется в токенах. Почему модель «забывает» начало длинного диалога и что с этим делать, отдельный разбор про контекстное окно.
Промпт: разбор задач под LLM
Этот запрос помогает понять, какие задачи в компании стоит отдать модели первыми. Вставьте в любую нейросеть, заполните скобки и получите список с оценкой.
Ты консультант по внедрению языковых моделей в малом бизнесе. Твоя задача: разобрать мои рабочие процессы и сказать, где LLM даст эффект, а где нет.
О компании:
— чем занимаемся: [описание]
— сколько сотрудников и кто чем занят: [список]
— откуда приходят клиенты и как с ними общаемся: [каналы]
— какие документы и данные есть в электронном виде: [список]
— что сейчас отнимает больше всего времени: [3–5 задач]
Сделай так:
1. Разбей задачи на три группы: (а) модель делает сама с проверкой человеком раз в день; (б) модель готовит черновик, человек правит; (в) модели здесь делать нечего, объясни почему.
2. Для каждой задачи из групп (а) и (б) напиши, какие данные модели нужны на входе и откуда они возьмутся.
3. Назови главный риск для каждой задачи: неверный ответ клиенту, утечка данных, потеря контроля.
4. Предложи, с какой одной задачи начать и как за две недели понять, что это работает: что измерить до и после.
Не обещай экономии в процентах, которых нет в моих данных. Если для оценки не хватает информации, задай мне вопросы по одному.
Последняя строка обязательна: без неё модель уверенно нарисует «экономию 40%», которую вы потом не найдёте.
Пример выхода для студии натяжных потолков с 4 сотрудниками и заявками из Авито и WhatsApp (сокращённо):
Начать модель предложила с ночных ответов: измерить до и после долю заявок, на которые ответили в течение 5 минут, и число замеров, записанных без участия менеджера.
Частые вопросы
Что такое LLM простыми словами?
Это программа, обученная на огромном объёме текстов предсказывать продолжение любого текста. Она отвечает на вопросы, пишет и переводит, потому что научилась статистике языка, а не потому что понимает смысл как человек.
Чем LLM отличается от нейросети?
Нейросеть это общий способ устройства обучаемых программ, LLM это нейросеть, обученная на тексте и работающая с текстом. Всякая LLM это нейросеть, но не всякая нейросеть это LLM: сети для картинок и видео устроены иначе.
Чем LLM отличается от ChatGPT?
ChatGPT это продукт с интерфейсом чата, внутри которого работает LLM компании OpenAI. LLM это сама модель. У Anthropic модель называется Claude, у Яндекса Alice AI, у Сбера GigaChat.
Что такое токен и сколько их в тексте?
Токен это кусочек текста, единица работы и оплаты модели. По моему замеру 15 сентября 2026 года, на русское слово уходит от 1,8 до 2,6 токена в зависимости от модели, на английское от 1,2 до 1,8.
Почему LLM выдумывает факты?
Потому что её обучали и оценивали по доле правильных ответов, и угадать при такой оценке выгоднее, чем признать незнание, как показано в исследовании OpenAI от сентября 2025 года. Лечится инструкцией «если данных нет, скажи об этом» и подключением документов компании.
Сколько стоит один ответ LLM?
По моему замеру, ответ клиенту по прайсу стоит от 0,8 копейки у DeepSeek V3.2 и GPT-5.4 nano до 38 копеек у GPT-5.5. На платформе с каналами и базой знаний медианная цена ответа 1,52 ₽ по данным за август 2026 года.
Можно ли пользоваться LLM из России?
Российские модели Яндекса и Сбера доступны без ограничений и оплачиваются с расчётного счёта. Зарубежные API не принимают российские карты, работать с ними напрямую можно через посредников или зарубежное юрлицо.
Нужен ли программист, чтобы внедрить LLM?
Для чата в браузере не нужен. Для агента, который отвечает клиентам в мессенджерах, нужен либо разработчик для работы с API, либо платформа, где подключение уже сделано.
Какую LLM выбрать для бизнеса?
Для простых ответов по прайсу подходят дешёвые модели, но проверяйте их на своих условиях: в моём замере самая дешёвая модель OpenAI потеряла один из двух вариантов доставки. Для задач с расчётами и документами берите модель с рассуждениями и сравнивайте на 20 реальных примерах.
Сама по себе модель только пишет текст; чтобы она открыла файл, сходила в Метрику или в браузер, между ней и программами ставят посредника. Как устроен этот стандарт, сколько инструментов у типичного сервера и во что их описания обходятся в каждом запросе, разобрано в статье MCP: что это.
Обратная сторона предсказания следующего слова: там, где знания нет, модель всё равно находит правдоподобное продолжение. Что такое галлюцинации, какие модели выдумывают чаще и какая строка в инструкции режет выдумки в 4 раза, в моём замере на 464 ответах.
С чего начать прямо сейчас
Всё ниже делается за один вечер, если LLM в компании пока используется только как чат.
- Выпишите 5 задач, которые повторяются каждый день и состоят из текста: ответы клиентам, описания, письма, разбор звонков.
- Прогоните промпт из этой статьи и получите список с рисками и данными на входе.
- Соберите для одной задачи 20 реальных примеров с правильными ответами: это ваш тест.
- Проверьте на этом тесте 2–3 модели разной цены. Смотрите не только на качество, но и на то, что модель пропустила, как nano в моём замере.
- Решите, по какой из трёх дорог идти: чат, API или платформа. Критерий один: есть ли у вас разработчик и должна ли модель отвечать клиентам без вас.
- Назначьте человека на подстраховку и дату через 2 недели, когда сравните время и число ответов до и после.
Дальше по цепочке: разобраться, как модель держит длинный диалог, собрать первого ИИ-сотрудника и научиться писать ему инструкции, которые он не нарушает.