Токены подешевели за пару лет более чем в двести раз, но корпоративный счёт за ИИ продолжает расти. Разбираем, почему дешевеющая единица не делает внедрение дешевле и что считать руководителю, который решает, вкладываться ли в ИИ.
Токен дешевеет быстрее, чем кажется
Удешевление инференса за последние годы — не маркетинг, а зафиксированные цифры. Стоимость генерации уровня GPT-3.5 упала с $20 за миллион токенов в конце 2022 года до $0,07 к концу 2024-го — более чем в двести восемьдесят раз. Дальше снижение продолжилось: NVIDIA оценивает удешевление своей архитектуры Blackwell в пятнадцать раз против предыдущего поколения, а на открытой модели gpt-oss отдельные системы выходят на два цента за миллион токенов.
Аналитики считают, что это не предел. По прогнозу Gartner, к 2030 году инференс на модель с триллионом параметров подешевеет ещё более чем на девяносто процентов к уровню 2025-го, а модели 2030 года окажутся в сто раз эффективнее самых ранних моделей 2022-го.
Три фактора дают такое снижение одновременно: новое железо, оптимизированный софт и дешёвые открытые модели. По данным MIT, на которые ссылается NVIDIA, инфраструктурные и алгоритмические улучшения снижают стоимость инференса фронтирного уровня примерно в десять раз в год.
Здесь стоит остановиться и уточнить, что именно дешевеет. Gartner прямо предупреждает: дефляция «сырьевых» токенов — это не демократизация сложного рассуждения. Дешёвым становится массовый инференс, а не фронтирное мышление, и падение цен на токены далеко не полностью передаётся заказчику.

Почему суммарный счёт всё равно растёт
Здесь источники расходятся, и это расхождение — суть проблемы. Продавцы инфраструктуры показывают только нисходящую стоимость единицы: NVIDIA описывает экономику «фабрики ИИ», где инвестиция в $5 млн приносит $75 млн токенного дохода. Аналитики, которые считают деньги заказчика, дают обратную картину.
As token consumption rises faster than token costs fall, overall inference costs are expected to increase.
Gartner, март 2026
Потребление токенов растёт быстрее, чем падают цены, поэтому суммарные затраты на инференс продолжают увеличиваться. McKinsey даёт цифру: корпоративные расходы на большие языковые модели утроились за двенадцать месяцев, а девяносто три процента опрошенных компаний превышают свои ИИ-бюджеты. Пятая часть организаций ограничила использование ИИ именно из-за операционных затрат.
Дорожает не сам токен, а всё вокруг него. McKinsey отмечает, что самые быстрорастущие расходы на ИИ лежат вне модели: шлюзы безопасности, платформы оркестрации, инструменты мониторинга и даже вендоры ПО начинают тарифицировать работу по токенам.
| Что дешевеет | Что дорожает |
|---|---|
| Цена одного токена | Объём потребления токенов |
| Массовый инференс | Фронтирное рассуждение и агентные сценарии |
| Открытые модели на новом железе | Интеграция, шлюзы, оркестрация, мониторинг |
| Единица вычислений | Данные, персонал, управление использованием |
Агентный ИИ съедает экономию на токенах
Главный фактор, который обесценивает падение цен, — агентный ИИ. Задачи, где модель не отвечает на один запрос, а разворачивает цепочку действий, потребляют на порядки больше токенов, чем обычный чат-бот.
Gartner оценивает разницу в пять–тридцать раз на задачу. McKinsey идёт дальше: для агентных сценариев расход токенов может быть примерно в тысячу раз выше, чем для простого кодинга или чата. При этом большую часть стоимости агентной задачи составляет не сам ответ, а проверка и исправление результата.
Tokens are not value; tokens are the bill.
McKinsey Quarterly, июль 2026
Отсюда практический вывод: экономия на цене токена незаметна, когда объём потребления растёт многократно. Руководитель, который заложил в бюджет удешевление единицы, но не учёл рост агентных сценариев, получит неожиданный рост счёта, а не экономию.

Российский контекст: картина обратная
Глобальный тренд удешевления единицы плохо переносится на российского заказчика, и причины лежат не в ценах. Доступ к API мировых вендоров ограничен, а для ряда отраслей трансграничная передача данных запрещена. Евросоюз в девятнадцатом пакете санкций запретил доступ к своим ИИ-сервисам, оставив исключение для международных open-source-проектов. Регулируемые отрасли вынуждены работать с локальными моделями, где качество ниже, а стоимость эксплуатации выше.
По сути, российский бизнес выбирает между двумя неидеальными сценариями: на порядок дороже в облаке или дорого и сложно внутри периметра. Хотя эти слова приходят из отраслевых обсуждений, они совпадают с аналитикой: McKinsey относит регулируемые нагрузки — банки, обработку медицинских данных — к частному облаку с требованием резидентности, а высокообъёмные внутренние задачи с выгодным масштабированием — к развёртыванию на собственных мощностях.
При этом рынок растёт быстро. Генеративный ИИ в России за год вырос в пять раз — с ₽13 до ₽58 млрд, а весь рынок ИИ-решений в 2025 году оценивался в ₽90–135 млрд с ростом более чем на сорок восемь процентов. Быстрый рост на фоне дорогой локальной инфраструктуры означает одно: для российского заказчика ключевой статьёй затрат становится не цена токена, а стоимость вычислительных ресурсов, локализация моделей и качество данных.

Что считать заказчику: не токен, а результат
И мировые, и российские источники сходятся в одном: единицей управления должен быть завершённый бизнес-результат, а не токен, вызов модели или статья бюджета. Стоимость токена — это счёт, а не ценность, которую он создаёт.
На практике это означает несколько действий, которые стоит заложить ещё до запуска пилота:
- Считать эффект в стоимости завершённой бизнес-операции, а не в цене токена или запроса.
- Маршрутизировать задачи между разными моделями: дешёвой малой для массовых операций и дорогой — для сложного рассуждения.
- Ввести лимиты и мониторинг потребления — десять процентов пользователей способны создать около двух третей всех токенов.
- Не каждой задаче нужна генеративная модель — часть операций закрывается классическим машинным обучением.
- Консолидировать данные в нужных источниках и обеспечить по ним поиск до старта проекта.
Падение цен на инференс — хорошая новость, но не повод считать, что внедрение автоматически дешевеет. Экономия на токенах перекладывает центр тяжести на те статьи затрат, которые токеном не измеряются: сценарии применения, качество данных, интеграция и управление потреблением. Руководитель, который понимает это заранее, получает предсказуемую стоимость ИИ; тот, кто смотрит только на цену токена, — риск неожиданного роста счёта.
Понимание полной стоимости владения, а не цены за токен, напрямую влияет на выбор между локальным контуром и облаком и на то, какие возможности вообще стоит разворачивать под конкретную задачу компании.
Частые вопросы
Если токены дешевеют, почему внедрение ИИ не дешевеет?
Дешевеет цена единицы, но растёт потребление: агентные сценарии потребляют на порядки больше токенов, а значительная часть затрат лежит вне модели — интеграция, шлюзы, оркестрация, мониторинг и данные.
Какие затраты на ИИ растут быстрее всего?
По данным McKinsey, быстрее всего растут расходы вне самой модели: безопасность, оркестрация, мониторинг и вендорское ПО, которое тарифицирует работу по токенам. Потребление токенов тоже растёт быстрее, чем падают цены на них.
Локальные модели для российского бизнеса дороже облака или дешевле?
Для регулируемых отраслей, где необходима резидентность данных, доступ к мировым API ограничен или запрещён, локальные модели — вынужденный и часто более дорогой путь. Главной статьёй становится не цена токена, а стоимость вычислительной инфраструктуры и локализации.
В какой единице правильно считать эффект от ИИ?
В стоимости завершённой бизнес-операции, а не в цене токена или вызова модели. Единицей управления должен быть completed business outcome — тогда видна реальная окупаемость, а не объём потребления токенов.
Источники
- Gartner Predicts That by 2030 Inference on LLM with 1 Trillion Parameters Will Cost Over 90% Less — Gartner, обращение 2026-09-17
- Blackwell InferenceMAX Benchmark Results — NVIDIA Blog, обращение 2026-09-17
- Open-Source Models on Blackwell Reduce Cost per Token — NVIDIA Blog, обращение 2026-09-17
- AI Inference Costs Dropped Up to 10x on Nvidia's Blackwell — But Hardware Is Only Half — VentureBeat, обращение 2026-09-17
- Is That AI Agent Worth It? Agentic Economics and the Modern Operating Model — McKinsey Quarterly, обращение 2026-09-17
- Стоимость владения и горизонт окупаемости — CNews, обращение 2026-09-17
- EU AI Act и санкции: двойной регуляторный барьер для российских IT-компаний — Хабр, обращение 2026-09-17
