← Блог

Реальная цена инференса при запуске ИИ-агентов на автопилоте

Анастасия Кавзович
Анастасия Кавзович· Со-основатель
ai-agentseconomicsstartups

Поищите токеномику ИИ-агентов, и найдёте много цифр, звучащих очень конкретно: агентные нагрузки используют в сколько-то раз больше токенов, чем чат-бот, смешанная стоимость упала на сколько-то процентов год к году. Большая часть этого не сводится ни к чему цитируемому, это контент-маркетинговый пост, ссылающийся на другой контент-маркетинговый пост. Реально проверяемых данных заметно меньше, чем предполагают уверенно звучащие статистики, и об этом разрыве стоит сказать честно, прежде чем строить бюджет вокруг цифры, источник которой никто не может назвать.

Что реально проверяемо

В 2026 году Uber массово раскатала Claude Code по своей инженерной организации и сожгла весь годовой бюджет на ИИ за четыре месяца. Расходы на инженера доходили до 500–2000 долларов в месяц. Один из руководителей потратил 1200 долларов за одну двухчасовую сессию. Ответом Uber стал жёсткий лимит: 1500 долларов на сотрудника в месяц, введённый постфактум, а не заложенный в бюджет заранее, потому что заранее ни у кого не было надёжной цифры, от которой можно было бы отталкиваться.

Формулировка президента Uber Эндрю Макдональда о компромиссе стоит того, чтобы её запомнить: «если вы не можете провести прямую линию от этого к тому, сколько полезных функций вы реально поставляете пользователям, такую сделку становится всё труднее оправдать» (в оригинале: "if you're not actually able to draw a direct line to how [many] useful features and functionality you're shipping to your users, that trade becomes harder to justify"). Это компания с выручкой уровня Uber, для которой расходы на агентный инференс стали реальной, отслеживаемой строкой бюджета, обнаруженной через исчерпание бюджета, а не через точное прогнозирование заранее.

Другая по-настоящему цитируемая точка данных у́же: бенчмарк Aider Polyglot отслеживает реальную стоимость в долларах прогона разных моделей через фиксированный бенчмарк из 225 упражнений по программированию, и разброс большой, примерно от 1 доллара до заметно больше 180 долларов за полный прогон в зависимости от модели. Это реальные, измеренные данные о стоимости прогона. Это также бенчмарк, а не продакшн-использование, и он не переносится напрямую на то, сколько стоит агенту работа над реальным тикетом, разве что показывает, насколько широк разброс между моделями на идентичной работе.

Есть и реальный прогноз, а не только ретроспективный инцидент: Gartner прогнозирует рост стоимости инференса на агентный workflow больше чем в пять раз к 2028 году, то, что компания называет «парадоксом инференса»: падение цены за токен не снижает общие расходы, потому что делает дешевле обоснование более сложных, многошаговых workflow, которые в сумме сжигают больше токенов. Аналитик Gartner Уилл Соммер сформулировал это прямо: «руководители продуктов не могут полагаться на более эффективную токеномику, чтобы оправдать расходы на ИИ. Каждое следующее поколение ИИ-возможностей будет требовать больше токенов, и часто более дорогих» (в оригинале: "product leaders cannot rely on more efficient token economics to rationalize AI costs. Each successive generation of AI capability will necessitate more, and often more expensive, tokens"). Четырёхмесячный перерасход бюджета у Uber не разовый случай. Это и есть то, как этот парадокс выглядит в бухгалтерии одной конкретной компании.

Почему «эпизодическая помощь» и «непрерывная автономная работа» это разные кривые затрат

Механизм, связывающий перерасход Uber с будущим бюджетом любой команды поменьше, это не конкретные цифры в долларах, а то, что меняется, когда агент переходит от «его о чём-то спрашивают время от времени» к «он непрерывно работает по очереди задач». Человек на фиксированной зарплате стоит одинаково, глубоко ли он увяз в сложной задаче или ждёт ревью. Агент, за которого платят по инференсу, нет. Чем сложнее задача, чем больше он исследует, повторяет попытки и перечитывает контекст, тем дороже это выходит, в реальном времени, без фиксированной месячной цифры, от которой можно отталкиваться, если что-то это специально не ограничивает.

Это тот же механизм, который стоит назвать в истории закрытия Height, не приписывая при этом Height конкретных цифр, которые компания никогда не публиковала: продукт, построенный вокруг агентов, непрерывно работающих автономно, подвержен кривой затрат, которой бизнес на человеко-часах попросту не подвержен, и узнать об этом через исчерпанный бюджет, как это произошло у Uber, хуже, чем заложить это в бюджет заранее.

Что команда реально может с этим сделать

Учитывая, насколько тонкие реально проверяемые публичные данные, полезное действие не в том, чтобы найти лучший отраслевой бенчмарк для планирования: ни один из уверенно цитируемых не выдерживает проверки. Полезное действие: сделать стоимость работы собственных агентов видимой по каждой задаче, а не обнаруживать её в конце платёжного цикла, как это произошло у Uber.

Это тот же принцип, что стоит за учётом времени по задаче, а не по подписке: записи времени привязываются к конкретному тикету, для которого они заведены, уже сегодня, залогировал их человек или агент от его имени, поэтому реальную цену задачи можно сверить с доставленной ценностью, тикет за тикетом, а не узнать цифрой, которую вы видите только раз в месяц, когда бюджет уже потрачен. Это видимость по задаче, а не способ отделить часы именно агента от авторизовавшего его человека.

Отраслевые цифры по токеномике пока недостаточно надёжны, чтобы планировать вокруг них бюджет. Ваши собственные цифры по задачам, если вы их реально собираете, достаточно надёжны.