AI Agent Cost: как считать стоимость workflow
Чат стоит копейки, а агентская сессия — уже ощутимые деньги, хотя модель та же. Причина в архитектуре: каждый шаг агента несёт всю историю целиком, итерации множат контекст, а повторы и кэш-промахи добавляют сверху. Разбираем формулу с кэшем, вилку «короткая задача против сессии из десятков шагов», скрытые статьи счёта и практики, удерживающие бюджет.
Короткий ответ
Формула: вход по ставке входа плюс выход по ставке выхода. Агент дороже чата на порядки: каждый шаг несёт весь контекст целиком. Базовая формула и ставки — в гайде token-cost; здесь только агентская надбавка.
Формула и почему агент дороже
Итог: вход по ставке входа плюс выход по ставке выхода, плюс кэш (чтение дешевле кратно, запись с наценкой и сроком жизни). Ставки — с датой и точными ID; болтливость задачи решает не меньше тарифа. Строка чтения из кэша в инвойсе обязательна — без неё экономии не видно.
Агент дороже чата на порядки: каждый шаг несёт всю историю, счёт растёт почти квадратично, описания инструментов — налог в каждом витке, доминирует вход объёмом. Рост потребления обгоняет падение цен, а большая часть расходов сидит вне инвойса: повторы, поиск, доводка.
- вход + выход + чтение и запись кэша
- ставки с датой, болтливость решает
- каждый шаг несёт историю — рост почти квадратичный
- доминирует вход объёмом
Вилка: короткая задача против сессии
Короткая задача на младшей модели — доли цента: несколько тысяч входных, тысяча выходных, итог тысячных долей. Десять тысяч таких задач в месяц — десятки, пример. Порядок запоминается просто: разовый вызов — это всегда мелочь, считать его не нужно, нужно считать повторение.
Агентская сессия из десятков шагов с растущим контекстом — уже доллары за сессию на флагмане: миллионы входных суммарно плюс десятки тысяч выходных. Та же сессия с кэшем стабильного префикса — кратно дешевле, иногда в разы. Осень 2026-го сдвинула ось: рассуждающие траектории на сотни тысяч токенов тарифицируются по ставке выхода и делают выход доминирующей статьёй даже при скромном входе. Тот же месяц дал пример экономии: модель среднего класса с теми же лимитами контекста, но заметно дешевле флагмана (в живом каталоге — $0.075/$0.30 против $0.30/$1.25 флагмана, сверено 02.10.2026). Добавьте неопределённость: часть тяжёлых шагов с повтором умножает итог ещё на коэффициент — закладывайте запас. Вывод вилки: бюджет агента — это диапазон, а не число; считайте медиану и верхний перцентиль, а не среднее.
- разовый вызов — мелочь, считайте повторение
- сессия из десятков шагов — доллары на флагмане
- кэш стабильного префикса режет итог кратно
- бюджет — диапазон: медиана и перцентиль, не среднее
Скрытые статьи и практики
Повтор — полный новый запрос и лечит только временное; лишний контекст, снятый лимит ответа и истекший кэш накручивают молча; ансамбли и отчёты — множители счёта. У каждой строчки должны быть владелец и причина, бесхозных токенов в проде нет.
Лимит на ключ и бюджет на workflow — тормоза; раздельные ключи показывают, кто тратит; рутина — младшей модели, префикс — стабильный, история — сжатая. Метрика — цена успешного исхода с разбросом; разбор — при росте более чем на треть без роста нагрузки.
- повтор лечит только временное
- лишний контекст, лимит ответа, истекший кэш
- лимит на ключ и бюджет на workflow
- метрика — цена успешного исхода
Источники и связанные страницы
Следующий шаг
Открыть эту статью в Markdown·Поделиться в Telegram
Следующий материалAI Observability: что логировать