Prompt caching в GPT-6: breakpoints и диагностика
Агент повторяет одни и те же инструкции и описания инструментов в каждом витке — и каждый раз платит за них как за новые. Prompt caching превращает повтор в скидку до порядка, но только при дисциплине: стабильный префикс, явные границы, диагностика промахов. Разбираем механику на семействе GPT-6: где ставить breakpoints, как читать диагностику и когда кэш не работает.
Срез на дату публикации: тарифы и каталог меняются — пересчитайте по методике статьи на свежих данных.
Короткий ответ
Стабильный префикс — в кэш осознанно через breakpoints, меняющийся хвост — мимо кэша. Диагностика показывает, какой именно параметр сломал совпадение.
Архитектура: стабильное вперёд, меняющееся в хвост
Правило одно: всё, что повторяется между запросами (системные инструкции, описания инструментов, контекст проекта), — в начало и под явную границу; всё, что меняется (вопрос, история, результаты инструментов), — после границы и мимо кэша. Граница — это breakpoint: конец кэшируемого префикса. Без явных границ провайдер ставит их сам — удобно, но непредсказуемо для агентов с меняющимся хвостом.
Для агентов стандартная раскладка: system context → стабильные инструкции → инструменты → динамическое состояние. Первые три блока не трогать между витками вообще: ни порядок, ни текст, ни набор инструментов. Четвёртый — единственный, которому разрешено меняться. Смена модели, tier, инструментов или effort ломает совпадение префикса — это нормально, просто знайте цену переключения.
- повторяемое — в начало под границу, меняющееся — в хвост
- первые три блока не трогать между витками
- смена модели/инструментов ломает кэш — осознанно
Диагностика промахов: читать, а не гадать
Когда ожидаемого переиспользования нет, сверяйтесь сравнением с базовым ответом: диагностика скажет причину первым классифицированным поводом — сменилась модель, ключ кэша, tier, инструменты, формат, effort, verbosity, сжатие контекста или сам вход (метка времени, request ID в инструкциях — классика). Чините по одной причине за раз и повторяйте сравнение.
Частые виновники у агентов: timestamp в системном промпте (каждый запрос — новый префикс), переупорядочивание инструментов, compaction, съевший начало, и смена effort между витками. Лекарства соответственно: время — в хвост, порядок инструментов — зафиксировать, effort — константой на сессию, compaction — с сохранением стабильного начала.
| Симптом | Причина | Лечение |
|---|---|---|
| 0 cached при стабильном тексте | Метка времени/ID в префиксе | Время и ID — в хвост после границы |
| Промахи после смены модели в роутере | Другой кэш на другую модель | Префикс общий — кэш у каждой свой |
| Промахи после compaction | Съедено начало | Сохранять стабильные инструкции |
| Промахи при том же тексте | Смена effort/tier/инструментов | Константы на сессию, сверить диагностику |
- диагностика называет первую причину — чинить по одной
- время и ID не живут в префиксе
- effort и tier — константы на сессию
Экономика: чтение, запись, TTL
Чтение из кэша дешевле базы кратно (порядок — до 90% скидки на GPT-6), запись — с небольшой наценкой и сроком жизни около 30 минут с продлением при использовании. Отсюда арифметика: первая запись окупается уже со второго-третьего повтора, а короткие редкие сессии кэш не замечают вообще. Не кэшируйте ради кэширования: префикс короче минимального порога (порядка тысячи токенов) не кэшируется никак.
Для агентов считайте кэш частью архитектуры, а не бонусом: стабильный префикс проектируется, а не получается случайно. Метрика — доля кэшированных входных токенов по ключам и задачам; разбор — при падении доли без изменения инструкций. Итог: кэш превращает повтор в скидку, дисциплина превращает скидку в деньги.
- чтение дешевле кратно, запись с наценкой, жизнь ~30 минут
- порог минимума: короткий префикс не кэшируется
- метрика — доля кэшированных по ключам
- кэш — часть архитектуры, не бонус
Источники и связанные страницы
Следующий шаг
Открыть эту статью в Markdown·Поделиться в Telegram
Следующий материалOpenAI Agents API: long-running агенты в облаке