# Context Engineering: зачем AI-агенту контекст

> Короткий ответ: Контекст — это всё, что видит модель кроме вопроса: инструкции, инструменты, память, история. Побеждает не длинный контекст, а точный: малое, сигнальное, свежее.

Агент глупеет не потому, что модель плохая, а потому, что в контекст накидали всё подряд. Context Engineering — дисциплина сборки оптимального набора токенов на каждый запрос: что положить, в каком порядке, что выкинуть и что закэшировать. Разбираем состав контекста, почему длинное окно не равно вниманию, и рабочие приёмы от порядка блоков до суммаризации.

- Категория: Агенты
- Автор: Редакция NormaHub
- Техническая проверка: Техническая проверка NormaHub
- Опубликовано: 2026-10-01
- Обновлено: 2026-10-01

## Что входит в контекст

Контекст — это всё, что видит модель помимо текущего вопроса: системные инструкции, описания инструментов, память прошлых шагов, история диалога, подтянутые документы и настройки выборки. Кладёт их туда не модель, а вы: разработчик, приложение и отчасти сама модель через вызовы. Поэтому качество агента — это качество вашей сборки контекста, а не только выбор модели.

Принцип сборки: минимальный набор токенов с максимальным сигналом. У контекста конечный объём и убывающая отдача: каждый следующий килобайт даёт меньше, чем предыдущий, а стоит столько же. Перед добавлением блока спрашивайте: этот токен меняет решение модели? Если нет — он мусор, который оплачивается в каждом витке.



- контекст: инструкции, инструменты, память, история, документы

- собираете его вы, а не модель

- принцип: минимум токенов, максимум сигнала

- лишний блок оплачивается в каждом запросе

## Почему длинное окно не работает само

Большое окно не означает внимание: середина длинного контекста читается хуже начала и конца, а наращивание выдачи сверх десятка документов почти не добавляет качества чтения — в классических замерах рост выдачи с 20 до 50 документов давал порядка полутора процентов. Проверяйте на своём ретриве: поднимите k с 10 до 20 и замерьте качество и цену — чаще выигрывает rerank топа, а не рост k.

Порядок блоков влияет и на внимание, и на кэш: стабильное (инструкции, инструменты) — первым, переменное (история, документы) — в конец. Обрезка обязательна: окно истории, фрагменты документов, лимит инструментов — с запасом на ответ и рост в следующих витках.



- середина хуже краёв; рост 20→50 давал ~1.5%

- проверяйте k=10 vs 20 на своём ретриве

- стабильное первым, переменное в конец

- обрезка обязательна, с запасом на рост

## Ротация, кэш и наблюдаемость

История растёт с каждым витком: суммаризация в память, структурированные заметки вместо сырого хвоста, вынос подзадач с возвратом итога. Сжимайте итеративно с проверкой критичного; тяжёлое подавайте по требованию, десятки инструментов — через поиск, а не списком. Новая ось роста осени 2026-го — выходные: рассуждения на сотни тысяч токенов тарифицируются по дорогой ставке выхода, поэтому компактность нужна и мыслям модели, не только входу.

Повторяющийся префикс кэшируется и дешевеет кратно — главный рычаг экономии агентов. Условия: стабильность и длина, иначе холодный старт. Наблюдайте вход, долю кэша и выход по ключам; разбор — при росте входа без роста качества.



- суммаризация, заметки, вынос подзадач

- тяжёлое — по требованию

- стабильный префикс дешевеет кратно

- метрики: вход, доля кэша, выход

## Источники

- [Расчёт стоимости токенов](/guides/token-cost)
- [Модели и тарифы](/models)

## Следующие шаги

- [Как считать стоимость workflow](/company/articles/ai-agent-cost-stoimost-workflow)
- [Зачем субагенты](/company/articles/subagents-zachem-odnomu-agentu-drugie)
