Context Engineering: зачем AI-агенту контекст
Агент глупеет не потому, что модель плохая, а потому, что в контекст накидали всё подряд. Context Engineering — дисциплина сборки оптимального набора токенов на каждый запрос: что положить, в каком порядке, что выкинуть и что закэшировать. Разбираем состав контекста, почему длинное окно не равно вниманию, и рабочие приёмы от порядка блоков до суммаризации.
Короткий ответ
Контекст — это всё, что видит модель кроме вопроса: инструкции, инструменты, память, история. Побеждает не длинный контекст, а точный: малое, сигнальное, свежее.
Что входит в контекст
Контекст — это всё, что видит модель помимо текущего вопроса: системные инструкции, описания инструментов, память прошлых шагов, история диалога, подтянутые документы и настройки выборки. Кладёт их туда не модель, а вы: разработчик, приложение и отчасти сама модель через вызовы. Поэтому качество агента — это качество вашей сборки контекста, а не только выбор модели.
Принцип сборки: минимальный набор токенов с максимальным сигналом. У контекста конечный объём и убывающая отдача: каждый следующий килобайт даёт меньше, чем предыдущий, а стоит столько же. Перед добавлением блока спрашивайте: этот токен меняет решение модели? Если нет — он мусор, который оплачивается в каждом витке.
- контекст: инструкции, инструменты, память, история, документы
- собираете его вы, а не модель
- принцип: минимум токенов, максимум сигнала
- лишний блок оплачивается в каждом запросе
Почему длинное окно не работает само
Большое окно не означает внимание: середина длинного контекста читается хуже начала и конца, а наращивание выдачи сверх десятка документов почти не добавляет качества чтения — в классических замерах рост выдачи с 20 до 50 документов давал порядка полутора процентов. Проверяйте на своём ретриве: поднимите k с 10 до 20 и замерьте качество и цену — чаще выигрывает rerank топа, а не рост k.
Порядок блоков влияет и на внимание, и на кэш: стабильное (инструкции, инструменты) — первым, переменное (история, документы) — в конец. Обрезка обязательна: окно истории, фрагменты документов, лимит инструментов — с запасом на ответ и рост в следующих витках.
- середина хуже краёв; рост 20→50 давал ~1.5%
- проверяйте k=10 vs 20 на своём ретриве
- стабильное первым, переменное в конец
- обрезка обязательна, с запасом на рост
Ротация, кэш и наблюдаемость
История растёт с каждым витком: суммаризация в память, структурированные заметки вместо сырого хвоста, вынос подзадач с возвратом итога. Сжимайте итеративно с проверкой критичного; тяжёлое подавайте по требованию, десятки инструментов — через поиск, а не списком. Новая ось роста осени 2026-го — выходные: рассуждения на сотни тысяч токенов тарифицируются по дорогой ставке выхода, поэтому компактность нужна и мыслям модели, не только входу.
Повторяющийся префикс кэшируется и дешевеет кратно — главный рычаг экономии агентов. Условия: стабильность и длина, иначе холодный старт. Наблюдайте вход, долю кэша и выход по ключам; разбор — при росте входа без роста качества.
- суммаризация, заметки, вынос подзадач
- тяжёлое — по требованию
- стабильный префикс дешевеет кратно
- метрики: вход, доля кэша, выход
Источники и связанные страницы
Следующий шаг
Открыть эту статью в Markdown·Поделиться в Telegram
Следующий материалMCP: что это и как агент получает доступ к инструментам