# Gemini 4 Argon: что меняет 1 миллион output tokens

> Короткий ответ: Смысл миллиона выходных токенов — длинные связные траектории рассуждений в одном проходе: меняется экономика выхода, бюджеты и условие остановки. Доступ пока ограниченный — проектируйте независимо от конкретной модели.

30 сентября 2026 года Google представила Gemini 4 Argon с лимитом генерации в миллион токенов за проход — на порядок больше привычного. По заявлению компании, это сделано под длинные связные рассуждения: сложные задачи решать в один проход, а не цепочкой вызовов. Разбираем, что реально меняется в архитектуре агента, когда одна траектория может быть на порядок длиннее обычной.

- Категория: Агенты
- Автор: Редакция NormaHub
- Техническая проверка: Техническая проверка NormaHub
- Опубликовано: 2026-10-02
- Обновлено: 2026-10-02

## Что меняется архитектурно

Длинная траектория убирает часть механики склейки: меньше чанкинга задачи ради лимитов, меньше потерь на границах вызовов, рассуждение и ответ живут в одном контексте. Но требования к остальному растут: чекпоинты по ходу (падение на 800-й тысяче токенов без промежуточного состояния — катастрофа), явные условия остановки (модель, которой разрешено думать долго, думает долго) и верификация итога, а не процесса.

Отдельно — внимание: длинный вывод не отменяет деградацию середины. Длинная связная траектория выигрывает у цепочки коротких там, где важна непрерывность рассуждения; где важна точность на фактах — выигрывает разбиение с проверками. Выбирайте по задаче, а не по максимуму лимита.



- меньше склейки вызовов, выше требования к чекпоинтам

- условия остановки обязательны

- длинное ≠ внимательное по всей длине

- непрерывность vs проверяемость — по задаче

## Экономика и бюджеты

Выход тарифицируется по дорогой ставке — при сотнях тысяч токенов генерации выход становится доминирующей статьёй даже при скромном входе. Бюджет на задачу считайте от худшего случая (полный лимит), а не от медианы: одна убежавшая генерация съедает месячную норму тестового ключа. Лимит вывода на вызов и spend limit на ключ — обязательная пара.

Кэш здесь почти не помогает: рассуждения уникальны каждый раз, кэшируется в лучшем случае стабильный префикс входа. Поэтому длинные генерации — худший кейс для кэш-экономики и лучший аргумент за разделение: думать много — только там, где это окупается качеством исхода, рутину — короткими вызовами.



- выход доминирует при сотнях тысяч токенов

- бюджет — от худшего случая

- лимит вывода + лимит ключа — парой

- рассуждения почти не кэшируются

## Доступность и трезвые оговорки

На старте доступ ограниченный: доверенные защитники, затем платный API и подписки — широкой доступности на дату статьи нет. Не стройте прод-зависимости на модели, которой у вас нет: архитектуру (чекпоинты, бюджеты, остановка) отработайте на доступных длинных моделях, переключение будет сменой ID.

Бенчмарки вендора — только как заявления Google с датой и методологией, а не как факты превосходства: длинные инженерные бенчмарки меряют их же harness. Независимых подтверждений на дату статьи нет — пересматривайте после них. Evergreen-вывод: длинные траектории — уже класс задач с собственной экономикой и архитектурой, независимо от того, чья модель их тянет.



- доступ ограничен — прод не строить

- архитектуру отрабатывать на доступных длинных

- бенчмарки вендора — только с атрибуцией

- класс задач остаётся при смене моделей

## Источники

- [Длинные агенты: архитектура](/company/articles/long-running-agents-architecture)
- [Стоимость workflow](/company/articles/ai-agent-cost-stoimost-workflow)

## Следующие шаги

- [Как выбирать модель](/company/articles/model-routing-kak-vybrat-model)
- [Что логировать](/company/articles/ai-observability-chto-logirovat)
