Все вопросы

Модели · Обновлено 27 сентября 2026 г.

Как выбрать max_tokens для запроса?

Ставьте лимит под задачу с запасом: короткие ответы и классификация — сотни токенов, статьи и код — тысячи. Каждый вызов без max_tokens — открытый счёт: output обычно дороже входа, а раздутый ответ оплачиваете вы. Лимит на вызов — ещё и защита от зацикливаний.

Если ответы регулярно упираются в лимит и режутся — поднимите его и сверьте usage в истории: рост выхода должен быть оправдан задачей. Единого значения нет — калибруйте под свой сценарий.

Смежные вопросы: модели