Все статьи
Практика3 минутыОбновлено 2 октября 2026 г.Проверено 2 октября 2026 г.

Grok 4.7: почему длинные coding-задачи — отдельный класс

21 сентября 2026 года xAI представила Grok 4.7 как модель для coding и knowledge work с акцентом не на скорость, а на выносливость: дольше работает над трудным, тщательнее проверяет себя. Независимые замеры подтверждают профиль: сильные coding-агентские scores ценой вдвое большего выхода токенов. Разбираем, почему это отдельный класс задач со своей экономикой — и когда он ваш, а когда нет.

Срез на дату публикации: тарифы и каталог меняются — пересчитайте по методике статьи на свежих данных.

Короткий ответ

Grok 4.7 — это ставка на выносливость: дольше работает, тщательнее проверяет себя, но генерирует вдвое больше выходных токенов. Отдельный класс задач — длинные coding-сессии, где цена считается за исход, а не за токен.

Профиль: выносливость вместо скорости

По заявлению xAI: новая увеличенная базовая модель, длинный RL-прогон на задачах «на много часов», нативная поддержка harness для диалогов. Независимые замеры (Artificial Analysis, сентябрь 2026): Coding Agent Index вырос с 47 до 56, DeepSWE — с 65% до 73%, Terminal-Bench — с 18% до 33%. Обратная сторона: ~81 тысяча выходных токенов на задачу против ~38 тысяч у предшественника — вдвое больше генерации за те же очки.

Контекст 500K токенов, уровни reasoning low/medium/high/xhigh, вход текста и картинок, вызов инструментов. Быстрый вариант существует отдельно (только через часть каналов, не публичный API). Бенчмарки вендора — с его method (усилия выставлены несимметрично конкурентам), независимые — со своей; читайте оба слоя, верьте цене за исход.

  • длинный RL на многочасовых задачах
  • самопроверка и длинные контексты
  • выхода вдвое больше за те же очки
  • бенчмарки вендора и независимые — разные слои

Экономика: токены врут, исход решает

Прайс xAI стартует с $2 вход / $6 выход за миллион — выглядит дешевле конкурентов с более высокими ставками. Независимый замер стоимости задачи переворачивает картину: ~$3.74 за задачу против ~$1.99 у соперника с более дорогим прайсом — потому что соперник генерирует в разы меньше. Вывод: цена токена без объёма генерации — шум; считайте $/успешный исход на своих задачах.

Рычаги управления: уровень reasoning (low — извлечение, xhigh — длинные траектории; высокий стоит кратно), кэш входа, разделение «думать много / отвечать коротко». Правило: effort под задачу ступенью ниже привычного, затем замер — в половине случаев качество не падает, а счёт падает заметно.

  • дешёвый прайс ≠ дешёвая задача
  • считать $/исход на своих задачах
  • effort ступенью ниже, затем замер
  • кэш входа обязателен при длинных сессиях

Когда брать и ограничения

Берите для длинных coding-сессий с самопроверкой, где цена ошибки выше цены токенов: рефакторинги, миграции, разборы чужого кода. Не берите для скорости (заметно медленнее медианы класса), для 1M+ контекстов (потолок 500K) и для топовых терминальных сценариев (там лидеры другие). Слабые места из независимых замеров: длинные документы и презентации — прирост неровный.

В каталоге NormaHub модель присутствует — сверяйте ID и ставки на день перед продом. Практический тест за вечер: прогоните 5 своих типовых задач на двух уровнях effort, сравните исходы и счета, зафиксируйте уровень в конфиге. Модель — инструмент с профилем, а не место в рейтинге.

  • брать: длинные сессии, где ошибка дороже токенов
  • не брать: скорость, 1M+, топ-терминал
  • тест: 5 задач × 2 effort, фиксация в конфиге
  • ID и ставки — из каталога на день

Источники и связанные страницы

Следующий шаг

Открыть эту статью в Markdown·Поделиться в Telegram

Следующий материалКак безопасно хранить API-ключи для AI-сервисов