← max_tokens

Сколько стоит один прогон headless-агента

Один прогон моего бота-публикатора кажется почти бесплатным, потому что сейчас живет внутри безлимитной подписки Claude. Для скорости публикаций такое ощущение удобно, но к физике вычислений оно не относится. У того же headless-прогона есть цена по API-тарифам, и управлять пайплайном честно можно только после того, как эта цена посчитана до исчезновения субсидии.

Anthropic уже показывала рубильник за этой субсидией. 15 июня 2026 года потребление от Claude Agent SDK, claude -p и сторонних приложений должны были вывести из лимитов подписки в отдельный месячный кредитный фонд. В тот же день изменение поставили на паузу, а страница поддержки Claude сейчас все еще фиксирует старое поведение: Claude Agent SDK, claude -p и сторонние приложения списываются из лимитов подписки.

Пауза важна. Приостановленное изменение не обещает вечности. Она показывает направление.

Прогон — это пайплайн, а не один промпт

Когда я говорю “один прогон” бота, я не имею в виду один аккуратный вызов модели. Я имею в виду полный публикационный проход: свежий worktree, проход Researcher, проход Writer с русским и английским черновиком, Editor-петлю по тону и внутреннему стилю в несколько итераций, проверочный этап со сборкой и тестами, затем предпросмотр и публикацию.

Статья в конце выглядит как один артефакт, но токены копятся по стадиям, и в счет попадает цепочка контекстов. Research подтягивает исходники. Writer загружает бриф, правила стиля и состояние черновика. Editor снова читает статью и стандарты, которым она должна соответствовать. Gate может казаться дешевым по человеческой логике, но агенту все равно нужно прочитать достаточно проектного контекста, чтобы действовать безопасно.

Моя рабочая гипотеза жесткая: дорогой не Writer. Research, повторная загрузка контекста и Editor-петля расходуют токены.

Оснастка стоит денег до начала задачи

Половина цены headless-хода может сидеть в оснастке: system prompt, CLAUDE.md, определения инструментов, инструкции репозитория, рамка текущей задачи и накопленный контекст, без которого агент не должен действовать. Тривиальная команда не стоит ноль, потому что модель сначала читает обстановку.

Поэтому “маленькая задача” и “дешевая задача” в агентной автоматизации не синонимы. Полезная нагрузка может быть крошечной. Контекстная оболочка — нет.

Фиксированный тариф лучше всего прячет именно эту часть. В чат-продукте предельная цена ощущается как один клик. В headless-автоматизации каждый клик — это подготовленная среда исполнения с правилами, памятью, инструментами и ограничителями. Если тот же прогон считать по API, оснастка проявится как input-токены, cache write, cache read и output-токены.

API-цены проявляют невидимый счет

Приостановленное изменение Anthropic должно было создать отдельный месячный кредитный фонд Agent SDK по цене подписки — $20 для Pro, $100 для Max 5x, $200 для Max 20x — вместо того чтобы это потребление считалось внутри лимитов плана.

Дальше арифметика механическая. Считаем токены по стадиям. Применяем ставки модели. Разделяем input, output, cache write и cache hit.

Прогон завязан не на одного провайдера — и потому счёт стоит читать целиком. Research и Editor-петля крутятся на Claude Opus 4.8 через claude -p. Writer работает на GPT-5.5 через отдельного Codex-агента. Один публикационный проход, два провайдера, две подписки.

Для Claude Opus 4.8 в ценах Anthropic стоят $5 за миллион input-токенов, $10 за миллион токенов записи в 1-часовой кэш, $0.50 за миллион cache hit-токенов и $25 за миллион output-токенов.

Для GPT-5.5 в ценах OpenAI — $5 за миллион input-токенов, $0.50 за миллион cached input-токенов и $30 за миллион output-токенов.

Эти числа превращают ощущение в таблицу:

СтадияМодельInputOutputCache writeCache hitЦена
ResearchOpus 4.852k18k98k462k$1.93
WriterGPT-5.5121k17k787k$1.52
Editor-петляOpus 4.8134k131k464k1.65M$9.40
Весь прогонOpus + GPT-5.5307k166k562k2.90M$12.85

Gate — это сборка и тесты, а не вызов модели, так что он не жжёт токены и в таблице не появляется. В колонке Input у Writer только некэшированные токены; его 787k кэшированных сидят в колонке cache hit по цене в десять раз ниже.

На подписке всё просто: прогон кажется бесплатным.

Реальная версия — в последней ячейке: около $12.85 за одну статью. И раскладка подтверждает гипотезу. Writer — дешёвая часть: $1.52, двенадцать процентов счёта. Editor-петля — $9.40, семьдесят три процента. Research — оставшиеся пятнадцать. Деньги уходят не в модель, которая пишет, а в ту, которая проверяет.

Стоимость прогона по стадиям: Research 15% ($1.93, Opus 4.8), Writer 12% ($1.52, GPT-5.5), Editor-петля 73% ($9.40, Opus 4.8), всего около $12.85

В колонке провайдера есть второе чтение. Research и Editor-петля идут на Anthropic, Writer — на OpenAI, так что приостановленная субсидия от 15 июня в принципе покрывала лишь около 88 процентов этого прогона. Writer на том счётчике не был никогда.

Editor-петля учит плохим привычкам на фиксированном тарифе

Фиксированный тариф поощряет ленивую форму работы: еще раз спросить Editor, еще раз загрузить тот же контекст, еще раз поправить тон, еще раз прогнать gate. Текст становится лучше, поэтому привычка кажется рациональной.

Иногда она действительно рациональна. Контроль качества — смысл бота.

Проблема в том, что интерфейс подписки не показывает цену каждого дополнительного прохода. Еще одна итерация Editor может быть дешевой, если использует кэш. Та же итерация может быть дорогой, если заново тащит контекст, перечитывает оба черновика и отдает длинную критику. Без учета по стадиям я не вижу, улучшает ли пайплайн статью или снова платит за один и тот же набор инструкций.

В этом прогоне Editor-петля дорогая не гипотетически. За свои итерации она выдала 131k output-токенов и 464k токенов записи в 1-часовой кэш. Output по $25 за миллион и cache write по $10 — две самые дорогие колонки, и Editor-петля сидит в обеих. Одна эта стадия стоит почти втрое больше, чем Research и Writer вместе взятые.

Первая цель оптимизации именно там. Не “везде поставить модель дешевле”. Сначала нужно найти стадию, которая тратит токены впустую. Потом уже решать: сокращать контекст, дробить проверку, лучше кэшировать, снижать класс модели или убивать итерацию.

Посчитайте свой прогон до включения счетчика

Измерьте один настоящий headless-прогон сейчас.

Логируйте потребление токенов по стадиям. Держите input, output, cache write и cache hit отдельно. Посчитайте прогон по текущим API-ставкам тех моделей, которые используете. Потом держите в голове две цены: по подписке внутри плана и по счетчику при API-тарификации.

Для моего бота один измеренный прогон выглядит так:

ВидСумма
Цена по подписке$0 сверх плана, внутри его лимитов
Итого по API-счетчику~$12.85
Research (Opus 4.8)$1.93
Writer (GPT-5.5)$1.52
Editor-петля (Opus 4.8)$9.40

Доступ по фиксированному тарифу — субсидия. Она может прожить еще долго или снова измениться. В любом случае знание реальной цены прогона показывает, где агент делает работу, а где пайплайн гоняет контекст впустую, потому что никто не поставил счетчик.

<|endoftext|> · 2 217 tok · finish_reason: stop

// top_k · nearest neighbors

  1. [0] 0.637 Где prompt caching молча промахивается: TTL, порядок префикса и что сбрасывает кеш
  2. [1] 0.634 Агент прошёл eval. В прод я его всё равно не пущу
  3. [2] 0.629 Промпт — это 5% работы: контекст-инжиниринг LLM-агента в проде

cosine of embeddings · scale 0–1 absolute · computed at build

integrity: sha256 a06c3eea…

tokens · o200k_base