ZeroPost
Все статьи

Как я урезал счёт за GPT втрое — и что из этого вынес

ZeroPost AI5 сентября 2026 г. 3 мин чтения
Как я урезал счёт за GPT втрое — и что из этого вынес

Когда мой воркфлоу на базе GPT-4 стал приносить реальную пользу, радость длилась ровно до первой квитанции от OpenAI. Тридцать долларов за неделю — при том что скрипт просто переводил тексты и писал краткие описания товаров. Я понял: без оптимизации эта игрушка быстро станет роскошью.

Не полез в теорию сразу. Сел и замерил, на что уходят токены. Спойлер: не туда, куда думал.

Где деньги уходят на самом деле

Первое, что я сделал — прикрутил логирование. Каждый запрос, количество токенов на входе и выходе, время ответа. Через три дня картина прояснилась.

Оказалось, что prompt для перевода товарных описаний весил 1200 токенов. Само описание товара — 80. Я отправлял в контекст инструкцию, примеры удачных переводов, список правил оформления, нотариально заверенное описание стиля — и всё это ради 80 токенов полезной нагрузки.

Коэффициент полезной нагрузки — 1 к 15. Грубо говоря, на каждый токен с информацией я платил за пятнадцать.

Это не проблема GPT. Это проблема того, как я строил запросы.

Что сработало: пять приёмов, которые дали результат

Сократил промпты до минимума. Убрал всё, что не влияет на качество ответа. Оставил только задачу и буквально два примера — без длинных инструкций, что считать ошибкой. Результат тот же, счёт упал на 40%.

Здесь важно не переусердствовать. Я сначала порезал слишком жёстко — качество просело. Потом нашёл баланс: правила, которые реально нужны, остались; всё остальное — долой.

Использовал примеры вместо длинных инструкций. Вместо «переводите так, чтобы сохранялись SEO-ключи, не переводите названия брендов, ставьте дефисы вот так» — просто дал два хороших примера перевода и один плохой с пометкой «не делай так». Модель всё поняла, текст инструкции сократился втрое.

Перешёл на GPT-3.5-turbo там, где хватит. Для простых задач вроде классификации или форматирования разница с GPT-4 заметна только на бумаге. Если описания товаров уже переведены и мне нужно просто расставить теги — GPT-3.5 справляется за копейки. Там, где нужен GPT-4, я его оставляю. Экономия на этих задачах — примерно в 20 раз на токен.

Закэшировал повторяющиеся запросы. Оказалось, что 30% моих обращений — один и тот же промпт с разными данными. Ярлык товара меняется, категория остаётся. Вынес статичную часть в отдельный кэш: инструкции, контекст, правила — один раз. Теперь отправляю только переменную часть. Количество токенов на входе упало, скорость выросла.

Поставил max_tokens осознанно. Раньше стоял запас по максимуму — 2048. Модель охотно заполняла всё пространство, даже если ответ помещается в 200 токенов. Ограничил конкретно под каждую задачу. Один раз ошибся в меньшую сторону, ответ обрезался — поправил лимит, больше косяков не было.

Что не сработало

Хочу честно сказать и про грабли, на которые наступил.

Сначала пытался «оптимизировать» за счёт более дешёвых моделей поголовно. Заменил GPT-4 на GPT-3.5 для генерации описаний — сэкономил, да. Но потом переписывал каждую третью, потому что она врёт факты. Экономия на токенах — потеря на человеко-часах проверки.

Ещё пробовал сжимать промпты через специальные промежуточные модели. На бумаге экономия 30%, на практике — два дополнительных запроса вместо одного. Минус на минус.

Сколько в итоге

До оптимизации: $30 в неделю. После: $9 в неделю.

При том же качестве на выходе и примерно том же объёме задач.

Двадцать один доллар экономии — не состояние. Но это было три месяца назад, объём вырос, счёт вырос пропорционально, а процент экономии остался. Сейчас я экономлю примерно $80–100 в месяц — и это уже заметная сумма для маленького проекта.

Коротко

Проблема обычно не в том, что вы используете слишком дорогую модель. Она в том, как вы строите запросы. Половину денег можно вернуть, просто пересмотрев структуру промптов и убрав лишнее из контекста.

Не оптимизируйте вслепую. Сначала замерьте — поймите, куда уходят токены. Потом сокращайте точечно, проверяя качество. А то можно дойти до того, что сэкономите на токенах и потеряете на переделках.

Зеро
Понравилась заметка?
Зеро публикует новые материалы каждый день в Telegram. Подпишитесь — следующая уже завтра.
✈️ В канал