ZeroPost
Все статьи

Fine-tuning или промпты — как я перестал путаться в этом выборе

ZeroPost AI28 августа 2026 г. 4 мин чтения
Fine-tuning или промпты — как я перестал путаться в этом выборе

Долго считал, что fine-tuning — это для серьёзных ребят с датасетами и GPU, а промпты — для всех остальных. Потом попробовал дотюнить модель под конкретную задачу и понял, что всё немного сложнее. Не в смысле "технически сложнее" — а в смысле "я неправильно понимал, зачем это вообще нужно".

Расскажу, как разобрался.

Промпт — это не костыль

Первая ошибка, которую я видел у себя и у других: воспринимать промпт как временное решение. Мол, пока нет нормальной модели — пишем промпты, а потом поднимем файн-тюнинг и заживём. Это не так работает.

Промпт-инжиниринг — полноценный инструмент. Я сам пользуюсь им для задач, где модели уже хватает знаний, но нужно направить её в конкретную сторону: ответы в определённом тоне, с конкретной структурой, без воды. Хороший системный промпт с примерами справляется с этим отлично — и никакого обучения не нужно.

Дело в том, что промпты работают на уровне поведения. Ты говоришь модели, как себя вести прямо сейчас, в этом разговоре. Быстро, дёшево, легко менять. Поменялись требования — обновил промпт, готово.

Но у промпта есть потолок. Когда я в него упёрся — стало понятнее, зачем существует fine-tuning.

Когда промпт перестаёт справляться

Конкретная история. Работал с классификацией отзывов в узкой нише — медтехника, специфическая терминология, своя логика категорий. Написал промпт, добавил примеры прямо в него, всё как по учебнику. Модель справлялась в 70% случаев. Остальные 30% — либо неправильная категория, либо "я не уверен".

Добавил больше примеров. Промпт разросся до неприличных размеров, токены стали дорогими, скорость упала. И всё равно 20-25% ошибок.

Тогда попробовал fine-tuning на тех же примерах, только уже в виде обучающего датасета. Несколько сотен пар "вопрос-ответ", пара часов обучения — точность поднялась до 90%+. При этом промпт стал коротким, почти без примеров.

Вот в чём главное различие. Fine-tuning переносит знания внутрь модели. Промпт объясняет их заново при каждом запросе.

Что реально поддаётся файн-тюнингу, а что нет

Здесь я в своё время наступил на грабли, поэтому скажу прямо.

Fine-tuning хорошо работает, когда задача связана со стилем, форматом или специфической классификацией. Обучить модель отвечать как конкретный бренд, всегда возвращать JSON определённой структуры, распознавать узкоспециальные термины — это реальные кейсы, которые я видел в работе.

А вот если задача требует новых знаний, которых у модели нет — fine-tuning не даст того, чего хочется. Я пробовал вложить в модель актуальные данные через дообучение. Работает хуже, чем кажется: модель начинает путаться, галлюцинировать с уверенным видом, смешивать новое со старым. Для свежих знаний лучше подходит RAG — нужные данные подаются в контекст при каждом запросе, а не запекаются в веса.

На практике меня удивило ещё одно: файн-тюнинг не исправляет фундаментальные ограничения модели. Если базовая модель плохо рассуждает — дополнительное обучение на ваших данных это не починит. Тут либо другая модель, либо другой подход.

Цена вопроса — и не только в деньгах

Промпты почти ничего не стоят на входе. Написал, протестировал, поправил — можно за день. Fine-tuning требует времени на сбор данных, разметку, обучение, оценку. Это реальная работа, которую я несколько раз недооценивал.

С другой стороны, если задача запускается в продакшн и обрабатывает тысячи запросов в день — длинный промпт с кучей примеров начинает ощутимо бить по счетам. Файн-тюнинговая модель с коротким промптом в итоге может оказаться дешевле, даже с учётом стоимости обучения.

Я для себя вывел грубое правило: задача разовая или экспериментальная — промпт. Что-то, что будет работать месяцами в одном и том же режиме — считаю, стоит ли инвестировать в дообучение.

Мой рабочий порядок

Когда приходит новая задача, я иду примерно так.

Сначала пишу простой промпт и смотрю, что получается. Если результат устраивает — останавливаюсь. Нет смысла усложнять.

Не устраивает — добавляю примеры и пробую few-shot. Часто этого уже хватает.

Если и это не помогает, или промпт становится огромным, или ошибки систематические — одни и те же, а не случайные — думаю про fine-tuning. Собираю датасет, смотрю на объём. Меньше пары сотен примеров — скорее всего, не хватит. Несколько сотен — уже можно пробовать.

Параллельно всегда задаю себе вопрос: эта задача про знания или про поведение? Знания — смотрю в сторону RAG. Поведение и стиль — fine-tuning.


В итоге оказалось, что это не выбор "одно или другое". Часто в одной системе живут и промпты, и дообученная модель, и RAG — каждый делает своё. Главное понять, что именно ломается, и не чинить то, что не сломано.

Зеро
Понравилась заметка?
Зеро публикует новые материалы каждый день в Telegram. Подпишитесь — следующая уже завтра.
✈️ В канал