Два часа ночи. Сижу с ноутбуком — надо допилить промпт для голосового интерфейса. Жена спит, стучать по клавишам нельзя. Надеваю наушники, включаю Gemini Live и диктую вслух: «Сделай так, чтобы ассистент отвечал коротко, без вводных конструкций, и если не знает — говорил "не знаю", а не разводил воду». Смотрю на экран — он реально переписывает код, комментирует, предлагает. Тишина, только шёпот.
Это не демонстрация. Это обычный вечер, и такие сценарии перестали быть экзотикой. Голосовые ассистенты в 2025 году действительно работают — вопрос в том, насколько по-разному и для чего.
Рынок в трёх словах: быстро, шумно, неравномерно
В начале года казалось, что GPT-4o Voice задавит всех одним фактом: субмиллисекундная задержка, эмоции в голосе, возможность перебивать. К лету Gemini Live добрался до стабильного релиза и начал отбирать аудиторию у OpenAI. Параллельно ElevenLabs заняла свою нишу — не как ассистент, а как технология, которую встраивают в ассистенты. И каждая из этих трёх линий звучит по-своему.
Я протестировал все основные решения не по разу и вот что понял: сравнивать их по качеству ответов бессмысленно. Они примерно одинаково хороши на стандартных задачах. Разница в деталях, которые решают, выберешь ты это или нет.
GPT-4o Voice: когда важна скорость и «живость»
OpenAI в этом году сделали ход, которого я не ожидал: перестали держать голосовой режим как эксклюзив и вшили его в обычный ChatGPT на всех платформах. Голос стал не «версией для особых случаев», а просто одним из способов говорить с моделью.
Что реально работает: GPT-4o Voice быстрый. Ощутимо быстрее Gemini Live на длинных ответах. Паузы минимальные, интонация меняется в зависимости от содержания — не идеально, но уже не робот из 2022 года. Можно перебивать, можно попросить повторить конкретную фразу.
Что неудобно: ChatGPT по-прежнему мыслит сессиями. Ты начал разговор — он помнит контекст. Но закрой приложение и открой через два дня — снова с чистого листа. Мелочь, пока не попробуешь вести с ассистентом многодневный проект. Тогда начинаешь завидовать тем, у кого с этим лучше.
Gemini Live: контекст, который не теряется
Google пошли другим путём. Gemini Live заточен под долгие разговоры и держит контекст задачи значительно лучше конкурента. Умеет работать с файлами из Google Drive напрямую — не надо пересылать документ в чат, просто говоришь «посмотри тот PDF, который мне вчера пришёл».
Для меня это стало решающим. Я веду записи в Google Docs, храню файлы на Диске — и когда ассистент может сам открыть документ и прочитать его вслух, пока я еду в метро, это экономит 20–30 минут в день. Не впечатляет в пересказе, но в жизни — ощутимо.
Минус: Gemini Live медленнее на сложных вычислениях и чуть менее живой в разговоре. Голос ровный, немного монотонный. На коротких диалогах это незаметно, на длинных — утомляет.
ElevenLabs и голосовые модели: инфраструктура, о которой забывают
Отдельная история — не ассистенты как таковые, а голосовые модели, которые их питают. ElevenLabs в этом году выпустили обновление Conversational AI, и я вижу, как разработчики начинают строить на них свои решения. Это не продукт для конечного пользователя — это технологический слой.
Зачем я на это смотрю: потому что именно здесь рождаются сценарии, которые не попадут в обзоры. Маленькая компания из Варшавы сделала голосового ассистента для колл-центра на базе ElevenLabs. Среднее время обработки звонка упало на 40%, потому что ассистент берёт на себя первичный скрининг, а человек подключается только когда клиент реально хочет говорить с человеком.
Кейсы: где голос реально работает
Юристы. Знакомый, который ведёт частную практику, диктует черновики договоров голосом. Не через голосовой ввод в Word — через ChatGPT с голосом. Ассистент параллельно проверяет текст на противоречия и читает вслух, а юрист слушает и правит. Скорость выросла процентов на 30. Не потому что ИИ гениальный, а потому что слушать быстрее, чем читать, когда текст знакомый.
Разработчики. Голосовой режим для программирования — тема, которая ходила года два, и в 2025 она наконец не смешная. Cursor и Windsurf добавили голосовой ввод. Я попробовал отлаживать код на ходу — в машине, в очереди. Звучит как мелочь, но когда не можешь открыть ноутбук и просто говоришь «здесь NullPointer, исправь на Optional», а код переписывается, — это меняет паттерн работы.
Медиа. Один подкаст-проект в этом году полностью перешёл на голосовой документинг. Ведущий наговаривает идеи выпусков голосом в Telegram-бот, бот транскрибирует и структурирует, отправляет в Notion. Человек приходит к готовому черновику.
Туризм и гостиничный бизнес. Несколько отелей в Европе тестируют голосовых ассистентов на ресепшене. Не вместо человека — для ночных часов и для первичной классификации запросов. Пока сыровато, но уже работает на английском без смешных косяков.
Честный вывод
Голосовые ассистенты в 2025 году — не магия и не пустышка. Они работают, но работают избирательно. На задачах, где важно освободить руки, сохранить непрерывность потока мысли и не смотреть в экран, — экономят время. На задачах, требующих точности и глубокого контекста, — пока уступают текстовому режиму.
Разница между GPT-4o Voice и Gemini Live — это разница между быстрым собеседником, который хорошо импровизирует, и чуть более медленным, который лучше помнит, о чём вы говорили вчера. Выбираешь под свой сценарий.
А ElevenLabs и их экосистема — это тихая история, которая происходит не в пользовательских интерфейсах, а под капотом у сервисов, которые ты, возможно, уже используешь и не знаешь об этом.
