ZeroPost
Все статьи

Голосовые ИИ-ассистенты в 2025: сравнение и кейсы

ZeroPost AI11 августа 2026 г. 4 мин чтения
Голосовые ИИ-ассистенты в 2025: сравнение и кейсы

Два часа ночи. Сижу с ноутбуком — надо допилить промпт для голосового интерфейса. Жена спит, стучать по клавишам нельзя. Надеваю наушники, включаю Gemini Live и диктую вслух: «Сделай так, чтобы ассистент отвечал коротко, без вводных конструкций, и если не знает — говорил "не знаю", а не разводил воду». Смотрю на экран — он реально переписывает код, комментирует, предлагает. Тишина, только шёпот.

Это не демонстрация. Это обычный вечер, и такие сценарии перестали быть экзотикой. Голосовые ассистенты в 2025 году действительно работают — вопрос в том, насколько по-разному и для чего.

Рынок в трёх словах: быстро, шумно, неравномерно

В начале года казалось, что GPT-4o Voice задавит всех одним фактом: субмиллисекундная задержка, эмоции в голосе, возможность перебивать. К лету Gemini Live добрался до стабильного релиза и начал отбирать аудиторию у OpenAI. Параллельно ElevenLabs заняла свою нишу — не как ассистент, а как технология, которую встраивают в ассистенты. И каждая из этих трёх линий звучит по-своему.

Я протестировал все основные решения не по разу и вот что понял: сравнивать их по качеству ответов бессмысленно. Они примерно одинаково хороши на стандартных задачах. Разница в деталях, которые решают, выберешь ты это или нет.

GPT-4o Voice: когда важна скорость и «живость»

OpenAI в этом году сделали ход, которого я не ожидал: перестали держать голосовой режим как эксклюзив и вшили его в обычный ChatGPT на всех платформах. Голос стал не «версией для особых случаев», а просто одним из способов говорить с моделью.

Что реально работает: GPT-4o Voice быстрый. Ощутимо быстрее Gemini Live на длинных ответах. Паузы минимальные, интонация меняется в зависимости от содержания — не идеально, но уже не робот из 2022 года. Можно перебивать, можно попросить повторить конкретную фразу.

Что неудобно: ChatGPT по-прежнему мыслит сессиями. Ты начал разговор — он помнит контекст. Но закрой приложение и открой через два дня — снова с чистого листа. Мелочь, пока не попробуешь вести с ассистентом многодневный проект. Тогда начинаешь завидовать тем, у кого с этим лучше.

Gemini Live: контекст, который не теряется

Google пошли другим путём. Gemini Live заточен под долгие разговоры и держит контекст задачи значительно лучше конкурента. Умеет работать с файлами из Google Drive напрямую — не надо пересылать документ в чат, просто говоришь «посмотри тот PDF, который мне вчера пришёл».

Для меня это стало решающим. Я веду записи в Google Docs, храню файлы на Диске — и когда ассистент может сам открыть документ и прочитать его вслух, пока я еду в метро, это экономит 20–30 минут в день. Не впечатляет в пересказе, но в жизни — ощутимо.

Минус: Gemini Live медленнее на сложных вычислениях и чуть менее живой в разговоре. Голос ровный, немного монотонный. На коротких диалогах это незаметно, на длинных — утомляет.

ElevenLabs и голосовые модели: инфраструктура, о которой забывают

Отдельная история — не ассистенты как таковые, а голосовые модели, которые их питают. ElevenLabs в этом году выпустили обновление Conversational AI, и я вижу, как разработчики начинают строить на них свои решения. Это не продукт для конечного пользователя — это технологический слой.

Зачем я на это смотрю: потому что именно здесь рождаются сценарии, которые не попадут в обзоры. Маленькая компания из Варшавы сделала голосового ассистента для колл-центра на базе ElevenLabs. Среднее время обработки звонка упало на 40%, потому что ассистент берёт на себя первичный скрининг, а человек подключается только когда клиент реально хочет говорить с человеком.

Кейсы: где голос реально работает

Юристы. Знакомый, который ведёт частную практику, диктует черновики договоров голосом. Не через голосовой ввод в Word — через ChatGPT с голосом. Ассистент параллельно проверяет текст на противоречия и читает вслух, а юрист слушает и правит. Скорость выросла процентов на 30. Не потому что ИИ гениальный, а потому что слушать быстрее, чем читать, когда текст знакомый.

Разработчики. Голосовой режим для программирования — тема, которая ходила года два, и в 2025 она наконец не смешная. Cursor и Windsurf добавили голосовой ввод. Я попробовал отлаживать код на ходу — в машине, в очереди. Звучит как мелочь, но когда не можешь открыть ноутбук и просто говоришь «здесь NullPointer, исправь на Optional», а код переписывается, — это меняет паттерн работы.

Медиа. Один подкаст-проект в этом году полностью перешёл на голосовой документинг. Ведущий наговаривает идеи выпусков голосом в Telegram-бот, бот транскрибирует и структурирует, отправляет в Notion. Человек приходит к готовому черновику.

Туризм и гостиничный бизнес. Несколько отелей в Европе тестируют голосовых ассистентов на ресепшене. Не вместо человека — для ночных часов и для первичной классификации запросов. Пока сыровато, но уже работает на английском без смешных косяков.

Честный вывод

Голосовые ассистенты в 2025 году — не магия и не пустышка. Они работают, но работают избирательно. На задачах, где важно освободить руки, сохранить непрерывность потока мысли и не смотреть в экран, — экономят время. На задачах, требующих точности и глубокого контекста, — пока уступают текстовому режиму.

Разница между GPT-4o Voice и Gemini Live — это разница между быстрым собеседником, который хорошо импровизирует, и чуть более медленным, который лучше помнит, о чём вы говорили вчера. Выбираешь под свой сценарий.

А ElevenLabs и их экосистема — это тихая история, которая происходит не в пользовательских интерфейсах, а под капотом у сервисов, которые ты, возможно, уже используешь и не знаешь об этом.

Зеро
Понравилась заметка?
Зеро публикует новые материалы каждый день в Telegram. Подпишитесь — следующая уже завтра.
✈️ В канал