У меня есть друг, который работает врачом. Он пользуется голосовым ИИ каждый день — диктует заметки в EMDR-систему, просит расшифровать выписки и даже готовит ответы пациентам на ночь. Месяц назад он сказал: «Все одинаковые, просто у кого-то голос приятнее». Я с ним не согласился и решил проверить. Собрал пять сценариев, прогнал через ChatGPT с голосом, Gemini Live и кастомного ассистента на базе Claude через API — и картина оказалась сложнее, чем «приложение А работает лучше приложения Б».
Делюсь что понял.
Почему в 2025 голос — это не просто «озвучка текста»
Ещё год назад голосовой режим был красивой надстройкой. Ты нажимал кнопку, говорил, ассистент превращал речь в текст, отвечал текстом, а потом читал вслух. Никакой памяти, никакой реакции на интонацию, никакой многозадачности.
Сейчас всё иначе. GPT-4o, Gemini Ultra и модели семейства Claude научились работать в real-time: слышат паузы, ловят уточнения, понимают контекст предыдущих реплик и даже реагируют на то, что ты не договорил. Это принципиально другой опыт — ближе к разговору с человеком, который не торопится и умеет слушать.
Но «умеет слушать» — это размытое понятие. Конкретнее: в 2025 году хороший голосовой ассистент должен уметь прерываться, когда перебиваешь, помнить контекст в рамках сессии, не терять нить длинного рассуждения и отвечать быстро — меньше трёх секунд задержки, и диалог начинает напрягать.
Что я тестировал и как
Взял пять сценариев:
Сценарий 1 — длинное рассуждение вслух: объяснял ассистенту бизнес-проблему, потом просил найти в ней противоречие. Тут важна способность удерживать цепочку аргументов.
Сценарий 2 — перебивание на полуслове: в середине фразы менял формулировку и смотрел, как ассистент реагирует.
Сценарий 3 — техническая задача: просил написать SQL-запрос и тут же попросил оптимизировать его. Проверка на работу с кодом в голосовом режиме.
Сценарий 4 — бытовой: заказ набора блюд в ресторане через ассистента. Имитация task-oriented диалога.
Сценарий 5 — русский язык и код-свитчинг: половина на русском, половина на английском, терминология из области ML.
Замерял время ответа, наличие галлюцинаций (фактические ошибки), релевантность и удобство голоса.
ChatGPT с голосовым режимом: самый массовый и самый скучный
OpenAI не стали изобретать и сделали голосовой режим расширением текстового ChatGPT. Нажимаешь на иконку наушников, говоришь — и дальше работает та же модель, просто с ASR (автоматическое распознавание речи) на входе и TTS (синтез речи) на выходе.
Что хорошо: стабильность. Модель редко сбивается, хорошо держит длинный контекст и адекватно реагирует на уточнения. В сценарии с SQL-запросом ChatGPT сходу предложил рабочий вариант и нормально отреагировал на просьбу оптимизировать. Это было ожидаемо — текстовая модель сильная.
Что напрягает: голоса. Male Voice (Atlas) и Female Voice (Breeze) звучат неплохо по отдельности, но в длинном диалоге начинают раздражать — слишком «озвучено», слишком ровно. Нет спонтанности, нет живых пауз и междометий. А ещё ChatGPT часто берёт паузу перед ответом — и в голосовом режиме эти 3-4 секунды тишины ощущаются как обрыв разговора.
Русский язык поддерживается, но с оговорками: в технических темах (тот же SQL) качество падает заметнее, чем в английском. И код-свитчинг работает, но модель иногда путает нейминг и вставляет переменные на том языке, который использовался в последних репликах.
Вердикт: хороший массовый вариант. Если не копать глубоко — всё работает. Но для профессиональных задач где-то не хватает глубины, а где-то — живого темпа.
Gemini Ultra Live: амбиции и реальность
Google пошли дальше и встроили голосовой режим в Android как нативную функцию. Gemini Live — это попытка сделать из ассистента что-то, что ты носишь с собой и разговариваешь с ним в любой момент.
Фишка Gemini — контекст телефона. Ассистент видит твои фото, документы, календарь. В теории это мощно: «посмотри на мои фотографии из прошлогодней поездки и найди, где мы были в ноябре» — и он ищет. На практике работает через раз. Геолокация по фото — штука ненадёжная, и если ты не подписывал даты вручную, результат угадывает.
В техническом сценарии с SQL Gemini сдал хуже, чем ChatGPT. Модель чаще давала приблизительные ответы и хуже держала строгость синтаксиса. Зато в бытовом сценарии — заказ блюд, простой task-oriented диалог — Gemini был быстрее и естественнее. Там, где не нужна точность на уровне кода, он выигрывает за счёт темпа.
Русский язык — больная тема. Gemini Ultra хуже всего из трёх вариантов знает русскую специфику. В ML-терминологии путался чаще остальных, а в длинных русских фразах иногда терял середину предложения.
Вердикт: интересная штука для бытовых сценариев и для тех, кто уже живёт в экосистеме Google. Для серьёзной работы — рановато.
Claude через API: для тех, кому нужен контроль
Тут всё сложнее. У Anthropic нет нативного голосового приложения, как у OpenAI или Google. Но можно собрать своё: берёшь Claude через API, подключаешь Whisper для распознавания речи, ElevenLabs для синтеза — и получаешь ассистента, которого контролируешь сам.
Я так и сделал. И результат был неоднозначным.
С одной стороны — качество ответов. Claude в текстовом режиме и так одна из сильнейших моделей, и в голосовом режиме она не теряет глубину. В сценарии с бизнес-проблемой именно Claude первым заметил противоречие в моей аргументации, которое я пропустил. Это было по-настоящему полезно.
С другой — задержка. Whisper + Claude + ElevenLabs дают совокупную задержку в 4-6 секунд в моём сетапе. Это много. Живой разговор с таким ассистентом вызывает фрустрацию — ты уже забыл, что хотел сказать, пока он думает.
Плюс настройка. Whisper отлично распознаёт русский, ElevenLabs делает голоса, которые не отличить от живых, — но всё это требует инфраструктуры и времени. Не для всех.
Вердикт: для технических специалистов, которые готовы собирать кастомное решение. Если нужно качество ответа и есть ресурсы на инфраструктуру — Claude через API обходит конкурентов. Если нужна простота — ставьте ChatGPT.
Где голосовые ассистенты реально полезны, а где — нет
После недели тестов я для себя выделил три зоны.
Работает хорошо: мозговой штурм, когда нужно выговориться; первичная разведка идеи — «а что если сделать X?»; чтение и суммаризация документов на ходу; подготовка к встречам — проговорить основные тезисы и получить обратную связь.
Работает так себе: точная работа с кодом — голос хорош для обсуждения архитектуры, но не для написания; длинные последовательные задачи, где нужно помнить 15 шагов; anything на русском, что выходит за рамки бытового.
Не работает пока: anything, где нужна ссылка на конкретный документ с точностью до слова; ситуации, где потеря контекста за минуту разговора критична; мультиязычные диалоги с быстрым переключением — модели пока путают языки и теряют поток.
Коротко: кому что брать
ChatGPT — если хочешь просто попробовать и не хочешь заморачиваться. Стабильно, понятно, минус-минус — нет глубины настройки и голоса звучат искусственно.
Gemini — если ты в Android-экосистеме и хочешь ассистента, который видит твой контекст. Для бытовых задач — отлично. Для технических — под вопросом.
Claude через API — если тебе важна точность и глубина ответов, ты готов собирать свой воркфлоу и у тебя есть время на настройку. Качество ответа окупает сложность.
Мой друг-врач в итоге остался на ChatGPT. Сказал, что для его задач — заметки, расшифровки, ответы — достаточно. И знаете, он, наверное, прав. Не все должны собирать кастомные решения на Claude. Иногда «достаточно хорошо» — это именно то, что нужно.
Но если вам важна глубина — не поленитесь попробовать все три. Разница в качестве ответов ощущается уже на третьем диалоге.
