Сижу, диктую задачи ассистенту вслух, и поймал себя на мысли: год назад я бы за такое себя засмеял. Голосовые интерфейсы казались игрушкой — что-то для умных колонок с ненужной музыкой и ответами в стиле «я не понял вопрос». Но что-то изменилось. Не в рекламе, а на практике.
Я провозился с несколькими голосовыми ИИ-ассистентами последние месяцы — для работы, для быта, просто из любопытства. Расскажу, что реально работает, где я сжёг время впустую и почему половина этих инструментов всё ещё раздражает больше, чем помогает.
ChatGPT Voice: когда наконец нормально
Начну с того, что использую чаще всего. ChatGPT с голосовым режимом в мобильном приложении — первый голосовой ИИ, с которым у меня получился нормальный рабочий разговор. Не «скажи, какая погода», а именно разговор: прерваться, переформулировать, сказать «нет, подожди, я имел в виду другое» — и ассистент не теряет нить.
Я пробовал так разбирать заметки после встреч. Надиктовывал сумбурно, вслух, как думаешь — и просил структурировать. Работает. Медленнее, чем напечатать, если набираешь быстро. Но если голова занята и руки тоже — это реально выход.
Где сломалось: технические термины. Сказал «промпт-инжиниринг» — расслышал что-то своё. Название библиотеки — три попытки, всё равно мимо. Не трагедия, но привыкнуть к тому, что некоторые слова надо произносить по слогам как на диктанте — странно.
Gemini Live: эксперимент с переменным успехом
Google запустил Gemini Live с претензией на «естественный разговор». Попробовал — и первые минуты правда впечатляют. Перебивает меньше, паузы держит, интонацию слышит лучше ChatGPT. Чувствуется, что в Google умеют делать голос — всё-таки годы работы с ассистентом за плечами.
Дальше начались нюансы. Gemini Live хочет быть разговорчивым. Задаёшь конкретный вопрос — получаешь развёрнутый ответ с подводкой, переходами, завершением. Как будто с тобой говорит ведущий подкаста, а не коллега. Мне не зашло. Минут двадцать потратил, объясняя, что хочу короткие ответы — помогло, но ненадолго.
Один кейс, где Gemini Live меня удивил: попросил помочь с устной подготовкой к презентации. Объяснял тему вслух, он переспрашивал, уточнял, возвращал мне структуру. Получился почти живой прогон. Для этого — хорош.
Apple Siri + Shortcuts: старый конь, но борозды нет
Siri я использую давно — и это отдельная история про ожидания. Apple каждый год обещает, что Siri стала умнее. Может, и стала. Но по сравнению с ChatGPT Voice и Gemini разрыв не сокращается — он растёт.
Где Siri выигрывает — интеграция. Установить таймер, добавить в календарь, позвонить, открыть приложение — всё это без лишних слов, без загрузки, без «дайте подумаю». Быстро и тихо. В этой нише она работает хорошо.
Стоит выйти за пределы команд — начинается знакомая боль. «Siri, напиши письмо коллеге про перенос встречи» — и ты получаешь или открытый браузер, или что-то невпопад. Я перестал ждать от неё понимания контекста. Пользуюсь как умным пультом — не больше.
ElevenLabs + пользовательские голоса: нишевый, но интересный случай
Это немного другая история — не ассистент в обычном смысле, а инструмент для создания голосового контента. Упомянуть не мог, потому что наткнулся случайно и потратил на него вечер.
ElevenLabs клонирует голос и строит сценарии, где голосовой агент говорит вашим голосом или заданным персонажем. Я сделал тестового ассистента с голосом, похожим на мой, и дал послушать коллеге — она не сразу поняла, что это не я. Жутковато. И при этом интересно.
Для контент-проектов, для обучения, для автоматизации клиентских сценариев — отдельное направление. Не замена личному ассистенту, но своя ниша есть.
Почему я всё ещё не перешёл на голос полностью
Голосовые ассистенты стали заметно лучше, но есть вещи, которые я пока не могу делать голосом так же хорошо, как текстом.
Приватность. Я не готов диктовать рабочие задачи в кафе — не потому что параноик, а потому что не хочу, чтобы соседи за столиком слышали про проект. Голосовой интерфейс предполагает, что ты один. Это условие выполняется реже, чем кажется.
Точность при сложных задачах. Когда надо сформулировать точно — я пишу. Голос хорош для черновиков, для «подумать вслух», для навигации. Но финальный промпт я всё равно наберу руками.
И привычка. Я печатаю быстро. Переучиваться тяжело даже когда инструмент объективно лучше в каких-то сценариях. Это не аргумент против голоса — просто честное признание.
Где голос реально выигрывает прямо сейчас
За эти месяцы у меня сложилась картина. Голосовые ассистенты работают хорошо в нескольких конкретных ситуациях.
Когда руки заняты: за рулём, на кухне, во время тренировки. Тут конкурентов нет, и даже Siri справляется.
Когда надо думать вслух — разбирать идею, проговаривать план, формулировать то, что сам ещё не понял. ChatGPT Voice для этого я использую регулярно. Что-то вроде интерактивного блокнота, который не молчит в ответ.
Когда задача простая и повторяющаяся: таймеры, напоминания, быстрые поиски. Здесь голос быстрее любого интерфейса.
Для всего остального — пока текст. Но это «пока» с каждым месяцем становится короче.
