Сижу в кафе, за соседним столиком парень минут пять разговаривает с телефоном — не торопясь, по делу, вслух. Задаёт вопросы, уточняет, получает ответы. Не показывает экран окружающим, не держит трубку у уха. Просто говорит.
Лет пять назад это выглядело бы странно. Сейчас — нормально. Голосовые ассистенты наконец доросли до того, чтобы с ними разговаривали не через силу.
Разбираюсь, что из этого реально работает и для чего.
Что изменилось за последний год
Раньше ассистенты выполняли команды. Сейчас — ведут диалог. Задают уточняющие вопросы, запоминают контекст в рамках одной сессии. Это заслуга связки из трёх технологий: быстрого распознавания речи, мощной языковой модели на бэкенде и генерации голоса, которая хотя бы приближается к человеческой интонации.
Главная боль ушла, появилась новая. Раньше раздражало, что ассистент не понимал длинную фразу или отвечал так, что хотелось прекратить разговор. Теперь иногда бесит другое — он слишком старается быть полезным и перебивает на полуслове.
Кто сейчас на рынке
ChatGPT Voice (OpenAI). Встроен прямо в приложение. Четыре голоса на выбор, разговор идёт естественно — можно перебить, можно попросить повторить. Умеет анализировать картинку с камеры и описывать увиденное. Хорошо справляется с задачами, где нужен последовательный анализ: разобрать документ, объяснить формулу, спланировать маршрут. Из минусов — нет нормальной интеграции с внешними сервисами, это скорее собеседник для разовых задач.
Google Gemini Live. Живёт в экосистеме Google — Android, наушники. Можно болтать в фоне, пока едешь на велосипеде или идёшь по улице. Здорово гуглит и актуализирует информацию. Если спросить "какие новости по закону об X", выдаст свежее с привязкой к дате. Умеет работать с файлами из Google Drive. Минус — отвечает порой слишком общо, недоговаривает.
Apple Intelligence + Siri. Тихо, но верно Siri подтянулась. В 2025 году она наконец нормально понимает контекст в рамках нескольких приложений: можно попросить "найди письмо от Миши с файлом про бюджет и отправь его Марине в мессенджер" — и это работает. Главное ограничение — экосистема. На Android не работает вообще.
Алиса (Яндекс). В России это самый массовый ассистент. К 2025 году научилась вести длинные разговоры и работать с Яндекс-поиском в реальном времени. Умеет звонить, заказывать такси, управлять умным домом. Для русскоязычного рынка — сильный вариант, особенно с Яндекс-станцией. Но как интеллектуальный собеседник для сложных задач заметно уступает ChatGPT.
Команда (VK). Младше, но развивается быстро. В 2025 добавили нормальный контекст и интеграцию с ВКонтакте. Для тех, кто живёт в экосистеме VK, удобно — наговорил голосовое, получил текстовый ответ.
Где это реально пригождается
Просто болтать прикольно первые полчаса. Дальше встаёт практический вопрос: а зачем мне это в рабочем процессе.
Первое — быстрый разбор информации. Ставлю задачу: "Объясни за пять минут, что такое новый закон о маркировке рекламы, который приняли в марте". Слушаю, параллельно записываю тезисы. На это уходит минут семь, включая уточняющие вопросы. Раньше я бы читал три новостных текста и час собирал картину.
Второе — подготовка к встречам. Краткая выжимка из материалов, генерация вопросов, которые стоит задать, оценка рисков контракта. Не заменяет нормальную работу, но экономит первый круг.
Третье — голосовой ввод для тех, кто не любит печатать. Одна знакомая ведёт так все рабочие заметки — наговорила, ассистент привёл в порядок, отправила. Скорость заметно выше, чем с клавиатуры.
Бизнес-кейсы: где всё серьёзно
От бытового любопытства к практике. Голосовые ИИ начали проникать в реальные рабочие процессы.
Колл-центры. Пилотные проекты, где ИИ берёт на себя первичные звонки — бронь, подтверждение записи, ответ на частые вопросы. Живой оператор подключается, когда клиент просит "соедините с человеком" или задача нестандартная. Экономия — до 40% времени операторов. Пока это работает только на структурированных сценариях. Если клиент начинает мяться и перескакивать между темами, ИИ теряет нить.
Медицина. В нескольких клиниках в Европе и Штатах ИИ-ассистент ведёт первичный анамнез — собирает жалобы, уточняет симптомы, формирует сводку для врача. Тот приходит к пациенту уже с готовой картиной. Из разговоров с практикующими врачами — реакция смешанная: кто-то рад, кто-то жалуется, что теряет контакт с пациентом на этапе сбора информации.
Образование. Голосовые ассистенты как языковые партнёры — не новость, но качество диалога заметно выросло. Можно репетировать собеседование, разбирать бизнес-кейсы, тренировать переговорные навыки. Не заменяет живого наставника, но для практики разговорной речи — рабочий инструмент.
Недвижимость и автодилеры. Звонок по объекту — сколько комнат, какой этаж, есть ли парковка — ИИ отвечает круглосуточно, без очередей и усталости. Живой менеджер подключается на этапе показа. Вопрос в качестве скриптов: если сценарий кривой, ИИ будет уверенно отвечать ерунду.
Что пока не работает
Длинные разговоры всё ещё деградируют. После 15–20 минут ИИ начинает терять нить, повторяться, цепляться к не тому контексту. Для сложных задач разбивка на короткие сессии эффективнее.
Эмоциональный интеллект — на уровне хорошего актёра, а не понимающего человека. ИИ распознаёт тон ("ты звучишь расстроенным") и даже реагирует уместно, но это симуляция. Если нужен собеседник, который реально понимает — такого пока нет.
Русский язык заметно хуже английского по глубине и естественности. Особенно в Алисе — местами чувствуется, что ответ сгенерирован, а не продуман. ChatGPT на русском хорош, но всё равно уступает английской версии.
Куда это движется
Голосовой интерфейс переживает момент, когда он перестал быть прикольной фичей и стал обычным каналом взаимодействия. Как когда-то веб-интерфейс, потом мобильное приложение — теперь голос.
Вопрос не в том, будут ли люди говорить с ИИ. Будут. Вопрос в том, для каких задач это станет основным способом, а для каких останется экспериментом.
Моё ощущение: для информационных задач — разбор, поиск, выжимка — голос уже выигрывает у текста по скорости. Для задач, где нужен результат — написать документ, сделать расчёт, свести таблицу — текст и показываемый результат всё ещё удобнее.
Хороший тест — попробовать в следующий раз не гуглить, а спросить голосом. Не для всего подойдёт. Но для части задач — удивитесь, насколько быстрее.
