24 сентября Google представила Gemini 3.8 Live with Live Avatar. Система соединяет разговор с потоковым видео: аватар слушает, отвечает голосом, меняет выражение лица и синхронизирует движения губ с речью. Это не заранее записанный ролик с наложенной озвучкой, а интерактивный интерфейс, где ответ формируется во время диалога.
В опубликованных демонстрациях Google показывает персонажей с разной внешностью, переход между языками и сценарий регистрации гостя, в котором агент обращается к инструментам, пока разговор продолжается. Релиз доступен в Gemini Enterprise. Создание собственного персонажа по референсному изображению ограничено отдельным доступом для организаций — это существенное условие, если хочется повторить именно фирменный аватар.
Чем такой аватар отличается от обычного голосового бота
У голосового бота есть микрофон, распознавание речи и звуковой ответ. Здесь добавляется визуальный канал: пользователь видит персонажа, мимику и синхронизацию губ. По описанию Google, система обрабатывает аудио и изображение одновременно и поддерживает разговор, пока в фоне выполняются вызовы инструментов.
Последнее особенно важно для практического сценария. Если агент проверяет запись в календаре или статус заявки, пауза на запрос к API может разрушить ощущение непрерывного разговора. Асинхронный вызов позволяет продолжать диалог и вернуться с результатом. Однако внешний вид персонажа не гарантирует правильного ответа: данные инструмента, разрешения и подтверждение действий по-прежнему требуют отдельной проверки.
Что показано в визуальной части
Google заявляет точную синхронизацию губ, естественные выражения и переключение между 97 языками без видимого дрейфа персонажа. В демонстрации можно увидеть, как меняются голос и артикуляция в середине разговора. Для команды, которая делает интерфейс, это повод оценивать не один красивый кадр, а последовательность: начало фразы, перебивание, паузу, ответ после вызова инструмента и переход между языками.
Своего аватара организация может создать из качественного референсного изображения, сохраняя черты персонажа и стиль. Но официальное описание прямо ограничивает эту возможность доступом по приглашению для предприятий. Готовые персонажи и собственный образ — разные варианты продукта; их не стоит смешивать в обещаниях доступности.
Что проверить перед использованием
Для честного теста возьмите короткий диалог с несколькими типами реплик: вопрос на известный факт, уточнение, смену языка и запрос к внешнему источнику данных. Отдельно измерьте время до первого звука и до первого кадра, проверьте синхронизацию губ при перебивании и посмотрите, как система обозначает ошибку инструмента. Публикация Google не даёт универсальной задержки для любой сети и устройства, поэтому такой замер нужен на своей инфраструктуре.
Google указывает, что выходное аудио и видео помечаются SynthID. Это механизм происхождения контента, но он не заменяет согласие человека, если используется его изображение или голос. Мы не запускали Live Avatar и опираемся на материалы разработчика; качество русской речи и устойчивость персонажа в длинной сессии остаются вопросами для отдельного испытания.