Вход Регистрация

Google представила Gemini 3.8 Live с говорящим AI-аватаром

4 мин.
Google добавила Gemini 3.8 Live визуального собеседника, который не просто озвучивает ответы, а смотрит на пользователя, меняет выражение лица и синхронизирует артикуляцию с речью. Новая функция поддерживает десятки языков, однако пока предназначена только для корпоративных клиентов Gemini Enterprise.
Gemini 3.8 Live с Live Avatar
Gemini 3.8 Live с Live Avatar

Google обновила Gemini 3.8 Live, добавив режим Live Avatar с анимированным виртуальным персонажем. Во время разговора пользователь видит не только текст или слышит голосовой ответ, но и наблюдает, как AI-аватар двигает губами, меняет выражение лица и реагирует на ход беседы в реальном времени.

Новая функция рассчитана на более естественное взаимодействие с искусственным интеллектом. Аватар синхронизирует мимику и артикуляцию с генерируемой речью, поэтому ответы выглядят как диалог с цифровым собеседником, а не как обычная озвучка

По заявлению Google, Live Avatar поддерживает 97 языков. Система может переключаться между ними прямо во время разговора без заметного ухудшения качества видео и так называемого visual drift - постепенного рассинхрона между звуком и движениями лица.

В демонстрации Google персонаж разговаривает сначала на английском, а затем на японском. В обоих случаях движение рта соответствует произносимым словам, несмотря на разницу в фонетике и темпе речи. Это особенно важно для многоязычных сценариев, где автоматический перевод часто приводит к задержкам или неестественной артикуляции.

Live Avatar также способен выводить информацию на экран во время беседы. Такой режим может пригодиться для корпоративных презентаций, обучения, поддержки клиентов и видеоконсультаций, где пользователю важно одновременно слышать объяснение и видеть связанные с ним материалы.

На первом этапе функция доступна только клиентам Gemini Enterprise. Google не раскрыла сроки запуска Live Avatar для обычных пользователей Gemini и не сообщила, появится ли возможность выбирать внешний вид, голос или характер виртуального персонажа.

Что изменилось в Gemini Live

Gemini Live развивается как разговорный режим с низкой задержкой, а Live Avatar добавляет к нему визуальный слой. В отличие от стандартного голосового помощника, система должна синхронно обрабатывать речь, ответ модели и поток анимации лица. Именно поэтому для функции важны стабильное соединение и достаточная вычислительная мощность на серверной стороне.

Технология построена вокруг мультимодального взаимодействия: Gemini может работать с голосом, изображениями и содержимым, которое пользователь показывает в процессе разговора. В экосистеме Gemini Live ранее уже тестировались сценарии с камерой и демонстрацией экрана, а новая функция переносит акцент с анализа информации на присутствие виртуального собеседника.

Для пользователей в России практическая доступность сервиса будет зависеть не только от корпоративной подписки, но и от поддержки аккаунта, региона, языковых настроек и качества подключения к инфраструктуре Google. Даже при наличии русского языка в списке поддерживаемых языков конкретный набор функций может отличаться для разных рынков.

Появление Live Avatar усиливает конкуренцию между поставщиками AI-сервисов в сфере цифровых ведущих и виртуальных консультантов. Однако пока Google демонстрирует технологию прежде всего как корпоративный инструмент, а не как массовую функцию для личных аккаунтов.

97 языковAI-аватарGemini 3.8 LiveGemini EnterpriseGoogleGoogle GeminiLive Avatarголосовой помощникискусственный интеллектмультимодальный AIсинхронизация губ