Meta представила Muse Realtime Avatar: выразительные видеоаватары, синхронизированные с голосом Muse менее чем за секунду
23 сентября 2026 года Meta представила Muse Realtime Avatar — превращение Muse Realtime Voice в интерактивные аватары по фото или иллюстрации. Поток 448×768, задержка около 870 мс; Muse для возраста 18+.
23 сентября 2026 года на Meta Connect компания Meta представила Muse Realtime Avatar — систему, которая превращает Muse Realtime Voice в выразительные интерактивные аватары по референсному медиа: фото, иллюстрации или даже животным и предметам. Компания также анонсировала очки Ray-Ban Meta Audio и заявила, что Muse появится в очках; Muse по-прежнему доступен для возраста от 18 лет.
Как это работает
Аватар управляется аудиоуправляемым Diffusion Transformer, который делит поток речевых токенов с голосовой моделью, чтобы губы и мимика оставались синхронными. Meta сообщает о потоке портрета 448×768 при 25 кадрах в секунду и задержке около 870 миллисекунд от конца реплики пользователя до первого байта синхронизированных голоса и видео.
Дистилляция резко снижает вычисления: учитель с 120 оценками на чанк заменён учеником с двумя неуправляемыми оценками — сокращение в 60 раз. На одном GPU GB200 Meta сообщает о 12 одновременных сессиях realtime-видео — в 8 раз больше ёмкости, чем у базовой линии BF16.
Сравнения и безопасность
В сравнениях живых звонков, по данным Meta, люди-оценщики в целом предпочли Muse Realtime Avatar системам Runway Characters и HeyGen LiveAvatar. Для безопасности Meta применяет невидимый водяной знак Meta Video Seal без дополнительной задержки.
Почему это важно
Аватары реального времени по референсу сближают разговорный ИИ и экранное присутствие. Опубликованные Meta цифры задержки, ёмкости и водяного знака дают конкретную базу для того, как такие системы могут выходить на рынок — при этом возрастной порог 18+ и маркировка отражают заявленный Meta подход к безопасности Muse.