|
Компания Tavus представила Griffin — модель для видеодиалогов в реальном времени, которая анализирует происходящее на экране, понимает речь собеседника и формирует ответ одновременно. По словам разработчиков, это первая модель, которая сумела пройти видеотест Тьюринга. В отличие от обычных систем, где распознавание речи, языковая модель, синтез голоса и аватар работают последовательно, Griffin объединяет эти процессы в одну полнодуплексную video-to-video модель. Griffin несколько раз в секунду заново оценивает разговор, поэтому может кивнуть или вставить короткую реплику, пока собеседник ещё говорит, остановиться после перебивания и реагировать на происходящее перед камерой. Модель генерирует видео в разрешении 720p небольшими фрагментами по 320 мс, а средняя задержка между аудио и видео составляет 0,43 секунды при работе на NVIDIA H100. Голос, по данным Tavus, можно клонировать примерно по десятисекундной записи. Для демонстрации эффективности модели разработчики провели видеотест Тьюринга. Его задача — оценить способность искусственного интеллекта реалистично имитировать человека при видеосвязи в режиме реального времени. После минутного разговора 48% участников (26 из 54) были убеждены, что общались с реальным человеком. Для сравнения, в схожем эксперименте с предыдущим набором моделей Tavus только 1 из 41 участника принял ИИ за реального человека. В независимом тесте NVIDIA VideoFDB новая модель Griffin также заняла первое место среди 15 проверенных моделей сразу по генерации и восприятию видео. Пока что Tavus не открывает доступ к Griffin для обычных пользователей. В целях безопасности версия Griffin-Lite доступна только ограниченному числу доверенных тестировщиков. Онлайн-репетиторство, порностриминги, гадалки, психологи, коучи, в общем, все виды услуг, оказываемых по видеосвязи. А уж какой простор для скамеров... #ии 2 октября в 22:15
|