Google, Gemini 3.8 Live에 실시간 AI 아바타 추가
Google이 Gemini 3.8 Live에 음성과 실시간 생성 영상을 결합한 Live Avatar를 추가했다. AI 에이전트가 사용자를 보고 듣고 말하는 동시에 백그라운드에서 도구를 실행할 수 있으며, 97개 언어 전환과 기업용 맞춤 아바타도 지원한다.

UPDATE DETAIL
무엇이 발표됐는가
Google은 2026년 9월 24일 Gemini 3.8 Live with Live Avatar를 공개했습니다.
기존 Gemini 3.8 Live가 실시간 음성 대화와 추론에 초점을 맞췄다면 Live Avatar는 여기에 실시간에 가까운 생성형 영상을 결합합니다.
사용자는 화면 속 AI 캐릭터와 대화할 수 있고, AI는 음성만 출력하는 것이 아니라 입 모양과 표정까지 대화에 맞춰 표현합니다.
중요한 점은 단순히 음성 AI 위에 애니메이션 캐릭터를 붙인 것이 아니라는 것입니다.
Live Avatar는 시각 정보와 음성을 동시에 처리하고 이에 맞춰 영상과 음성을 생성합니다.
즉 AI가
보고 → 듣고 → 판단하고 → 말하고 → 표정으로 반응하는
하나의 실시간 인터페이스로 구성됩니다.
주요 기능과 작동 방식
실시간에 가까운 영상 생성
Live Avatar는 Gemini의 실시간 대화 모델과 저지연 스트리밍 영상을 결합합니다.
AI가 말할 때 음성과 영상이 함께 생성되며 입 모양, 표정, 대화 순서가 자연스럽게 이어지도록 설계됐습니다.
Google은 이를 단순한 아바타 영상이 아니라 visual presence, 즉 AI가 대화 공간에 시각적으로 존재하는 방식으로 설명합니다.
보고 듣는 멀티모달 대화
Live Avatar는 영상과 음성을 동시에 입력으로 받을 수 있습니다.
따라서 사용자가 보여주는 상황을 보면서 대화를 이어가는 형태의 에이전트를 만들 수 있습니다.
예를 들어 고객이 제품이나 화면을 카메라로 보여주면 AI가 그것을 확인하면서 음성으로 안내하는 형태가 가능합니다.
대화하면서 백그라운드 도구 실행
Live Avatar는 비동기 도구 호출을 지원합니다.
기존 AI 에이전트에서는 외부 도구를 호출하거나 데이터를 가져오는 동안 대화가 멈추는 경우가 있었습니다.
Live Avatar는 대화를 계속하면서 백그라운드에서 필요한 도구를 실행할 수 있습니다.
Google은 호텔 체크인 사례를 예시로 제시했습니다.
AI 아바타가 고객과 계속 대화하는 동안 뒤에서는 필요한 정보를 조회하거나 도구를 호출할 수 있습니다.
97개 언어 전환
Live Avatar는 97개 언어에서 speech-to-speech 동기화를 지원합니다.
대화 중 언어가 바뀌더라도 해당 언어의 음성에 맞춰 입 모양과 표정을 조정합니다.
Google은 언어 전환 과정에서도 영상 품질이나 아바타 움직임이 무너지지 않도록 설계했다고 설명합니다.
기업 맞춤형 아바타
기업은 Google이 제공하는 기본 아바타를 사용할 수 있습니다.
또한 고품질 참조 이미지 하나를 이용해 브랜드에 맞는 사용자 지정 아바타를 만들 수도 있습니다.
다만 맞춤형 아바타 생성은 현재 일반 공개 기능이 아니라 enterprise allowlisting을 받은 조직에 한정됩니다.
이용 대상과 지원 환경
현재 Live Avatar의 주요 대상은 일반 Gemini 앱 사용자가 아니라 기업과 개발자입니다.
사용 환경:
- Gemini Enterprise
- Gemini Enterprise Agent Platform
- Live API
일반 Gemini 앱에서 누구나 개인 아바타를 만들어 사용하는 기능으로 발표된 것은 아닙니다.
출시 상태
Gemini 3.8 Live with Live Avatar는 발표일부터 Gemini Enterprise에서 제공됩니다.
다만 사용자 지정 아바타 생성은 별도 enterprise allowlisting이 필요합니다.
따라서
Live Avatar 제공 시작과
모든 기업이 자유롭게 맞춤형 아바타를 만들 수 있음
을 같은 의미로 해석하면 안 됩니다.
가격과 제한
Google의 이번 공식 발표문에는 Live Avatar만을 위한 별도의 단일 소비자 가격이 명시되어 있지 않습니다.
Gemini Enterprise 및 API 사용 환경과 계약 방식에 따라 비용 구조가 달라질 수 있으므로 실제 도입 전 Google Cloud의 최신 가격과 제공 조건을 확인해야 합니다.
또한 맞춤형 아바타 생성은 현재 allowlist 제한이 있습니다.
안전 장치
AI가 사람처럼 보이고 말하는 인터페이스에서는 사용자가 실제 사람과 AI를 혼동할 가능성이 커집니다.
Google은 이를 위해 Live Avatar가 생성하는 음성과 영상 모두에 SynthID 워터마크를 적용한다고 밝혔습니다.
SynthID는 AI가 생성한 콘텐츠임을 판별할 수 있도록 출력물에 삽입되는 워터마크 기술입니다.
WHAT CHANGED
무엇이 바뀌는가
기존 방식
실시간 AI 대화의 중심은 대부분 음성이었습니다.
사용자는 AI의 목소리를 들을 수 있었지만 화면 속 AI가 실제 대화 상대처럼 시선을 맞추고 표정을 바꾸며 반응하는 경험은 별도의 아바타 시스템과 결합해야 했습니다.
외부 도구를 호출할 때 대화 흐름이 끊기는 문제도 있었습니다.
변경된 방식
Gemini 3.8 Live는 이제 하나의 모델 경험 안에서
- 시각 입력
- 음성 입력
- 음성 출력
- 실시간 생성 영상
- 표정과 lip-sync
- 도구 호출
- 다국어 대화
를 연결합니다.
즉 음성 챗봇에 얼굴을 붙이는 것이 아니라 멀티모달 에이전트 자체에 시각적 존재를 추가하는 방향입니다.
실제 영향
AI 인터페이스의 기준이 다시 달라질 가능성이 있습니다.
지금까지 AI 서비스에서 가장 익숙한 인터페이스는 텍스트 입력창이었습니다.
이후 Voice AI가 등장하면서 말을 통한 상호작용이 늘었습니다.
Live Avatar가 보여주는 다음 단계는
텍스트 → 음성 → 실시간 시각적 에이전트
입니다.
다만 이것이 모든 서비스에서 더 좋은 인터페이스라는 의미는 아닙니다.
사용자가 얼굴을 보면서 대화해야 실제 가치가 생기는 영역에서 의미가 큽니다.
WHAT WE CAN DO
이 변화로 무엇을 할 수 있는가
고객 서비스
기업은 단순한 전화 상담 AI 대신 화면에 등장하는 AI 상담원을 만들 수 있습니다.
예를 들어 호텔에서는 고객과 대화하면서 예약 정보를 조회하고 체크인 절차를 진행하는 AI 직원 형태로 활용할 수 있습니다.
적합한 사용자: 호텔, 항공, 금융, 통신, 온라인 고객지원
주의점: 중요한 계약이나 결제, 개인정보 처리에는 인간 승인과 명확한 AI 표시가 필요합니다.
제품 안내
사용자가 제품을 카메라로 보여주면 AI가 현재 상황을 확인하면서 사용법을 설명하는 방식도 가능합니다.
적합한 사용자: 전자제품, 자동차, 산업 장비, 소프트웨어 교육
텍스트 매뉴얼을 검색하는 대신 AI에게 실제 제품을 보여주면서 질문하는 형태입니다.
AI 교육·강사
언어 교육이나 온라인 수업에서도 활용 가능성이 있습니다.
학습자는 화면 속 AI와 얼굴을 보면서 대화하고, AI는 학습자의 발화와 시각적 상황을 확인하면서 피드백을 제공할 수 있습니다.
97개 언어 전환 기능은 다국어 학습 서비스에도 활용할 수 있습니다.
가상 안내원
공항, 병원, 관광지, 박물관 등에서는 여러 언어를 사용하는 방문객에게 동일한 AI 안내원을 제공하는 형태를 고려할 수 있습니다.
한 명의 디지털 캐릭터가 사용자의 언어에 따라 자연스럽게 언어를 전환하는 구조입니다.
브랜드 AI
기업은 향후 브랜드 캐릭터 자체를 대화 가능한 AI로 만드는 것도 가능합니다.
하지만 맞춤형 Live Avatar는 현재 allowlisting 대상이므로 모든 개발자가 바로 사용할 수 있는 기능은 아닙니다.
주의할 점
시각적 AI가 자연스러워질수록 새로운 검증 문제가 생깁니다.
사용자는 반드시 다음을 구분할 수 있어야 합니다.
- 실제 사람인가 AI인가
- 실제 영상인가 생성 영상인가
- AI가 말하는 정보의 출처는 무엇인가
- AI가 뒤에서 어떤 도구를 실행하고 있는가
- 어떤 개인정보가 처리되고 있는가
AI가 사람처럼 보인다는 이유만으로 답변의 신뢰도가 높아지는 것은 아닙니다.
오히려 사람처럼 보이는 AI일수록 정보의 검증 기준은 더 명확해야 합니다.