구글, 실시간 멀티모달 AI 'Gemini 3.8 Live' 출시

구글, 실시간 멀티모달 AI 'Gemini 3.8 Live' 출시

구글이 카메라·마이크·화면을 동시에 인식하며 실시간 대화가 가능한 Gemini 3.8 Live와 복잡한 추론을 지원하는 Extended Thinking 모델을 출시했어요.

구글이 음성 AI의 차원을 한 단계 끌어올린 두 가지 새 모델을 공개했어요. 'Gemini 3.8 Live'는 카메라·화면·마이크를 동시에 인식하며 실시간 대화를 이어갈 수 있어요. 97개 언어 간 대화 도중 자동 전환을 지원하고, 백그라운드에서 도구 호출과 API 실행을 처리하면서도 대화 흐름을 끊기지 않게 유지해요. 'Gemini 3.8 Live Extended Thinking'은 복잡한 작업에 특화된 모델로, 추론과 발화를 동시에 진행하며 진행 상황을 실시간으로 안내해요. Artificial Analysis 음성-음성 품질 지수에서 82.6점으로 1위를 기록했고, Big Bench Audio에서 97.7%를 달성했어요.

디자이너·아티스트 관점에서 가장 주목할 기능은 '화면을 보여주면서 AI와 대화'하는 방식이에요. 작업 중인 화면을 공유하면 AI가 시각적 맥락을 즉시 파악하고 실시간 피드백을 제공해요. 스케치와 음성 피드백만으로 React 컴포넌트를 생성하는 데모, 체스 게임을 실시간 시각 인식으로 분석하는 데모 등이 공개됐어요. Google Workspace의 Docs Live·Gmail Live·Keep Live와 Google 검색에도 통합되며, Gemini API를 통해 개발자들도 바로 활용할 수 있어요.

원문: Google Blog