구글, 이미지·오디오·텍스트 뭐든 넣으면 영상으로 만드는 'Gemini Omni' 발표

구글, 이미지·오디오·텍스트 뭐든 넣으면 영상으로 만드는 'Gemini Omni' 발표

구글이 이미지·오디오·영상·텍스트 등 어떤 입력이든 받아 고품질 영상을 생성하는 멀티모달 모델 'Gemini Omni'를 I/O 2026에서 발표했어요.

구글이 I/O 2026에서 이미지·오디오·영상·텍스트 등 어떤 입력이든 받아 고품질 영상을 생성하는 멀티모달 AI 모델 패밀리 'Gemini Omni'를 발표했어요. 단순히 여러 입력을 합산하는 방식이 아니라, 모든 모달에 걸쳐 물리·문화·역사·과학 지식을 추론하여 일관된 결과물을 내는 것이 특징이에요. 첫 공개 버전인 Gemini Omni Flash는 Gemini 앱, YouTube Shorts, 창작 스튜디오 Flow에서 최대 10초 분량의 영상을 생성할 수 있어요.

편집 기능도 강력해요. 텍스트 명령만으로 사진을 수정하거나 디지털 아바타를 만들 수 있고, '클레이메이션 방식의 단백질 접힘 설명 영상'처럼 구체적인 요청도 내레이션까지 포함해 자동으로 완성해 줘요. 아바타를 만들 때는 안전 장치로 본인 음성 녹음 온보딩 절차가 있으며, 생성된 영상에는 구글의 SynthID 워터마크가 자동으로 삽입돼요. 광고 텍스트 정확도를 위해 강력한 텍스트 렌더링도 지원해, 상업적 활용 가능성이 높아요.

구글은 수 주 내 API를 제공하고 성능이 개선되면 전문가용 Omni Pro 모델도 출시할 계획이에요. 별도 영상 편집 도구 없이 단일 AI로 완성도 높은 영상 창작이 가능해지는 만큼, 영화·광고·크리에이터 콘텐츠 등 비주얼 아트 산업 전반에 큰 변화가 예상돼요. 특히 아트 에셋 제작, 영상 홍보물, 게임 트레일러 등을 다루는 크리에이터에게 새로운 가능성을 열어 줄 것으로 기대돼요.

원문: TechCrunch