GenClaw: Tencent Hunyuan의 코드 구동 에이전틱 이미지 생성 프레임워크

GenClaw: Tencent Hunyuan의 코드 구동 에이전틱 이미지 생성 프레임워크

LLM 에이전트가 SVG·HTML·Three.js 코드로 스케치한 뒤 이미지 모델로 완성하는 GenClaw 방법론이 공개됐어요.

Tencent Hunyuan 팀이 LLM 에이전트가 사람처럼 먼저 개념을 구상하고, 코드로 스케치한 다음, 이미지 생성 모델로 마무리하는 3단계 이미지 생성 패러다임 GenClaw를 공개했어요. 에이전트는 검색과 추론으로 개념적 지식을 구성하고, SVG·HTML·Three.js 같은 코드를 통해 실행 가능한 시각적 스케치를 렌더링한 뒤, 최종적으로 텍스처·재질·포토리얼리즘을 이미지 생성 모델로 보완해요.

기존 이미지 생성 에이전트는 텍스트 프롬프트를 반복적으로 수정하는 블랙박스 방식에 머물러 있었어요. GenClaw는 코드를 언어 추론과 픽셀 합성 사이의 제어 가능한 중간 캔버스로 활용함으로써, 프로그래밍 로직과 생성 모델의 시각적 표현력을 원활히 통합해요. 이 접근법은 이미지 생성 과정에 높은 해석 가능성과 제어력을 부여한다는 점에서 기존 방법과 크게 차별화돼요.

게임 컨셉 아트 제작에서 이 기술은 특히 유용할 것으로 기대돼요. 아티스트처럼 단계적으로 생각하며 이미지를 구성할 수 있어, 구도·비율·레이아웃에 대한 정밀한 제어가 필요한 게임 UI나 씬 디자인에 바로 적용할 수 있어요. AI 이미지 생성의 블랙박스 문제를 해결하려는 방향을 제시한다는 점에서도 의미 있는 연구예요.

원문: HuggingFace / arXiv (Tencent Hunyuan)