Photoroom, 오픈소스 텍스트-이미지 모델 PRX의 데이터 전략 공개 — 다양성이 품질보다 중요해요

Photoroom, 오픈소스 텍스트-이미지 모델 PRX의 데이터 전략 공개 — 다양성이 품질보다 중요해요

포토룸이 오픈소스 이미지 생성 모델 PRX의 훈련 데이터 파이프라인 전략을 4부작 마지막 편으로 상세히 공개했어요.

포토룸(Photoroom)이 자사 오픈소스 텍스트-이미지 생성 모델 PRX의 훈련 데이터 파이프라인 구축 과정을 블로그 4부작의 마지막 편으로 공개했어요. PRX는 70억(7B) 파라미터 규모의 디퓨전 모델이며, 이번 시리즈는 아키텍처·학습 기법·평가·데이터 전략을 각각 다루고 있어요. 핵심 원칙은 '완벽한 데이터보다 다양한 데이터'로, 공개 데이터셋과 사내 데이터를 결합하고, Qwen3-VL-8B 비전 언어 모델로 자동 캡셔닝을 수행하며, 탐색용 Lance 포맷과 훈련용 MDS 스트리밍 포맷을 구분해 파이프라인 효율을 높였어요. Qwen3-VL-8B는 FID·CMMD·DINO-MMD 벤치마크에서 대안 모델 대비 가장 우수한 성과를 내 최종 선택됐고, 초당 약 20장의 처리 속도를 달성했어요.

기술적 결정들도 인상적이에요. 이미지는 PNG 대신 JPEG 품질 92로 저장해 시각적 차이 없이 저장 용량을 3~10배 줄였고, 캡션 품질 기반 라이트 필터링과 퍼셉추얼 해시 기반 중복 제거로 데이터 품질을 유지했어요. 다양한 이미지 비율을 처리하기 위한 애스펙트 비율 버킷팅도 구현했으며, Ray Data로 분산 처리를 수행했어요. 팀은 '정확하지 않은 이미지도 그대로 캡셔닝하라'는 원칙을 고수해 이미지 자체를 필터링하지 않고 캡션 정확도로 품질을 관리하는 방식을 택했어요. 사전 학습 단계에서는 완벽한 데이터보다 다양성이 더 중요하다는 실험적 발견에서 비롯된 접근 방식이에요.

대형 AI 기업이 아닌 이커머스 특화 이미지 편집 스타트업이 수십억 파라미터 이미지 생성 모델의 데이터 전략 전체를 이토록 상세히 오픈소스로 공개하는 사례는 드물어요. 모델 가중치·데모·코드까지 모두 공개된 PRX는 AI 아트 도구의 민주화를 실질적으로 이끄는 프로젝트로 주목받고 있어요. 독자적인 이미지 생성 파이프라인을 구축하려는 개발자와 AI 아트 연구자 모두에게 실용적인 레퍼런스가 될 거예요.

원문: Hugging Face Blog