H Company Releases NeoMME: 260M/800M Single-Tower Multimodal Encoders (Apache 2.0)
H Company가 단일 트랜스포머 구조로 텍스트와 이미지를 함께 처리하는 멀티모달 인코더 NeoMME를 오픈소스로 공개했어요.
프랑스 AI 기업 H Company가 260M과 800M 두 가지 크기의 멀티모달 인코더 패밀리 NeoMME를 Apache 2.0 라이선스로 공개했어요. 일반적인 비전-언어 모델과 달리 NeoMME는 별도의 사전 학습된 비전 타워나 인과적 디코더 없이, 단 하나의 양방향 트랜스포머로 텍스트 토큰과 원시 이미지 패치를 함께 처리해요. 처음부터 다국어 데이터로 학습해 한국어를 포함한 다양한 언어를 지원해요.
성능 면에서도 눈에 띄는 결과를 보여줘요. 파인튜닝된 검색 특화 변형 모델이 같은 파라미터 크기 기준 ViDoRe v3 시각 문서 검색 벤치마크에서 1위를 기록했어요. 초당 51페이지를 인코딩해 ColModernVBERT보다 2배 빠르고, 계층적 토큰 풀링 기법으로 지연 상호작용 인덱스 저장 용량을 255배 줄였어요. 이 효율성 덕분에 방대한 시각 문서를 검색하는 RAG 파이프라인이나 멀티모달 에이전트에 실용적으로 적용할 수 있어요.
모든 체크포인트는 Hugging Face Transformers에서 바로 사용할 수 있어요. HuggingFace 블로그와 논문(arXiv 2609.01657)에서 기술적 세부 사항을 확인할 수 있어요. 크리에이티브 분야에서는 이미지-텍스트 교차 검색, 시각 문서 이해, 다국어 멀티모달 임베딩 등에 활용할 수 있을 것으로 기대돼요.
원문: MarkTechPost