Hcompany, 멀티모달-네이티브 및 다국어 인코더 NeoMME 공개
Hcompany는 단일 양방향 트랜스포머로 이미지와 텍스트를 처리하는 멀티모달-네이티브 및 다국어 인코더 NeoMME를 발표했다. 이 모델은 기존 VLM의 오버헤드를 줄이고 효율적인 시각 문서 검색을 지원하며, 고해상도 문서에 대한 저장 공간 및 추론 속도 문제를 개선한다.
Hcompany는 멀티모달-네이티브 및 다국어 인코더인 NeoMME 제품군을 공개했다. NeoMME는 260M 및 800M 두 가지 모델 크기로 제공되며, 기존의 많은 생성형 시각 언어 모델(VLM)과 달리 별도의 사전 학습된 비전 타워나 인과적 언어 모델을 사용하지 않는다. 대신 단일 양방향 트랜스포머가 텍스트 토큰과 원본 이미지 패치를 모두 처리하며, 마스크된 이산 확산(discrete masked-diffusion) 목표로 모델 전체를 처음부터 학습한다. 특히 시각 문서 검색을 위해 미세 조정된 NeoMME-Retriever는 밀집(dense) 및 지연 상호작용(late-interaction) 임베딩을 한 번의 순방향 패스로 생성하며, 계층적 토큰 풀링과 비대칭 양자화를 통해 지연 상호작용 인덱스 저장 공간을 크게 줄였다.
이러한 변화는 기존 시각 문서 검색 모델들이 사전 학습된 생성형 VLM을 기반으로 하는 방식의 한계에서 비롯된다. 기존 모델들은 별도의 사전 학습된 비전 인코더가 시각적 특징을 생성하고, 이를 프로젝터가 언어 모델의 입력 공간에 매핑한 후 인과적 디코더가 이미지와 텍스트 표현을 처리한다. 그러나 검색, 분류, 토큰 레이블링과 같은 작업은 텍스트를 자동 회귀적으로 생성할 필요가 없으므로, 이러한 아키텍처의 매개변수 및 연산 오버헤드는 불필요하다. ModernBERT가 양방향 인코더의 효율성을 개선했지만, ModernVBERT는 여전히 별도의 SigLIP2 비전 타워를 유지했다. NeoMME는 VLM의 오버헤드 없이 멀티모달 인코더를 설계하고 학습함으로써 이러한 효율성을 더욱 극대화하는 것을 목표로 한다.
NeoMME 인코더 백본은 260M 및 800M 두 가지 크기로 제공되며 동일한 아키텍처를 공유한다. 텍스트 입력은 분해된 토큰 임베딩을 사용하고, 이미지는 32x32 크기의 겹치지 않는 패치 그리드로 분할된 후 작은 MLP를 통해 투영되어 동일한 트랜스포머 인코더에 입력된다. 모델은 이미지의 종횡비와 크기를 유지하는 동적 이미지 해상도를 지원하여 고해상도 문서에 더 많은 토큰을 사용할 수 있다. 16,384 토큰의 긴 양방향 컨텍스트 길이를 가지며, 대부분의 레이어는 대칭 슬라이딩 윈도우 어텐션을 사용하고 매 6번째 레이어와 최종 레이어는 전역 어텐션을 사용한다. 또한 그룹화된 쿼리 어텐션, 쿼리-키 정규화, 게이티드 어텐션, 2D 로터리 위치 임베딩, Squared-ReLU MLP 등 최신 인코더 개선 사항을 적용했다. 다국어 텍스트 처리를 위해 131k 토큰 규모의 BPE 토크나이저를 다국어 텍스트, 코드, 수학, 기계 생성 이미지 전사 데이터로 처음부터 학습했다.
NeoMME는 이산 마스크 확산 텍스트 노이즈 제거 방식으로 처음부터 사전 학습된다. 텍스트 전용 예제의 경우 0에서 1 사이의 손상률을 무작위로 샘플링하여 각 텍스트 토큰을 독립적으로 마스킹한다. 멀티모달 예제에서는 0.3에서 1 사이의 손상률을 사용하며, 이미지 패치는 가시 상태로 유지된 채 NeoMME가 마스크된 텍스트를 재구성한다. 높은 마스킹은 모델이 마스킹되지 않은 입력 텍스트 토큰의 신호가 거의 또는 전혀 없는 상태에서 이미지 기반 설명을 학습하도록 유도한다. 사전 학습은 다국어 텍스트, 코드, 수학, 자연 이미지, 문서 이미지를 혼합하여 사용하며, 각 모델은 약 5,240억 개의 압축된 입력 토큰(텍스트 전용 2,900억 토큰 포함)을 처리한다. 데이터 효율성을 높이기 위해 NorMuon 옵티마이저를 사용했다.
NeoMME-Retriever는 NeoMME 백본을 재사용하지만, 검색을 위해 두 개의 공동 학습된 헤드를 추가한다. 밀집 헤드는 백본의 은닉 상태 벡터를 평균 풀링하여 정규화된 벡터를 생성하며, 이는 압축적이고 근사 최근접 이웃(ANN) 기술과 잘 작동한다. 지연 상호작용 헤드는 백본의 출력 은닉 상태에서 각 텍스트 토큰 또는 이미지 패치를 128차원 정규화된 벡터로 투영하여 개별 쿼리 토큰과 이미지 영역 간의 국소적 일치를 보존한다. NeoMME-Retriever는 한 번의 순방향 패스로 두 가지 표현을 모두 반환하여 사용 사례와 인프라에 유연성을 제공한다. 일반적으로 지연 상호작용 임베딩이 더 강력하므로 권장되지만, 매우 큰 코퍼스의 경우 밀집 임베딩으로 소수의 문서를 검색한 후 지연 상호작용으로 재순위화하는 방식도 가능하다.
성능 평가에서 NeoMME-Retriever는 ViDoRe v3 nDCG@10 벤치마크에서 경쟁력 있는 결과를 보였다. NeoMME-Retriever-260M은 0.523을 기록하여 평가된 800M 매개변수 미만 모델 중 가장 높은 점수를 달성했으며, ColQwen2.5보다 약 14배 적은 매개변수로 0.002 nDCG@10 이내의 성능을 보였다. NeoMME-Retriever-800M은 0.556을 기록하여 유사한 크기의 Vultron Retriever Flash(0.8B)와 0.009 nDCG@10 이내의 성능을 보였다. 두 NeoMME-Retriever 모델 모두 모델 크기 파레토 프론티어에 위치한다. 또한, 2048x2048 이미지 입력 크기에서 NVIDIA L40S GPU를 사용했을 때 NeoMME-Retriever-260M은 초당 약 51페이지를 인코딩하여 ColModernVBERT의 초당 26페이지보다 약 두 배 빠른 처리량을 보였다.
고해상도 문서에 대한 지연 상호작용 임베딩의 큰 저장 공간 문제를 해결하기 위해 두 가지 압축 방법을 결합했다. 계층적 토큰 풀링은 주어진 다중 벡터 임베딩에서 유사한 문서 벡터를 클러스터링하고 각 클러스터를 평균으로 대체하여 페이지당 저장되는 벡터 수를 줄인다. 비대칭 양자화는 문서 임베딩을 int8 또는 이진으로 양자화하며, 쿼리 임베딩은 즉석에서 생성되므로 더 높은 정밀도를 유지할 수 있다. ViDoRe v3 벤치마크에서 풀링 계수 10과 int8 쿼리 및 문서 설정을 사용했을 때, 페이지당 저장 공간은 약 1.5MB에서 39KB로 39배 감소했으며, 기준 nDCG@10의 99% 이상을 유지했다. 더 공격적인 설정인 풀링 계수 8, int8 쿼리, 이진 문서를 사용했을 때는 페이지당 6KB(255배 감소)로 저장 공간을 줄이면서도 원본 검색 품질의 95% 이상을 유지했다. 사용자는 저장 공간 예산과 필요한 검색 품질에 따라 압축 설정을 선택할 수 있다.
NeoMME-Retriever는 Hugging Face Transformers에서 사용할 수 있으며, 모든 모델 체크포인트는 Apache 2.0 라이선스 하에 공개된다. 개발자는 NeoMMEForRetrieval 클래스를 통해 밀집 및 다중 벡터 임베딩을 동시에 얻을 수 있다. Sentence Transformers v6를 사용한 미세 조정을 위해 별도의 밀집 및 지연 상호작용 체크포인트도 제공된다. 다만, Sentence Transformers는 현재 모델당 하나의 검색 헤드만 지원하므로, 두 헤드를 함께 학습하려면 사용자 정의 Trainer를 사용해야 한다. NeoMME-Retriever는 시각 검색 증강 생성(RAG) 시스템의 첫 단계로 활용될 수 있으며, 텍스트 추출로는 얻기 어려운 표, 플롯, 다이어그램, 페이지 레이아웃과 같은 시각적 단서를 VLM이 활용하여 답변을 생성하는 데 기여한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Hugging Face Blog
NeoMME: an efficient Multimodal-native and Multilingual Encoder
원문 발행: 2026-09-03 22:13:48
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 엔비디아, 추가 훈련 없는 표 데이터 파운데이션 모델 쿠모 태뷸러 공개 · Hugging Face Blog · 2026-09-30
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.