Qwen2.5-Omni 공개: 실시간 멀티모달 상호작용을 위한 종단간 모델
Qwen 개발팀이 텍스트, 이미지, 오디오, 비디오를 처리하고 실시간 텍스트 및 음성 응답을 제공하는 플래그십 멀티모달 모델 Qwen2.5-Omni를 공개했다. Thinker-Talker 아키텍처와 TMRoPE를 도입하여 포괄적인 멀티모달 인식과 실시간 상호작용을 지원한다.
Qwen 개발팀은 텍스트, 이미지, 오디오, 비디오 등 다양한 형태의 입력을 처리하고 실시간으로 텍스트 생성 및 자연스러운 음성 합성을 통해 응답하는 새로운 플래그십 종단간 멀티모달 모델인 Qwen2.5-Omni를 공개했다. 이 모델은 포괄적인 멀티모달 인식을 목표로 설계되었으며, Thinker-Talker 아키텍처와 비디오 입력의 타임스탬프를 오디오와 동기화하는 TMRoPE(Time-aligned Multimodal RoPE)라는 새로운 위치 임베딩을 도입한다.
Qwen2.5-Omni의 출시는 완전한 실시간 상호작용을 지원하고 다양한 모달리티를 통합하여 더욱 강력한 '옴니 모델'로 발전하려는 목표의 일환이다. 모델은 청크 단위 입력과 즉각적인 출력을 지원하도록 설계되어 실시간 음성 및 영상 채팅과 같은 애플리케이션에 적합하다. 향후에는 음성 명령 이해도를 높이고 시청각 협업 이해도를 개선하는 데 중점을 둘 계획이다.
Qwen2.5-Omni는 Thinker-Talker 아키텍처를 기반으로 동작한다. Thinker는 텍스트, 오디오, 비디오 모달리티의 입력을 처리하고 고수준 표현 및 해당 텍스트를 생성하는 역할을 수행한다. 이는 트랜스포머 디코더로 구성되며, 정보 추출을 용이하게 하는 오디오 및 이미지 인코더를 포함한다. Talker는 Thinker가 생성한 고수준 표현과 텍스트를 스트리밍 방식으로 받아 유동적인 음성 토큰을 출력한다. Talker는 이중 트랙 자동회귀 트랜스포머 디코더 아키텍처로 설계되었으며, Thinker로부터 고차원 표현을 직접 수신하고 Thinker의 모든 과거 컨텍스트 정보를 공유한다. 이로써 전체 아키텍처는 하나의 응집력 있는 모델로 작동하며, 종단간 학습 및 추론을 가능하게 한다.
성능 측면에서 Qwen2.5-Omni는 유사한 크기의 단일 모달리티 모델 및 Qwen2.5-VL-7B, Qwen2-Audio, Gemini-1.5-pro와 같은 모델과 비교하여 모든 모달리티에서 강력한 성능을 입증했다. 특히 OmniBench와 같은 여러 모달리티 통합이 필요한 작업에서 최첨단(state-of-the-art) 성능을 달성한다. 단일 모달리티 작업에서도 음성 인식(Common Voice), 번역(CoVoST2), 오디오 이해(MMAU), 이미지 추론(MMMU, MMStar), 비디오 이해(MVBench), 음성 생성(Seed-tts-eval 및 주관적 자연스러움) 등 다양한 분야에서 우수한 결과를 보인다. 특히 음성 생성에서는 기존의 스트리밍 및 비스트리밍 대안보다 뛰어난 견고성과 자연스러움을 나타낸다. 또한, MMLU 및 GSM8K 벤치마크에서 텍스트 입력과 유사한 수준의 종단간 음성 명령 이해 성능을 보여준다.
Qwen2.5-Omni는 개발자와 사용자에게 광범위한 접근성을 제공한다. 최신 모델은 Qwen Chat에서 Qwen2.5-Omni-7B를 선택하여 체험할 수 있으며, Hugging Face, ModelScope, DashScope, GitHub를 통해 공개적으로 이용 가능하다. 기술 문서는 논문(Paper)을 통해 제공되며, 데모를 통해 상호작용 기능을 경험하거나 디스코드 채널에 참여하여 토론할 수 있다. 이러한 공개적인 접근성은 개발 커뮤니티가 Qwen2.5-Omni를 활용하여 혁신적인 애플리케이션을 구축하고 모델의 발전에 기여할 수 있는 기회를 제공한다.
Qwen2.5-Omni는 다양한 모달리티를 통합하고 실시간 상호작용을 지원하는 강력한 기능을 제공하지만, 개발팀은 모델의 향후 목표를 통해 현재의 한계와 개선 방향을 제시한다. 음성 명령 이해도와 시청각 협업 이해도를 높이는 것이 가까운 미래의 목표로 언급되어, 이 분야에서 지속적인 연구와 개선이 필요함을 시사한다. 또한, 더 많은 모달리티를 통합하여 '옴니 모델'로 나아가려는 계획은 현재 지원되는 모달리티 외에 추가적인 확장이 필요함을 간접적으로 나타낸다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen2.5 Omni: See, Hear, Talk, Write, Do It All!
원문 발행: 2025-03-27 01:00:45
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 엔비디아, 추가 훈련 없는 표 데이터 파운데이션 모델 쿠모 태뷸러 공개 · Hugging Face Blog · 2026-09-30
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.