통합 멀티모달 서빙 런타임 vLLM-Omni

최근 30일 조회수 —좋아요 —

핵심 요약

텍스트·음성·영상·로봇 행동 생성을 단일 파이프라인과 세션 체계로 처리하는 런타임이 제안됐다.

텍스트·음성·이미지·영상·로봇 행동 생성을 하나의 제어 체계에서 처리하는 통합 서빙 런타임 ‘vLLM-Omni’가 제안됐다. 논문은 2026년 10월 8일 arXiv에 공개된 프리프린트로, 서로 다른 생성 모델을 임시방편으로 연결해 온 배포 구조를 통합하는 데 초점을 맞춘다.1

vLLM-Omni는 작업을 여러 단계의 파이프라인으로 구성한다. 단일 오케스트레이터가 요청을 받아 단계별 실행과 스트리밍 출력을 조율하고, 전용 엔진과 복제 인스턴스가 연산을 맡는다. 대용량 데이터는 별도 데이터 경로로 전달하며, 장시간 상태를 유지해야 하는 양방향 대화·월드 모델·로봇 작업도 세션 단위로 지원한다. 오픈AI 호환 API와 OpenPI API도 제시했다.

평가는 주로 Qwen3-Omni를 대상으로 H100에서 진행됐으며, TTS와 MiniCPM-o에는 H200을 사용했다. 다만 초록에는 처리량이나 지연시간 같은 구체적 성능 수치와 기존 시스템과의 비교 결과가 없다.

Footnotes

  1. arXiv cs.DC, 「vLLM-Omni Technical Report: A Unified Serving Runtime for Omni-Modality Generation」, arXiv:2610.09307v1 ↩

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. vLLM-Omni Technical Report: A Unified Serving Runtime for Omni-Modality Generation — arXiv cs.DC · 자료: 2026. 10. 8.

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.