Qwen 3.8 Omni Flash
요약
Qwen 3.8 Omni Flash는 텍스트, 이미지, 오디오, 비디오를 모두 처리하는 네이티브 옴니모달 모델입니다. 100만 토큰 컨텍스트와 함께 이전 버전 대비 성능을 크게 향상시켰으며, 특히 장시간 영상 이해 및 에이전트 작업에 강점을 보입니다. API 비용도 대폭 인하되었습니다.
핵심 포인트
- 네이티브 옴니모달 모델로 텍스트/이미지/오디오/비디오 입력 지원
- 100만 토큰 컨텍스트를 지원하며, 장시간 영상 이해 능력이 강화됨
- OmniVideoBench 정확도가 향상되고 질의당 토큰 사용량이 감소함
- API 가격이 대폭 인하되어 비용 효율성이 높아짐
Qwen3.8-Omni-Flash 는 텍스트, 이미지, 오디오, 비디오를 입력받아 콘텐츠 이해부터 작업 계획, 도구 호출, 결과물 제작까지 수행하는 네이티브 옴니모달 모델로, 100만 토큰 컨텍스트 를 지원함
Qwen 공개 평가에서 이전 Qwen3.5-Omni-Plus보다 29개 평가 평균 점수가 25% 이상 상승 했으며, 시간당 오디오 입력 API 가격은 98% 이상, 시청각 입력 가격은 93% 이상 낮아짐
장시간 영상에서 질문에 필요한 구간을 스스로 찾아 검증하는 에이전트 방식의 이해 를 지원하며, OmniVideoBench에서 정확도를 63.4에서 67.8로 높이고 질의당 토큰 사용량을 약 45.7% 줄임
영상 제작과 업무 실행 을 연결해 뮤직비디오 제작, 단편 드라마 번역과 더빙, 장편 영화 해설, 회의 후속 작업, 영상 기반 문서와 재사용 가능한 에이전트 스킬 생성을 지원함
별도 모델 Qwen3.8-Omni-Flash-Realtime 은 실시간 시청각 스트림을 받으며 응답하고 도구를 실행하며, 발음 연습, 공간 음향 기반 탐색, 업무 지식과 규칙을 적용한 대화에 활용할 수 있음
모델과 비용 변화
Qwen3.8-Omni-Flash 는 Qianwen AI Platform 에서 사용할 수 있으며, 코딩, 텍스트 기반 지식 업무, GUI 조작을 바탕으로 오디오와 비디오 중심의 에이전트 작업을 확장함
텍스트, 이미지, 오디오, 비디오 입력과 100만 토큰 컨텍스트 를 지원함
동일 규모의 텍스트 전용 모델과 비슷한 텍스트 성능을 유지하면서 옴니모달 성능을 개선함
Qwen 공개 평가에서 Qwen3.5-Omni-Plus 대비 29개 평가 평균 점수가 25% 이상 상승 함
Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고, 전반적인 오디오 성능은 이를 넘어선다고 밝힘
평가 범위에는 음성 인식, 음성 번역, 소리와 음악 이해, 시청각 추론, 설명 생성, 상호작용, 멀티모달 에이전트 작업이 포함됨
시간당 API 입력 가격은 이전 모델보다 오디오 98% 이상, 시청각 93% 이상 인하 됨
시간당 가격은 2분 분량 입력 비용의 30배로 추정하며, 시청각 입력은 720p, 초당 1프레임을 기준으로 함
비교에서 Gemini 3.8 Flash는 media_resolution=high
, Seed 2.0 Lite는 max_frame_tokens=384
를 사용하고 나머지 API 설정은 기본값을 사용함
텍스트 입출력 가격 단위는 100만 토큰당 위안이며, Gemini와 Muse의 달러 가격에는 1달러당 6.7191위안 환율을 적용함
장시간 오디오와 비디오는 저장, 전송, 반복 추론 비용 이 크고, 기존 에이전트 하네스의 네이티브 지원과 종단 간 실행 워크플로도 아직 초기 단계임
이를 해결하기 위해 모델뿐 아니라 도구와 실행 환경을 함께 확장함
Qwen-MM-Plugins는 필요에 따른 콘텐츠 인식과 장시간 작업 실행을, Qwen-Live Harness는 지속적인 실시간 상호작용을 담당함
장시간 시청각 이해와 근거 탐색
제어 가능한 영상 설명 은 사용자가 대상, 시간 범위, 상세도, 출력 형식을 지정할 수 있음
같은 영상에서 전체 개요를 만들거나 핵심 구간을 찾고, 인물 행동, 촬영 구도, 조명, 소리를 심층 분석해 구조화할 수 있음
이야기 중심의 콘텐츠 제작, 특정 장면 검색, 구조화된 자산 관리처럼 용도별로 다른 설명을 생성함
에이전트 방식의 장시간 영상 이해 는 질문에서 출발해 무엇을 보고 들을지 결정하고, 대략적인 탐색에서 세부 검증으로 이어지는 여러 차례의 근거 수집을 수행함
모든 프레임을 처리하지 않고 관련 구간에 연산과 토큰을 집중하며, 여러 차례의 상호작용 사이에 컨텍스트를 유지함
OmniVideoBench 정확도는 63.4 → 67.8 , 질의당 토큰은 145,736 → 79,117 로 변해 사용량이 약 45.7% 줄어듦
회의 이해 는 음성과 영상을 함께 사용해 화자를 인식하며, 최대 1시간의 시청각 입력을 네이티브로 지원함
화자 분리, 전사, 신원 정렬을 종단 간 수행하고, 시각 정보로 발화 속 지시 대상과 개체의 모호함을 해소함
참석자 관계, 회의록, 실행 항목, 프로젝트 위험을 정리하고, 도구와 연결하면 이메일 발송, 작업 정리, 회의 요구사항에 따른 코딩도 시작할 수 있음
영상 중심 심층 조사 는 사용자의 질문과 영상에서 추가 조사할 쟁점을 찾고, 웹의 이미지, 영상, 문서를 검색해 그림을 포함한 조사 보고서를 작성함
Photoshop에서 머리카락을 오려낸 뒤 색 번짐이 생긴 경우, 튜토리얼 절차를 분석하고 Multiply와 Screen 혼합 모드 원리 및 경계 보정 기법을 비교해 상황에 맞는 방법을 설명할 수 있음
영상 제작과 편집 자동화
Music2MV 는 노래의 구조, 리듬, 분위기, 보컬, 악기 변화를 분석해 등장인물, 장면, 촬영 구도를 설계함
행 단위 가사와 타임스탬프로 노래, 자막, 화면을 정렬함
Qwen-MM-Plugins 같은 제작 도구와 결합해 음악 이해, 창작 계획, 제작, 최종 품질 검토를 연결함
단편 드라마 번역 은 전사, 번역, 더빙, 편집 플랫폼 사이를 오가던 작업을 하나의 에이전트 워크플로로 묶음
한 문장으로 요구사항을 전달하면 화자별 대사 인식, 대화 번역, 캐릭터 음성 복제와 더빙, 오디오 재믹싱, 최종 검토를 수행함
분리된 도구를 사용할 때 맞추기 어려웠던 캐릭터 음성, 대사 길이, 영상 호흡을 함께 다룸
장편 영화 해설 은 2~3시간짜리 영화와 제작 요구사항을 받아 줄거리 이해, 핵심 장면 추출, 해설 기획, 음성 및 음악 제작, 편집, 렌더링, 품질 검토를 수행함
원본 대사와 해설을 교차 배치하고 말하기 속도와 음량을 조정해 내레이션, 원음, 배경 음악, 화면을 연결함
소형 모델 최적화 실험
실제 멀티모달 서비스는 품질, 지연 시간, 연산량, 배포 비용 을 함께 고려해야 하므로, 특정 업무에 맞춘 소형 모델이 대규모 배포의 한 경로가 됨
기존 방식은 데이터 구축, 문제 진단, 반복 학습과 평가에 시간이 많이 들고 전문가 의존도가 높음
Qwen3.8-Omni-Flash를 모델 개발 과정에도 투입해 대형 모델이 연구와 반복 실험을 주도하고 소형 모델이 실제 업무를 담당하는 방식을 시험함
실험 과제는 12시간 안에 Qwen2.5-Omni-3B의 쓰촨 방언 음성 인식을 개선 하고 사용 가능한 모델을 만드는 것이었음
에이전트가 WenetSpeech-Chuan 평가 세트를 선택하고 평가 기준과 기준 성능을 확정함
오디오를 직접 듣고 인식 결과에서 문제를 진단한 뒤, 네 차례 실험 동안 학습 예제 3,413개 를 생성함
평가 결과에 따라 효과적인 변경은 유지하고 실패한 시도는 되돌림
동일 평가 세트의 문자 오류율은 25.79%에서 15.30%로 감소 해 상대적으로 약 40.7% 개선됨
범용 멀티모달 모델이 데이터를 이해하고 실험을 계획하며 반복 개선을 이끌어, 소형 모델에 특화 역량을 부여하는 가능성을 보여줌
영상을 문서와 재사용 가능한 스킬로 변환
오디오와 비디오는 정보가 풍부하지만 선형적이고 비구조화된 형태 때문에 검색과 재사용이 어려움
에이전트가 음성, 화면, 시간축을 함께 이해하고 정보를 추출, 재구성, 검증해 긴 영상의 지식과 경험을 더 밀도 높은 자산으로 변환함
Video2Note 는 Qwen-MM-Plugins에 오픈소스로 포함됨
지식을 정리하고 핵심 절차를 나눈 뒤 대표 프레임을 골라 텍스트와 이미지가 대응하는 PDF 노트를 생성함
자동 검토와 반복 수정을 거쳐 수 시간짜리 영상을 다시 찾아보기 쉬운 문서로 압축함
Omni Skill Creator 도 Qwen-MM-Plugins의 오픈소스 기능임
시연에서 표준 운영 절차인 SOP를 추출하거나 전문가 교육에서 도구 사용법, 판단 기준, 핵심 통찰을 학습함
단일 시연을 검증과 평가를 거친 에이전트 스킬로 바꿔 재사용하고 공유할 수 있음
실시간 상호작용과 공간 음향
Qwen3.8-Omni-Flash-Realtime 은 완성된 콘텐츠를 처리하는 기본 모델과 달리, 실시간 스트림을 받으면서 인식하고 응답함
실시간 컨텍스트에 따라 도구를 호출하고 작업을 수행함
말하기 연습 에서는 발음과 의미를 함께 모델링해 억양, 모음과 자음의 대치, 성조 차이로 생기는 비표준 발화를 해석하고 올바른 단어와 연결함
표준 발음 시범을 실시간으로 생성하며, 여러 차례 연습에서 새 오디오를 반영해 판단을 갱신함
이해에 영향을 주는 오류를 고치면서 자연스러운 리듬, 어조, 감정을 유지함
공간 음향 인식 은 소리와 시각 정보를 결합해 음원의 방향과 거리를 지속적으로 판단하고 장애물, 이동 가능한 영역, 장면 변화를 인식함
Qwen은 소리로 목표 위치를 찾을 수 있는 최초의 옴니모달 모델이라고 밝힘
“이쪽으로 와” 또는 “무슨 소리인지 가서 확인해” 같은 지시에 따라 환경 소음에서 목표 소리를 분리하고, 도구로 위치 추정, 탐색, 경로 계획, 이동을 수행함
스킬을 통한 외부 지식 주입 으로 정체성 설정, 표현 방식, 업무 지식, 상호작용 규칙을 동적으로 적용할 수 있음
고객 서비스에서는 브랜드 언어와 서비스 절차를 불러와 사용자의 음성, 화면, 상황을 이해하고 업무 요건에 맞춰 응답과 행동을 수행함
공개 벤치마크와 평가 조건
멀티모달 에이전트 평가 에서 WildClawBench-MM은 71.0점으로 이전 모델보다 36.5점, AgenticVBench는 36.8점으로 22.3점 상승함
UniClawBench는 69.6점, OmniGAIA는 74.0점을 기록함
Gemini 3.8 Flash는 각각 58.9, 45.0, 69.0, 78.6점으로, 모델 간 우위는 평가에 따라 다름
WildClawBench-MM과 AgenticVBench는 Claude Code, UniClawBench는 OpenClaw를 사용하며 OmniGAIA는 하네스를 사용하지 않음
WildClawBench-MM은 WildClawBench 중 이미지, 영상, 오디오를 포함한 작업만 평가함
장시간 이해와 음성 처리 에서 LongAudioSpan 정확도는 82.7로 8.3점, OmniVideoBench는 63.4로 9.6점 상승함
OmniCap-IF의 CSR은 80.6, ISR은 28.2로 각각 8.5점, 14.1점 개선됨
AliMeeting의 DER/cpWER은 88.11/89.61 → 3.35/17.18 로 낮아짐
다만 FLEURS-ASR, FLEURS-S2TT, WenetSpeech Net, 일부 오디오 상호작용 평가 등에서는 이전 모델보다 낮은 점수도 기록함
FLEURS 음성 인식과 음성 번역 평가는 한국어를 포함한 60개 언어를 대상으로 함
Qwen Code 기반 에이전트 이해 와 직접 입력을 해석하는 정적 방식(Static)을 비교함
Qwen의 OmniVideoBench/Video-MME-v2/LVOmniBench 점수는 각각 63.4/65.0/63.3 → 67.8/71.3/73.6 으로 상승함
Gemini 3.8 Flash는 같은 조건에서 65.2/71.0/70.7 → 70.1/72.7/70.7로 변함
텍스트와 코딩 평가 에서는 SWE-bench Pro 63.3, SWE-bench Multilingual 80.5, CoWorkBench 75.3, IFBench 81.5, GPQA Diamond 91.0, LiveCodeBench v6 92.6을 기록함
DeepSWE 1.1은 Claude Code와 mini-SWE-agent 중 높은 점수를 사용하며, SWE 계열 평가는 주로 256K 컨텍스트, temp=1.0
, top_p=0.95
를 적용함
SWE-bench Pro는 문제가 있는 작업을 수정한 뒤 기준 모델을 재평가했으며, Claude-Opus-4.6 (Max)는 공식 공개 점수를 사용함
NL2Repo-Bench에서는 보상 편법을 막기 위해 특정 저장소에 접근하려는 pip download
, pip install
, git clone
등의 Bash 명령을 차단함
CoWorkBench는 컴퓨터 과학, 금융, 법률, 의료 등의 장기 사무 작업을 평가하는 자체 벤치마크이며, HLE는 GPT-4o로 판정함
시각과 GUI 평가 에서는 AndroidWorld 87.1, LVBench 76.9, RealWorldQA 87.7을 기록함
MathVision은 코드 인터프리터 미사용/사용 시 91.8/96.2, CharXiv (RQ)는 83.5/91.4임
ClawEval-MM은 세 번 중 한 번 이상 성공한 비율인 Pass@3와 세 번의 평균을 구분해 보고함
Vision2Web은 Claude Code를 사용하며 프런트엔드, 웹페이지, 웹사이트 범주의 평균을 gpt-5.4-2026-03-05
로 판정함
MathVision의 일부 잘못된 정답을 수동 검증 후 수정했으며, Qwen은 고정 프롬프트를, 다른 모델은 \boxed{}
형식 사용 여부에 따른 실행 중 높은 점수를 사용함
RecreationBench는 Ubuntu, macOS, Windows, Android, 웹의 애플리케이션 재현을 다루고, OSWorld 2.0은 완전 성공 비율과 부분 보상 점수를 구분함
Realtime API의 관측 성능 은 6초, 12초, 20초 입력을 기준으로 측정함
오디오 입력은 초당 약 8185토큰이며, 첫 토큰까지 약 591618ms, 첫 오디오 패킷까지 약 9781,026ms가 걸림85토큰이며, 첫 토큰까지 약 838
시청각 입력은 초당 약 83981ms, 첫 오디오 패킷까지 약 1,2151,350ms가 걸림
오디오 생성 실시간 계수인 RTF는 약 0.1524~0.1538임
언어 지원 은 음성 인식 74개 언어와 중국어 방언 39종, 음성 생성 29개 언어와 중국어 방언 7종임
한국어는 음성 인식과 생성 모두에 포함됨
생성 지원 방언은 쓰촨, 베이징, 톈진, 난징, 산시, 광둥어, 민난어임
벤치마크의 빈 점수는 아직 결과가 없거나 적용 대상이 아님
API와 영상 설명 작성 지침
기본 모델은 OpenAI 호환 Chat Completions와 Responses API 를 지원함
reasoning_effort
는 심층 분석용 기본값 xhigh
, 정확도와 속도 균형을 위한 medium
, 속도와 비용 중심의 low
를 제공함
preserve_thinking
은 모든 사용 시나리오에서 기본 활성화됨
예제는 qwen3.8-omni-flash
에 이미지, 오디오, 텍스트를 함께 전달하고 추론과 답변을 스트리밍으로 받는 방식을 보여줌
영상 설명의 구성과 상세도 는 시각 정보, 발화, 음악, 효과음, 환경음을 구분하고 원문, 화자 신원, 해당 시간 범위를 보존하는 방식으로 조절함
프롬프트에 약 2,000~3,000단어처럼 목표 길이를 지정하고 영상 길이와 정보 밀도에 맞춰 조정할 수 있음
예제 구성은 시간순 이야기, 화면에 보이는 모든 텍스트, 화자 정보와 전사의 세 부분을 요구함
인물과 사물의 특징, 행동, 공간 관계, 수량, 화면 글자, 색과 조명, 카메라 움직임, 발화 내용과 감정, 음악, 비언어적 소리, 시청각 대응 관계를 포함함
구조화 출력 에는 작업 지시와 완전한 JSON Schema를 함께 제공해 필드 의미, 타입, 필수 항목, 제약을 명시하는 방식을 권장함
예제는 요약과 시간순 장면 아래에 참여자, 행동, 소리, 시간 범위를 가진 사건을 배치함
타임스탬프는 영상 시작을 기준으로 하고, 종료 시간이 시작보다 빠르거나 영상 길이를 넘지 않으며, 사건은 상위 장면의 시간 범위 안에 있어야 함
음성과 영상이 직접 뒷받침하는 정보만 포함하고, 소리와 행동이 동시에 발생했다는 이유만으로 인과관계를 추정하지 않도록 지시함
Realtime API 는 WebSocket과 WebRTC 연결을 지원함
기본 예제는 카메라와 마이크를 사용한 실시간 시청각 대화를 실행하며, 헤드폰 사용을 권장함
오픈소스 플러그인과 실시간 하네스
Qwen-MM-Plugins 는 이미지, 오디오, 영상, 문서 이해와 장시간 영상 메모리, 콘텐츠 제작 기능을 에이전트 하네스에 추가함
Codex, Claude Code, Qwen Code, Gemini CLI, Qoder, CodeBuddy, OpenClaw를 지원함
에이전트에 설치를 요청하거나 공식 안내형 설치기를 사용할 수 있으며, 설치 후 하네스를 재시작하거나 새 작업을 만들어야 함
플러그인은 입력 해석, 제작, 지식 변환, 메모리 기능으로 나뉨
core
: 이미지, 영상 프레임, PDF, Office 문서, 코드, 데이터, 3D 파일을 읽음
api
: 이미지 이해, OCR, 객체 위치 추정, 시청각 전사, 화자 분리, 사건 분석, 이미지 분할을 수행함
omni-chatcut
: 뮤직비디오, 장편 영화 해설, 영상 음성 번역을 제작함
omni-video2note
: 핵심 스크린샷을 포함한 영상 튜토리얼 PDF 노트를 생성함
omni-skill-creator
: 교육 영상, 화면 녹화, 작업 시연을 재사용 가능한 Skill.md
파일로 변환함
omni-memory
: 긴 영상의 인물, 대화, 소리, 사건에 대한 메모리를 구축함
Qwen-Live Harness 는 Qwen3.8-Omni-Flash-Realtime API 중심의 오픈소스 실행 환경임
단일 명령으로 설치하고 주요 에이전트 워크플로에 통합할 수 있음
작업 위임, 선제적 상호작용, 장기 메모리, 컨텍스트 관리를 지원하며 커뮤니티 기여를 받음
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기