AI ASSiSTANT
오늘 19 · 총 2610
← AI 소식 목록으로
알리바바모델·서비스

알리바바가 소리·영상까지 한 모델로 받는 큐원 3.8 옴니 플래시를 내놨어요

2026년 9월 18일 기준 · 출처 Alibaba Cloud Model Studio 문서

알리바바 큐원(Qwen)팀이 2026년 9월 18일 'Qwen3.8-Omni-Flash'를 공개했어요. 글·이미지·소리·영상을 따로 처리하지 않고 한 모델이 그대로 받아들이는 방식이고, 답은 글로 나와요. 알리바바 클라우드 공식 문서(9월 18일 갱신) 기준으로 한 번에 넣을 수 있는 분량은 100만 토큰이고, 생각하기·도구 호출·웹 검색을 지원해요.

회의 녹화본 요약이나 영상 내용 분석처럼 소리와 화면을 같이 봐야 하는 일을 겨냥한 모델이에요. 쓰는 방법은 큐원 챗과 알리바바 클라우드 모델 스튜디오 API 두 가지이고, 오픈AI 호환 방식이라 기존 코드에서 주소와 모델 이름만 바꿔도 돼요. 서비스 지역은 베이징·싱가포르·홍콩·도쿄·프랑크푸르트·버지니아 여섯 곳이에요.

성능은 회사 발표 기준으로 평가 30종 평균이 앞 모델(Qwen3.5-Omni-Plus)보다 26% 이상 올랐다고 해요. 값은 조심해서 읽는 게 좋아요. 알리바바가 밝힌 건 입력 100만 토큰당 0.8위안(약 150원)부터라는 것과, 소리 한 시간을 넣을 때 값이 앞 모델보다 98% 싸다는 것 정도예요.

중개 사이트마다 적어 둔 단가가 서로 다른데, 글·소리·이미지·영상마다 값이 따로 매겨지는 구조라 어느 한 숫자로 옮겨 적기 어렵기 때문이에요. 실제 비용은 콘솔의 요금표를 봐야 해요. 그리고 가중치는 공개되지 않아서 직접 내려받아 돌릴 수는 없어요.

⚠ 허깅페이스에 'Qwen3.8-27B-Omnimerge' 같은 이름이 보이는데, 이건 다른 모델을 개인이 합쳐 올린 것이라 이 모델과는 별개예요.

실무에서는 어떤 뜻인가요

회의 녹음, 강의 영상, 통화 내용처럼 "듣고 봐야 아는" 자료를 다루는 일이 늘고 있는데, 지금까지는 음성을 글로 바꾼 뒤 다시 요약하는 식으로 단계를 나눠야 했어요. 한 모델이 소리와 영상을 그대로 받으면 중간에 잃어버리는 정보(말투, 화면에 뜬 자료, 누가 언제 말했는지)가 줄어요. 다만 한국어 성능을 따로 밝힌 자료는 없고 값도 입력 종류마다 달라서, 회사 업무에 넣기 전에는 실제 녹화본 한두 건으로 품질과 비용을 직접 재 보는 게 안전해요. 가중치가 공개되지 않아 외부에 보내기 곤란한 자료라면 이 모델은 선택지가 아니에요.

출처 원문 보기: Alibaba Cloud Model Studio 문서

정리 시점 이후 상황이 바뀌었을 수 있어요. 정확한 내용은 출처 원문에서 확인하세요.

함께 보면 좋은 소식