본문으로 건너뛰기
-
방문해주셔서 감사합니다. 잊지말고 구독해주세요. Subscribe Now!
누리의 알뜰살뜰 정보세상

누리의 정보세상

누리의 알뜰살뜰 정보세상

누리의 정보세상

  • 홈
  • Breaking News
  • 개인정보처리방침
  • 뉴스 속보
  • 소개
  • 연락처
  • 편리템즈 쇼핑 링크
  • 홈
  • Breaking News
  • 개인정보처리방침
  • 뉴스 속보
  • 소개
  • 연락처
  • 편리템즈 쇼핑 링크
닫기

검색

  • https://www.facebook.com/
  • https://twitter.com/
  • https://t.me/
  • https://www.instagram.com/
  • https://youtube.com/
구독하기
Qwen3.8-Max 출시 분석: 2.4조 MoE·950억 활성 파라미터, API 가격과 27B 팩트체크
시장동향

Qwen3.8-Max 출시 분석: 2.4조 MoE·950억 활성 파라미터, API 가격과 27B 팩트체크

By stanley0216
2026-08-09 8 Min Read
0
Qwen3.8-Max 출시 분석: 2.4조 MoE·950억 활성 파라미터, API 가격과 27B 팩트체크
Qwen3.8-Max의 공식 핵심 수치와 27B 팩트체크

알리바바는 2026년 8월 3일 Qwen 시리즈의 새 플래그십인 Qwen3.8-Max를 발표했습니다. 공식 수치는 총 2.4조 파라미터, 토큰마다 작동하는 활성 파라미터 950억, 최대 100만 토큰 컨텍스트입니다. 텍스트·이미지·비디오를 입력받고 텍스트를 출력하는 멀티모달 모델이며, 현재 QwenCloud와 알리바바 클라우드 모델스튜디오 API에서 qwen3.8-max라는 모델 ID로 호출할 수 있습니다.

다만 초기 보도와 커뮤니티 글에서 함께 거론된 Qwen3.8-27B는 별도로 확인해야 합니다. 8월 9일 기준 알리바바 공식 발표, QwenCloud 모델 목록, Qwen 공식 Hugging Face와 GitHub 어디에도 이 이름의 모델이 없습니다. 공식 발표가 예고한 것은 Qwen3.8-Max의 웨이트 공개이지, 27B 모델의 동시 출시가 아닙니다. 따라서 27B의 사양·VRAM·라이선스·벤치마크를 확정 사실처럼 적는 것은 현재 근거와 맞지 않습니다.

✨ 핵심 요약

Qwen3.8-Max는 총 2.4조·활성 950억 Sparse MoE, 100만 토큰 컨텍스트, 입력 2달러·출력 6달러의 API 모델입니다. 공식 확인은 Max뿐이며 Qwen3.8-27B는 8월 9일 현재 공식 목록과 저장소에서 확인되지 않습니다.

구분 수치·일정 읽는 방법
공식 모델 Qwen3.8-Max 8월 3일 발표, API 이용 가능
모델 구조 2.4조 / 950억 활성 Sparse MoE + 하이브리드 어텐션
컨텍스트 최대 100만 일반 입력 99.1만·최대 출력 13.1만 토큰
Qwen3.8-27B 미확인 공식 발표·카탈로그·저장소에서 확인되지 않음
2026년 8월 9일 기준 공식 확인 항목과 미확인 항목
2026년 8월 9일 기준 공식 확인 항목과 미확인 항목

※ 이 글에는 제휴 링크가 포함되어 있습니다. 링크를 통해 구매하면 운영자에게 일정 수수료가 지급될 수 있으며 구매 가격에는 영향을 주지 않습니다.

함께 확인할 생활 도구무거운 그래픽카드를 받치는 GPU 지지대그래픽카드 길이와 케이스 바닥 간격을 확인하면 장시간 사용 중 기판 처짐을 줄이는 보조 부품으로 활용할 수 있습니다.2280 KRWGPU 지지대 보기무거운 그래픽카드를 받치는 GPU 지지대

먼저 바로잡을 것: 공식 확인과 미확인 정보를 분리해야 한다

공식 발표문이 확인해 주는 사실은 명확합니다. Qwen3.8-Max는 8월 3일 출시됐고, 총 2.4조 파라미터와 950억 활성 파라미터를 가진 Sparse MoE 모델입니다. QwenCloud 제품 페이지에는 qwen3.8-max 모델 ID, 입출력 형식, 컨텍스트 한도, 가격, 도구 지원 범위까지 올라와 있습니다. 이 정보는 실제 구매와 도입 판단에 사용할 수 있는 1차 자료입니다.

반면 Qwen3.8-27B는 공식 발표문에 등장하지 않습니다. QwenCloud의 전체 모델 문서에는 이전 세대인 qwen3.6-27b가 있지만 qwen3.8-27b는 없고, Qwen 공식 Hugging Face와 QwenLM GitHub에서도 같은 이름의 체크포인트나 저장소를 찾을 수 없습니다. 이름이 비슷한 이전 세대 모델이나 비공식 전망이 새 제품 정보로 섞였을 가능성이 큽니다. 새 공식 공지가 나오기 전까지는 '출시 예정 모델'이 아니라 '확인되지 않은 명칭'으로 표현하는 것이 정확합니다.

출처: QwenCloud – 텍스트 생성 모델 공식 목록

2.4조보다 중요한 숫자, 활성 파라미터 950억

MoE는 모든 파라미터를 매 토큰마다 동시에 계산하는 dense 모델과 다릅니다. 입력에 따라 일부 전문가 네트워크만 선택해 실행합니다. Qwen3.8-Max의 총 파라미터는 2.4조지만 한 번의 추론에서 활성화되는 규모는 950억입니다. 따라서 '2.4조 dense 모델과 계산량이 같다'고 이해하면 과장이고, 반대로 950억짜리 모델과 저장·통신 요구가 완전히 같다고 봐도 틀립니다. 전체 가중치를 보관하고 전문가를 여러 장치에 배치해야 하므로 서빙 시스템은 여전히 데이터센터급입니다.

알리바바는 Sparse MoE에 하이브리드 어텐션을 결합해 대규모 모델의 능력과 추론 효율 사이의 균형을 잡았다고 설명합니다. 이 설계의 사업적 의미는 단순히 모델이 커졌다는 데 있지 않습니다. 전문 업무와 장기 에이전트 작업에 필요한 용량을 늘리면서도, 매 요청의 계산비와 응답 지연이 총 파라미터에 비례해 폭증하지 않도록 설계했다는 데 있습니다. 실제 효율은 입력 길이, 동시 요청, 라우팅 균형, 캐시 적중률에 따라 달라지므로 운영 환경에서 따로 측정해야 합니다.

출처: 알리바바 그룹 – Qwen3.8-Max 공식 발표

아키텍처·컨텍스트·가격·공개 상태를 한눈에 비교
아키텍처·컨텍스트·가격·공개 상태를 한눈에 비교

관련 자료를 볼 때 유용한 도구로컬 모델 실행 시 발열을 낮추는 노트북 쿨링 패드팬 개수와 크기, 소음 수준, 노트북 크기 호환성을 확인하면 장시간 추론 작업에 활용할 수 있습니다.4160 KRW쿨링 패드 보기로컬 모델 실행 시 발열을 낮추는 노트북 쿨링 패드

무엇을 잘한다고 주장하나: 코딩·장기 작업·멀티모달

알리바바는 Qwen3.8-Max를 자율 코딩, 전문 업무, 장기 실행에 초점을 둔 모델로 소개합니다. 공식 발표 기준 사용자 선호 평가에서 Text Arena 5위, Vision Arena 2위, Frontend Code Arena 4위에 올랐습니다. 내부 시험에서는 사용자 피드백과 테스트 로그를 반영하며 16일 동안 소프트웨어 프로젝트를 수행했고, 그 결과물인 자기개선형 에이전트 프레임워크 oh-my-cli를 공개했다고 설명합니다.

멀티모달 측면에서는 수백 페이지 문서, 장시간 영상, 화면 인터랙션을 분석해 검색 가능한 지식 구조를 만들거나, UI 스크린샷을 바탕으로 프런트엔드를 재구성하는 사용 사례를 제시합니다. 다만 Arena 순위는 상대적 선호 신호이고, 16일 프로젝트와 전문 분야 사례는 공급자가 공개한 내부 결과입니다. '플래그십급 가능성'을 보여주는 자료로는 유용하지만, 우리 회사의 코드베이스·언어·도구 체인에서 같은 성공률이 나온다는 보증은 아닙니다. 파일 편집 정확도, 장기 작업 중 오류 누적, 도구 호출 성공률, 총비용을 자체 평가해야 합니다.

출처: 알리바바 그룹 – Qwen3.8-Max 공식 발표

API 이용, 공식 자료 대기, 자체 호스팅 검토의 세 경로
API 이용, 공식 자료 대기, 자체 호스팅 검토의 세 경로

100만 토큰 컨텍스트를 실무적으로 읽는 법

공식 제품 페이지의 컨텍스트는 100만 토큰입니다. 일반 모드 최대 입력은 99만 1천 토큰, 생각 모드를 켜면 98만 3천 토큰이며, 최대 출력은 두 모드 모두 13만 1천 토큰입니다. 최대 추론 예산은 26만 2천 토큰으로 표기돼 있습니다. 긴 저장소, 계약서 묶음, 영상 전사본처럼 자료를 한 요청에 많이 넣을 수 있다는 뜻이지만, 입력 한도와 출력 한도, 내부 추론 예산을 같은 숫자로 혼동하면 안 됩니다.

또한 '100만 토큰을 받는다'와 '100만 토큰 전체를 언제나 같은 정확도로 활용한다'는 다른 주장입니다. 긴 프롬프트는 비용과 첫 토큰 지연을 키우고, 중간 정보 회수 능력이나 최신 지시 우선순위가 약해질 수 있습니다. 실무에서는 문서를 무조건 전부 넣기보다 검색·요약 계층을 두고, 정답이 문서의 앞·중간·끝에 있을 때 회수율을 따로 측정하는 편이 안전합니다. 반복되는 긴 시스템 프롬프트와 공통 자료는 캐시를 활용해야 경제성이 살아납니다.

출처: QwenCloud – Qwen3.8-Max 모델 페이지

API 가격: 표면 단가보다 캐시 설계가 중요하다

표준 가격은 100만 토큰당 입력 2달러($2), 출력 6달러($6)입니다. 암시적 캐시 입력은 0.25달러, 명시적 캐시 생성은 2.50달러, 명시적 캐시 읽기는 0.17달러입니다. 예를 들어 캐시가 없는 입력 50만 토큰과 출력 2만 토큰을 한 번 처리하면 모델 토큰 비용은 약 1.12달러입니다. 같은 50만 토큰 접두사가 암시적 캐시에 적중한다면 입력과 출력 합계는 약 0.245달러로 내려갑니다. 내장 도구나 별도 서비스 비용은 이 계산에 포함되지 않습니다.

이 차이는 장문 에이전트의 비용 구조를 바꿉니다. 정책 문서, 코드 저장소 스냅샷, 도구 설명처럼 반복되는 접두사를 안정적으로 유지하면 캐시 이득이 커집니다. 반대로 요청마다 앞부분을 재정렬하거나 동적 정보를 삽입하면 적중률이 떨어집니다. 도입 전에는 평균 입력·출력 토큰만 계산하지 말고 캐시 적중률, 재시도율, 생각 모드 사용률, 도구 호출 횟수까지 포함한 작업당 비용을 측정해야 합니다.

출처: QwenCloud – Qwen3.8-Max 모델 페이지

개발자가 지금 사용할 수 있는 기능

QwenCloud는 OpenAI 호환 API와 DashScope API 예제를 제공하며 모델 ID는 qwen3.8-max입니다. 함수 호출, 구조화 출력, 배치 처리, 웹 검색, 파인튜닝, 접두사 이어쓰기와 컨텍스트 캐시를 지원합니다. Responses API에는 코드 인터프리터, 웹 추출, 웹 검색, 텍스트-이미지 검색, 이미지-이미지 검색 등 다섯 가지 내장 도구가 표시돼 있습니다. 공개 제한은 분당 200만 토큰과 1만 5천 요청으로 안내됩니다.

호환 API라는 말은 SDK 형태가 익숙하다는 뜻이지, 다른 공급자와 동작이 완전히 같다는 뜻은 아닙니다. 생각 과정 필드, 스트리밍 이벤트, 도구 호출 스키마, 오류 코드, 지역별 엔드포인트, 데이터 보존 정책은 반드시 확인해야 합니다. 가장 안전한 시작은 실제 업무에서 대표성이 높은 50~100개 작업을 골라 품질·지연·비용·실패 복구를 함께 비교하는 제한된 파일럿입니다.

출처: QwenCloud – Qwen3.8-Max 모델 페이지

Qwen3.8-Max 웨이트 공개는 어디까지 확인됐나

알리바바의 8월 3일 발표문은 Qwen3.8-Max의 모델 웨이트를 '다음 주' 공개할 예정이라고 적었습니다. 그러나 8월 9일 기준 Qwen 공식 Hugging Face 모델 목록과 QwenLM GitHub 저장소에서 Qwen3.8-Max 체크포인트·모델 카드·라이선스를 확인할 수 없습니다. 발표 일정상 아직 약속한 기간 안일 수 있으므로 이를 지연이라고 단정할 단계는 아니지만, 현재 시점에 '이미 오픈소스로 공개됐다'고 쓰는 것도 정확하지 않습니다.

웨이트가 실제로 올라오면 체크할 항목은 파일 존재 여부만이 아닙니다. 라이선스의 상업 이용·재배포 조건, 전체 체크포인트 용량과 샤드 구성, 권장 정밀도, 지원 추론 프레임워크, 멀티노드 토폴로지, 양자화 레시피, 모델 카드의 평가 방법을 함께 봐야 합니다. 소스 코드 공개와 가중치 공개, 오픈소스 라이선스는 서로 다른 개념이므로 공식 라이선스가 나오기 전에는 '오픈웨이트 예정'이라는 표현이 가장 안전합니다.

출처: Qwen 공식 Hugging Face 모델 목록

Qwen3.8-27B 팩트체크: 지금은 하드웨어 견적을 낼 단계가 아니다

Qwen3.8-27B라는 이름이 공식적으로 확인되지 않았기 때문에, 이 모델을 dense 또는 MoE라고 규정하거나 24GB GPU에서 실행된다고 계산할 근거도 없습니다. 27B라는 숫자만 보고 BF16·FP8·4비트 메모리를 계산하는 것은 일반적인 27B급 모델의 산술일 뿐, 존재 여부와 구조가 확인되지 않은 특정 제품의 요구 사양이 아닙니다. 컨텍스트 길이와 KV 캐시 형식, 활성 파라미터 수가 달라지면 실제 메모리도 크게 달라집니다.

혼동 가능성이 가장 큰 공식 모델은 qwen3.6-27b입니다. QwenCloud 공식 문서에는 이 이전 세대 27B 모델이 25만 6천 토큰 컨텍스트, 6만 4천 토큰 최대 출력, 8만 토큰 생각 예산을 지원하는 것으로 기재돼 있습니다. 로컬 27B 모델이 필요하다면 현재 검증 가능한 이 모델이나 다른 공개 체크포인트를 별도로 검토할 수 있습니다. 그러나 그것을 Qwen3.8-Max 발표의 일부로 합치면 제품 세대와 근거가 뒤섞입니다.

출처: QwenCloud – 텍스트 생성 모델 공식 목록

누가 지금 써볼 만하고, 누가 기다려야 하나

지금 API 파일럿이 어울리는 경우는 긴 문서·대규모 코드·이미지와 영상을 한 작업에서 함께 다뤄야 하고, 장기 에이전트의 품질이 단가보다 중요한 팀입니다. 특히 기존 OpenAI 호환 클라이언트가 있고 공급자별 라우팅을 추상화해 둔 팀이라면 비교 시험 비용이 낮습니다. 반대로 짧은 질의가 대부분이거나 출력 토큰이 많은 콘텐츠 생성, 엄격한 데이터 소재지 요구, 예측 가능한 저지연이 핵심인 서비스는 더 저렴한 모델과 함께 라우팅하는 편이 합리적입니다.

자체 호스팅을 목적으로 이 소식을 본 독자는 기다리는 편이 맞습니다. 공식 웨이트, 라이선스, 배포 문서가 아직 확인되지 않았고 2.4조 전체 가중치는 950억 활성이라는 효율성과 별개로 대규모 저장·네트워크·운영 자원을 요구할 가능성이 높습니다. 특히 Qwen3.8-27B를 전제로 GPU를 먼저 구매해서는 안 됩니다. 공식 모델 카드와 실제 커뮤니티 배포 결과가 나온 뒤 총소유비용을 계산해도 늦지 않습니다.

출처: QwenLM 공식 GitHub 저장소 목록

향후 세 가지 경로

경로 확인 조건
API 파일럿 대표 업무로 품질·지연·캐시 적중률·작업당 총비용을 먼저 측정
공식 자료 대기 웨이트·라이선스·모델 카드와 제3자 평가가 나온 뒤 도입 범위를 확대
자체 호스팅 검토 실제 체크포인트와 배포 요건이 확인된 뒤 인프라 비용을 산정

발표 후 확인할 지표

지표 확인할 내용
공식 웨이트 Qwen 공식 계정에 체크포인트와 모델 카드가 실제 게시되는지
라이선스 상업 이용·재배포·파생 모델 조건이 무엇인지
배포 요건 샤드·정밀도·지원 프레임워크·멀티노드 구성
독립 평가 한국어·코딩·장기 에이전트에서 공급자 주장과 재현 결과가 일치하는지
27B 명칭 Qwen3.8-27B가 공식 발표나 모델 목록에 실제로 추가되는지
운영 경제성 캐시·재시도·도구 비용을 포함한 성공 작업당 비용

함께 읽을 글

  • 딥시크 API 가격 인상 예고
  • 엔비디아 8월 26일 실적 전망

체크리스트와 함께 보기고출력 그래픽카드에 대응하는 850W 파워서플라이정격 출력, 80 PLUS 등급, 보증 조건과 그래픽카드 권장 전력을 확인해야 하는 전원 부품입니다.6997 KRW파워서플라이 보기고출력 그래픽카드에 대응하는 850W 파워서플라이

자주 묻는 질문

Qwen3.8-Max는 지금 바로 쓸 수 있나요?

네. QwenCloud와 알리바바 클라우드 모델스튜디오의 API에서 qwen3.8-max로 호출할 수 있습니다. OpenAI 호환 예제와 DashScope 예제가 제공됩니다.

2.4조 파라미터가 요청마다 모두 작동하나요?

아닙니다. 공식 발표에 따르면 총 2.4조 가운데 토큰마다 활성화되는 규모는 950억입니다. 다만 전체 가중치 저장과 전문가 분산이 필요하므로 서빙 인프라까지 950억 dense 모델과 같다는 뜻은 아닙니다.

Qwen3.8-27B는 출시됐나요?

8월 9일 기준 공식 발표, QwenCloud 모델 목록, Qwen 공식 Hugging Face와 GitHub에서 확인되지 않습니다. 현재는 미확인 정보이며, 이전 세대 qwen3.6-27b와 혼동하지 않아야 합니다.

Qwen3.8-Max는 오픈소스인가요?

공식 발표는 모델 웨이트를 다음 주 공개할 예정이라고 밝혔습니다. 하지만 현재 공식 저장소에서 체크포인트와 라이선스를 확인할 수 없으므로 '오픈웨이트 예정'이라고 표현하는 것이 정확합니다.

100만 토큰을 쓰면 비용이 얼마인가요?

입력 100만 토큰은 표준 단가로 2달러이며 출력은 별도입니다. 예를 들어 출력 2만 토큰을 더하면 0.12달러가 추가됩니다. 캐시 적중 여부와 내장 도구 사용에 따라 실제 비용은 달라집니다.

공개 출처

  • 알리바바 그룹 – Qwen3.8-Max 공식 발표
  • QwenCloud – Qwen3.8-Max 모델 페이지
  • QwenCloud – 텍스트 생성 모델 공식 목록
  • Qwen 공식 Hugging Face 모델 목록
  • QwenLM 공식 GitHub 저장소 목록

이 글은 2026년 8월 9일 기준 알리바바와 Qwen의 공식 발표·제품 문서·공식 저장소를 대조해 작성했습니다. 제품 사양과 공개 상태는 이후 변경될 수 있으므로 실제 도입 전 최신 모델 카드와 라이선스를 다시 확인하세요.

작성자

stanley0216

Follow Me
다른 기사
NVIDIA's August 26 Earnings Preview: Five Signals for Samsung and SK Hynix
Previous

NVIDIA’s August 26 Earnings Preview: Five Signals for Samsung and SK Hynix

Qwen3.8-Max Explained: 2.4T MoE, 95B Active Parameters, API Pricing, and the 27B Fact Check
Next

Qwen3.8-Max Explained: 2.4T MoE, 95B Active Parameters, API Pricing, and the 27B Fact Check

댓글 없음! 첫 댓글을 남겨보세요.

답글 남기기 응답 취소

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

최신 글

  • DeepSeek API Price Hike Plan: Facts and Cost Scenarios
  • 딥시크 API 가격 인상 예고: 공식 가격·비용 시나리오·대응 전략
  • Why SpaceX Stock Jumped 15.8% in One Day: How the Lockup Shock Turned Into a Relief Rally
  • Why Palantir Stock Jumped 29.5% in One Day: Q2 Earnings, AIP Demand, Guidance, and Valuation
  • 스페이스X 주가가 하루 만에 15.8% 폭등한 이유: 보호예수 충격이 반전된 과정

최신 댓글

보여줄 댓글이 없습니다.

보관함

  • 2026년 8월
  • 2026년 7월
  • 2026년 6월
  • 2026년 4월

카테고리

  • 경제동향
  • 사회이슈
  • 쇼핑할인
  • 시장동향
  • 정책지원
  • 주식분석
  • 코인분석
Copyright 2026 — 누리의 알뜰살뜰 정보세상. All rights reserved. Blogsy WordPress Theme