Qwen3.8-Max 출시 타임라인: 프리뷰에서 GA까지 2주
7월 하순 국산 대형 모델이 연달아 등장했고, Qwen3.8-Max의 출시 속도는 Kimi K3·DeepSeek V4-Flash와 직접 맞붙습니다. 타임라인을 알면 어떤 정보가 제3자 검증을 거쳤고 어떤 것이 여전히 벤더 발표인지 구분할 수 있습니다.
7월 16일: Moonshot AI가 Kimi K3를 공개했습니다. 총 2.8조 파라미터(896개 전문가 중 16개 활성), 독립 평가·기술 보고서 투명성을 강조했습니다.
7월 19일: Qwen3.8-Max 프리뷰가 열렸습니다. Token Plan·Qoder·QoderWork에 연결되었고 가격은 정식의 10%였지만 활성 파라미터·벤치마크 표는 없었으며, 서비스 약관은 자동화 프로덕션 호출을 금지했습니다.
7월 27일: Kimi K3가 약속대로 Hugging Face에 가중치를 공개하고, 어텐션 커널·MoE 통신 라이브러리 등 인프라도 함께 오픈했습니다.
7월 31일: DeepSeek가 V4-Flash 정식판을 내면서 파라미터 규모는 유지한 채 아키텍처·학습 최적화로 에이전트·코드 벤치마크가 V4-Pro 프리뷰를 크게 넘겼습니다.
8월 3일: Qwen3.8-Max GA, 전체 벤치마크 표와 「천문 오피스」 에이전트가 동시 출시되었습니다. 당일 알리 홍콩 주가는 약 7%, 미국 ADR은 약 4.5% 상승했습니다.
8월 10일 전후 Qwen3.8-Max와 경량판 Qwen3.8-27B 가중치가 Hugging Face·ModelScope에 올라올 계획이지만, 작성 시점에는 정확한 일정과 라이선스 조항이 공개되지 않았습니다.
Qwen3.8-Max 핵심 스펙과 Kimi K3·DeepSeek·Claude 가로 비교
아래 표는 알리 GA 단계 공개 수치를 우선 나열합니다. 「알리 자체 측정」 표시 벤치마크는 Artificial Analysis·Arena.ai 등 제3자의 정식 재현이 아직 없습니다.
| 항목 | Qwen3.8-Max | 비고 |
|---|---|---|
| 총 파라미터 / 활성 | 2.4조 / 950억 | sparse MoE + 혼합 어텐션 |
| 컨텍스트 윈도우 | 100만 토큰 | 사고 모드 약 98.3만, 출력 상한 13.1만 |
| API 단가(백만 토큰) | 입력 $2 / 출력 $6 | 중국 내수: 입력 12원 / 출력 36원 |
| Arena 텍스트(8/1 스냅샷) | 5위, 1496점 | Preliminary 표기; 상위 8 중 유일 비-Anthropic |
| SWE-bench Pro(알리 자체) | 67.7 | Fable 5 80.0에 뒤짐 |
| 가중치 오픈 상태 | 「다음 주」 약속 | 작성 시점 미공개 |
| 모델 | 총/활성 파라미터 | 단가(입력/출력) | 가중치 오픈 | 제3자 평가 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950억 | $2 / $6 | 미오픈(약속 중) | 없음 |
| Kimi K3 | 2.8T / 약 500억 | $3 / $15 | 오픈 완료(7/27) | AA Index ≈ 57.11 |
| DeepSeek V4-Flash | V4-Pro 대비 동일 | 전체 표 미공개 | 오픈 완료 | 9개 에이전트·코드 벤치 V4-Pro 초과 |
| Claude Fable 5 | 비공개 | $10 / $50 | 폐쇄 | Arena 텍스트 1위 |
비교 가능한 독립 블라인드 테스트(269개 파일의 실제 프로젝트 아키텍처 과제) 한 건에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점으로 격차가 작았습니다. 「압도」가 아니라 동급·상호 우열에 가깝습니다.
2.4조 파라미터 이면: MoE 효율·추론 단계·에이전트 생태계
Qwen3.8-Max는 Qwen3.5의 sparse MoE 노선을 이어 총 2.4조, 실제 활성 950억으로 추론 비용은 전체 2.4T가 아니라 천억급 모델에 가깝습니다. API 단가를 $2/$6까지 낮추고 Claude Opus 5($5/$25)·Fable 5($10/$50)보다 저렴하게 맞출 수 있는 아키텍처적 기반입니다.
reasoning_effort 3단계는 low / medium / xhigh(기본 xhigh)를 제공합니다. 작업 복잡도에 따라 속도와 깊이를 조절할 수 있으며, enable_thinking 또는 Anthropic 호환 reasoning.effort 필드로 호출합니다.
장기 자율 태스크가 핵심 홍보 포인트입니다. 알리 사례에는 16일 무인 자율 코딩, 500+ 단계 칩 설계 최적화, RecreationBench(블랙박스 환경에서 상호·시각 피드백만으로 실제 앱 복원)가 포함됩니다. 일부 과정은 GitHub qwen-code-dev-bot/oh-my-cli에 기록되었지만 완전한 제3자 감사는 아닙니다.
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "3서비스 마이크로서비스 아키텍처를 설계하세요"}]
)
참고: API는 OpenAI·Anthropic 프로토콜을 동시 지원합니다. Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주요 에이전트 체인에 직접 연결할 수 있어 이전 비용을 낮출 수 있습니다.
Qwen3.8-Max 평가·접속: 6단계 Runbook
접속 경로를 먼저 정합니다: API 호출(QwenCloud / DashScope), 오픈 가중치 대기(Qwen3.8-27B가 현실적), OpenClaw 등 에이전트 게이트웨이 간접 호출을 구분합니다. 전체 2.4T 가중치는 다중 노드 데이터센터가 필요해 로컬 자체 배포에 맞지 않습니다.
API Key를 발급합니다: Alibaba Cloud Model Studio에서 Qwen3.8-Max를 개통하고 계정 쿼터·리전을 확인합니다. 프리뷰는 자동화 프로덕션 호출을 금지했으며, GA 이후 약관은 최신 공식 문서를 따르십시오.
reasoning_effort를 설정합니다: 작업 유형에 따라 low / medium / xhigh를 선택합니다. 단순 분류는 low, 복잡한 에이전트 오케스트레이션은 기본 xhigh로 지연과 추론 깊이를 맞춥니다.
캐시 전략을 켭니다: 암시적 캐시 적중 $0.25/백만 토큰, 명시적 캐시 읽기 $0.17/백만 토큰입니다. 장문 컨텍스트 에이전트 워크플로에서는 캐시 적중률이 실제 청구에 미치는 영향을 평가하십시오.
자체 데이터로 A/B 테스트합니다: 프로덕션 이전에 Kimi K3·DeepSeek V4-Flash와 블라인드 비교를 수행합니다. 벤더 자체 벤치마크에 의존하지 않습니다.
오픈웨이트 공개를 추적합니다: 8월 10일 전후 Hugging Face·ModelScope 저장소, 라이선스 조항, Qwen3.8-27B 경량판 가중치를 확인한 뒤 자체 배포 전환 여부를 결정합니다.
오픈소스 라벨 논란과 2026 중국 대형 모델 경쟁 구도
「Open-Source」 라벨이 가중치보다 먼저: qwen.ai는 GA 당일 이미 오픈소스로 표기했지만, Hugging Face·ModelScope에는 저장소·라이선스가 없고 「다음 주」만 약속된 상태입니다.
벤치마크는 전부 자체 프레임워크: PaperBench 93.0, OSWorld-Verified 86.1 등은 중립 플랫폼 재현이 없습니다. Arena 1496점도 Preliminary로 표기되었습니다.
Apple Intelligence 중국판: 천문 모델을 4GB 이하로 압축해 iPhone 15 이상에서 로컬 구동합니다. 상업적 파급은 수억 대 iPhone의 시스템 AI로 확장됩니다.
주의: 2026년 「파라미터 경쟁」 서사는 「아키텍처 효율 경쟁」으로 바뀌고 있습니다. DeepSeek V4-Flash는 파라미터를 늘리지 않고 V4-Pro를 넘겼습니다. Qwen3.8-Max의 「대용량·저활성」 설계도 같은 흐름이지만, 「글로벌 1티어」 결론은 오픈 가중치와 제3자 벤치마크가 나온 뒤에야 검증됩니다.
로컬 Mac에서 OpenClaw Gateway, Claude Code, Qwen Code 등 에이전트 오케스트레이션 도구를 돌려야 하는 팀에게 소비자급 하드웨어로 2.4T급 모델의 프라이빗 추론은 현실적이지 않습니다. 로컬 Mac의 절전·메모리 한계는 16일급 장기 에이전트 작업도 중단시킵니다. iOS CI/CD와 AI 에이전트 자동화를 7×24 안정 운영해야 하는 프로덕션 환경에서는 MESHLAUNCH Mac Mini 클라우드 대여가 보통 더 나은 선택입니다. 전용 Apple Silicon, 일·주·월 유연 과금으로 추론은 API에 맡기고 오케스트레이션·빌드는 안정적인 클라우드 Mac 노드에 두십시오.
API는 QwenCloud에서 OpenAI·Anthropic 호환 프로토콜로 호출할 수 있습니다. 가중치는 아직 공개되지 않았고, 8월 10일 전후 Hugging Face·ModelScope 등록이 예상되나 정확한 일정은 공식 발표를 따르십시오. 클라우드 개발 환경은 가격 페이지에서 확인하십시오.
권위 있는 단일 벤치마크는 없습니다. 비교 가능한 독립 블라인드 테스트에서 Kimi K3 83점·Qwen3.8-Max 프리뷰 80점으로 매우 근접했습니다. Kimi K3는 이미 오픈·제3자 평가가 있고, Qwen3.8-Max는 API 단가가 낮고 멀티모달 범위가 넓은 편입니다.
총 2.4조지만 활성은 950억이라 API 호출 비용은 천억급 모델에 가깝습니다. 전체 가중치 온프레미스는 다중 노드 데이터센터가 필요하고, 현실적 선택은 Qwen3.8-27B 경량판 오픈을 기다리는 것입니다.
참고는 가능하지만 결론으로 쓰기는 어렵습니다. 수치는 알리 자체 테스트 프레임워크 출처이며, Artificial Analysis 등 중립 플랫폼의 정식판 재현은 아직 없습니다. 후속 독립 평가를 보거나 자체 비즈니스 시나리오 A/B 테스트를 권장합니다. 클라우드 Mac 개발 환경 구성은 고객 센터를 참고하십시오.
중국 시장 Apple Intelligence는 압축된 Qwen 모델을 iPhone 로컬에서 구동합니다. 국내 iPhone 사용자도 시스템 레벨에서 천문 시리즈 능력을 간접적으로 활용하게 되며, 모델 벤더를 직접 고르지 않아도 됩니다.