Qwen3.8-Max GA
2,4T параметров · Arena Text 5-е место

Preliminary Arena · 95B active · обещание open weights · спор вокруг бенчмарков

Qwen3.8-Max Alibaba GA: 2,4T параметров, 5-е место Arena Text
3 августа 2026 Alibaba официально вывела Qwen3.8-Max в GA: 2,4 триллиона параметров суммарно, 95 миллиардов активных, контекст 1 миллион токенов — параллельно с Agent-продуктом «Qianwen Office». На Arena Text (снимок 1 августа) модель предварительно на 5-м месте и единственная не-Anthropic в топ-8. Все бенчмарки — внутренние тесты Alibaba; веса обещаны «на следующей неделе». Материал для команд, оценивающих китайские frontier API: двухнедельный таймлайн, сравнение с Kimi K3 и DeepSeek V4-Flash, спор вокруг open-source label и шестишаговый runbook подключения.
01

От preview до GA за две недели: таймлайн Qwen3.8-Max

В середине июля 2026 Kimi K3, preview Qwen3.8-Max и DeepSeek V4-Flash вышли почти в одну неделю — хронология помогает отделить то, что уже проверили третьи стороны, от заявлений вендора.

01

16 июля: Moonshot выпускает Kimi K3 — 2,8T параметров, 896 экспертов с 16 активными на токен, фокус на независимые обзоры и техотчёт.

02

19 июля: Preview Qwen3.8-Max в Token Plan / Qoder / QoderWork, цена 10 % от GA; активные параметры и таблица бенчмарков не опубликованы, автоматизированные production-вызовы запрещены.

03

27 июля: Веса Kimi K3 на Hugging Face как обещано; open-source attention-ядра, MoE-библиотека и инфраструктура.

04

31 июля: DeepSeek V4-Flash GA — размер не изменился, архитектура и обучение обгоняют preview V4-Pro на agent/code бенчмарках.

05

3 августа: Qwen3.8-Max GA с полной таблицей бенчмарков; agent Qianwen Office запущен. Акции Alibaba HK +7 %, US +4,5 % в тот же день.

Около 10 августа 2026 ожидаются Qwen3.8-Max и облегчённая Qwen3.8-27B на Hugging Face и ModelScope — точная дата и лицензия на момент публикации не объявлены.

02

Ключевые параметры: Qwen3.8-Max vs Kimi K3, DeepSeek и Claude

Таблицы отражают GA-данные Alibaba; строки «тест Alibaba» ещё не воспроизведены Artificial Analysis или Arena.ai.

ПараметрQwen3.8-MaxПримечание
Всего / активных2,4T / 95BSparse MoE + гибридная attention
Контекст1 000 000 токеновThinking ~983k, вывод до ~131k
API (на 1M токенов)Input $2 / Output $6В Китае: 12 ¥ / 36 ¥
Arena Text (1.08)5-е место, 1496 ptsPreliminary; единственный не-Anthropic в top 8
SWE-bench Pro (Alibaba)67,7Ниже Fable 5 (80,0)
Статус весовОбещаны «на следующей неделе»Не опубликованы на момент публикации
МодельВсего / активныхЦена (input/output)Open weightsОбзор третьих сторон
Qwen3.8-Max2,4T / 95B$2 / $6Ещё нет (обещано)Нет
Kimi K32,8T / ~500B$3 / $15Открыты (27.7.)AA Index ≈ 57,11
DeepSeek V4-FlashКак V4-ProТаблица неполнаяОткрыты9 agent/code бенчмарков > V4-Pro
Claude Fable 5Не раскрыто$10 / $50ЗакрытаArena Text 1-е место

В сопоставимом независимом blind test (269 файлов, реальная архитектура проекта) Kimi K3 — 83 балла, preview Qwen3.8-Max — 80. Разрыв минимальный, победы чередуются.

03

Эффективность MoE, уровни reasoning и Agent-экосистема

Qwen3.8-Max продолжает sparse MoE линию Qwen3.5: 2,4T суммарно, 95B активных — стоимость inference ближе к моделям сотен миллиардов, не к полному 2,4T. Это объясняет API $2/$6 — значительно ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).

reasoning_effort в трёх уровнях — low / medium / xhigh (по умолчанию xhigh) — через enable_thinking или поле reasoning.effort в Anthropic-совместимом API.

Длинные автономные задачи — ключевой маркетинг: Alibaba заявляет 16 дней coding без вмешательства, 500+ шагов оптимизации чип-дизайна и RecreationBench (реконструкция приложения в black box). Часть логов на GitHub qwen-code-dev-bot/oh-my-cli — без полного стороннего аудита.

Python · Anthropic-совместимый
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

message = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    thinking={"type": "enabled", "budget_tokens": 4096},
    messages=[{"role": "user", "content": "Спроектируй микросервисную архитектуру с тремя сервисами"}]
)

Важно: API совместим с OpenAI и Anthropic — подключение к Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw без серьёзной миграции.

04

Оценка и подключение Qwen3.8-Max: runbook в шесть шагов

01

Выбрать путь: API (QwenCloud / DashScope), ждать open weights (реалистичнее Qwen3.8-27B) или косвенный вызов через OpenClaw gateway. Self-hosting 2,4T требует мульти-нодового дата-центра.

02

API-ключ и регион: активировать Qwen3.8-Max в Alibaba Model Studio, проверить квоту и регион. Preview запрещал автоматизированные production-вызовы — условия GA в актуальной документации.

03

Настроить reasoning_effort: low для простой классификации, xhigh для сложной Agent-оркестрации — баланс latency и глубины.

04

Стратегия cache: implicit cache hit $0,25/M, explicit cache read $0,17/M — моделировать hit rate для длинных Agent-workflow.

05

A/B на своих данных: перед миграцией в production blind test против Kimi K3 и DeepSeek V4-Flash на своём датасете — не только vendor benchmarks.

06

Отслеживать open weight: около 10 августа проверить Hugging Face / ModelScope, лицензию и Qwen3.8-27B, затем решить о self-hosting.

05

Open-source label, спор вокруг бенчмарков и гонка китайских LLM 2026

A

«Open-Source» до весов: qwen.ai помечен open source в день GA; Hugging Face и ModelScope без репозитория и лицензии — только обещание «на следующей неделе».

B

Бенчмарки из внутреннего фреймворка: PaperBench 93,0, OSWorld-Verified 86,1 без нейтральной репродукции; Arena 1496 помечен Preliminary.

C

Apple Intelligence в Китае: Qwen сжат до менее 4 GB, локально на iPhone 15+ — коммерческий радиус сотен миллионов устройств на уровне системы.

Внимание: в 2026 нарратив смещается от «гонки параметров» к «эффективности архитектуры» — DeepSeek V4-Flash обгоняет V4-Pro без роста параметров. Qwen3.8-Max следует схеме «больший total, меньше active», но вердикт «первая лига» требует open weights и сторонних бенчмарков.

Оркестрация OpenClaw Gateway, Claude Code или Qwen Code на локальном Mac не позволяет приватный inference 2,4T; sleep и лимиты RAM прерывают 16-дневные Agent-циклы. Для iOS CI/CD и Agent-автоматизации 7×24 MESHLAUNCH Mac Mini cloud bare-metal — стабильная база: выделенный Apple Silicon, гибкие тарифы день/неделя/месяц — inference через API, оркестрация и builds на стабильных cloud Mac-нодах. Цены аренды и центр помощи.

FAQ

API через QwenCloud, совместим с OpenAI и Anthropic. Веса ещё не опубликованы — ожидается около 10 августа на Hugging Face и ModelScope. Облачная среда: цены аренды.

Единой авторитетной оценки нет. Blind test: K3 83, preview Qwen 80. K3: уже open, обзоры третьих сторон. Qwen3.8-Max: API дешевле, multimodal шире.

Активируется только 95B — стоимость API как у моделей сотен миллиардов. Полный self-hosting требует дата-центр; Qwen3.8-27B после open weight — практичный путь.

Как ориентир — да, как вердикт — нет. Собственный фреймворок, AA финальную версию не воспроизвёл. Рекомендуется свой A/B. Настройка: центр помощи.

Apple Intelligence в Китае локально запускает сжатые Qwen на iPhone 15+ — возможности Qwen на уровне системы без выбора модели.