От preview до GA за две недели: таймлайн Qwen3.8-Max
В середине июля 2026 Kimi K3, preview Qwen3.8-Max и DeepSeek V4-Flash вышли почти в одну неделю — хронология помогает отделить то, что уже проверили третьи стороны, от заявлений вендора.
16 июля: Moonshot выпускает Kimi K3 — 2,8T параметров, 896 экспертов с 16 активными на токен, фокус на независимые обзоры и техотчёт.
19 июля: Preview Qwen3.8-Max в Token Plan / Qoder / QoderWork, цена 10 % от GA; активные параметры и таблица бенчмарков не опубликованы, автоматизированные production-вызовы запрещены.
27 июля: Веса Kimi K3 на Hugging Face как обещано; open-source attention-ядра, MoE-библиотека и инфраструктура.
31 июля: DeepSeek V4-Flash GA — размер не изменился, архитектура и обучение обгоняют preview V4-Pro на agent/code бенчмарках.
3 августа: Qwen3.8-Max GA с полной таблицей бенчмарков; agent Qianwen Office запущен. Акции Alibaba HK +7 %, US +4,5 % в тот же день.
Около 10 августа 2026 ожидаются Qwen3.8-Max и облегчённая Qwen3.8-27B на Hugging Face и ModelScope — точная дата и лицензия на момент публикации не объявлены.
Ключевые параметры: Qwen3.8-Max vs Kimi K3, DeepSeek и Claude
Таблицы отражают GA-данные Alibaba; строки «тест Alibaba» ещё не воспроизведены Artificial Analysis или Arena.ai.
| Параметр | Qwen3.8-Max | Примечание |
|---|---|---|
| Всего / активных | 2,4T / 95B | Sparse MoE + гибридная attention |
| Контекст | 1 000 000 токенов | Thinking ~983k, вывод до ~131k |
| API (на 1M токенов) | Input $2 / Output $6 | В Китае: 12 ¥ / 36 ¥ |
| Arena Text (1.08) | 5-е место, 1496 pts | Preliminary; единственный не-Anthropic в top 8 |
| SWE-bench Pro (Alibaba) | 67,7 | Ниже Fable 5 (80,0) |
| Статус весов | Обещаны «на следующей неделе» | Не опубликованы на момент публикации |
| Модель | Всего / активных | Цена (input/output) | Open weights | Обзор третьих сторон |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | $2 / $6 | Ещё нет (обещано) | Нет |
| Kimi K3 | 2,8T / ~500B | $3 / $15 | Открыты (27.7.) | AA Index ≈ 57,11 |
| DeepSeek V4-Flash | Как V4-Pro | Таблица неполная | Открыты | 9 agent/code бенчмарков > V4-Pro |
| Claude Fable 5 | Не раскрыто | $10 / $50 | Закрыта | Arena Text 1-е место |
В сопоставимом независимом blind test (269 файлов, реальная архитектура проекта) Kimi K3 — 83 балла, preview Qwen3.8-Max — 80. Разрыв минимальный, победы чередуются.
Эффективность MoE, уровни reasoning и Agent-экосистема
Qwen3.8-Max продолжает sparse MoE линию Qwen3.5: 2,4T суммарно, 95B активных — стоимость inference ближе к моделям сотен миллиардов, не к полному 2,4T. Это объясняет API $2/$6 — значительно ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).
reasoning_effort в трёх уровнях — low / medium / xhigh (по умолчанию xhigh) — через enable_thinking или поле reasoning.effort в Anthropic-совместимом API.
Длинные автономные задачи — ключевой маркетинг: Alibaba заявляет 16 дней coding без вмешательства, 500+ шагов оптимизации чип-дизайна и RecreationBench (реконструкция приложения в black box). Часть логов на GitHub qwen-code-dev-bot/oh-my-cli — без полного стороннего аудита.
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "Спроектируй микросервисную архитектуру с тремя сервисами"}]
)
Важно: API совместим с OpenAI и Anthropic — подключение к Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw без серьёзной миграции.
Оценка и подключение Qwen3.8-Max: runbook в шесть шагов
Выбрать путь: API (QwenCloud / DashScope), ждать open weights (реалистичнее Qwen3.8-27B) или косвенный вызов через OpenClaw gateway. Self-hosting 2,4T требует мульти-нодового дата-центра.
API-ключ и регион: активировать Qwen3.8-Max в Alibaba Model Studio, проверить квоту и регион. Preview запрещал автоматизированные production-вызовы — условия GA в актуальной документации.
Настроить reasoning_effort: low для простой классификации, xhigh для сложной Agent-оркестрации — баланс latency и глубины.
Стратегия cache: implicit cache hit $0,25/M, explicit cache read $0,17/M — моделировать hit rate для длинных Agent-workflow.
A/B на своих данных: перед миграцией в production blind test против Kimi K3 и DeepSeek V4-Flash на своём датасете — не только vendor benchmarks.
Отслеживать open weight: около 10 августа проверить Hugging Face / ModelScope, лицензию и Qwen3.8-27B, затем решить о self-hosting.
Open-source label, спор вокруг бенчмарков и гонка китайских LLM 2026
«Open-Source» до весов: qwen.ai помечен open source в день GA; Hugging Face и ModelScope без репозитория и лицензии — только обещание «на следующей неделе».
Бенчмарки из внутреннего фреймворка: PaperBench 93,0, OSWorld-Verified 86,1 без нейтральной репродукции; Arena 1496 помечен Preliminary.
Apple Intelligence в Китае: Qwen сжат до менее 4 GB, локально на iPhone 15+ — коммерческий радиус сотен миллионов устройств на уровне системы.
Внимание: в 2026 нарратив смещается от «гонки параметров» к «эффективности архитектуры» — DeepSeek V4-Flash обгоняет V4-Pro без роста параметров. Qwen3.8-Max следует схеме «больший total, меньше active», но вердикт «первая лига» требует open weights и сторонних бенчмарков.
Оркестрация OpenClaw Gateway, Claude Code или Qwen Code на локальном Mac не позволяет приватный inference 2,4T; sleep и лимиты RAM прерывают 16-дневные Agent-циклы. Для iOS CI/CD и Agent-автоматизации 7×24 MESHLAUNCH Mac Mini cloud bare-metal — стабильная база: выделенный Apple Silicon, гибкие тарифы день/неделя/месяц — inference через API, оркестрация и builds на стабильных cloud Mac-нодах. Цены аренды и центр помощи.
API через QwenCloud, совместим с OpenAI и Anthropic. Веса ещё не опубликованы — ожидается около 10 августа на Hugging Face и ModelScope. Облачная среда: цены аренды.
Единой авторитетной оценки нет. Blind test: K3 83, preview Qwen 80. K3: уже open, обзоры третьих сторон. Qwen3.8-Max: API дешевле, multimodal шире.
Активируется только 95B — стоимость API как у моделей сотен миллиардов. Полный self-hosting требует дата-центр; Qwen3.8-27B после open weight — практичный путь.
Как ориентир — да, как вердикт — нет. Собственный фреймворок, AA финальную версию не воспроизвёл. Рекомендуется свой A/B. Настройка: центр помощи.
Apple Intelligence в Китае локально запускает сжатые Qwen на iPhone 15+ — возможности Qwen на уровне системы без выбора модели.