Что произошло с 12 по 17 августа 2026
Три хода выглядят противоречиво, пока их не сложить в один сигнал. Китайские лаборатории больше не соревнуются только ценником. Они борются за право задавать цену.
16 июля · Kimi K3: Moonshot открывает Kimi K3 на 2,8 трлн параметров и вызывает интерес американской безопасности.
2–3 августа · API Qwen: Alibaba анонсирует Qwen3.8-Max и поднимает облачный эндпоинт.
10 августа · Контраст Meta: Muse Glimmer выходит на 30B под Apache 2.0. Meta обещает открытые веса закрытого флагмана Muse Spark 1.2.
12 августа · Веса в репозитории: Alibaba кладёт Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. В тот же день xAI отдаёт Grok 4.6.
13–14 августа · Повышение и пост-обучение: DeepSeek-V4-Pro выходит в GA и объявляет рост цен с 17 августа. Google отдаёт подешевевший Gemini 3.7 Flash. Zhipu на следующий день выпускает GLM-5.3 на базе GLM-5.2 (743 млрд).
17 августа, 00:00 Пекин · Новые тарифы: 30 июля OpenAI срезал GPT-5.6 Luna на 80 %. 6–7 августа Luna стала бесплатной моделью по умолчанию с безлимитным текстом. Китай добавляет цену и открытые веса, США — бесплатность на потребительском слое.
Контекст: Китайская деловая пресса читает это как принудительный глобальный repricing. Англоязычный техпресс чаще разбирает каждый релиз как изолированный продукт. Обе рамки нужны одновременно.
Тарифы DeepSeek, спецификация Qwen3.8-Max, бенчи GLM-5.3
1100 % — это пиковый cache-hit input V4-Pro, строка, которая раньше была почти нулевой. Output, который доминирует в реальных счетах, вырос на 350 %. Пик — 9–12 и 14–18 по Пекину. Все цифры — за 1 млн токенов.
| Позиция (за 1M tokens) | Было | Вне пика | Пик | Рост в пике |
|---|---|---|---|---|
| V4-Flash cache-hit input | ¥0,02 | ¥0,05 | ¥0,10 | ~400 % |
| V4-Flash cache-miss input | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash output | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro cache-hit input | ¥0,025 | ¥0,15 | ¥0,30 | ~1100 % |
| V4-Pro cache-miss input | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro output | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Стороннее моделирование тяжёлой нагрузки (около 84M токенов, в основном вне пика, половина cache-hit) даёт ближе 1,8×, а не 12×.
Qwen3.8-2.4T-A95B — первый открытый Max у Alibaba. Qwen3.5 / 3.6 / 3.7 Max оставались только API.
| Параметр | Значение |
|---|---|
| Параметры | 2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 маршрутизируемых + 1 общий) |
| Контекст | 262 144 токена нативно, до ~1,01M; облачный Max по умолчанию 1M |
| Ритм | Анонс 2 авг. → API 3 авг. → веса 12 авг. |
| Международный API | 2 $ / M вход, 6 $ / M выход |
| Лицензия | Не Apache 2.0. Своя Qwen3.8-Max License |
GLM-5.3 сидит на той же базе 743 млрд, что и GLM-5.2. Повторного претрейна нет. Цифры — самоотчёт Zhipu, независимый прогон ещё не опубликован.
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Оговорка: На Terminal-Bench 3.0 GLM-5.3 всё ещё ниже GPT-5.6 Sol (34,6 %) и Claude Fable 5 (33,7 %). Это верх открытого класса, не победа закрытого фронтира.
Остался ли DeepSeek самым дешёвым флагманом после повышения
Нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5. Самым дешёвым вариантом он больше не является. Международный API Qwen3.8-Max и OpenAI Luna подрезают DeepSeek off-peak хотя бы по одной оси.
Читать повышение как «премиум-разворот» — ошибка планировщика. Старый плоский дешёвый тариф держался, пока GPU успевали за спросом. Когда вызовы растут экспоненциально, а поставка — нет, прайс обязан показать дефицит. «Гибкое планирование нагрузки» в релизе — это «пиковый compute кончился, сдвиньте джобы сами».
Деталь, которую международные обзоры почти не заметили: в пике официальный API уже дороже части реселлеров, включая GMI Cloud и Novita. Гипотеза «официальный эндпоинт всегда самый дешёвый способ гонять DeepSeek» сломана.
Alibaba одновременно выкладывает 2,4 трлн весов и вешает свою лицензию, не Apache 2.0. MaaS или ИИ-ассистент с выручкой выше 50 млн долларов за любые 12 месяцев обязан отдельно лицензироваться. Продукт с 100M+ MAU или 20 млн долларов месячной выручки обязан явно показывать имя модели. Это другой уровень «открытости», чем Muse Glimmer у Meta под чистым Apache 2.0.
Слух о запрете скачивания из США, ЕС, Великобритании и Кореи ложный. В тексте нет территориальной оговорки.
У GLM-5.3 смотреть надо не скор, а механизм. Та же база 743 млрд. Без ретрейна. Terminal-Bench 3.0 с 4,6 % до 28,3 % за счёт масштаба RL-сред в пост-обучении. Когда предельная отдача претрейна падает, пост-тренировочный RL становится рычагом с более низким порогом входа, чем новый foundation. Для тех, кто гоняет локальный инференс, это вопрос не «какой слоган», а «хватит ли unified memory и не уснёт ли хост».
| Модель | Вход / 1M tokens | Выход / 1M tokens | Открытые веса |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9,0 (~1,26 $) | ¥27,0 (~3,78 $) | Нет |
| DeepSeek V4-Pro (вне пика) | ¥4,5 (~0,63 $) | ¥13,5 (~1,89 $) | Нет |
| Qwen3.8-Max (международный API) | 2,00 $ | 6,00 $ | Да (своя лицензия) |
| OpenAI GPT-5.6 Luna | 0,20 $ | 1,20 $ | Нет |
| Claude Opus 5 (по коэффициенту Alibaba) | ~5,00 $ | ~25,00 $ | Нет |
Beijing peak: 09:00-12:00 and 14:00-18:00 CST MSK = CST − 5 hours (август 2026) FX ref ≈ ¥7.15 / $1
«Китайская модель = самая дешёвая» работало в 2025 и начале 2026. Как дефолт это больше не держится.
Шесть шагов разбора нового счёта DeepSeek и лицензии Qwen
Не пересобирайте стек по заголовочному множителю. Сначала режьте строку тарифа, часовой пояс и порог лицензии.
Назвать строку тарифа: 1100 %, 350 % и 200 % все верны. Это cache-hit input, output и cache-miss input. Счёт двигают последние две.
Наложить рабочий день на пекинский пик: 9–12 и 14–18 CST. Для Москвы это 4–7 и 9–13. Батчи и eval-циклы явно уводите во внепиковое окно.
Считать от hit rate, не от самой страшной строки: Тяжёлая внепиковая смесь с примерно половиной hits моделируется около 1,8×. Пик плюс низкий hit rate — там, где 350 % и 1100 % становятся фактом.
Проверить пороги Qwen: Личное и внутреннее использование свободно. Отдельная коммерческая лицензия при 50 млн долларов за 12 месяцев у MaaS / ИИ-ассистента. Имя модели на экране при 100M+ MAU или 20 млн долларов месячной выручки. Геозапрета нет.
Вести GLM-5.3 как результат пост-обучения: База 743 млрд не переучивалась. Только самоотчёт. До стороннего прогона держите ярлык «открытый первый эшелон, не закрытый фронтир».
Развести официальный API, реселлеров и локальные веса: Официальный пик уже может проигрывать GMI Cloud и Novita. Открытые веса переносят стоимость с токенов на память хоста и аптайм. Если нужен хост, который не засыпает, начните с цен аренды MESHLAUNCH и центра помощи.
Непроверенные утверждения, две ценовые войны, три цитируемые цифры
Эти четыре пункта не кладите в колонку «подтверждено», пока не подтянутся первоисточники:
Заголовок 1100 %: Технически верен. Без строки тарифа вводит в заблуждение. Только пиковый cache-hit input.
Кремний Zhenwu M890: Ряд китайских деловых изданий пишет, что часть инференса Qwen3.8-Max крутится на собственных чипах Zhenwu M890 и супернодах «Pangu AL128». У Alibaba нет независимой техдокументации и сторонних бенчей. Пометка: не проверено.
«Серьёзная» дыра в Cursor: VentureBeat и Zhipu. Технических деталей нет. Источник вендорский, не аудированный.
Ответные экспортные ограничения: Сообщения о возможных мерах Минкоммерции КНР остаются спекуляцией. Официального объявления нет.
Внутренняя деловая пресса уже зовёт последний месяц «три обновления моделей в неделю». DeepSeek, Alibaba и Zhipu стоят поверх Kimi K3 (2,8 трлн, 16 июля) и MiniMax H3. Американские лаборатории сыграли наоборот на потребительском слое: Luna минус 80 % 30 июля, затем бесплатно и безлимитно 6–7 августа; Gemini 3.7 Flash 13 августа за половину цены трёхнедельного предшественника.
Есть и геополитическое чтение, которое англоязычный техпресс почти пропустил. Kimi K3 уже вызвал интерес американской проверки. Часть аналитиков читает дроп 2,4 трлн от Alibaba в этом окне как попытку закрепить международное присутствие и нарратив технологического паритета до возможного ужесточения правил. Это интерпретация, не факт. Для тайминга волны она всё равно важна.
Три цифры для цитаты: ① Пиковый cache-hit input V4-Pro ¥0,025 → ¥0,30 (~1100 %); output ¥6,0 → ¥27,0 (350 %). ② Qwen3.8-2.4T-A95B: 2,4 трлн / 95 млрд активных; международный API 2 $ / 6 $. ③ GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % на той же базе 743 млрд, самоотчёт.
Источники: официальное объявление DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и V2EX; официальные репозитории Qwen (Hugging Face / ModelScope) и SCMP по лицензии; страница Z.ai по GLM-5.3 плюс VentureBeat и StableLearn; Meta AI Research и VentureBeat по Muse Glimmer; Yicai и Sohu Finance по ритму релизов. Публичные данные на момент подготовки.
Пиковые API штрафуют вечные eval-циклы. Открытые веса штрафуют хосты, которые засыпают или делят порты. Закрытая крышка ноутбука или дешёвый VPS без Metal ломают и локальные бенчи, и soak-тесты агентов. Для продакшен-хоста, который держит iOS CI/CD и автоматизацию агентов, облачная аренда Mac Mini у MESHLAUNCH обычно чище: выделенный Apple Silicon, 7×24, сутки / неделя / месяц. См. страницу цен и центр помощи.
Зависит от окна и hit rate кэша. Вне пика Пекина (9–12 и 14–18) и при высоком hit rate реальный счёт ближе к 1,8×. В пике и при низком hit rate цифры заголовка становятся правдой.
Личное и внутреннее использование почти не затронуто. Отдельная коммерческая лицензия нужна, если MaaS или ИИ-ассистент за 12 месяцев превысил 50 млн долларов выручки. При 100M+ MAU или 20 млн долларов месячной выручки имя модели должно быть на экране.
База одна: 743 млрд параметров, без повторного претрейна. Прирост дало масштабирование RL-сред в пост-обучении.
Нет. В опубликованном тексте нет территориальной оговорки. Пороги завязаны на выручку, не на локацию.
Только частично. Muse Glimmer — дистиллированная 30B-модель. Закрытый флагман Muse Spark 1.2 ещё не открыт. Цукерберг сказал «скоро». Для стабильного хоста оценки начните со страницы цен и центра помощи.