Почему DeepSeek поднял API до 1100 %
— сразу после китайской open-weight волны

Пиковые тарифы · 2,4 трлн весов · пост-обучение · власть над ценой

Повышение DeepSeek и китайская open-weight атака августа 2026
Коротко: DeepSeek больше не самый дешёвый frontier-API по умолчанию. С 12 по 17 августа 2026 лаборатория подняла отдельные позиции до 1100 %, Alibaba впервые выложила Max-веса на 2,4 трлн параметров, Zhipu выпустила GLM-5.3 с примерно шестикратным скачком coding-бенчей на той же базе 743 млрд. Ниже — лента, тарифная карта, три стратегии и шесть шагов разбора счёта. Цены и лицензию перед перепечаткой сверяйте с первичным источником.
01

Что произошло с 12 по 17 августа 2026

Три хода выглядят противоречиво, пока их не сложить в один сигнал. Китайские лаборатории больше не соревнуются только ценником. Они борются за право задавать цену.

01

16 июля · Kimi K3: Moonshot открывает Kimi K3 на 2,8 трлн параметров и вызывает интерес американской безопасности.

02

2–3 августа · API Qwen: Alibaba анонсирует Qwen3.8-Max и поднимает облачный эндпоинт.

03

10 августа · Контраст Meta: Muse Glimmer выходит на 30B под Apache 2.0. Meta обещает открытые веса закрытого флагмана Muse Spark 1.2.

04

12 августа · Веса в репозитории: Alibaba кладёт Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. В тот же день xAI отдаёт Grok 4.6.

05

13–14 августа · Повышение и пост-обучение: DeepSeek-V4-Pro выходит в GA и объявляет рост цен с 17 августа. Google отдаёт подешевевший Gemini 3.7 Flash. Zhipu на следующий день выпускает GLM-5.3 на базе GLM-5.2 (743 млрд).

06

17 августа, 00:00 Пекин · Новые тарифы: 30 июля OpenAI срезал GPT-5.6 Luna на 80 %. 6–7 августа Luna стала бесплатной моделью по умолчанию с безлимитным текстом. Китай добавляет цену и открытые веса, США — бесплатность на потребительском слое.

Контекст: Китайская деловая пресса читает это как принудительный глобальный repricing. Англоязычный техпресс чаще разбирает каждый релиз как изолированный продукт. Обе рамки нужны одновременно.

02

Тарифы DeepSeek, спецификация Qwen3.8-Max, бенчи GLM-5.3

1100 % — это пиковый cache-hit input V4-Pro, строка, которая раньше была почти нулевой. Output, который доминирует в реальных счетах, вырос на 350 %. Пик — 9–12 и 14–18 по Пекину. Все цифры — за 1 млн токенов.

Позиция (за 1M tokens)БылоВне пикаПикРост в пике
V4-Flash cache-hit input¥0,02¥0,05¥0,10~400 %
V4-Flash cache-miss input¥1,0¥1,5¥3,0200 %
V4-Flash output¥2,0¥4,5¥9,0350 %
V4-Pro cache-hit input¥0,025¥0,15¥0,30~1100 %
V4-Pro cache-miss input¥3,0¥4,5¥9,0200 %
V4-Pro output¥6,0¥13,5¥27,0350 %

Стороннее моделирование тяжёлой нагрузки (около 84M токенов, в основном вне пика, половина cache-hit) даёт ближе 1,8×, а не 12×.

Qwen3.8-2.4T-A95B — первый открытый Max у Alibaba. Qwen3.5 / 3.6 / 3.7 Max оставались только API.

ПараметрЗначение
Параметры2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 маршрутизируемых + 1 общий)
Контекст262 144 токена нативно, до ~1,01M; облачный Max по умолчанию 1M
РитмАнонс 2 авг. → API 3 авг. → веса 12 авг.
Международный API2 $ / M вход, 6 $ / M выход
ЛицензияНе Apache 2.0. Своя Qwen3.8-Max License

GLM-5.3 сидит на той же базе 743 млрд, что и GLM-5.2. Повторного претрейна нет. Цифры — самоотчёт Zhipu, независимый прогон ещё не опубликован.

БенчмаркGLM-5.2GLM-5.3Дельта
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Оговорка: На Terminal-Bench 3.0 GLM-5.3 всё ещё ниже GPT-5.6 Sol (34,6 %) и Claude Fable 5 (33,7 %). Это верх открытого класса, не победа закрытого фронтира.

03

Остался ли DeepSeek самым дешёвым флагманом после повышения

Нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5. Самым дешёвым вариантом он больше не является. Международный API Qwen3.8-Max и OpenAI Luna подрезают DeepSeek off-peak хотя бы по одной оси.

Читать повышение как «премиум-разворот» — ошибка планировщика. Старый плоский дешёвый тариф держался, пока GPU успевали за спросом. Когда вызовы растут экспоненциально, а поставка — нет, прайс обязан показать дефицит. «Гибкое планирование нагрузки» в релизе — это «пиковый compute кончился, сдвиньте джобы сами».

Деталь, которую международные обзоры почти не заметили: в пике официальный API уже дороже части реселлеров, включая GMI Cloud и Novita. Гипотеза «официальный эндпоинт всегда самый дешёвый способ гонять DeepSeek» сломана.

Alibaba одновременно выкладывает 2,4 трлн весов и вешает свою лицензию, не Apache 2.0. MaaS или ИИ-ассистент с выручкой выше 50 млн долларов за любые 12 месяцев обязан отдельно лицензироваться. Продукт с 100M+ MAU или 20 млн долларов месячной выручки обязан явно показывать имя модели. Это другой уровень «открытости», чем Muse Glimmer у Meta под чистым Apache 2.0.

Слух о запрете скачивания из США, ЕС, Великобритании и Кореи ложный. В тексте нет территориальной оговорки.

У GLM-5.3 смотреть надо не скор, а механизм. Та же база 743 млрд. Без ретрейна. Terminal-Bench 3.0 с 4,6 % до 28,3 % за счёт масштаба RL-сред в пост-обучении. Когда предельная отдача претрейна падает, пост-тренировочный RL становится рычагом с более низким порогом входа, чем новый foundation. Для тех, кто гоняет локальный инференс, это вопрос не «какой слоган», а «хватит ли unified memory и не уснёт ли хост».

МодельВход / 1M tokensВыход / 1M tokensОткрытые веса
DeepSeek V4-Pro (пик)¥9,0 (~1,26 $)¥27,0 (~3,78 $)Нет
DeepSeek V4-Pro (вне пика)¥4,5 (~0,63 $)¥13,5 (~1,89 $)Нет
Qwen3.8-Max (международный API)2,00 $6,00 $Да (своя лицензия)
OpenAI GPT-5.6 Luna0,20 $1,20 $Нет
Claude Opus 5 (по коэффициенту Alibaba)~5,00 $~25,00 $Нет
msk map
Beijing peak: 09:00-12:00 and 14:00-18:00 CST
MSK = CST − 5 hours (август 2026)
FX ref ≈ ¥7.15 / $1

«Китайская модель = самая дешёвая» работало в 2025 и начале 2026. Как дефолт это больше не держится.

04

Шесть шагов разбора нового счёта DeepSeek и лицензии Qwen

Не пересобирайте стек по заголовочному множителю. Сначала режьте строку тарифа, часовой пояс и порог лицензии.

01

Назвать строку тарифа: 1100 %, 350 % и 200 % все верны. Это cache-hit input, output и cache-miss input. Счёт двигают последние две.

02

Наложить рабочий день на пекинский пик: 9–12 и 14–18 CST. Для Москвы это 4–7 и 9–13. Батчи и eval-циклы явно уводите во внепиковое окно.

03

Считать от hit rate, не от самой страшной строки: Тяжёлая внепиковая смесь с примерно половиной hits моделируется около 1,8×. Пик плюс низкий hit rate — там, где 350 % и 1100 % становятся фактом.

04

Проверить пороги Qwen: Личное и внутреннее использование свободно. Отдельная коммерческая лицензия при 50 млн долларов за 12 месяцев у MaaS / ИИ-ассистента. Имя модели на экране при 100M+ MAU или 20 млн долларов месячной выручки. Геозапрета нет.

05

Вести GLM-5.3 как результат пост-обучения: База 743 млрд не переучивалась. Только самоотчёт. До стороннего прогона держите ярлык «открытый первый эшелон, не закрытый фронтир».

06

Развести официальный API, реселлеров и локальные веса: Официальный пик уже может проигрывать GMI Cloud и Novita. Открытые веса переносят стоимость с токенов на память хоста и аптайм. Если нужен хост, который не засыпает, начните с цен аренды MESHLAUNCH и центра помощи.

05

Непроверенные утверждения, две ценовые войны, три цитируемые цифры

Эти четыре пункта не кладите в колонку «подтверждено», пока не подтянутся первоисточники:

A

Заголовок 1100 %: Технически верен. Без строки тарифа вводит в заблуждение. Только пиковый cache-hit input.

B

Кремний Zhenwu M890: Ряд китайских деловых изданий пишет, что часть инференса Qwen3.8-Max крутится на собственных чипах Zhenwu M890 и супернодах «Pangu AL128». У Alibaba нет независимой техдокументации и сторонних бенчей. Пометка: не проверено.

C

«Серьёзная» дыра в Cursor: VentureBeat и Zhipu. Технических деталей нет. Источник вендорский, не аудированный.

D

Ответные экспортные ограничения: Сообщения о возможных мерах Минкоммерции КНР остаются спекуляцией. Официального объявления нет.

Внутренняя деловая пресса уже зовёт последний месяц «три обновления моделей в неделю». DeepSeek, Alibaba и Zhipu стоят поверх Kimi K3 (2,8 трлн, 16 июля) и MiniMax H3. Американские лаборатории сыграли наоборот на потребительском слое: Luna минус 80 % 30 июля, затем бесплатно и безлимитно 6–7 августа; Gemini 3.7 Flash 13 августа за половину цены трёхнедельного предшественника.

Есть и геополитическое чтение, которое англоязычный техпресс почти пропустил. Kimi K3 уже вызвал интерес американской проверки. Часть аналитиков читает дроп 2,4 трлн от Alibaba в этом окне как попытку закрепить международное присутствие и нарратив технологического паритета до возможного ужесточения правил. Это интерпретация, не факт. Для тайминга волны она всё равно важна.

Три цифры для цитаты: ① Пиковый cache-hit input V4-Pro ¥0,025 → ¥0,30 (~1100 %); output ¥6,0 → ¥27,0 (350 %). ② Qwen3.8-2.4T-A95B: 2,4 трлн / 95 млрд активных; международный API 2 $ / 6 $. ③ GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % на той же базе 743 млрд, самоотчёт.

Источники: официальное объявление DeepSeek, сверка с Wall Street CN, IT Home, AIGC.cn и V2EX; официальные репозитории Qwen (Hugging Face / ModelScope) и SCMP по лицензии; страница Z.ai по GLM-5.3 плюс VentureBeat и StableLearn; Meta AI Research и VentureBeat по Muse Glimmer; Yicai и Sohu Finance по ритму релизов. Публичные данные на момент подготовки.

Пиковые API штрафуют вечные eval-циклы. Открытые веса штрафуют хосты, которые засыпают или делят порты. Закрытая крышка ноутбука или дешёвый VPS без Metal ломают и локальные бенчи, и soak-тесты агентов. Для продакшен-хоста, который держит iOS CI/CD и автоматизацию агентов, облачная аренда Mac Mini у MESHLAUNCH обычно чище: выделенный Apple Silicon, 7×24, сутки / неделя / месяц. См. страницу цен и центр помощи.

FAQ

Зависит от окна и hit rate кэша. Вне пика Пекина (9–12 и 14–18) и при высоком hit rate реальный счёт ближе к 1,8×. В пике и при низком hit rate цифры заголовка становятся правдой.

Личное и внутреннее использование почти не затронуто. Отдельная коммерческая лицензия нужна, если MaaS или ИИ-ассистент за 12 месяцев превысил 50 млн долларов выручки. При 100M+ MAU или 20 млн долларов месячной выручки имя модели должно быть на экране.

База одна: 743 млрд параметров, без повторного претрейна. Прирост дало масштабирование RL-сред в пост-обучении.

Нет. В опубликованном тексте нет территориальной оговорки. Пороги завязаны на выручку, не на локацию.

Только частично. Muse Glimmer — дистиллированная 30B-модель. Закрытый флагман Muse Spark 1.2 ещё не открыт. Цукерберг сказал «скоро». Для стабильного хоста оценки начните со страницы цен и центра помощи.