Не только Китай: Jalapeño OpenAI и глобальная волна кастомных чипов
К июлю 2026 «AI-компании строят чипы» — глобальный феномен. Данные TrendForce: рост отгрузок кастомных AI-чипов гиперскейлеров — 44,6%, общие GPU — 16,1%. Кастомный silicon впервые обгоняет по темпу роста.
2026-06-24: OpenAI + Broadcom анонсируют inference ASIC Jalapeño — 9 месяцев от design до tape-out. Подробнее: разбор Jalapeño.
2026-07-02: The Information: Anthropic ведёт переговоры с Samsung о 2nm кастомном silicon.
2026-07-07: Reuters: DeepSeek разрабатывает кастомный inference-чип (эксклюзив).
2026-07-07: The Information: Zhipu AI оценивает кастомные чипы.
Тезис: конкуренция в AI сместилась от «лучшей модели» к «самому дешёвому и контролируемому compute».
Training — как первоначальный взнос; inference — аренда, масштабируемая с DAU. На масштабе ChatGPT расходы на inference превышают training. Кастомные ASIC бьют по этому recurring bill.
Что Reuters реально сообщил (и что DeepSeek не подтвердил)
7–8 июля 2026 СМИ разошли Reuters exclusive с единым ядром: DeepSeek строит кастомный AI-чип только для inference, не для training. Проект, по данным источников, стартовал около середины 2025 и остаётся на ранней стадии. Компания ведёт переговоры с chip design house, foundry и поставщиками памяти; усилила закрытый найм chip-инженеров — без публичных вакансий.
Парадокс, который нельзя игнорировать: DeepSeek уже адаптировал модели под Huawei Ascend (V4 в апреле 2026; V4-Flash частично обучен на Ascend), но всё равно идёт в собственный silicon. Точная формулировка: партнёрство и self-development параллельно — партнёрство в production, self-development на ранней стадии. Успех снизит двойную зависимость от Nvidia и Huawei Ascend.
| Измерение | Оценка |
|---|---|
| Качество источника | Высокое — Reuters, «three people familiar with the matter» |
| Официальное подтверждение | Нет по состоянию на 9 июля 2026 |
| Косвенные доказательства | Сильные — раунд $7,4B (июнь 2026) с chip R&D в use of proceeds; тихий найм; формат UE8M0 FP8 как сигнал hardware-software co-design |
| Контртезисы | Часть аналитиков ожидала краткосрочную опору на Huawei; реальность — параллельные треки |
2023–2024 Интервью Лян Вэньфэна: экспортный контроль, голод по compute 2025-01 DeepSeek R1 на Nvidia H800 (уже под export restriction) Середина 2025 Старт in-house chip-проекта (по Reuters) 2026-04 DeepSeek V4 на Huawei Ascend 2026-06 ~$7,4B внешнего финансирования; chip R&D в disclosed use of proceeds 2026-07-07 Reuters: кастомный inference-чип DeepSeek (эксклюзив)
Что CEO DeepSeek Лян Вэньфэн говорил о чипах и compute
Лян Вэньфэн редко выступает публично. Самые полезные источники — два глубоких интервью «暗涌 Waves» в мае 2023 и июле 2024. Он никогда не анонсировал chip-программу. Reuters описывает действия компании — найм, переговоры с поставщиками — а не founder launch event.
«Наш настоящий вызов никогда не был в финансировании — это экспортный контроль на передовые чипы.» — Лян Вэньфэн, июль 2024
Разрыв 4× по compute: лучший внутренний уровень vs. зарубеж: ~2× по training efficiency плюс ~2× по data efficiency — примерно 4× compute для паритета.
Дефицит tech community: отечественные чипы стагнируют без экосистемы; кто-то должен стоять на frontier с first-hand knowledge.
Бесконечный аппетит к compute: исследователи всегда хотят больше; DeepSeek сознательно разворачивает максимум compute.
Эти цитаты задают стратегический мотив — ограничения, экспортный контроль, необходимость co-design — но не являются product announcement.
Alibaba T-Head уже отгружает — ставка Jack Ma 2018 окупается в 2026
Работа Alibaba по чипам — не свежий слух, а восьмилетняя исполненная стратегия. Нельзя писать «Jack Ma недавно сказал, что будут строить чипы». Точная арка: Jack Ma заложил стратегию T-Head в 2018; Joe Tsai объяснил давление export control в 2024; CEO Wu Yongming раскрыл метрики массового производства в 2026.
На Cloud栖 conference в сентябре 2018 Alibaba объединила Zhongtian Micro и chip-команды Damo Academy в T-Head Semiconductor. Jack Ma лично утвердил название. Чипы стали приоритетом уровня группы.
| Фигура | Роль | Публичная позиция по чипам |
|---|---|---|
| Jack Ma | Стратегический спонсор 2018 | Назвал T-Head; поднял чипы до group strategy |
| Joe Tsai | Председатель | Podcast 2024: export limits явно ударили по Alibaba Cloud; долгосрочная вера в domestic advanced semiconductors |
| Wu Yongming | CEO | Earnings call FY2026: 470K+ AI-чипов поставлено; billion-yuan annualized revenue; IPO-опция для T-Head |
| Модель | Сроки | Ключевые характеристики |
|---|---|---|
| GuangNeng 800 | 2019 | Ранний AI inference-чип |
| Zhenwu 810E | Янв. 2026 | Train+infer; 96GB HBM2e; между Nvidia A800 и H20; в массовом производстве |
| Zhenwu M890 | 2026 | 144GB; 800GB/s die-to-die; ~3× 810E |
| Zhenwu V900 | План Q3 2027 | 216GB; 1200GB/s interconnect |
| Zhenwu J900 | План Q3 2028 | Итерация proprietary parallel compute architecture |
Коммерческие данные (H1 2026): 560 000+ отгруженных единиц; billion-yuan annualized revenue; 400+ enterprise-клиентов на Zhenwu clusters. Уставный капитал T-Head вырос до 1 млрд юаней (июнь 2026). Alibaba обязалась вложить 380 млрд юаней за три года в cloud и AI-инфраструктуру. WSJ: новые чипы совместимы с Nvidia CUDA для снижения migration cost; производство смещается с раннего TSMC на domestic foundries (индустрия указывает на SMIC 7nm-class flows).
Почему tech-гиганты строят кастомные AI-чипы: cost, control и Nvidia tax
Экономика — первична. Кастомные inference ASIC дают 30–65% TCO преимущество на hyperscaler scale; per-token cost может упасть на 30–40%. Gross margin datacenter GPU Nvidia превышает 70% — каждая покупка H200 отправляет основную маржу Nvidia. In-house silicon конвертирует recurring «GPU tax» в upfront R&D.
Экономика: Morgan Stanley оценивала 24 000 Blackwell GPU в ~$852M hardware vs. ~$99M эквивалентного Google TPU cluster (hardware-only, Breakingviews/Reuters).
Устойчивость цепочки: export controls, allocation risk, single-vendor dependency — не только cybersecurity, но и предсказуемость поставок.
Hardware-software co-design: DeepSeek UE8M0 FP8, OpenAI Jalapeño под реальный serving (KV cache, batching, latency). GPU жертвуют efficiency ради flexibility; ASIC — наоборот для известных workload.
Переговорная сила: даже частичный self-supply усиливает позицию в переговорах с Nvidia и full-stack narrative (model + cloud + silicon).
Энергетика: performance-per-watt критичен на megawatt и gigawatt datacenters; ASIC убирает неиспользуемые GPU circuits.
| Компания | Проект | Стадия | Фокус | Ключевая метрика |
|---|---|---|---|---|
| DeepSeek | Безымянный inference ASIC | Ранняя R&D | Inference | $7,4B funding; тихий найм; не подтверждено |
| Alibaba T-Head | Zhenwu 810E / M890 | Массовое производство | Train+infer | 560K+ shipped; billion-yuan revenue |
| Huawei | Ascend 950 series | Массовое производство | Train+infer | DeepSeek V4 адаптирован; заказы растут |
| OpenAI | Jalapeño (Broadcom) | Tape-out | Inference | 9-месячный design cycle; deploy конец 2026 |
| TPU v6/v7 | At scale | Train+infer | Gemini end-to-end на TPU | |
| Amazon | Trainium3 / Inferentia | Commercial | Both | Anthropic на Trainium at scale |
| Microsoft | Maia 100 | Развёртывание | Inference | Azure / OpenAI workloads |
| Meta | MTIA | Internal deploy | Inference | Recommendation systems; reboot |
| Anthropic | Переговоры с Samsung | Exploration | TBD | The Information, июль 2026 |
| Zhipu AI | Оценка кастомных чипов | Ранняя стадия | Inference | The Information, июль 2026 |
| Измерение | Training | Inference |
|---|---|---|
| Workload | Динамичный, экспериментальный, частые смены архитектуры | Статичная модель, предсказуемые request patterns |
| Software moat | CUDA stack (cuDNN, NCCL, Nsight) очень глубок | Hand-tuned kernels для фиксированных моделей реалистичны |
| Экономика | Крупный one-time cluster capex | 24/7 recurring spend — часто больше на scale |
| Вердикт | Training остаётся территорией Nvidia; inference — поле боя ASIC | |
Шестишаговый runbook для разработчиков:
Маркируйте слух vs. confirmed: не включайте Reuters-sourced early projects в procurement SLA.
Разделяйте training и inference budgets: большинство кастомных чипов — inference-first; training держите на CUDA-class GPU.
Бенчмаркуйте по TCO, не list price: token cost модели, power и multi-year depreciation вместе.
Отслеживайте global peers: Jalapeño, Anthropic-Samsung, Zhipu evaluation — рост кастомного silicon структурный.
Планируйте supply-chain сценарии: export controls могут ускорить экономику, которая уже была заложена.
Держите edge dev стабильным: дешевле cloud inference не заменяет локальные Agent/Xcode workflow — фиксируйте pinned-версии в Git-репозитории, обновляйте материал каждые 2–4 недели.
Риск: ранние программы проваливаются — Meta MTIA перезапускали. Смена архитектуры может обесценить ASIC. Пишите «по данным Reuters» до официального подтверждения.
Раунд DeepSeek $7,4B (июнь 2026): disclosed uses включают кастомные AI-чипы и domestic compute centers.
560K+ отгрузок T-Head: earnings call Wu Yongming FY2026; billion-yuan annualized revenue.
44,6% vs 16,1% growth: кастомный AI silicon обгоняет general GPU (TrendForce 2026).
Покупка Mac для локального Agent work выглядит дешевле при падении inference prices, но остаются memory ceilings, нестабильный 24/7 uptime и contention в build queue. Для production iOS CI/CD и AI Agent automation аренда Mac Mini в облаке MESHLAUNCH — обычно лучший fit: dedicated bare metal, шесть регионов, гибкие daily/weekly/monthly terms.
По Reuters от 7 июля 2026 со ссылкой на трёх источников DeepSeek на ранней стадии разрабатывает кастомный чип для AI-inference. Компания официально не подтвердила проект.
Публичного анонса не было. В интервью 2024 года он заявил, что экспортный контроль на передовые чипы — главный вызов, а не финансирование. Это мотив, не product launch.
Подразделение Alibaba T-Head (основано в 2018) массово производит AI-чипы Zhenwu — 560 000+ отгруженных единиц, billion-yuan annualized revenue в 2026. Edge dev: страница цен.
Inference-нагрузки повторяемы и предсказуемы — идеальный профиль для кастомных ASIC. Training по-прежнему сильно завязан на GPU Nvidia и стек CUDA.
Оба фактора. Первичный драйвер — экономика: снижение Nvidia tax и per-token cost на масштабе. Export controls ускоряют переход. Локальная настройка: центр помощи.