Le tarif officiel de l’API DeepSeek au 18 août 2026 est affiché par million de tokens : 0,0028 $ en entrée avec cache pour DeepSeek V4 Flash, 0,14 $ sans cache et 0,28 $ en sortie ; pour DeepSeek V4 Pro, les montants affichés sont 0,003625 $, 0,435 $ et 0,87 $. Consultez les tarifs officiels de l’API DeepSeek avant chaque estimation.

La conclusion est immédiate : ne calculez pas le prix de DeepSeek Harness avec le seul nombre d’heures d’exécution. Additionnez les tokens réellement consommés, le taux de cache, les appels parallèles, les reprises, l’occupation du Mac et le temps humain. Cette semaine, nous vous recommandons de mesurer une tâche réelle, de fixer une limite de budget et d’ajouter une condition d’arrêt automatique avant de lancer un agent toute une journée.

Cet article s’adresse :

  • aux développeurs indépendants qui veulent connaître l’ordre de grandeur d’une longue tâche ;
  • aux responsables d’agents IA qui doivent préparer un budget de pilote pour une équipe ;
  • aux responsables techniques qui comparent un Mac déjà disponible, un environnement distant temporaire et un nœud conservé en permanence.

Dernière mise à jour : 18 août 2026. Les modèles, tarifs, règles de cache et limites de concurrence ont été vérifiés dans la documentation officielle DeepSeek à cette date.

01

Un coût horaire ne décrit pas le vrai périmètre

« Une journée » peut désigner quatre choses différentes :

  1. Une tâche unique : l’agent analyse un dépôt, modifie le code, lance les tests et produit un résultat final.
  2. Des lots planifiés : plusieurs traitements identiques démarrent à intervalles réguliers.
  3. Un développement interactif : un développeur reprend régulièrement la session, modifie les consignes et relance l’agent.
  4. Un agent continu : le système observe des événements, appelle des outils, crée des sous-tâches et recommence jusqu’à une règle d’arrêt.

Ces quatre cas ne produisent pas la même consommation. Une session de six heures peut rester peu coûteuse si elle attend souvent une intervention humaine. À l’inverse, une boucle autonome peut multiplier les appels sans que le Mac soit utilisé à pleine capacité.

Avant le premier lancement, nous inscrivons dans le journal :

  • le livrable attendu ;
  • les fichiers ou tâches inclus dans le périmètre ;
  • le nombre maximal de sous-tâches ;
  • le nombre maximal de reprises par sous-tâche ;
  • la durée maximale ;
  • le budget maximal ;
  • la condition de réussite ;
  • la condition d’abandon.

Sans ces éléments, « DeepSeek Harness a tourné toute la journée » ne permet pas de comparer deux essais. Il faut plutôt mesurer le coût par tâche terminée et le coût par résultat accepté.

02

La formule distingue les tokens du reste

La première estimation peut être écrite ainsi :

Coût total quotidien =
coût des entrées avec cache
+ coût des entrées sans cache
+ coût des sorties
+ coût des reprises
+ coût de l’environnement Mac
+ stockage et sauvegardes
+ maintenance humaine

Pour la partie API :

Coût API =
(tokens entrée avec cache × tarif cache)
+ (tokens entrée sans cache × tarif sans cache)
+ (tokens sortie × tarif sortie)

Les valeurs doivent être prises dans le champ usage de chaque réponse, et non déduites de la taille du fichier envoyé. La documentation DeepSeek distingue notamment prompt_cache_hit_tokens et prompt_cache_miss_tokens. Elle recommande aussi l’outil officiel de calcul hors ligne lorsque le volume de texte doit être préparé avant l’appel. Consultez la documentation officielle sur les tokens et leur utilisation et le guide du cache de contexte.

Le cache ne doit pas être traité comme une remise garantie. Il fonctionne surtout lorsque le préfixe est réutilisé de manière suffisamment identique. Un dépôt transmis avec un ordre de fichiers différent, un horodatage injecté dans le prompt ou une consigne placée avant le contexte peut réduire les correspondances. Le cache est automatique, mais sa construction prend du temps et les entrées inutilisées sont supprimées après une période variable.

Pour connaître combien de tokens DeepSeek Harness utilise en une journée, nous conseillons donc de créer une ligne par requête avec :

  • l’identifiant de la tâche ;
  • le modèle ;
  • les tokens d’entrée avec cache ;
  • les tokens d’entrée sans cache ;
  • les tokens de sortie ;
  • le nombre d’outils appelés ;
  • le statut final ;
  • le motif d’échec éventuel.

Une moyenne quotidienne sans cette ventilation masque les erreurs coûteuses. Une seule tâche qui repart avec un historique complet peut consommer davantage qu’un lot de petites tâches correctement bornées.

03

DeepSeek V4 Pro ou DeepSeek V4 Flash : le prix unitaire ne suffit pas

La documentation officielle présente DeepSeek V4 Pro et DeepSeek V4 Flash avec une fenêtre de contexte de 1 million de tokens et un maximum de sortie indiqué à 384 000 tokens. Ces valeurs décrivent une capacité maximale de l’API, pas une recommandation pour laisser un agent générer sans limite.

DeepSeek V4 Flash est généralement le premier candidat pour :

  • le classement de fichiers ;
  • l’extraction structurée ;
  • les transformations répétitives ;
  • les vérifications simples ;
  • les tâches audio ou vidéo où le modèle reçoit des métadonnées, des transcriptions ou des descriptions déjà préparées.

DeepSeek V4 Pro se justifie davantage lorsque le coût d’une mauvaise décision dépasse l’écart de tarif API :

  • modification de plusieurs modules interdépendants ;
  • diagnostic d’un échec de compilation difficile à reproduire ;
  • planification d’une migration ;
  • raisonnement long avec plusieurs appels d’outils ;
  • validation finale d’un résultat destiné à être livré.

Le bon comparatif n’est donc pas « quel modèle est le moins cher ? », mais :

Coût d’un résultat accepté =
coût des appels
× nombre moyen de reprises
÷ taux de tâches acceptées

Un modèle plus cher par token peut devenir préférable si ses résultats nécessitent moins de corrections humaines. À l’inverse, un modèle plus puissant mal cadré peut générer davantage de contexte, de raisonnement et de reprises. Le mode de réflexion est activé par défaut selon la documentation actuelle, et les demandes complexes d’agent peuvent recevoir un niveau d’effort élevé ou maximal. Cela doit figurer dans le journal de test. Consultez le guide officiel du mode de réflexion avant de comparer deux campagnes.

04

Le parallélisme augmente la capacité, pas automatiquement la productivité

Les limites officielles de concurrence indiquées pour le compte sont de 500 connexions simultanées pour DeepSeek V4 Pro et 2 500 pour DeepSeek V4 Flash. Une requête compte comme une connexion depuis son envoi jusqu’à la fin de la réponse ; dépasser la limite peut produire une erreur HTTP 429. Vérifiez la page officielle sur la concurrence et l’isolation.

Ces valeurs ne signifient pas qu’un Harness doit lancer autant de tâches. Le débit utile dépend aussi :

  • du nombre de fichiers verrouillés par plusieurs sous-tâches ;
  • de la capacité du Mac à exécuter les tests ;
  • de la bande passante et de la latence ;
  • des limites des outils appelés ;
  • du temps de validation humaine ;
  • de la cohérence des résultats produits en parallèle.

Un schéma fréquent est le suivant : l’agent crée plusieurs sous-tâches, deux modifications touchent le même fichier, les tests échouent, puis une nouvelle demande est envoyée avec un historique plus long. Le nombre de tâches terminées peut alors rester stable alors que le volume de tokens augmente.

Nous séparons quatre compteurs :

  • requêtes initiales ;
  • appels d’outils ;
  • reprises automatiques après erreur ou délai ;
  • relances manuelles après résultat jugé insuffisant.

Les erreurs HTTP 429, 500 et 503 n’ont pas la même cause ni la même stratégie de reprise. La documentation officielle des codes d’erreur DeepSeek recommande de ralentir les appels en cas de limitation et de réessayer après un délai en cas d’erreur serveur ou de surcharge.

Une politique de reprise doit aussi comporter un plafond. Sans plafond, un outil indisponible peut déclencher une boucle de raisonnement, puis une nouvelle tentative, puis une intervention humaine. Le coût n’est plus corrélé à la valeur du travail.

05

L’environnement Mac doit être facturé selon son occupation

Le coût du Mac dépend moins du simple fait qu’il s’agit d’un Mac que de la manière dont il est réservé.

Mac déjà disponible

Pour un appareil déjà acheté, le poste n’ajoute pas forcément une facture immédiate. Il possède néanmoins un coût d’opportunité :

  • il n’est plus disponible pour le développement interactif ;
  • il peut monopoliser un écran, un compte ou un accès réseau ;
  • une panne ou une mise à jour peut interrompre le traitement ;
  • son stockage peut être rempli par les dépôts, artefacts et journaux.

Nous pouvons attribuer un coût interne à partir du nombre d’heures réellement bloquées et de la valeur comptable retenue par l’entreprise. Il faut le documenter comme une hypothèse, pas le présenter comme un tarif universel.

Environnement Mac distant temporaire

Un environnement temporaire convient à une validation courte, à un test de compatibilité ou à une démonstration. Le calcul doit inclure :

  • le temps de préparation ;
  • l’installation du Harness et des dépendances ;
  • l’import du dépôt ;
  • l’exécution ;
  • la récupération des résultats ;
  • la suppression ou la conservation des données.

Pour comparer des options disponibles chez MESHLAUNCH, utilisez par exemple la page de présentation des environnements Mac, puis remplissez votre propre durée d’occupation. Nous ne publions ici aucun montant de location non confirmé.

Nœud conservé et environnement partagé

Un nœud conservé en permanence peut être pertinent si les tâches sont fréquentes et si le taux d’occupation reste élevé. Dans le cas contraire, vous payez de la disponibilité inactive. Un environnement partagé peut réduire cette inactivité, mais ajoute des règles de séparation des comptes, des permissions, des journaux et des fenêtres de maintenance.

La puissance de calcul du Mac n’est qu’un poste parmi d’autres. Un Mac suffisamment rapide pour les tests locaux ne supprime pas le coût API. De même, un environnement distant très disponible ne rend pas rentable une boucle d’agent qui échoue régulièrement.

06

La maintenance humaine doit apparaître dans le budget

Un projet d’agent n’est pas sans maintenance parce que le Harness est ouvert ou automatisé. Nous mesurons séparément :

  • installation et mise à jour des dépendances ;
  • correction d’un conflit de version ;
  • approbation des permissions d’accès au dépôt ;
  • réparation d’un outil qui ne répond plus ;
  • récupération après redémarrage ;
  • vérification des sorties ;
  • nettoyage des fichiers temporaires ;
  • adaptation des prompts après une évolution de modèle.

Le coût humain se calcule simplement :

Coût de maintenance =
heures consacrées × coût horaire interne

Pendant une phase de préversion, nous ajoutons une ligne « régression après mise à jour ». Le modèle, le schéma d’appel, le comportement du mode réflexion ou la logique de reprise peuvent changer. DeepSeek indique par ailleurs que les anciens identifiants deepseek-chat et deepseek-reasoner ont été retirés après le 24 juillet 2026 à 15 h 59 UTC, avec un routage vers les variantes V4 correspondantes. Une configuration non vérifiée peut donc produire un échec de démarrage ou un résultat différent sans que le nombre d’heures d’exécution ait changé. Consultez l’annonce officielle sur l’évolution des identifiants de modèles lors d’une migration.

07

La mesure se fait en cinq étapes contrôlables

Étape 1 : définir le résultat accepté

Écrivez ce qui doit être vrai à la fin : tests passants, fichier audio exporté, séquence vidéo rendue, rapport produit ou modification revue. Ajoutez ce qui déclenche l’arrêt.

Étape 2 : lancer un échantillon limité

Ne commencez pas par une journée complète. Utilisez un petit lot représentatif comprenant les outils, le contexte et les erreurs habituelles. Enregistrez les tokens de chaque réponse.

Étape 3 : séparer les modèles et les reprises

Ne mélangez pas les appels de DeepSeek V4 Pro et DeepSeek V4 Flash dans une moyenne unique. Notez aussi les relances causées par une sortie invalide, un échec d’outil ou une intervention humaine.

Étape 4 : mesurer l’occupation du Mac

Relevez les heures de préparation, d’exécution, d’attente, de stockage et de récupération. Si le Mac sert à plusieurs personnes, comptez les périodes pendant lesquelles il ne peut pas être utilisé pour une autre tâche.

Étape 5 : projeter une journée puis une semaine

Utilisez la moyenne par tâche uniquement après avoir constaté que le lot est stable. Pour un agent continu, projetez aussi le pire cas : boucle de reprise, panne d’outil, contexte qui s’allonge et absence de validation humaine.

08

Les conditions déterminent s’il faut continuer ou revenir en arrière

Utilisez cette liste de décision avant de passer du pilote à l’exécution continue :

  • Si le coût API par tâche acceptée est stable sur plusieurs essais et que le taux de reprise reste faible, alors poursuivez avec le modèle sélectionné.
  • Si les tâches simples représentent la majorité du volume et que la validation ne détecte pas de perte de qualité, alors basculez ces tâches vers DeepSeek V4 Flash.
  • Si une tâche critique échoue après plusieurs reprises ou exige une correction humaine importante, alors réservez DeepSeek V4 Pro aux étapes de planification et de validation.
  • Si le cache reste faible parce que le préfixe change à chaque requête, alors raccourcissez le contexte variable et placez les éléments réutilisés au début du prompt.
  • Si le nombre de tokens de sortie augmente sans améliorer le taux de réussite, alors réduisez la longueur maximale et imposez un format de résultat vérifiable.
  • Si le Mac reste inactif pendant une grande partie de la période réservée, alors préférez un environnement temporaire ou mutualisé.
  • Si les erreurs 429 apparaissent, alors réduisez la concurrence avant d’augmenter la capacité.
  • Si le coût de maintenance dépasse la valeur des tâches terminées, alors suspendez le pilote et corrigez l’installation, les permissions ou les règles d’arrêt.

Pour organiser ce suivi avec une équipe, vous pouvez aussi consulter la présentation française de MESHLAUNCH et documenter séparément l’environnement, les accès et le cycle de récupération.

09

Le modèle de budget doit rester vide avant la mesure

Le tableau suivant ne donne pas un faux prix moyen. Il indique les champs à renseigner avec les données de votre compte, de votre Harness et de votre Mac.

Poste Mesure à relever Formule de calcul Décision associée
Entrée avec cache Tokens prompt_cache_hit_tokens Tokens × tarif cache Optimiser les préfixes si la part reste faible
Entrée sans cache Tokens prompt_cache_miss_tokens Tokens × tarif sans cache Réduire le contexte répété
Sortie Tokens générés, y compris le raisonnement exposé dans usage Tokens × tarif sortie Limiter les sorties inutiles
Reprises Appels automatiques et manuels Appels supplémentaires × coût moyen Plafonner les tentatives
Mac Heures de préparation, exécution et attente Temps occupé × coût interne ou tarif confirmé Changer la durée de réservation
Stockage Dépôts, journaux, artefacts, sauvegardes Volume et durée réellement conservés Définir une rétention
Maintenance Temps d’installation, correction et contrôle Heures × coût horaire interne Décider si l’automatisation est rentable
Résultat accepté Nombre de livrables validés Coût total ÷ résultats acceptés Comparer les modèles sur la valeur produite

Le montant final doit être calculé après la première campagne réelle. Toute projection qui ne connaît ni le volume de tokens ni le taux de reprise donne une précision artificielle.

10

Le bon choix dépend du rythme, pas du slogan « moins cher »

Pour une validation ponctuelle, choisissez la durée d’environnement la plus courte qui couvre l’installation, l’exécution et la récupération. Pour des lots récurrents, mesurez le taux d’occupation du Mac avant de conserver un nœud permanent. Pour un agent continu, imposez une limite de dépense, une limite de reprises et une procédure de reprise après redémarrage.

Le local reste intéressant lorsque l’équipement est déjà amorti, que les données doivent rester physiquement sur place ou qu’un accès matériel est nécessaire. Il devient moins pratique lorsque le poste doit rester libre, être partagé ou être surveillé à distance. Un Mac distant peut simplifier le lancement et la continuité, mais ses coûts réels incluent le temps d’initialisation, le stockage, les journaux, les sauvegardes et les interruptions de session.

En pratique, le principal défaut d’une solution actuelle mal cadrée est souvent double : elle facture l’occupation du poste sans mesurer son inactivité et elle laisse l’agent multiplier les appels sans relier la dépense à un résultat accepté. À cela s’ajoutent les reprises manuelles, les permissions fragiles et la récupération après mise à jour. Si vous avez besoin d’un environnement Mac temporaire pour calibrer votre formule, MESHLAUNCH peut servir de support de test ; commencez toutefois par une petite tâche réelle, renseignez le tableau, puis décidez seulement après observation du coût par résultat.