昨晚的長任務明明只跑了幾個小時,API 用量、重試次數和 Mac 待機時間卻對不起來。

最快的估法不是把「運行小時數」乘上一個單價,而是把模型 Token、快取、並發重試、Mac 環境占用與人工維護分開記錄;本週先用一個小型真實任務校準公式,再決定試用、擴容或暫停。

最後更新於 2026 年 8 月 18 日;模型、價格、快取與並發資料核實自 DeepSeek 官方 API 文件。DeepSeek Harness 本身的資源占用與維護時間沒有統一官方數值,必須由我們或讀者自行記錄。

這篇適合三類讀者:

  • 想知道一次長任務大致消耗範圍的獨立開發者。
  • 正在為團隊試點申請預算的 AI Agent 負責人。
  • 正在比較短期遠端環境、長期保留節點與自有 Mac 占用成本的技術管理者。
01

先用完整成本口徑回答:DeepSeek Harness 跑一天多少钱

「一天」不是成本單位,只是觀察時間。真正可比較的單位應是:

總成本 = 模型呼叫成本 + Mac 環境成本 + 儲存與日誌成本 + 人工維護成本

其中模型呼叫成本再拆成:

模型成本 =(快取命中輸入 Token × 命中單價)+(快取未命中輸入 Token × 未命中單價)+(輸出 Token × 輸出單價)

若有多個子任務,還要乘上實際請求次數,而不是只看主任務數量:

有效完成成本 = 當日總成本 ÷ 完成並通過驗收的任務數

短期驗證,建議按「每個任務」計量。每天固定批次,按「每日有效完成成本」監測。持續 Agent,則必須加上預算上限、自動停止條件與人工接管率。沒有完成條件和中止條件時,「跑一天」只會形成一筆無法重現的帳。

02

模型價格怎樣拆:DeepSeek V4 Pro 與 V4 Flash 不只比單價

截至 2026 年 8 月 18 日,DeepSeek 官方價格頁列出:

  • DeepSeek V4 Flash:快取命中輸入每百萬 Token $0.0028,未命中輸入每百萬 Token $0.14,輸出每百萬 Token $0.28
  • DeepSeek V4 Pro:快取命中輸入每百萬 Token $0.003625,未命中輸入每百萬 Token $0.435,輸出每百萬 Token $0.87
  • 兩者上下文長度均為 1M Token,最大輸出均標示為 384K Token

資料來源:DeepSeek 官方 Models & Pricing。價格可能調整,重新估算前應再次核對官方頁面。

這代表不能只問「V4 Pro 和 V4 Flash 哪個更省成本」。應同時記錄三個變數:

  1. 每次請求的輸入 Token。
  2. 每次請求的輸出 Token。
  3. 任務完成前需要重試或重新推理的次數。

例如,V4 Pro 的輸出單價較高,但如果它能減少工具失敗、錯誤修補和人工重新發起,最終的有效完成成本未必較高。相反,V4 Flash 適合大量格式化、初步分類、簡單測試與批次改名,但若輸出品質不足,重試造成的 Token 會抵銷單價優勢。

我們建議在 Harness 的每筆請求記錄以下欄位:

task_id
model
prompt_tokens
prompt_cache_hit_tokens
prompt_cache_miss_tokens
completion_tokens
retry_count
tool_failure_count
human_takeover
final_status

官方 API 回應會提供 prompt_tokensprompt_cache_hit_tokensprompt_cache_miss_tokenscompletion_tokens,可直接用來填入公式。欄位定義可參考 Chat Completion 回應文件

DeepSeek Harness 一天會用多少 Token?

沒有固定答案。長時間編碼通常不是一個請求,而是「讀取狀態、呼叫工具、取得結果、再次推理」的循環。每次循環都可能重新提交部分上下文,輸出也可能包含推理內容、程式碼、測試結果和修正方案。

因此我們不應以「運行 24 小時」推算 Token,而應先估算:

每日 Token = 每個子任務平均請求次數 × 每次輸入 Token + 每次輸出 Token,再加上失敗重試 Token

如果每個任務的輸入高度重複,快取命中會降低輸入成本;但官方明確說明快取採最佳努力方式,並不保證百分之百命中。快取命中狀態應以 API 回應中的欄位為準。相關規則見 DeepSeek Context Caching 文件

03

快取與上下文:省的是輸入費,不是所有推理成本

DeepSeek 的磁碟快取預設啟用。只有完整匹配已建立的前綴單位,後續請求才可能命中。若 Harness 每次改動系統提示、工具描述或檔案前綴,原本可重用的內容便可能變成未命中輸入。

我們會把快取問題分成兩類:

  • 穩定前綴:固定系統指令、工具定義、專案規則、長篇參考資料。這些內容適合放在請求前段,並觀察後續命中狀況。
  • 高變動內容:最新錯誤、測試輸出、即時檔案差異和使用者新指令。這些內容通常較難重用。

官方文件指出,每次請求會建立快取前綴單位,快取可能在停止使用後自動清除,通常是數小時至數天;這不是我們可以當作永久儲存的資料層。

提醒: 不要把快取命中率直接當成節省比例。即使輸入成本下降,輸出 Token、失敗重試、Mac 待機與人工接管仍會繼續計費。

04

並發與重試:請求變多,不代表有效產出同步增加

官方目前列出的帳戶級並發限制為:DeepSeek V4 Pro 500,DeepSeek V4 Flash 2500。超過限制會收到 HTTP 429;並發是從請求送出直到模型回應完成期間計算,且限制按帳戶計算,不是每把 API Key 各自獨立計算。詳細限制見 DeepSeek Rate Limit 文件

這些數字是服務端連線限制,不是 Harness 在 Mac 上可以安全承受的工作數。實際成本還會受到以下因素影響:

  • 子任務是否共用同一份檔案與工作目錄。
  • 工具呼叫是否會互相覆寫結果。
  • 429 限流後採取固定等待、指數退避,還是立即重試。
  • 工具回傳錯誤後,Agent 是否重新提交整段上下文。
  • 人工是否因任務看似卡住而再次發起請求。

官方錯誤文件把 429 定義為請求過快,402 則代表餘額不足;500 和 503 則屬於服務端錯誤或過載,重試策略必須與錯誤類型分開處理。可按 DeepSeek API 錯誤碼說明設定不同的停止與重試規則。

05

Mac 算力怎樣入帳:已有設備、短租與長期節點要分開

Mac 成本不是只有租金。若使用已有設備,至少要記錄它在任務期間無法服務其他工作的機會成本;若使用遠端 Mac,則要加入啟動、連線、儲存、日誌保留、備份與無人值守恢復。

我們通常把環境分成三種:

  • 已有 Mac 閒置運行:現金支出可能接近零,但會占用磁碟、記憶體、電力、網路上傳頻寬和日常工作時間。
  • 短期遠端 Mac:適合驗證任務流程。環境週期應覆蓋安裝、執行、匯出結果和清理,不宜只按模型實際推理時間計算。
  • 長期保留節點或多人共享:適合固定批次,但要把閒置時間、權限審批、使用者隔離、備份和故障接管納入。

MESHLAUNCH 的遠端 Mac 方案頁面可作為環境選型入口,但本文不預填租賃金額,也不把任何未核實的 Mac 配置或節點價格寫進成本公式。若需要進一步比較本地設備與遠端環境,可參考本地 Mac 與雲端 Mac 的成本比較方向,再把實際報價與占用時段填入自己的預算表。

本地 Mac 與雲端 Mac 的比較,可先用這個口徑:

本地環境成本 = 設備機會成本 + 電力與網路增量 + 儲存與備份 + 維護時間

遠端環境成本 = 租賃費 + 啟動與清理時間 + 儲存與日誌 + 連線及故障恢復成本

若本地設備只在夜間執行,卻需要白天人工處理異常,低現金成本不等於低總成本。反過來,若任務只做一次驗證,長期保留遠端節點也可能造成不必要的閒置支出。

06

人工維護:開源 Harness 仍然不是零成本

持續運行 AI Agent 要計算哪些費用?除了 API 和 Mac,還要計算人的時間:

  • 安裝與升級 Harness。
  • API 格式、工具介面或模型參數變更後的相容性修復。
  • 檔案權限、SSH、VNC、金鑰和環境變數審批。
  • 任務失敗時的人工接管。
  • 產出程式碼的測試、審查和結果復核。
  • 日誌清理、備份還原與無人值守恢復。

DeepSeek 官方文件目前列出 thinking 模式預設啟用,部分複雜 Agent 請求會自動使用較高推理 effort;這會影響輸出量和任務耗時,不能把所有請求視為同一種推理成本。設定方式可參考 Thinking Mode 官方文件

開發者預覽期尤其要預留升級回歸成本。今天可以完成的工具鏈,未必能在下次模型、SDK 或 Harness 更新後原樣運作。若每次異常都由資深工程師處理,人工成本可能很快超過 API 費用。

07

第一步:建立可比較的任務紀錄

我們建議每次執行前先填入:

任務名稱:
完成條件:
中止條件:
預計子任務數:
模型:
預計輸入 Token:
預計輸出 Token:
可重用上下文:
最大重試次數:
Mac 環境開始時間:
Mac 環境結束時間:
人工接管條件:
每日預算上限:

完成條件要能驗收,例如「所有測試通過並產出差異檔」,而不是「Agent 沒有再回覆」。中止條件也要明確,例如連續工具失敗、超出 Token 預算或人工接管時間已達上限。

08

第二步:用實際回應填公式,再決定模型

可勾選檢查清單:

  • [ ] 已保存每次請求的輸入與輸出 Token。
  • [ ] 已分開記錄快取命中與未命中輸入。
  • [ ] 已統計限流、工具錯誤和人工重新發起。
  • [ ] 已把 Mac 從啟動到清理的完整占用時間記入。
  • [ ] 已記錄日誌、備份和儲存保留成本。
  • [ ] 已把人工分鐘數換算成團隊內部成本。
  • [ ] 已按「通過驗收的任務」計算有效完成成本。

模型選擇可依以下條件分支:

  • 若任務需要複雜程式設計、長鏈推理,且 V4 Pro 能顯著降低重試或接管,則保留 DeepSeek V4 Pro。
  • 若任務是大量簡單批次、固定格式輸出,且錯誤率可接受,則優先測試 DeepSeek V4 Flash。
  • 若輸入前綴重複度高,先優化上下文排列並觀察快取命中,再判斷是否需要縮短上下文。
  • 若 429 或工具失敗頻繁出現,先降低並發與增加退避,不要直接增加 Mac 算力。
  • 若每日有效完成成本超過預算上限,先縮短環境週期或暫停低價值任務,再考慮擴容。
  • 若人工接管率持續偏高,先修正工具權限、測試流程和中止條件,不能只換更貴模型。
09

哪些指標決定繼續、切換或暫停

我們會每天查看四個指標:

每任務成本:判斷單項工作是否值得自動化。

有效完成成本:排除失敗任務後,判斷真正交付一項結果要花多少。

每日預算消耗:防止多個 Agent 同時重試,把固定預算快速用盡。

人工接管率:判斷目前是模型能力問題、工具鏈問題,還是環境運維問題。

如果成本主要來自輸出 Token,應限制輸出長度、拆小任務或調整推理模式。如果成本主要來自未命中輸入,應整理固定上下文。如果成本主要來自重試,應先處理限流、工具錯誤和狀態保存。如果成本主要來自 Mac 占用,則應比較短期遠端環境、長期保留節點與已有設備的實際占用率。

10

當前方案與 Mac 方案:不要只比較 API 帳單

若我們直接把 Harness 放在開發者日常使用的本地 Mac,常見缺點是會與互動式開發爭用記憶體和磁碟,重啟後不一定能自動恢復,權限與金鑰也較難交接;若改用一般雲端主機,則可能遇到 macOS 相容性、圖形工具、Apple 平台測試和遠端操作流程不一致。

對只做短期驗證、夜間批次或需要特定 Mac 工具鏈的任務,先租用 MESHLAUNCH 的 Mac 環境,通常比立即購置設備或長期保留未充分利用的節點更容易校準成本。對長期穩定重負載、需要物理介面或已有專用設備的團隊,自購 Mac 仍可能更合適。無論選哪一種,先用小規模真實任務填滿上述記錄,再按環境占用率決定短租或長期保留,預算才不會被「跑了一天」這個模糊單位帶偏。