免費諮詢

想了解更多?留下您的資訊

我們的專業團隊將在 1 個工作日內與您聯繫

請填寫姓名
請填寫職稱
請填寫公司名稱
請填寫公司統編
請填寫有效的電子郵件地址
請填寫公司電話
請填寫公司網站
請選擇預算範圍
請選擇需求類別
請簡述您的需求

感謝您的諮詢

我們已收到您的資訊,專業團隊將在 1 個工作日內與您聯繫。

AI Agent 用量成本怎麼估:訂閱費之外,那筆跑起來才開始算的帳

企業評估 AI 工具時算的是訂閱費,真正會失控的是跑起來之後的用量成本。這篇拆開席次費與用量費兩種成本結構,說明長對話、批次處理、retry 迴圈與把整份報表塞進 context 為什麼會讓帳單非線性成長,並給出開跑前估量級的算法、官方降價機制的適用條件、在後台設上限與告警的做法,以及哪些工作其實不該交給 agent。

AI Agent 用量成本怎麼估:訂閱費之外,那筆跑起來才開始算的帳

訂閱費在簽約那天就算完了。用量費要等它跑起來,才開始跳。

訂閱費那張試算表,算不到會失控的那一筆

Gartner 在 2025 年 6 月的預測裡,逾四成的 agentic AI 專案會在 2027 年底之前被取消,取消原因列了三個:成本攀升、商業價值不明確、風險控管不足。Gartner 沒有公布這三者各占多少,也沒有把成本限定在哪一種成本。本篇只處理其中一塊,系統上線之後持續累積的用量成本。同一份新聞稿裡,Gartner 資深總監分析師 Anushree Verma 提到,多數專案還停在實驗階段,這會讓組織看不見大規模部署 AI agent 的真實成本。

台灣品牌值得多看一眼的地方在於,評估階段攤在會議桌上的通常是一張席次費試算表:幾個人用、每人每月多少、乘十二個月、加上導入輔導費。這張表算得完,因為每一格都是固定的。

會失控的那筆不在這張表上。它在系統跑起來之後才出現,長在帳單上一個叫做 usage 的欄位裡,而且沒有由人數決定的天花板。帳單上最大的那一筆,通常不是模型太貴,是某個沒人在看的自動化流程一直在空轉。

帳單上那一行 API usage,沒有人拆得回某個具體的工作

我們最近跟幾個品牌的行銷團隊聊 AI 工具導入,被問最多的是月費多少、哪個方案划算。這些問題都有答案。難的是下一題:這個月的用量費,是哪幾件事花掉的。

我們看過那個畫面。月初的週一早上,會議室投影幕上是一張雲端帳單截圖,訂閱費那幾行都對得起來,下面一行 API usage 的數字讓所有人安靜了幾秒。行銷主管當下的反應是心慌,因為財務接下來會問這筆錢買到了什麼,而他手上沒有一份報表能把這個數字拆回到某個具體的工作上。金額大小還好處理,拆不開才難處理。那一行拆不開的 API usage,是這篇文章想處理的東西。

席次費算得完,用量費算不完

訂閱費與用量費不是同一筆錢的兩種說法,它們是兩種計價結構,行為完全不一樣。把它們混在一張表上算,是預算失準的起點。

  1. 席次費是固定成本。人數乘上月費,上限由人數決定,沒人用的那個月人數也不會自己長大。它可預測,所以簽約當天就能算完全年。市面上主流工具的月費級距,已經有人把它們攤開比過,這條線的功課相對單純。
  2. 用量費是浮動成本。處理量乘上單價,而處理量由使用行為決定,使用行為在簽約當天還不存在。企業級方案更複雜一些,按席次還是按用量,本身就是另一場功課,有些方案是兩種混著收。
  3. 還有第三種,是伺服器端工具與執行時間的費用,它既不算席次也不算 token,但一樣進帳單。以 Anthropic 公開的 API 計價頁為例:網頁搜尋是每一千次搜尋 10 美元,跟 token 分開算,而搜尋回來的內容還會再以 token 計費一次;受管理的 agent session 另外按執行時間計費,每個 session 小時 0.08 美元,只在執行中才累積。這類費用跟模型多聰明無關,只跟你叫它做了幾次事、做了多久有關。

本文引用的所有單價與規格,都是截至 2026 年 8 月的官方公告值。這類數字會變動,評估時請以當下頁面為準。

要看懂帳單,得先看懂四個詞。

名詞 一句話定義
token 計價的最小單位,Anthropic 文件給的粗估是一個約等於 4 個英文字元;中文與中英混排的比例差異較大,實際請看 API 回應的 usage 欄位
context window 一次請求裡,模型最多能讀進去多少 token
cache hit 這次請求的開頭內容跟上次一樣,命中快取,用較低的單價計費
batch 把不急的請求整批丟進去非即時處理,換取單價折扣

帳單長得最快的地方,都在重複送同樣的內容

用量費不會平均地成長。它會在某幾個使用模式上突然變陡,而這幾個模式在行銷情境裡都很常見。共同點只有一個:同樣的內容被反覆送進模型,而每一次都要付錢。

以下所有試算都是本文為了說明量級而設的假設情境,做法是拿官方公告單價乘上本文自訂的用量假設,不是任何品牌的實際帳單,也不是市場統計。

長對話:每一輪都把之前的往來重付一次

對話式的 API 幾乎都是無狀態的。Anthropic 的計價頁解釋 prompt caching 的存在理由是「不必在每次請求都重新處理同一份大型系統提示、文件或對話歷史」,反過來讀就知道,沒有快取的時候,每一輪對話都會把之前所有的往來重送一次,而且重送的不只是使用者講過的話,還包括模型自己前幾輪的回覆。

假設每輪使用者新增 500 token、模型回 300 token,跑十輪:使用者輸入累計 27,500 token,模型的歷史回覆再累計 13,500 token,輸入合計 41,000 token,輸出合計 3,000 token。以 Claude Sonnet 5 的每百萬輸入 2 美元、輸出 10 美元計算,一場對話約 0.112 美元,而這還沒算系統提示與工具回傳,那兩項也是每輪重送。

一天三千場,一個月就是一萬零八十美元。更值得注意的是單輪的形狀:第十輪的單次輸入是 7,700 token,第一輪只有 500 token,而使用者感覺不到差別,因為回覆速度只慢了一點。客服機器人如果讓對話無限延長,第五十輪的單次成本已經是開場的幾十倍。

對話輪次越多,每一輪送進模型的 token 量越高,同一個問題到後段的成本明顯拉高

批次處理:五折是真的,但品項數與頻率會同時放大

批次處理是這四種情境裡唯一有官方折扣的,而且三家的口徑一致。Anthropic 的 batch 處理文件寫的是輸入與輸出都打五折,OpenAI 的 API 定價頁上 Batch 相對 Standard 也是五折,Google 的 Gemini 2.5 Pro 同樣是對半。

折扣本身沒有陷阱,會出事的是它被乘上兩個同時放大的數字。假設要幫一千支商品重寫描述,每支輸入 2,000 token、輸出 500 token,用 Claude Sonnet 5 計算,輸入 200 萬 token 是 4 美元、輸出 50 萬 token 是 5 美元,合計 9 美元,走批次是 4.5 美元。這個數字很好接受。接著把它接上排程:設成每天重跑一次全品項,一個月就是 135 美元;品項數從一千變成一萬,就是 1,350 美元。品項數與重跑頻率通常是各自被決定的,很少有人把兩者相乘之後再看一眼。

Anthropic 的計價頁上還給了一個官方參照點,處理一萬件客服案件、平均每件約 3,700 token、用 Claude Haiku 4.5 計算,總成本約 37 美元。這個數字適合當估算的錨:它告訴你單件工作的成本在什麼刻度上,剩下的變數是你打算做幾件。

retry 迴圈:失敗那次也要付錢,而且可能重複做事

這是最容易被忽略的一種,因為它在正常的成本模型裡不存在。

呼叫失敗、輸出格式解析不出來、驗證沒過,程式重試一次,這次很可能送同樣的輸入、產生一份新的輸出、再付一次錢。計費結果會依失敗發生在哪一段而不同:連線層或速率限制擋掉的請求通常不計費,但如果模型已經算完、只是回傳的格式解析失敗,那次的 token 是實際發生過的。Anthropic 的計價頁在伺服器端工具那節也明寫網頁搜尋若過程出錯就不計費,這是工具層的例外,不是 token 層的通則。

風險在於一個沒有重試上限的迴圈。如果重試條件寫成「解析失敗就重試」,而失敗的原因是提示詞本身有問題,它會永遠失敗、永遠重試,一個下午就能燒掉一個月的預算,而且從監控上看不出異常:沒有錯誤告警,因為每次呼叫在 API 層都成功了;沒有效能告警,因為它跑得很順。

重試也不只花錢。如果那個步驟後面接著寄信、發券、改訂單或呼叫收費的外部工具,重試會把這些動作重複做一遍。所以重試的規格要跟成本一起定:只對暫時性錯誤重試、採用指數退避、設最大次數、對有副作用的動作帶冪等鍵,並留一條轉人工接管的路。

把整份報表塞進 context:越過門檻,單價會跳一階

這一種在行銷團隊裡特別常見,因為它是最直覺的做法:要分析上個月的銷售,就把整份報表貼進去;要寫一份競品摘要,就把五份 PDF 都丟進去。

先看量級。Anthropic 的計價頁在網頁擷取工具那節給了三個官方粗估:一般網頁約 10 kB、約 2,500 token;大型文件頁面約 100 kB、約 25,000 token;一份研究報告 PDF 約 500 kB,官方粗估約 125,000 token。塞一份這個尺寸的報告進去,光輸入就是十二萬個 token 上下,用 Claude Sonnet 5 的輸入單價算一次約 0.25 美元。一天兩百次,一個月一千五百美元,而輸出還沒開始算。

比量級更值得注意的是單價會跳階。Google 的 Gemini API 定價頁上 Gemini 2.5 Pro 是分級定價,依據是這次請求的 prompt 有沒有超過 20 萬 token:沒超過時輸入每百萬 1.25 美元、輸出 10 美元,超過之後輸入變 2.50 美元、輸出變 15 美元。決定用哪一階的是輸入的大小,被調整的卻是輸入與輸出兩邊。送進去的東西一越線,兩邊的單價一起往上。這是「非線性」最字面的意思,它寫在官方定價表上,不是誰的推論。

prompt 大小一旦越過門檻,每百萬 token 的單價就跳上一階,輸入與輸出兩邊同時重新計價

還有一個更少人算到的變數:token 量本身會隨模型改變。Anthropic 的計價頁註明,Claude 4.7 之後的模型換了新的 tokenizer,同一段文字產生的 token 數大約多三成。換模型的時候,帳單的變化不只是單價的差額,還要乘上 token 量的差額。看單價便宜了兩成就換過去,實際帳單有可能還變貴。

每次都把整份文件讀完,換成只取要用的那幾段,這件事有它自己的成本與延遲取捨,值得單獨評估一次。但在做這個技術選型之前,先把量級算出來,才知道值不值得為它花工。

開跑前估一個量級,比事後看帳單有用

前面四種情境的共同結構已經清楚了。之所以估不出來,原因多半不在算術太難,而在沒有人先定義「一次工作」是什麼。

定義這件事只要三個動作。

  1. 量一次工作的形狀。挑一個最典型的任務跑一次,把輸入與輸出的 token 數記下來。多數 API 的回應裡都帶 usage 欄位,這個數字不用估,直接讀出來。
  2. 乘上頻率。一天幾次、幾個人在用、有沒有排程在半夜自己跑。頻率通常是量級誤差的主要來源,因為自動化流程的次數往往遠高於人為操作,究竟高多少要用自己的排程表去算,不要沿用別人的經驗值。
  3. 乘上官方單價,再乘一個安全係數吸收重試、重跑與歷史累加。本文建議先抓兩倍,這個倍數是操作起點而非通用標準,跑一個月之後用實際帳單校正。

要注意的是,把「單一 token 單價乘上次數」當成總成本會低估,因為帳單上的項目比這個多。比較貼近實際的算法是把這幾項加起來,再乘上任務次數:

  1. 未命中快取的輸入 token
  2. 快取寫入與快取讀取的 token(兩者單價不同)
  3. 輸出 token,包含模型的推理過程
  4. 伺服器端工具的次數費與執行時間費
  5. 重試與重跑產生的重複計費

另外建議多算一個指標:每個成功完成的任務花了多少錢。只看總用量,空轉也會被算進工作量裡,而空轉正是前面 retry 那節的主角。

算出量級之後,才輪到降價。官方給的降價機制屬於帳單結構的一部分,用對了折扣很實在,用錯了反而更貴。

快取的槓桿最大,條件也最嚴。Anthropic 的 prompt caching 文件與計價頁給的倍率是:讀取為基礎輸入單價的十分之一,五分鐘寫入 1.25 倍,一小時寫入 2 倍。從這組倍率可以推出回本條件,五分鐘的那種讀一次就回本,一小時的那種要讀兩次。反過來說,一份大文件寫進一小時快取卻只被讀一次,比不用它還貴。它適合穩定而且會被重複送出的長前綴,例如固定的系統提示或商品規格書;前綴每次都在變、命中率低、或內容短到達不到門檻時,這個機制幫不上忙。

模型分級是另一項槓桿。同一份 Anthropic 計價頁上,Claude Haiku 4.5 是每百萬 token 輸入 1 美元、輸出 5 美元,Claude Opus 5 是 5 美元與 25 美元,入門級與旗艦級差五倍。三項疊起來效果可觀,但適用條件都要先對過自己的用量形狀。

再往前想一步,有些成本不該用省的方式處理,而該用不做的方式處理。換一顆更強的模型,解不了輸入太大這件事,因為問題不在模型的能力,在送進去的東西太多。同樣的道理,工具買了一堆卻證明不出效益這個老問題,在用量費上會重演得更快,因為它的計價週期是按天的。

讓 agent 少讀一點,先從資料整理開始

回到那個最常見的動作:把整份報表塞進 context。這件事的成本已經算過了,但它的根因不在 AI 這一側。

一個團隊之所以要把整份會員名單貼進對話框,通常是因為他們拿不到「只有需要的那幾行」。資料散在 POS、電商後台、CRM、廣告平台,同一個人在不同系統裡是不同的紀錄,沒有一個地方可以用一句條件把符合的人撈出來。於是最省力的做法就變成把全部倒出來,讓模型自己找。模型確實找得到,但那份倒出來的資料每次都要重新付一遍費用。

這是 91APP CDMP 跟用量成本最直接相關的一段。CDMP 把線上線下的消費紀錄歸戶到同一個會員身分,再把行為與偏好整理成可以查詢的標籤與分群。對 agent 來說,這改變的是輸入的形狀。以下同樣是本文為了說明量級而設的假設情境:一份三萬列的會員名單整份送進模型,光輸入就落在十萬 token 這個級別;換成一段條件查詢,回來的是符合條件的那幾百列,輸入量落在千級。實際差距取決於欄位數與每列長度,這裡只說明兩種做法的量級不同,不是任何品牌的實測結果。附帶效果是模型要處理的無關資料變少,判斷哪幾列重要被移到查詢條件裡處理。

有一件事比省錢更優先。會員資料要送進外部模型之前,欄位最小化、去識別化、存取權限與資料保留期限都要先過一遍,順序在成本之前,不能因為 token 便宜就多帶欄位。

把資料整理好本來就是一筆投資,過去它的回報寫在名單精準度與活動成效上,現在多了一項寫在每個月的用量帳單上。第一方數據的價值常被說成不受平台政策影響,比較準確的說法是它較不依賴第三方平台提供的受眾資料;而它現在還多了一個算得出來的好處,就是讓每一次呼叫送進去的東西變少。

CDMP 這類顧客數據平台不會讓用量費消失,它處理的是算式裡的第一項,單位工作的輸入量。次數與上限還是要自己管,那是下一節的事。

上線第一週就該把用量上限與成本歸屬設好

以下四件事都不需要換掉任何工具,本文的經驗是可以排在導入的第一週做完。它們的共同作用是讓錢花掉的時候有人知道,省錢只是附帶的結果。

沒有成本歸屬的帳單,最大一塊金額往往落在無人認領的欄位上,比任何單一流程都高
  1. 先確認供應商給的是告警還是硬上限,兩者差很多。以 Google Cloud 的預算說明文件為例,它明寫僅告警的預算「不會自動限制或停止用量與花費」,真正會攔的 spend cap 另外設定而且只支援部分服務。做法是:告警設在月預算的七成,同時在自己的應用層加一個能立刻關掉的開關,加上每日配額與單一流程的斷路器。預期效果是把「事後發現」變成「事中攔截」。直接面對顧客的流程不要設成到頂就全停,要留一條降級路徑,例如切回制式回覆或轉真人。建議週期是導入第一週設好,之後每季用實際用量校正。
  2. 讓帳單拆得回流程。用獨立的 project 或 workspace 區分不同用途,請求上帶自訂的識別欄位,再自己記一份成本歸屬表。用 API key 當標籤能用但不適合當主要手段,金鑰該按權限與輪替需求管理。預期效果是帳單來的時候找得到人認領。建議週期是每次新增一個自動化流程就順手加,不要事後補。
  3. 縮短每次送進去的內容,順序有講究。先做截斷與摘要,再把穩定的長前綴放進快取,最後才評估要不要把一場長對話拆成幾個獨立呼叫。拆分不一定更便宜,拆太細會讓系統提示與工具定義被重複送好幾份。同時給每個迴圈設重試上限與輪次上限。預期效果是砍掉歷史累加那部分的成本,也順便擋掉空轉。建議週期是每個月挑一個最耗用的流程來動。
  4. 明列不該交給 agent 的工作。有些工作人做更便宜,包括一次性的、資料量小的、規則寫得出來的、以及做錯了要花更多時間查的那些。哪些工作值得做成可重複的 AI 流程,本來就該先過一次判斷,這份判斷同時是一份成本控制文件。建議週期是每季重看一次,因為單價與模型能力都在變。

第四項最容易被跳過,因為它聽起來像在扯後腿。但一個每月跑三十次、每次省二十分鐘人力的任務,如果它的用量費是每月四百美元,那筆錢買到的十小時可能比外面請人還貴。這個算式很簡單,只是很少有人真的算。

用量費要加上流程標籤與成功率,才會變成營運儀表

回到月初那張投影幕。那一行 API usage 之所以讓人心慌,原因在於它拆不開,而不在金額大小。同一個金額,如果旁邊有一張「哪個流程花了多少、其中多少比例真的完成了任務」的拆解表,它就從一筆意外變成一份營運報表。

用量數字本身只反映消耗了多少運算,不會告訴你那些運算有沒有換到成果,前面那個永遠失敗又永遠重試的迴圈就是證明。加上流程標籤與成功率之後,它才變成一支儀表,而這是席次費永遠給不了的資訊。席次費只告訴你有幾個人有帳號;用量費配上歸屬與成功率,才說得出這些帳號背後真的完成了什麼。

台灣品牌在這件事上的位置其實不差。這一輪 AI 導入還在早期,多數團隊的自動化流程還不多,現在就把上限、歸屬與告警裝好,代價是幾個小時的設定工。等到流程長到三十個再回頭補,要付的就不只是設定工了。

品牌最常問的 AI 用量成本問題

Q1:訂閱費跟用量費到底差在哪裡? A1:訂閱費是按席次計的固定成本,公式是人數乘月費,簽約當天就能算完全年,上限由人數決定。用量費是按處理量計的浮動成本,處理量由使用行為決定,而使用行為在簽約當天還不存在,所以它沒有由人數決定的天花板,上限要自己設。兩者混在同一張試算表上算,是預算失準最常見的起點。

Q2:怎麼在開跑前估出一個大概的量級? A2:先挑一個最典型的任務實跑一次,從 API 回應的 usage 欄位讀出輸入與輸出的 token 數,這是單位工作的形狀。再乘上頻率,包括一天幾次、幾個人用、有沒有排程在半夜自己跑。單價不要只乘一項,把未命中快取的輸入、快取寫入與讀取、輸出、伺服器端工具的次數與執行時間、以及重試重跑都加進去,最後乘一個安全係數。另外建議追蹤每個成功完成的任務花了多少錢,否則空轉會被算成工作量。

Q3:哪些行銷情境的用量特別容易失控? A3:四種。無狀態的 API 每輪都會重送對話歷史,包括模型自己前幾輪的回覆,所以長對話的累計輸入量會比直覺快很多;批次處理雖然有五折,但折扣會被品項數與重跑頻率同時放大;沒有設上限的 retry 迴圈會讓同一份輸入付好幾次錢,還可能把寄信、發券這類有副作用的動作重複做一遍;把整份報表或 PDF 塞進 context 會讓單次輸入上到十萬 token 級,而且有供應商是依 prompt 是否超過 20 萬 token 來決定輸入與輸出兩邊適用哪一階單價。

Q4:預算有限的小品牌要怎麼開始? A4:從模型分級與批次處理下手,這兩項不需要改架構。同一家供應商的入門級與旗艦級單價可以差五倍,該用哪一級請拿自己的任務做小樣本評估,先訂好品質門檻再比成本,不要直接假設入門級夠用。不急的工作走批次通常打五折。接著把用量告警與應用層的開關設好,這部分不花錢。真的要投資的話,優先順序是先整理自己的顧客數據,因為它同時降低送進模型的資料量與減少無關欄位。

Q5:多久會看到用量成本的改善? A5:設告警與開關是當天生效,它防的是失控,作用不在節省。模型分級與批次處理通常在下一個帳期就看得出差異。把長對話縮短、或把整份資料改成條件查詢,這類需要改流程的做法通常要兩到四週才會反映在帳單上,這是本文的操作經驗值而非通則。要留意的是單價與模型會變動,所以估算表建議每季重算一次。

Q6:換更便宜的 AI 模型,用量成本就一定會下降嗎? A6:不一定。不同模型的 tokenizer 不同,同一段文字產生的 token 數可能差三成,單價便宜兩成而 token 多三成,換過去反而更貴。另外兩個常見誤解也值得一起看。一個是把用量費當成模型單價的問題,於是一直在比誰便宜,但單價只是算式裡的一項,而且通常是最小的變數。另一個是以為快取一定省錢,長效快取的寫入單價是基礎單價的兩倍,讀取次數不夠或前綴每次都在變就會虧。 Betika tips

延伸閱讀

  1. 先拆解任務,再決定要不要 multi-agent:AI 系統的架構取捨
  2. 用經理人思維設計 AI 工作流:從確定性程式到模糊系統的四個轉變
  3. AI 行銷做不出成效?關鍵常常在你給它的工作環境,而非模型本身
☆ 在 Google 新聞中設為偏好來源