LLM 應用的成本控管實戰:讓每次 API 呼叫都花在刀口上
談 LLM 成本控管的文章很多,但大部分作者沒有自己付過帳單。我們有——AI 工具平台十幾個工具、自動剪片引擎、電商的內容審查,每一筆 API 呼叫都從自己口袋出。所以這篇不談理論,只講四個我們每天在用、上線就有感的省錢手法。
先說一個前提:省成本的目的不是摳,是讓單位經濟撐得起訂閱制。如果每個用戶用一次功能,你就虧一次錢,產品做得再好都是慢性自殺。
手法一:模型分級,別用大砲打蚊子
最大的浪費,是所有任務都丟給旗艦模型。實際上一條 pipeline 裡,八成的步驟根本不需要最聰明的模型。我們的剪片引擎就是典型:逐字稿分段、語言判斷、格式整理這類機械性工作,用最便宜的輕量模型;只有「從一小時的內容裡挑出最有梗的三十秒」這種需要理解力的關鍵步驟,才動用旗艦。同一條 pipeline,分級前後的成本差距可以到一個數量級。
實作上的原則:先讓旗艦模型把整條流程跑通,再逐步把每個步驟降級,降到準確率掉了為止,退回一級。方向是由上往下試,不要由下往上,不然你會分不清是任務不可行還是模型不夠力。模型怎麼挑,我們在 選模型的三個實務判斷 有更完整的討論。
手法二:快取,重複的問題不要重複付錢
兩層快取,層次不同:
- 提示詞快取(prompt caching):主流模型商都支援。你的系統提示詞、知識庫內容這些每次呼叫都一樣的前綴,快取後費用打到一折上下。長系統提示詞的應用,這一項就能砍掉可觀的比例,而且只是加幾個參數的事。
- 結果快取:一樣的輸入不要問第二次。我們的行銷工具有不少「同一個熱門主題被很多用戶重複查」的場景,把結果按輸入雜湊存起來,第二個人查直接回快取。命中率視產品而定,但只要有兩成命中,就是白撿兩成。
手法三:提示詞瘦身,token 是按字計費的
很多提示詞是「疊加式成長」出來的:每次出 bug 就補一段指示,半年後變成三千 token 的裹腳布,裡面一半的指示互相重複,甚至互相矛盾。我們的習慣是每季清一次提示詞:刪掉重複的、把囉嗦的範例換成精簡的、能用結構化輸出約束的就不要用文字描述。瘦身完通常還會發現準確率不降反升——模型跟人一樣,指令越乾淨,執行越到位。
帳單是最好的程式碼審查:每一個多餘的 token,月底都會回來找你。
另一個常被忽略的是輸出端:輸出 token 通常比輸入貴好幾倍。要求模型「直接給答案,不要解釋過程」、用 JSON 欄位取代自然語言長文,省的都是貴的那端。
手法四:批次處理,不急的事半價辦
模型商的批次 API(batch)通常是半價,代價是要等,慢則數小時。關鍵是分清楚你的場景哪些是「用戶在畫面前等」、哪些是「隔天給結果也沒差」。我們電商的商品文案合規掃描、每日數據摘要、內容農場級的素材預產,全部走批次;只有用戶即時互動的功能才走即時 API。把非即時流量搬去批次,等於那部分永久打五折,而用戶完全無感。
先量測,再優化
最後提醒一件基本功:上面四招都要有量測才做得準。每次 API 呼叫記錄下功能名稱、模型、輸入輸出 token 數,月底才知道錢花在哪個功能、哪個步驟。我們就靠這張報表抓過一個佔了整體三成費用、但用戶幾乎沒在用的功能——直接下架,比任何優化都省。
收束:LLM 成本不是玄學,是「分級、快取、瘦身、批次」四件工程活,而且都不難。如果你的 AI 功能帳單已經開始刺眼,或想在開發前就把成本結構設計對,AI 應用開發服務 是我們的本行,也歡迎直接 來聊聊。
這類問題,我們每天都在自己的產品上解
免費 30 分鐘線上諮詢・先釐清方向,不推銷・一個工作天內回覆