隨著人工智慧(AI)編碼代理工具逐漸普及,開發者經常面臨高階模型消耗龐大運算代幣(Token)所產生的驚人帳單。音樂串流平台 Spotify 的工程師公開了一套自動分流架構,利用平價模型協助處理繁重的檔案讀寫,成功讓高階模型的運算成本降低高達九成。
雙模型協同作業:用 Gemini 幫高階模型「打雜」
在軟體開發過程中,高價值的旗艦 AI 模型往往因為被指派讀取數千行的程式碼檔案,或編寫結構重複的單元測試,而白白浪費了大量上下文視窗(Context Window)資源。該位工程師設計了兩套輕量代理人角色,指定由價格較便宜的 Gemini 2.5 Flash 負責運作。
第一種是「巨量閱讀器」,負責掃描與濃縮大檔案內容後僅回傳關鍵資訊;第二種是「代碼生成工」,根據規格直接產生樣板代碼並寫入系統。這種策略實現了「上下文隔離」,確保高級模型僅處理複雜的架構思維與邏輯推理。
外掛自動攔截:防止 AI 隨機暴飲暴食
為了避免 AI 模型忽略提示詞(Prompt)規則而自行讀取大型檔案,該工程師利用了工具事件鉤子(Hook),打造出名為「shunt」的攔截外掛。當模型企圖讀取超過 350 行的原始碼或執行終端機指令查看大檔時,外掛會立即強制阻斷,並轉由輕量模型接手。
唯有當指示明確包含特定的程式碼行數範圍,或是使用篩選指令時,系統才會放行讓高階模型直接讀取,藉此建立無法繞過的硬性防火牆。
成本效益與技術限制的平衡
根據實測數據,這套架構在大型專案中平均能減少約 90% 的運算消耗,大幅節省企業成本。不過,此作法也有其侷限性,輕量模型雖然能處理表面語法與格式,但在審查極度隱晦的「執行緒安全(Thread-safety)」等複雜並發問題時仍容易遺漏。
此外,跨模型的呼叫會帶來額外 10 到 30 秒的延遲,因此團隊需要針對檔案大小設定合理門檻,避免小任務反而效率降低。
這代表什麼
這代表 AI 應用正在從「單一高階模型打天下」轉向「多模型協同運作」的精細化營運階段。對台灣軟體團隊或企業而言,直接調用最強模型固然省事,但在規模化導入後將面臨龐大的營運成本壓力。
透過建立技術架構來強制進行任務分流,企業可以在維持產出品質的前提下顯著降低訂閱與 API 支出。這種將算力「各司其職」的務實作法,將是中小企業導入 AI 工具時控管預算的重要參考範例。
背景補充
編碼代理(Coding Agent)是一種能自動理解專案結構並協助撰寫、修復程式碼的工具,例如 Anthropic 推出的 Claude Code 等。這類工具在執行任務時,需要將檔案內容載入「上下文視窗」,而收費方式通常依照處理的字詞數量計算。
由於高階模型如 Claude AI 的調用單價遠高於平價模型(如 Google 推出的 Gemini 輕量版本),若未適當控管輸入與輸出的檔案大小,很容易導致專案預算快速消耗完畢。
常見問題
如何利用平價模型降低 AI 編碼工具的費用?
可以建立任務分流機制,將大量檔案閱讀與樣板程式碼生成等簡單工作交給 Gemini 等平價模型處理,只讓 Claude AI 負責複雜的架構推理。
為什麼只寫提示詞(Prompt)無法有效限制 AI 的費用?
提示詞屬於軟性約束,AI 模型在處理複雜專案時經常忽視提示規則,必須透過系統層級的攔截外掛強制阻斷不必要的檔案讀取。
將任務分流給平價 AI 模型有哪些風險或缺點?
平價模型可能無法發現執行緒安全等隱晦的深層程式碼問題,且跨模型調用外部請求會增加 10 到 30 秒的處理延遲。