AI 工具成本最佳化實務
節省 AI 成本,除了選擇合適的模型,也要減少不必要的資料讀取、重複對話與反覆修改。目標是以合理成本完成工作,並維持結果品質;Token 數量減少與模型單價降低,是兩種可以搭配使用的手段
一、先從日常使用習慣著手
1.
一個任務一個對話,適時整理上下文
對話歷史、附件、工具定義與工具回傳,都可能成為後續模型處理的內容。切換不相關的工作時,建議開新對話;同一個長任務則先整理進度、關鍵決策與待辦,再繼續執行。使用 Copilot CLI 時,可用 /context 查看上下文、/compact 壓縮工作階段,並以 /usage 檢查用量
2.
把需求說清楚,指定範圍與完成條件
一次交代目的、相關檔案、限制與預期結果。例如:「請檢查指定登入函式處理特殊字元時的錯誤,只修改相關程式,附上驗證結果。」比「幫我檢查整個專案」更容易聚焦。涉及多檔案或設計決策時,先用 Plan 模式確認方向,減少走錯路後重做。
簡單問答採互動模式;需要完整自主執行的工作,再評估 Autopilot 等模式及其總用量
3.
明確指定輸出格式與長度
可要求「最多 3 個重點」、「先給結論」、「用表格比較」或「只提供修改內容與必要說明」,減少冗長回覆。正式文件、重要決策與問題排查仍應保留足夠資訊,不宜為了省 Token 省略必要說明
必要的驗證與測試也應保留;測試建立後可重複執行,協助確認結果並減少返工
4.
精簡固定指示,重複流程改用 Skills
固定指示只保留專案特有規則、禁止事項與無法從現有資料推知的限制。避免每次都帶入完整教材、專案歷史或大量範例;常用流程可整理為可重複使用的 Skills,需要時再載入
Skills 的描述與載入內容也可能占用上下文,建議依個人或專案需求管理,只保留工作需要的項目,定期整理過時、重複或不再使用的設定
講者也提醒,自訂設定應保持簡單、聚焦工作流程,避免過度複雜而與產品既有機制衝突
5.
只開必要的工具,只讀必要的資料
MCP 工具的定義與回傳內容也可能增加用量。依任務啟用必要工具,指定檔案或資料範圍,避免整個專案、完整日誌與大量成功訊息全部送入模型。若工具支援專職代理,可讓它整理探索結果後回傳摘要,但仍要檢查整體用量,並非開越多代理越省
6.
善用快取,維持固定內容穩定
固定規則與工具組合宜在工作開始時決定,同一任務中盡量以追加資訊的方式補充需求。符合平台快取條件的重複輸入,可能以較低費率計費;頻繁改動前段指示、工具清單或壓縮對話,可能影響快取。快取降低的是部分輸入成本,並不代表所有 Token 都免費
7.
自然語言的選擇
中文字數少不代表 Token 一定較少,應以清楚表達需求為優先;程式需求也可用函式簽章、虛擬碼或既有範例精準描述,熟悉英文者也可用英文描述技術需求,再以中文呈現結果;是否較省仍應依模型實測
二、課程介紹的工具與功能
下列工具較適合有開發或進階需求的同仁評估:
•
Caveman:精簡 AI 的文字回覆,適合日常問答與程式協作。先使用較溫和的精簡方式,確認資訊仍完整
GitHub -
JuliusBrussee/caveman: 🪨
why use many token when few token do trick. Viral skill + proxy f…
•
RTK(Rust Token Killer):過濾及壓縮終端機命令輸出,適合經常使用 Git、測試與建置命令的開發工作。節省的是部分工具輸出的 Token,不能直接等同整張帳單的降幅
GitHub - rtk-ai/rtk: CLI
proxy that reduces LLM token consumption by 60-90% on common dev commands. …
•
Ponytail:引導 AI 優先重用現有程式、標準函式庫與平台功能,減少不必要的程式碼、依賴與過度設計,同時保留必要的驗證及錯誤處理
GitHub -
DietrichGebert/ponytail: Makes your AI agent think like the laziest senior dev
in the room.…
•
Graphify:將程式與文件整理成可查詢的知識圖譜,適合需要反覆理解大型專案的工作,減少重複探索。建立及更新圖譜也有成本,應依使用頻率評估
GitHub -
Graphify-Labs/graphify: Turn any codebase, with its docs, SQL schemas, configs,
and PDFs, i…
•
Copilot Auto:依任務選擇模型,可依需求使用 Efficiency、Balance 或 Intelligence 偏好;適合不想逐一挑模型的同仁。符合官方條件的付費方案使用 Auto,可享模型成本 10% 折扣
About
Copilot auto model selection - GitHub Docs
•
Webwright/Microsoft Web IQ:課程另介紹按需讀取網頁狀態、保留可重跑腳本的瀏覽器自動化,以及提供結構化網路資訊的服務。適合有相關開發需求的團隊評估,實際效果與可用性依工具、帳號及任務而定
GitHub -
microsoft/Webwright: A simple SWE style browser agent framework that achieves
SOTA results …
課程也介紹 HydraFusion 多模型協作研究預覽,以及 Artificial Analysis 模型能力與成本比較網站,可供進階評估;是否省錢仍需用實際工作驗證
•
HydraFusion 啟用條件與辨識方式:
1. 使用 VS Code 1.140.0 或更新版本;低於此版本不支援 HydraFusion
2. 已登入可使用 GitHub Copilot Chat 的帳號,且組織或帳號已取得 HydraFusion 功能
3. 在 VS Code 的 Chat/Copilot
介面中,應可看到「HydraFusion」選項;畫面也會同時看到 Agent、Copilot、Interactive 及 Manual permissions 等功能入口
4. 若已更新 VS Code 但仍看不到 HydraFusion,請先確認 VS Code 與 Copilot Chat 擴充功能均已更新、重新登入 Copilot,並確認公司政策或帳號方案是否已開通研究預覽功能。功能是否可用仍以實際帳號與產品逐步開放狀態為準,圖片中紅框標示的位置,分別是上方的 HydraFusion 選項,以及下方的 Copilot Chat 入口
三、補充模型選擇建議:優先試用 GPT-6 Luna,按需要提高思考強度
建議同仁在工具提供該模型且公司允許使用的情況下,優先試用 GPT-6 Luna,處理摘要、分類、資料整理、一般程式修改等範圍明確的工作。它定位於成本敏感、使用量較大的任務,支援 Extra High(xhigh)思考設定,是值得評估的高 CP 值選項
•
一般任務:先用 GPT-6 Luna 搭配 Low 或
Medium
• 需要多步分析或較深入的問題排查:可試 GPT-6 Luna 搭配 High/Extra
High(xhigh),再檢查成果是否達到要求
• 複雜設計、跨系統問題,或較輕量模型無法可靠完成的工作:再升級至 GPT-6.1 Sol 或 GPT-6 Astra;也可先由較強模型規劃,再交由較低成本模型執行範圍明確的子任務
「Luna + Extra High」的優勢在於較低的模型單價搭配較充分的思考,但不是保證每個任務都最省。提高思考強度可能增加推理 Token、等待時間與總費用,因此不建議所有任務一律開到最高。應以完成品質及每項任務的實際成本,決定最合適的組合。
以 2026/10/05 查核的 OpenAI 官方 API Standard 短上下文價格為例,每百萬 Token 的輸入/輸出費率,GPT-6 Luna 為 US$0.10/US$0.50,GPT-6.1 Sol 為 US$2/US$10。相同 Token 用量下,Luna 的這兩項單價約為
Sol 的 1/20。此為 API 費率比較,不能直接換算為公司 Copilot、ChatGPT 或其他平台的實際扣點;推理 Token 也會計費,價格及可用模型以各平台當時資訊為準
建議大家先實踐「明確需求、精簡上下文、指定輸出、按任務選模型」四項做法,再依工作需求試用工具。課程中的節省百分比屬於特定測試或示意,實際成果應以各單位的用量與完成品質驗證