← 回 AI API 費用一覽表
00懶人包(看這段就夠)
🏆 Opus 5 —— CP 值之王
新出的旗艦。聰明程度接近最頂的 Fable 5,價格只要一半。想用最聰明的 Claude,選這個就對了。
$5 / $25(跟前代 Opus 4.8 同價)
🔮 Fable 5 —— 最頂但最貴
等級比 Opus 更高一階。給最難、要自己跑很久的任務用。缺點:貴一倍、內建安全審查偶爾拒答、資料強制保留 30 天。
$10 / $50(Opus 5 的 2 倍)
⚡ 一句話選擇法
預設選 Opus 5。除非任務難到 Opus 5 做不動、你又願意付 2 倍價錢,才升級 Fable 5。這也是 Anthropic 官方自己的建議。
不知道選什麼 → Opus 5
📊 差距其實很小
官方公布的考試成績:寫程式測驗兩者只差 0.5%,操作電腦的測驗 Opus 5 甚至用 1/3 的成本反超。價差卻是 2 倍。
詳見下方第 03 節
0130 秒名詞解釋(第一次看必讀)
- Token:AI 計費的文字單位。1 個中文字約 1–2 個 tokens。「$5 / 1M」= 每處理 100 萬個 tokens 收 5 美元(100 萬 tokens 大約是 50–75 萬個中文字)。
- 輸入 / 輸出:你丟給 AI 的內容算「輸入」,AI 回答你的內容算「輸出」。輸出比輸入貴好幾倍,這是所有 AI 公司的通則。
- Context(上下文窗):AI 一次能「記在腦中」的內容上限。兩個模型都是 100 萬 tokens——大約整套長篇小說一次塞得下。
- 快取(Cache):重複丟一樣的內容(例如固定的指令或文件),第二次起只收約 1 折。
- 批次(Batch):不趕時間的任務排隊慢慢跑,直接打 5 折。
- 拒答(Refusal):模型內建的安全審查判定主題敏感(例如網路攻擊、生化武器)就不回答。
02兩個模型是什麼
📌 Anthropic 官方原話(models overview 頁):「不確定用哪個,從 Claude Opus 5 開始;需要最高可用能力才用 Fable 5。」
03價格與規格:每一項都差 2 倍
- 記憶容量一樣:都是 100 萬 tokens 的上下文窗、一次最多回 12.8 萬 tokens。
- 速度:Opus 5 中等;Fable 5 偏慢,難題一個回答可能要跑好幾分鐘。
- 知識新舊:Opus 5 讀過的資料到 2026 年 5 月,比 Fable 5(2026 年 1 月)新 4 個月——問新東西 Opus 5 反而更清楚。
- 資料保留:Fable 5 的對話紀錄 Anthropic 強制保留 30 天(安全監控用);Opus 5 沒有這條限制。在意隱私的話這點很重要。
04能力對比:官方考試成績
Benchmark = 讓 AI 考標準化考試然後比分數。以下都是 Anthropic 自己公布的成績(發布才一天,還沒有第三方複測)。
那 Fable 5 贏在哪?「跑很久的大任務」——需要長期記憶的任務它比前代強 3 倍;官方引述有客戶用它一天完成了原本要一個團隊做兩個多月的超大程式碼搬遷。簡單說:短跑兩人差不多,馬拉松 Fable 5 領先。
⚠ 提醒:以上都是原廠自己公布的數字(就像手機廠自己跑分),等第三方複測出來才算定案。
05安全審查的差別(為什麼有時會「拒答」)
- Fable 5 內建「安全審查員」:問到網路攻擊、生化等敏感主題會拒答,多數情況自動改由前代 Opus 4.8 代答。官方說平均不到 5% 的對話會遇到,而且被拒答的部分不收錢。
- Opus 5 審查寬鬆很多:官方說介入次數比 Fable 5 少約 85%,一般正常使用幾乎感覺不到。
- 白話結論:正常工作用 Opus 5 幾乎不會被誤擋;用 Fable 5 偶爾會遇到「明明正當卻被拒」,尤其是資安相關的正當工作(防毒、檢測、稽核)。
06怎麼選(對照你的情境)
💼 給接案者 / 小團隊的一句話:把 Opus 5 當日常主力(跟前代同價、能力大升級),Fable 5 留給「單次高價值、可以等」的難題。先用 Opus 5 試,做不動再升級,不要反過來。
07給工程師的進階細節(新手可跳過)
API 行為差異 + 從 Opus 4.8 遷移的注意事項(點開展開)
- 沒帶 thinking 欄位的請求行為改變:4.8 = 不思考;Opus 5 = adaptive thinking 自動開。max_tokens 是「思考+回答」總上限,原本抓很緊的要放寬。
- thinking disabled + effort xhigh/max → 400(4.8 接受這組合)。
- 回應預設變長,降 effort 只減思考量、不會可靠縮短可見回答——要簡潔請直接在 prompt 講。
- Opus 5 會自動自我驗證——舊 prompt 裡「請檢查你的工作」類指令要拿掉,否則過度驗證燒 token。
- 更愛派 subagent——多代理框架要明確約束派工時機或數量上限。
- xhigh/max 跑 agentic 時 max_tokens 至少從 64K 起跳。
- mid-conversation tool changes(beta mid-conversation-tool-changes-2026-07-01):對話中途加減工具不再打爆 prompt cache。