
據報道10 月 7 日 Anthropic 上線了新的輕量模型 Claude Haiku 5.5官方稱平均運行成本比上一代 Haiku 4.5 低約 75%。具體到價簽上提示詞不超過 10 萬 Token 的請求輸入價降到每百萬 Token 0.10 美元、輸出 0.50 美元官方說這一檔比上代低了 90%超過 10 萬 Token 的請求輸入 0.50 美元、輸出 2.50 美元比上代低 50%。一句話又是一輪小模型降價這回降得不算小。對天天跟 API 賬單打交道的人來說這條消息值得看一眼但也別急著換。先把幾件事拆開。這次降的是什么沒降的是什么Anthropic 這次的定位很清楚把 Haiku 放在高頻、重復、對成本敏感的活上比如摘要、上下文壓縮、數據庫查詢、分類請求以及給旗艦模型當子智能體。官方同時把 Sonnet 5.5 的緩存讀取價格從每百萬 Token 0.20 美元降到 0.10 美元說這能讓它在多數智能體任務里便宜約 20%。變的東西是計價思路。過去大家比的是誰參數大、誰跑分高現(xiàn)在廠商開始比單位任務成本——同一個任務誰花更少的錢做完。分檔計價、緩存折扣、批處理、推理強度檔位Haiku 5.5 提供了從 Low 到 Max 的多檔 effort 設置本質上都是在把便宜做成一個可調的旋鈕。沒變的是分工。官方自己也說Haiku 5.5 不是來取代大模型的寫復雜代碼、跑多步驟智能體這類活還是得靠能力更強的檔位。小模型接的是以前因為太貴而不劃算、干脆不做的任務——這點很關鍵它擴張的是任務邊界不是把貴的模型擠下去。對你我的實際影響最直接的場景是批量處理。假設你有個每天跑 10 萬條的分類任務每條平均 2000 輸入 Token、200 輸出 Token。按官方這個價輸入 2 億 Token 約合 20 美元輸出 2000 萬 Token 約合 10 美元一天差不多 30 美元。這種量級放兩年前基本不用想。調用上沒什么花活還是標準 SDKimportanthropic clientanthropic.Anthropic()# 從環(huán)境變量 ANTHROPIC_API_KEY 讀取密鑰respclient.messages.create(modelclaude-haiku-5-5,max_tokens1024,messages[{role:user,content:把下面這段會議記錄壓縮成三條要點……}],)print(resp.content[0].text) 批處理任務可以走 Batch 接口具體折扣和限額以官方文檔為準別拿博客里的舊數字直接估預算。## 幾個容易踩的坑第一便宜不等于夠用。跑分提升比如官方給的電腦操作、智能體編程幾項成績是在它自己的測試集上你的業(yè)務數據能不能過得自己拿真實樣本評測一遍別照著榜單切模型。 第二注意10萬 Token 那條分界線??邕^去單價直接翻五倍。也就是說把上下文壓短、把長文檔先切分再喂本身就是省錢動作不只是省 Token 數。 第三別只比單價。計費項里有輸入、緩存寫入、緩存讀取、輸出、批處理、服務層級好幾檔。只盯著輸入價做對比很容易算出便宜 80%然后發(fā)現(xiàn)賬單沒怎么降。 第四推理強度檔位會讓同一模型成本上下浮動。別拿最高檔去跑那些本來就不需要思考的簡單任務那是純浪費。 小模型降價對真在做批量業(yè)務的人是實打實的利好工具鏈成熟得也快。但廠商單價降了和你的賬單降了是兩碼事。你現(xiàn)在的項目里有多少活其實壓根用不上旗艦模型評論區(qū)聊聊。