參數(shù)到財務(wù)模型的實戰(zhàn)指南)
1. 從算力狂熱到回報率拷問一個投資框架的誕生背景過去兩年我身邊做投資的朋友分成了兩派。一派在2023年上半年沖進(jìn)算力租賃賽道張口閉口就是“卡就是印鈔機(jī)”另一派在2024年下半年開始焦慮因為發(fā)現(xiàn)很多AI項目的收入曲線和算力投入曲線完全對不上。我自己從2022年底開始系統(tǒng)性地跟蹤AI基礎(chǔ)設(shè)施投資踩過坑也吃過肉最大的體會是AI投資正在從“算力軍備競賽”切換到“回報率驗證”階段而市面上缺少一套能把技術(shù)參數(shù)翻譯成財務(wù)語言的中間框架。這個框架要解決的核心問題很具體當(dāng)一個AI項目擺在你面前它說要買多少張卡、建多大集群、用多高的精度訓(xùn)練你怎么判斷這筆錢砸下去能不能收回來算力不是抽象概念它對應(yīng)著具體的電費(fèi)、折舊、運(yùn)維人力和機(jī)會成本。我見過太多BP把“算力規(guī)?!碑?dāng)成核心競爭力來寫但一問到“每PetaFLOP-day的產(chǎn)出是多少”“推理毛利率能不能覆蓋折舊”就含糊其辭。這套框架適合三類人一是看AI賽道的投資人需要把技術(shù)敘事拆解成可驗證的財務(wù)模型二是AI創(chuàng)業(yè)公司的技術(shù)負(fù)責(zé)人需要向董事會解釋算力預(yù)算的合理性三是傳統(tǒng)行業(yè)里負(fù)責(zé)數(shù)字化轉(zhuǎn)型的管理者需要判斷供應(yīng)商報出的算力方案是否虛高。不管你是哪一類核心邏輯是一致的算力是成本項不是收入項只有能轉(zhuǎn)化為可計費(fèi)產(chǎn)出的算力才有投資價值。我把它拆成四個模塊算力需求評估、算力成本結(jié)構(gòu)、回報率測算、風(fēng)險排查。每個模塊都有具體的參數(shù)和計算路徑不是拍腦袋的定性判斷。下面我按實操順序展開中間會穿插我實際做過的案例和踩過的坑。2. 算力需求評估從模型參數(shù)量到實際集群規(guī)模2.1 精度選擇如何直接影響算力賬單很多人一上來就問“訓(xùn)練一個大模型要多少算力”這個問題沒法直接回答因為精度格式?jīng)Q定了算力需求的基數(shù)。我用一個具體例子來說明假設(shè)你要訓(xùn)練一個130億參數(shù)的模型訓(xùn)練token量是2萬億不同精度下的顯存占用和算力需求差異巨大。先看顯存。模型參數(shù)本身占用的顯存等于參數(shù)量乘以每個參數(shù)的字節(jié)數(shù)。FP32下每個參數(shù)4字節(jié)130億參數(shù)就是52GBFP16下每個參數(shù)2字節(jié)就是26GBINT8下每個參數(shù)1字節(jié)就是13GB。但這只是權(quán)重訓(xùn)練時還有優(yōu)化器狀態(tài)、梯度、激活值。以Adam優(yōu)化器為例FP32訓(xùn)練時優(yōu)化器狀態(tài)需要參數(shù)量乘以8字節(jié)一階矩和二階矩各4字節(jié)梯度需要參數(shù)量乘以4字節(jié)加起來每個參數(shù)額外12字節(jié)。所以130億參數(shù)在FP32下光是權(quán)重優(yōu)化器梯度就是130億乘以16字節(jié)約208GB。這還沒算激活值實際訓(xùn)練時激活值可能再占幾十到上百GB。這就是為什么現(xiàn)在主流訓(xùn)練都用混合精度前向和反向傳播用FP16或BF16優(yōu)化器更新用FP32。這樣權(quán)重和激活值用2字節(jié)優(yōu)化器狀態(tài)用4字節(jié)梯度用2字節(jié)每個參數(shù)約8字節(jié)130億參數(shù)約104GB。如果再用上ZeRO零冗余優(yōu)化器做分片把優(yōu)化器狀態(tài)和梯度切分到多張卡上單卡顯存壓力就能降到可接受范圍。INT8在訓(xùn)練中很少用因為量化誤差會嚴(yán)重影響收斂但在推理場景下INT8是主流。推理時不需要優(yōu)化器狀態(tài)和梯度只需要權(quán)重和激活值。INT8推理下130億參數(shù)模型權(quán)重占13GB加上激活值和KV Cache一張24GB顯存的卡就能跑起來。FP16推理則需要26GB權(quán)重至少兩張24GB卡或者一張48GB卡。注意精度選擇不是“越高越好”而是“夠用就好”。FP64在AI訓(xùn)練中幾乎用不到那是科學(xué)計算領(lǐng)域的。FP32適合小模型或者對數(shù)值穩(wěn)定性要求極高的場景FP16/BF16是當(dāng)前訓(xùn)練標(biāo)配INT8/INT4是推理降本的關(guān)鍵手段。2.2 從參數(shù)量到算力需求的換算路徑顯存只是門檻真正決定訓(xùn)練時間的是浮點(diǎn)運(yùn)算次數(shù)。業(yè)界有個經(jīng)驗公式訓(xùn)練算力需求約等于6乘以參數(shù)量乘以訓(xùn)練token數(shù)。這個6的來歷是前向傳播一次矩陣乘法是2倍參數(shù)量乘以token數(shù)乘加各算一次反向傳播是前向的兩倍所以總共約6倍。拿130億參數(shù)、2萬億token來算6乘以130億乘以2萬億等于1.56乘以10的24次方FLOPs。這個數(shù)字很大我們換算成更直觀的單位。一張H100的FP16算力不算稀疏性大約是989 TFLOPS也就是每秒約10的15次方次浮點(diǎn)運(yùn)算。1.56乘以10的24次方除以10的15次方得到1.56乘以10的9次方秒約等于18000天。一張卡要跑49年顯然不現(xiàn)實。所以需要集群。如果用1000張H100理想情況下18天能跑完。但實際不可能達(dá)到100%利用率通信開銷、數(shù)據(jù)加載、檢查點(diǎn)保存都會吃掉時間。我實測下來大規(guī)模訓(xùn)練的有效算力利用率通常在30%到50%之間。按40%算1000張H100需要45天左右。這就是為什么大模型訓(xùn)練動輒幾個月而且集群規(guī)模直接決定了你能在多短時間內(nèi)迭代一次。這里有個關(guān)鍵參數(shù)叫MFU模型浮點(diǎn)運(yùn)算利用率等于實際達(dá)到的FLOPs除以理論峰值FLOPs。MFU超過50%就算非常優(yōu)秀了很多團(tuán)隊只能做到30%出頭。MFU低的原因包括通信瓶頸尤其是跨節(jié)點(diǎn)All-Reduce、顯存帶寬限制、流水線氣泡、數(shù)據(jù)預(yù)處理跟不上。評估一個團(tuán)隊的訓(xùn)練能力不要只看他們有多少卡要問他們的MFU是多少。2.3 推理場景的算力評估邏輯訓(xùn)練是一次性投入推理是持續(xù)性成本。推理的算力需求取決于三個變量請求量、每次請求的token數(shù)、模型大小。假設(shè)你有一個130億參數(shù)的模型每天處理100萬次請求每次請求平均輸入500 token、輸出200 token。推理的算力消耗主要來自兩部分Prefill階段處理輸入和Decode階段逐token生成輸出。Prefill階段的計算量約等于2乘以參數(shù)量乘以輸入token數(shù)Decode階段每生成一個token需要2乘以參數(shù)量次運(yùn)算。所以每次請求的總FLOPs約等于2乘以130億乘以500200等于1.82乘以10的13次方FLOPs。100萬次請求就是1.82乘以10的19次方FLOPs。一張H100在INT8推理下的算力約2000 TOPS每秒萬億次操作考慮50%利用率每秒能處理10的15次方次操作。1.82乘以10的19次方除以10的15次方等于18200秒約5小時。也就是說一張H100理論上5小時能處理完100萬次請求平均每天只需要0.2張卡。但實際要考慮峰值并發(fā)不能按平均值配置通常要留3到5倍余量。實操心得推理算力評估最容易犯的錯誤是只看平均值。我見過一個項目按日均請求量配了卡結(jié)果晚上流量高峰時排隊嚴(yán)重用戶體驗崩了。正確做法是看P99峰值并發(fā)按峰值配置閑時用彈性伸縮降本。3. 算力成本結(jié)構(gòu)把技術(shù)參數(shù)翻譯成財務(wù)語言3.1 自建集群與租用算力的成本對比算力獲取方式主要有三種自建集群、租用云算力、混合模式。每種方式的成本結(jié)構(gòu)完全不同不能簡單比單價。自建集群的成本包括硬件采購GPU服務(wù)器、網(wǎng)絡(luò)設(shè)備、存儲、機(jī)房改造供電、制冷、承重、電費(fèi)、運(yùn)維人力、軟件授權(quán)、折舊。以1000張H100為例單張H100服務(wù)器含8卡市場價約300萬人民幣1000張卡約125臺服務(wù)器硬件采購約3.75億。機(jī)房改造按每千瓦1萬元算1000張H100功耗約700千瓦加上制冷和網(wǎng)絡(luò)總功耗約1000千瓦改造費(fèi)用約1000萬。電費(fèi)按每度0.8元、每天滿載20小時算每天電費(fèi)約1.6萬一年約584萬。運(yùn)維團(tuán)隊至少5人人均年薪50萬一年250萬。折舊按3年直線折舊每年約1.25億。租用云算力的成本相對簡單按卡時計費(fèi)。H100的市場租用價格波動很大2023年高峰期每小時30到40元2024年回落到20到25元。按每小時25元算1000張卡租一年按每天20小時有效使用約1.8億。表面看租用比自建貴但自建有大量隱性成本和資金占用。這里有個關(guān)鍵決策點(diǎn)如果你的算力利用率低于50%租用幾乎總是更劃算。因為自建集群閑置時也在折舊和耗電而租用可以隨用隨停。我?guī)鸵粋€團(tuán)隊算過賬他們訓(xùn)練任務(wù)不連續(xù)平均利用率只有35%自建三年總成本約4.5億租用同樣算力三年約3.2億租用省了1.3億。但如果利用率能到70%以上自建在第二年就開始有成本優(yōu)勢。3.2 算力集群的架構(gòu)選擇與成本影響算力集群的架構(gòu)直接影響通信效率和成本。當(dāng)前主流架構(gòu)有三種胖樹架構(gòu)、軌道優(yōu)化架構(gòu)、蜻蜓架構(gòu)。胖樹架構(gòu)是最常見的核心交換機(jī)和匯聚交換機(jī)分層連接任意兩個節(jié)點(diǎn)之間的通信跳數(shù)相同。優(yōu)點(diǎn)是延遲可預(yù)測適合All-Reduce密集的訓(xùn)練任務(wù)。缺點(diǎn)是核心交換機(jī)端口數(shù)量限制了集群規(guī)模擴(kuò)展成本高。一個支持1000張卡的胖樹集群網(wǎng)絡(luò)設(shè)備成本約占總硬件成本的15%到20%。軌道優(yōu)化架構(gòu)把同一軌道內(nèi)的節(jié)點(diǎn)用高速鏈路連接跨軌道通信走上層交換機(jī)。這種架構(gòu)適合混合并行策略因為同一軌道內(nèi)的通信可以走高速鏈路。但軌道間通信可能成為瓶頸需要精心設(shè)計并行策略來減少跨軌道通信。蜻蜓架構(gòu)用高維超立方體拓?fù)鋽U(kuò)展性好但布線復(fù)雜對運(yùn)維要求高。我見過一個團(tuán)隊用蜻蜓架構(gòu)搭了2000卡集群結(jié)果因為光模塊故障率偏高實際可用性只有85%訓(xùn)練任務(wù)經(jīng)常中斷。注意網(wǎng)絡(luò)成本容易被低估。1000卡集群的網(wǎng)絡(luò)設(shè)備交換機(jī)、光模塊、線纜成本可能占到總硬件成本的20%到30%。而且網(wǎng)絡(luò)故障是訓(xùn)練中斷的首要原因選架構(gòu)時要把可靠性和可維護(hù)性放在擴(kuò)展性前面。3.3 電力與制冷被忽視的成本大頭算力集群的電力成本包括兩部分IT設(shè)備耗電和制冷耗電。PUE電能利用效率等于總耗電除以IT設(shè)備耗電。先進(jìn)數(shù)據(jù)中心PUE可以做到1.1到1.2普通機(jī)房可能到1.5甚至更高。1000張H100的IT設(shè)備功耗約700千瓦如果PUE是1.2總功耗就是840千瓦。一年電費(fèi)按0.8元每度算約588萬。如果PUE是1.5總功耗1050千瓦一年電費(fèi)735萬多出147萬。所以機(jī)房選址和制冷方案對長期成本影響很大。制冷方案主要有風(fēng)冷和液冷。風(fēng)冷改造成本低但散熱效率有限適合功率密度較低的集群。液冷散熱效率高支持更高功率密度但改造成本高。冷板式液冷每千瓦改造成本約5000到8000元浸沒式液冷更高。對于1000卡以上的集群液冷通常是更優(yōu)選擇因為可以降低PUE到1.1左右長期電費(fèi)節(jié)省能覆蓋改造成本。我個人的經(jīng)驗是如果電價高于0.6元每度液冷的投資回收期通常在2年以內(nèi)。如果電價低于0.4元風(fēng)冷可能更經(jīng)濟(jì)。選址時優(yōu)先考慮電價低、氣候涼爽的地區(qū)比如西北和華北部分地區(qū)。4. 回報率測算從算力投入到可計費(fèi)產(chǎn)出4.1 訓(xùn)練項目的回報率測算框架訓(xùn)練項目的回報率測算比推理復(fù)雜因為訓(xùn)練本身不直接產(chǎn)生收入它產(chǎn)出的是模型能力模型能力再通過推理服務(wù)變現(xiàn)。所以訓(xùn)練項目的回報率要分兩步算先算模型能力提升帶來的收入增量再算訓(xùn)練成本。假設(shè)你有一個基礎(chǔ)模型當(dāng)前在某個任務(wù)上的準(zhǔn)確率是80%你計劃用1000張H100訓(xùn)練一個月預(yù)期準(zhǔn)確率提升到85%。這個5個百分點(diǎn)的提升能帶來多少收入取決于你的商業(yè)模式。如果是API調(diào)用準(zhǔn)確率提升可能帶來調(diào)用量增長如果是垂直場景解決方案準(zhǔn)確率提升可能帶來客單價提升或客戶留存率提升。我做過一個案例一個法律文書生成模型準(zhǔn)確率從82%提升到88%后客戶續(xù)費(fèi)率從65%提升到80%客單價從每年10萬提升到15萬。假設(shè)有100個客戶收入增量等于100乘以15萬乘以80%減去10萬乘以65%等于100乘以12萬減去6.5萬等于550萬。訓(xùn)練成本按1000張H100一個月算租用成本約1000乘以25乘以24乘以30等于1800萬。單看這個項目收入增量覆蓋不了訓(xùn)練成本。但這里有個關(guān)鍵模型能力提升往往有復(fù)用性。同一個模型可以服務(wù)多個場景收入增量要按所有場景匯總。而且模型能力提升后推理成本可能下降比如可以用更小的模型達(dá)到同樣效果這部分節(jié)省也要算進(jìn)去。所以訓(xùn)練項目的回報率測算不能只看單個場景要看模型能力的整體價值。4.2 推理服務(wù)的單位經(jīng)濟(jì)模型推理服務(wù)的單位經(jīng)濟(jì)模型相對清晰每千token收入減去每千token成本。收入端取決于定價策略成本端包括算力折舊或租金、電費(fèi)、網(wǎng)絡(luò)帶寬、運(yùn)維分?jǐn)?。?30億參數(shù)模型、INT8推理為例。一張H100每小時能處理約200萬token考慮50%利用率和批處理優(yōu)化租用成本每小時25元每百萬token算力成本約12.5元。加上電費(fèi)、網(wǎng)絡(luò)、運(yùn)維分?jǐn)偯堪偃ftoken總成本約18元。如果定價是每百萬token 30元毛利率40%。如果定價是每百萬token 20元毛利率只有10%稍微有點(diǎn)波動就虧損。這里的關(guān)鍵變量是批處理大小。批處理越大GPU利用率越高單位token成本越低。但批處理太大會增加延遲影響用戶體驗。我實測下來對于交互式應(yīng)用批處理大小在8到16之間比較平衡對于離線批量處理可以開到64甚至128。實操心得推理服務(wù)的毛利率對算力利用率極其敏感。利用率從50%提升到70%單位成本能降30%左右。所以推理服務(wù)要盡量把流量集中到少數(shù)幾張卡上而不是分散到很多卡上。我見過一個團(tuán)隊為了“高可用”把流量分散到10張卡上結(jié)果每張卡利用率都不到20%毛利率慘不忍睹。4.3 算力投資回報率的核心公式與參數(shù)把上面這些串起來算力投資回報率的核心公式是ROI 推理收入 模型能力增量收入 - 算力總成本 - 其他運(yùn)營成本/ 算力總成本其中算力總成本包括硬件折舊或租金、電費(fèi)、制冷分?jǐn)?、網(wǎng)絡(luò)成本、運(yùn)維人力、軟件授權(quán)。其他運(yùn)營成本包括數(shù)據(jù)標(biāo)注、模型評估、市場推廣、銷售人力。每個參數(shù)都需要有依據(jù)不能拍腦袋。硬件折舊按3年直線折舊殘值率5%到10%。電費(fèi)按實際PUE和當(dāng)?shù)仉妰r算。運(yùn)維人力按集群規(guī)模配通常每1000卡配5到8人。數(shù)據(jù)標(biāo)注成本按標(biāo)注量和單價算模型評估成本按評估次數(shù)和每次成本算。我建議做一個敏感性分析表把關(guān)鍵參數(shù)上下浮動20%看ROI的變化范圍。如果ROI在悲觀情景下仍然為正這個投資就比較安全如果在樂觀情景下才為正風(fēng)險就很高。參數(shù)悲觀情景基準(zhǔn)情景樂觀情景算力利用率30%50%70%每百萬token收入20元30元40元電費(fèi)元/度1.00.80.5硬件折舊年限2年3年4年ROI-15%25%60%這張表是我實際做項目時用的模板每次評估新項目都會填一遍。如果悲觀情景下ROI為負(fù)就要慎重考慮如果基準(zhǔn)情景下ROI低于20%說明這個項目抗風(fēng)險能力弱。5. 常見問題與排查技巧實錄5.1 算力需求評估中的典型誤判誤判一按理論峰值算算力需求忽略實際利用率。我見過一個BP寫“1000張H100峰值算力989 PFLOPS訓(xùn)練130億模型只需XX天”完全沒考慮MFU。實際MFU可能只有30%訓(xùn)練時間是理論值的3倍多。評估時要問清楚MFU假設(shè)最好要求提供歷史訓(xùn)練任務(wù)的MFU數(shù)據(jù)。誤判二把顯存需求當(dāng)成算力需求。顯存決定能不能跑起來算力決定跑多快。兩個模型可能顯存需求差不多但算力需求差幾倍。評估時要分開算先算顯存能不能裝下再算算力需要多少卡時。誤判三忽略推理的峰值并發(fā)。按日均請求量配卡晚上高峰時排隊。正確做法是按P99峰值并發(fā)配卡閑時用彈性伸縮。彈性伸縮的響應(yīng)時間也要考慮如果擴(kuò)容需要5分鐘那這5分鐘內(nèi)的請求要么排隊要么丟棄。誤判四低估網(wǎng)絡(luò)和存儲成本。算力集群不只是GPU網(wǎng)絡(luò)設(shè)備和存儲系統(tǒng)可能占總成本的30%以上。評估時要問清楚網(wǎng)絡(luò)架構(gòu)、存儲方案、帶寬需求。5.2 回報率測算中的常見陷阱陷阱一把收入增長全部歸因于算力投入。收入增長可能來自市場推廣、銷售團(tuán)隊擴(kuò)張、產(chǎn)品體驗優(yōu)化不全是算力的功勞。做回報率測算時要剝離其他因素的影響或者至少做歸因分析。陷阱二忽略競爭導(dǎo)致的降價壓力。AI推理服務(wù)的價格在過去一年下降了50%以上未來可能繼續(xù)下降。測算時要考慮價格年降幅保守一點(diǎn)按每年降20%到30%算。陷阱三低估運(yùn)維復(fù)雜度和人力成本。大規(guī)模集群的運(yùn)維不是幾個腳本就能搞定的需要專業(yè)的SRE團(tuán)隊、監(jiān)控系統(tǒng)、故障排查流程。我見過一個團(tuán)隊自建了500卡集群結(jié)果因為運(yùn)維跟不上實際可用性只有70%算力成本變相增加了40%。陷阱四把一次性收入當(dāng)成持續(xù)性收入。有些AI項目是項目制交付收入是一次性的但算力成本是持續(xù)性的。這種項目的回報率測算要特別小心確保一次性收入能覆蓋整個項目周期的算力成本。5.3 算力投資決策的檢查清單每次評估算力投資項目我都會過一遍這個清單算力需求是否按實際MFU折算MFU假設(shè)是否有歷史數(shù)據(jù)支撐顯存需求是否算上了優(yōu)化器狀態(tài)、梯度、激活值是否用了混合精度和ZeRO推理算力是否按P99峰值并發(fā)配置彈性伸縮策略是否明確自建還是租用利用率是否超過50%資金成本是否算進(jìn)去了網(wǎng)絡(luò)架構(gòu)是否匹配并行策略網(wǎng)絡(luò)成本占比是否合理PUE是多少電價是多少制冷方案是否經(jīng)濟(jì)收入預(yù)測是否剝離了非算力因素是否考慮了價格年降運(yùn)維人力是否配足可用性目標(biāo)是否現(xiàn)實敏感性分析是否做了悲觀情景下ROI是否為正這個清單我用了兩年多幫我避開了至少三個坑。有一次一個項目看起來回報率很高過完清單發(fā)現(xiàn)他們按100%利用率算的實際歷史利用率只有40%重算后ROI從35%降到8%果斷放棄。5.4 算力集群架構(gòu)選擇的實操建議如果你決定自建集群架構(gòu)選擇有幾個實操建議第一先確定并行策略再選架構(gòu)。數(shù)據(jù)并行、流水線并行、張量并行的通信模式不同對網(wǎng)絡(luò)的要求也不同。數(shù)據(jù)并行需要高帶寬All-Reduce流水線并行需要低延遲點(diǎn)對點(diǎn)通信張量并行需要極高帶寬和極低延遲。先確定主要用哪種并行策略再選匹配的網(wǎng)絡(luò)架構(gòu)。第二網(wǎng)絡(luò)設(shè)備不要省錢。網(wǎng)絡(luò)故障是訓(xùn)練中斷的首要原因而且排查困難。我建議網(wǎng)絡(luò)設(shè)備預(yù)算占總硬件預(yù)算的20%以上選擇成熟穩(wěn)定的品牌和型號。光模塊要買原廠的兼容模塊雖然便宜但故障率高。第三存儲系統(tǒng)要分層。訓(xùn)練數(shù)據(jù)量大全部放高速存儲成本太高。建議用分層存儲熱數(shù)據(jù)放NVMe SSD溫數(shù)據(jù)放SATA SSD冷數(shù)據(jù)放HDD或?qū)ο蟠鎯?。檢查點(diǎn)保存要快否則訓(xùn)練中斷后恢復(fù)時間長。第四預(yù)留擴(kuò)展空間。機(jī)房供電、制冷、承重、網(wǎng)絡(luò)端口都要預(yù)留擴(kuò)展空間。我見過一個團(tuán)隊建了500卡集群想擴(kuò)展到1000卡時發(fā)現(xiàn)機(jī)房供電不夠改造花了半年錯過了市場窗口。5.5 算力成本優(yōu)化的幾個實用技巧技巧一混合精度訓(xùn)練。FP16/BF16訓(xùn)練比FP32訓(xùn)練省一半顯存和算力而且收斂性通常沒問題。BF16比FP16更穩(wěn)定推薦優(yōu)先用BF16。技巧二梯度累積。顯存不夠時可以用小batch加梯度累積模擬大batch。梯度累積步數(shù)等于目標(biāo)batch除以實際batch。這樣不增加顯存但訓(xùn)練時間會線性增加。技巧三檢查點(diǎn)優(yōu)化。檢查點(diǎn)保存頻率太高會拖慢訓(xùn)練太低則中斷后損失大。建議根據(jù)訓(xùn)練穩(wěn)定性和任務(wù)時長平衡通常每幾小時保存一次。檢查點(diǎn)可以用異步保存不阻塞訓(xùn)練。技巧四推理批處理。推理時盡量批處理提高GPU利用率。但批處理大小要平衡延遲和吞吐交互式應(yīng)用批處理小一點(diǎn)離線應(yīng)用批處理大一點(diǎn)。技巧五彈性伸縮。推理服務(wù)用彈性伸縮閑時縮容降本忙時擴(kuò)容保體驗。伸縮策略要基于實際流量模式不要拍腦袋設(shè)閾值。技巧六算力共享。如果多個團(tuán)隊共用集群可以用調(diào)度系統(tǒng)做算力共享提高整體利用率。但要做好隔離和優(yōu)先級管理避免互相影響。6. 一個完整的算力投資評估案例6.1 項目背景與算力需求測算去年我參與評估了一個AI客服項目。項目計劃訓(xùn)練一個70億參數(shù)的垂直領(lǐng)域模型用于替代人工客服。訓(xùn)練數(shù)據(jù)是500萬條歷史客服對話訓(xùn)練token量約50億。推理場景是每天處理20萬次用戶咨詢每次咨詢平均輸入300 token、輸出150 token。訓(xùn)練算力測算6乘以70億乘以50億等于2.1乘以10的21次方FLOPs。用100張H100訓(xùn)練理論時間等于2.1乘以10的21次方除以100乘以10的15次方等于2.1乘以10的4次方秒約5.8小時。按MFU 35%算實際約16.6小時。加上數(shù)據(jù)加載、檢查點(diǎn)、評估按2天算。租用100張H100兩天成本約100乘以25乘以24乘以2等于12萬。推理算力測算每次請求FLOPs等于2乘以70億乘以300150等于6.3乘以10的12次方。20萬次請求等于1.26乘以10的19次方FLOPs。一張H100 INT8推理算力2000 TOPS按50%利用率算每秒10的15次方次操作。1.26乘以10的19次方除以10的15次方等于12600秒約3.5小時??紤]峰值并發(fā)是平均值的3倍需要約10張H100。租用10張H100一個月成本約10乘以25乘以24乘以30等于18萬。6.2 成本結(jié)構(gòu)與回報率測算訓(xùn)練成本12萬推理成本每月18萬。其他成本包括數(shù)據(jù)標(biāo)注和清洗約5萬模型評估約2萬運(yùn)維人力分?jǐn)偧s3萬每月。首月總成本約40萬后續(xù)每月約21萬。收入端替代人工客服假設(shè)每個客服月薪6000元20萬次咨詢需要約20個客服月人力成本12萬。AI客服定價按每次咨詢0.5元算20萬次收入10萬。表面看AI客服收入10萬低于人工成本12萬但AI客服可以24小時服務(wù)且邊際成本低。如果咨詢量增長到30萬次人工需要30個客服成本18萬AI客服收入15萬成本增加很少。算力投資回報率首月投入40萬后續(xù)每月收入10萬減去成本21萬虧損11萬。但隨著咨詢量增長和模型優(yōu)化推理成本會下降。假設(shè)6個月后咨詢量到50萬次收入25萬推理成本因批處理優(yōu)化降到每月25萬其他成本5萬月利潤負(fù)5萬。再優(yōu)化模型用更小的模型達(dá)到同樣效果推理成本降到15萬月利潤5萬。累計12個月總投入約40萬加11個月乘以20萬等于260萬總收入約12個月平均15萬等于180萬凈虧損80萬。這個項目單看財務(wù)回報不理想但戰(zhàn)略價值在于積累垂直領(lǐng)域模型能力可以復(fù)用到其他客服場景數(shù)據(jù)資產(chǎn)可以用于訓(xùn)練更多模型AI客服可以提升響應(yīng)速度和一致性帶來隱性收益。所以最終決策是先小規(guī)模試點(diǎn)用租用算力驗證效果如果效果好再擴(kuò)大。6.3 敏感性分析與決策建議對關(guān)鍵參數(shù)做敏感性分析參數(shù)悲觀基準(zhǔn)樂觀咨詢量月增長5%15%30%每次咨詢定價0.3元0.5元0.8元推理成本月降幅5%10%20%12個月累計利潤-180萬-80萬50萬悲觀情景下虧損180萬基準(zhǔn)情景虧損80萬樂觀情景盈利50萬。這個項目風(fēng)險較高建議先租用算力做3個月試點(diǎn)投入控制在50萬以內(nèi)。如果3個月內(nèi)咨詢量月增長超過20%且推理成本月降幅超過15%再考慮擴(kuò)大投入。這個案例的教訓(xùn)是算力投資不能只看技術(shù)可行性要看商業(yè)可行性。技術(shù)上行得通的項目商業(yè)上可能虧錢。評估時要算清楚賬不要被技術(shù)敘事帶偏。7. 算力投資的未來變量與應(yīng)對策略7.1 算力供給格局的變化趨勢算力供給正在從緊缺走向結(jié)構(gòu)性過剩。2023年一卡難求2024年很多算力租賃商開始降價促銷。這個變化對投資決策的影響是自建集群的風(fēng)險在上升租用算力的性價比在提升。因為如果算力供給持續(xù)增加租用價格會繼續(xù)下降自建集群的折舊成本相對固定競爭力會下降。另一個變化是推理算力需求超過訓(xùn)練算力需求。隨著大模型應(yīng)用落地推理算力占比越來越高。推理算力對集群架構(gòu)的要求和訓(xùn)練不同推理更看重低延遲和高吞吐對網(wǎng)絡(luò)帶寬要求相對低。這意味著現(xiàn)有訓(xùn)練集群可能不適合做推理需要單獨(dú)建設(shè)推理集群。應(yīng)對策略訓(xùn)練算力優(yōu)先租用保持靈活性推理算力可以根據(jù)流量穩(wěn)定性決定自建還是租用流量穩(wěn)定且規(guī)模大時自建更經(jīng)濟(jì)。7.2 模型效率提升對算力需求的影響模型效率在快速提升。同樣的任務(wù)2024年的模型可能比2023年的模型少用50%算力。MoE混合專家架構(gòu)、稀疏注意力、量化推理等技術(shù)都在降低算力需求。這對算力投資的影響是算力需求預(yù)測要留出效率提升的余量不能按當(dāng)前效率線性外推。我建議做算力規(guī)劃時按每年效率提升20%到30%來折算。也就是說如果當(dāng)前需要1000張卡一年后同樣任務(wù)可能只需要700到800張卡。這個效率提升來自模型架構(gòu)優(yōu)化、推理框架優(yōu)化、硬件升級等多個方面。應(yīng)對策略算力投資要模塊化、可擴(kuò)展避免一次性大規(guī)模投入。先建小集群驗證再根據(jù)實際需求逐步擴(kuò)展。硬件選擇上優(yōu)先考慮通用性強(qiáng)的型號避免專用芯片鎖定。7.3 算力投資的風(fēng)險管理框架算力投資的主要風(fēng)險包括技術(shù)路線變化導(dǎo)致硬件過時、算力價格下降導(dǎo)致自建集群貶值、模型效率提升導(dǎo)致算力需求下降、競爭加劇導(dǎo)致推理價格下降。風(fēng)險管理框架包括第一控制自建集群規(guī)模。自建集群不超過總算力需求的50%其余用租用滿足。這樣既保證核心任務(wù)的算力供應(yīng)又保持靈活性。第二硬件折舊年限不要超過3年。AI硬件迭代快3年后可能大幅貶值。折舊年限太長會導(dǎo)致賬面利潤虛高實際現(xiàn)金流緊張。第三收入預(yù)測要保守。推理價格年降幅按20%到30%算咨詢量增長按10%到15%算。不要用樂觀情景做決策。第四保持技術(shù)跟蹤。關(guān)注模型效率、硬件性能、算力價格的變化每季度更新一次算力投資模型。第五設(shè)置止損線。如果實際利用率連續(xù)3個月低于30%或者推理毛利率連續(xù)3個月低于10%就要考慮調(diào)整策略。這套框架我用了兩年多幫我在算力投資上避開了大坑也抓住了機(jī)會。最核心的體會是算力是手段不是目的能產(chǎn)生回報的算力才是好算力。不要被“算力規(guī)模”迷惑要盯著“算力回報率”。每次決策前把賬算清楚把風(fēng)險想全面比盲目跟風(fēng)靠譜得多。最后分享一個小技巧做算力投資評估時找一個懂技術(shù)的人和一個懂財務(wù)的人一起看項目。技術(shù)的人看算力需求是否合理財務(wù)的人看回報率是否可行。兩個人意見一致時再決策不一致時就要深挖原因。我見過太多項目是技術(shù)的人覺得可行、財務(wù)的人覺得虧錢最后發(fā)現(xiàn)是技術(shù)的人高估了利用率或者財務(wù)的人低估了收入增長。兩邊對齊了決策質(zhì)量會高很多。