TPU之父看軟硬件協(xié)同設(shè)計(jì)新范式)
上周當(dāng)我在調(diào)試一個(gè)基于大模型的推理服務(wù)時(shí)又一次遇到了熟悉的“資源瓶頸”警告。不是模型不夠聰明也不是代碼邏輯有問(wèn)題而是底層的計(jì)算硬件——GPU在批量處理請(qǐng)求時(shí)顯得力不從心成本曲線陡峭得讓人心驚。這幾乎是所有深入應(yīng)用大模型的公司和開(kāi)發(fā)者都會(huì)遇到的“最后一公里”難題模型能力很強(qiáng)但把它變成穩(wěn)定、高效、可負(fù)擔(dān)的服務(wù)卻需要跨越從軟件到硬件的巨大鴻溝。就在這個(gè)當(dāng)口AI領(lǐng)域最受矚目的明星公司之一Anthropic傳出了一個(gè)看似低調(diào)卻可能影響深遠(yuǎn)的動(dòng)作他們聘請(qǐng)了前谷歌TPU張量處理單元負(fù)責(zé)人阿米爾·薩萊克Amir Salek。這遠(yuǎn)不止是一次普通的人事變動(dòng)。TPU是谷歌為了其AI帝國(guó)從搜索到翻譯再到AlphaGo而量身定制的“心臟”是谷歌在AI硬件競(jìng)賽中甩開(kāi)對(duì)手的關(guān)鍵籌碼。如今這位核心架構(gòu)師轉(zhuǎn)投Anthropic其信號(hào)再明確不過(guò)Anthropic已經(jīng)不滿足于僅僅在模型算法上領(lǐng)先它要親手打造承載其未來(lái)AI夢(mèng)想的“物理基石”——自研芯片。這個(gè)消息之所以值得每一個(gè)關(guān)注AI技術(shù)落地的人仔細(xì)琢磨是因?yàn)樗沂玖艘粋€(gè)正在發(fā)生的深刻轉(zhuǎn)變AI的競(jìng)爭(zhēng)正從純粹的“大腦”算法模型競(jìng)賽演變?yōu)椤按竽X”與“軀體”算力硬件協(xié)同設(shè)計(jì)的系統(tǒng)級(jí)競(jìng)賽。對(duì)于開(kāi)發(fā)者、技術(shù)決策者乃至整個(gè)生態(tài)來(lái)說(shuō)理解這場(chǎng)“軟硬一體”的變革遠(yuǎn)比追逐某個(gè)模型的最新版本號(hào)更為重要。1. 為什么“造芯”成了頂級(jí)AI公司的必答題要理解Anthropic為何要走上這條艱難且昂貴的自研芯片之路我們不能只看它一家而要看整個(gè)行業(yè)頂級(jí)玩家的共同選擇。這背后是AI模型發(fā)展規(guī)律與現(xiàn)有通用硬件之間日益尖銳的矛盾。1.1 從“買顯卡”到“造芯片”成本與效率的雙重倒逼過(guò)去幾年訓(xùn)練和運(yùn)行大模型幾乎等同于“堆GPU”。無(wú)論是英偉達(dá)的A100、H100還是AMD的MI系列它們都是性能強(qiáng)大的通用加速器。但“通用”也意味著妥協(xié)。這些GPU需要兼顧圖形渲染、科學(xué)計(jì)算、深度學(xué)習(xí)等多種任務(wù)其架構(gòu)并非為大模型尤其是Transformer架構(gòu)的極致優(yōu)化而設(shè)計(jì)。這就導(dǎo)致了幾個(gè)核心痛點(diǎn)驚人的成本動(dòng)輒數(shù)萬(wàn)甚至數(shù)十萬(wàn)美元一張的頂級(jí)GPU構(gòu)建一個(gè)千卡集群就是數(shù)億美元的投資。這不僅是初創(chuàng)公司的門檻也讓大公司的每一次模型迭代都伴隨著巨大的財(cái)務(wù)壓力。低效的利用率大模型計(jì)算有獨(dú)特的模式比如注意力機(jī)制中大量的矩陣乘加運(yùn)算和特定的內(nèi)存訪問(wèn)模式。通用GPU的某些計(jì)算單元和內(nèi)存帶寬在運(yùn)行大模型時(shí)可能處于“閑置”或“低效”狀態(tài)相當(dāng)于你為整個(gè)豪華酒店付費(fèi)但只住其中一個(gè)房間。受制于人的供應(yīng)鏈全球高端AI芯片的供應(yīng)高度集中。當(dāng)你的核心業(yè)務(wù)命脈系于單一供應(yīng)商的產(chǎn)能和定價(jià)策略時(shí)其風(fēng)險(xiǎn)不言而喻。最近的芯片短缺和出口管制已經(jīng)給行業(yè)上了一課。因此自研芯片的本質(zhì)是將AI工作負(fù)載的“共性”提取出來(lái)用定制化的硬件去極致地滿足它從而在性能、功耗和成本上實(shí)現(xiàn)數(shù)量級(jí)的優(yōu)化。谷歌的TPU已經(jīng)證明了這條路的可行性在其內(nèi)部TPU運(yùn)行搜索、翻譯等AI服務(wù)的成本遠(yuǎn)低于使用同等性能的GPU。1.2 Anthropic的“憲法AI”需要怎樣的“軀體”Anthropic的核心技術(shù)理念是“憲法AI”Constitutional AI旨在通過(guò)一套明確的規(guī)則憲法來(lái)引導(dǎo)和約束模型行為使其更安全、更可控、更符合人類意圖。這不僅僅是算法上的創(chuàng)新也對(duì)底層計(jì)算提出了特殊要求。推理與微調(diào)的高頻性為了讓模型持續(xù)對(duì)齊“憲法”需要頻繁地進(jìn)行推理過(guò)程中的約束計(jì)算和基于人類反饋的微調(diào)。這些操作雖然計(jì)算量可能小于預(yù)訓(xùn)練但要求極低的延遲和高能效比以便快速迭代和實(shí)時(shí)響應(yīng)。長(zhǎng)上下文與復(fù)雜邏輯Anthropic的Claude模型一直以處理超長(zhǎng)上下文見(jiàn)長(zhǎng)。處理長(zhǎng)達(dá)數(shù)十萬(wàn)token的上下文對(duì)芯片的內(nèi)存帶寬、片上緩存架構(gòu)以及管理超長(zhǎng)序列的專用電路提出了苛刻要求。通用GPU的顯存帶寬可能成為瓶頸。可靠性與確定性安全對(duì)齊要求模型行為高度可控和可預(yù)測(cè)。定制化芯片可以針對(duì)關(guān)鍵的安全檢查步驟設(shè)計(jì)專用電路減少軟件層面的不確定性從硬件層面為“可控性”提供支撐??梢哉f(shuō)Anthropic的AI理念越獨(dú)特、越前沿其對(duì)計(jì)算硬件“量身定制”的需求就越迫切。通用GPU就像一輛全能SUV能跑公路也能輕度越野而Anthropic需要的可能是一輛為“安全、長(zhǎng)距離、復(fù)雜路況AI推理”賽道專門設(shè)計(jì)的方程式賽車。2. 前TPU負(fù)責(zé)人加盟一次精準(zhǔn)的“降維打擊”阿米爾·薩萊克的加盟是Anthropic自研芯片戰(zhàn)略中最關(guān)鍵的一塊拼圖。他的價(jià)值絕不僅僅是一個(gè)“芯片專家”的頭銜。2.1 他帶來(lái)的是“從零到一”構(gòu)建AI計(jì)算體系的經(jīng)驗(yàn)在谷歌TPU并非一蹴而就。從第一代主要針對(duì)推理到后續(xù)版本兼顧訓(xùn)練TPU的演進(jìn)是軟件TensorFlow框架、硬件架構(gòu)、編譯器、系統(tǒng)軟件協(xié)同設(shè)計(jì)的經(jīng)典案例。薩萊克深度參與甚至主導(dǎo)了這一過(guò)程他深刻理解如何定義芯片的指令集和架構(gòu)使其與上層AI框架如Anthropic可能優(yōu)化的訓(xùn)練/推理?xiàng)8咝?duì)接。如何平衡計(jì)算單元、內(nèi)存層次結(jié)構(gòu)和互連帶寬以滿足大模型訓(xùn)練和推理中數(shù)據(jù)流的特點(diǎn)。如何構(gòu)建圍繞芯片的整個(gè)軟件生態(tài)包括編譯器、驅(qū)動(dòng)、運(yùn)行時(shí)庫(kù)讓開(kāi)發(fā)者無(wú)需關(guān)心硬件細(xì)節(jié)就能發(fā)揮芯片性能。這對(duì)于從零開(kāi)始的Anthropic來(lái)說(shuō)是無(wú)可替代的經(jīng)驗(yàn)??梢员苊夂芏嗉夹g(shù)路線上的陷阱直接瞄準(zhǔn)最核心的優(yōu)化目標(biāo)。2.2 從“云上芯片”到“專屬芯片”的思維轉(zhuǎn)變谷歌的TPU首先是為其龐大的云計(jì)算業(yè)務(wù)Google Cloud服務(wù)的需要考慮多租戶、虛擬化、通用性。而Anthropic自研芯片的初期目標(biāo)很可能更聚焦全力服務(wù)好自己的大模型尤其是Claude系列。這種“專屬芯片”的思路可以做得更加極致架構(gòu)極端特化可以只為Transformer類模型優(yōu)化甚至為Claude的特定模型版本優(yōu)化舍棄所有不必要的通用計(jì)算單元。軟硬件深度協(xié)同Anthropic的模型研發(fā)團(tuán)隊(duì)可以和芯片團(tuán)隊(duì)坐在一起從模型結(jié)構(gòu)設(shè)計(jì)階段就考慮硬件特性實(shí)現(xiàn)“算法-硬件”聯(lián)合優(yōu)化。例如設(shè)計(jì)更利于硬件并行執(zhí)行的注意力機(jī)制變體??焖俚]環(huán)芯片設(shè)計(jì)可以緊密跟隨模型架構(gòu)的演進(jìn)快速迭代。而不像通用GPU其架構(gòu)迭代周期長(zhǎng)達(dá)數(shù)年且需考慮海量不同客戶的需求。薩萊克的任務(wù)可能就是帶領(lǐng)團(tuán)隊(duì)將谷歌“為云設(shè)計(jì)AI芯片”的系統(tǒng)工程能力轉(zhuǎn)化為Anthropic“為自家AI大腦設(shè)計(jì)專屬軀體”的極致優(yōu)化能力。3. 自研芯片之路并非坦途而是布滿荊棘的攀登對(duì)于任何一家公司涉足芯片設(shè)計(jì)都是“勇敢者的游戲”。Anthropic面臨的挑戰(zhàn)是立體而復(fù)雜的。3.1 技術(shù)挑戰(zhàn)從架構(gòu)設(shè)計(jì)到流片量產(chǎn)架構(gòu)定義與驗(yàn)證確定芯片的微架構(gòu)是第一步也是最難的一步。是做訓(xùn)練芯片、推理芯片還是訓(xùn)練推理一體核心計(jì)算單元采用什么精度FP8, BF16, FP16片上內(nèi)存SRAM要多大片外內(nèi)存HBM帶寬需要多少這些決策需要基于對(duì)未來(lái)2-3年模型發(fā)展趨勢(shì)的精準(zhǔn)預(yù)測(cè)。物理設(shè)計(jì)與流片將架構(gòu)轉(zhuǎn)化為實(shí)際的電路設(shè)計(jì)RTL再經(jīng)過(guò)物理設(shè)計(jì)、驗(yàn)證最終送到臺(tái)積電或三星這樣的晶圓廠“流片”。這個(gè)過(guò)程耗資巨大一次流片費(fèi)用可能高達(dá)數(shù)千萬(wàn)美元且周期漫長(zhǎng)18-24個(gè)月。任何設(shè)計(jì)錯(cuò)誤都可能導(dǎo)致芯片無(wú)法工作或性能不達(dá)標(biāo)造成巨大損失。軟件棧構(gòu)建芯片再?gòu)?qiáng)大如果沒(méi)有好用的軟件也是一塊磚頭。需要開(kāi)發(fā)配套的編譯器、驅(qū)動(dòng)程序、內(nèi)核庫(kù)以及可能與現(xiàn)有AI框架如PyTorch對(duì)接的接口。構(gòu)建一個(gè)成熟的軟件生態(tài)其難度和耗時(shí)往往不亞于芯片設(shè)計(jì)本身。3.2 商業(yè)與生態(tài)挑戰(zhàn)如何走出“自?shī)首詷?lè)”這是比技術(shù)更深刻的挑戰(zhàn)。Anthropic自研芯片的成功最終需要體現(xiàn)在商業(yè)價(jià)值和生態(tài)影響力上。成本攤薄芯片研發(fā)的固定成本極高。如果芯片只用于內(nèi)部有限的模型訓(xùn)練和推理其均攤成本可能長(zhǎng)期無(wú)法低于采購(gòu)成熟GPU的方案。除非芯片帶來(lái)的性能提升和功耗降低足夠巨大。生態(tài)孤立風(fēng)險(xiǎn)如果Anthropic的芯片和軟件棧成為一個(gè)完全封閉的系統(tǒng)將不利于吸引外部開(kāi)發(fā)者和研究者在其上構(gòu)建應(yīng)用。這可能會(huì)限制其模型的生態(tài)影響力和創(chuàng)新活力。與云廠商的競(jìng)合Anthropic目前通過(guò)亞馬遜AWS和谷歌云提供服務(wù)。一旦擁有自研芯片它與云廠商的關(guān)系將變得微妙。是繼續(xù)深度合作利用云廠商的全球基礎(chǔ)設(shè)施還是逐步建立自己的算力集群甚至最終成為云服務(wù)的競(jìng)爭(zhēng)者這需要高超的戰(zhàn)略平衡。一個(gè)可能的路徑是初期芯片嚴(yán)格內(nèi)用極致優(yōu)化自身核心模型的成本與性能。在技術(shù)成熟后或許會(huì)以“AI超級(jí)計(jì)算機(jī)”或?qū)S脤?shí)例的形式通過(guò)云合作伙伴對(duì)外提供算力服務(wù)從而構(gòu)建一個(gè)圍繞其芯片和模型的獨(dú)特生態(tài)位。4. 對(duì)開(kāi)發(fā)者與行業(yè)的影響算力格局的“鯰魚(yú)效應(yīng)”Anthropic自研芯片短期內(nèi)可能不會(huì)直接改變普通開(kāi)發(fā)者的工作臺(tái)。但從長(zhǎng)期看它像一條鯰魚(yú)將攪動(dòng)整個(gè)AI算力格局帶來(lái)一系列連鎖反應(yīng)。4.1 更多元化的算力選擇與可能更低的門檻目前高端AI訓(xùn)練幾乎被英偉達(dá)統(tǒng)治。Anthropic、OpenAI也被報(bào)道在探索自研芯片、亞馬遜已有Trainium/Inferentia、谷歌TPU等巨頭的入局正在創(chuàng)造一個(gè)多極化的算力市場(chǎng)。競(jìng)爭(zhēng)加劇最終可能帶來(lái)價(jià)格壓力更多選擇意味著供應(yīng)商需要提供更具競(jìng)爭(zhēng)力的價(jià)格和性能。專業(yè)化分工可能會(huì)出現(xiàn)針對(duì)訓(xùn)練、推理、長(zhǎng)上下文、多模態(tài)等不同場(chǎng)景的專用芯片開(kāi)發(fā)者可以根據(jù)任務(wù)特點(diǎn)選擇最經(jīng)濟(jì)的方案。云服務(wù)創(chuàng)新云廠商會(huì)集成更多樣化的算力實(shí)例。未來(lái)在AWS或Google Cloud上啟動(dòng)一個(gè)訓(xùn)練任務(wù)時(shí)選擇列表里可能不僅有英偉達(dá)GPU還有“Anthropic定制推理實(shí)例”或“長(zhǎng)上下文優(yōu)化實(shí)例”。4.2 開(kāi)發(fā)范式的潛在變化更關(guān)注算法-硬件協(xié)同當(dāng)?shù)讓佑布兊酶佣鄻雍吞鼗瘯r(shí)“一份代碼到處運(yùn)行”的便利性可能會(huì)降低但同時(shí)也打開(kāi)了性能優(yōu)化的新天花板。開(kāi)發(fā)者可能需要更關(guān)注模型架構(gòu)的硬件友好性了解不同硬件GPU、TPU、定制ASIC的特性在設(shè)計(jì)或選擇模型時(shí)考慮其計(jì)算和內(nèi)存模式。學(xué)習(xí)使用新的編譯器和優(yōu)化工具為了發(fā)揮定制芯片的性能可能需要使用特定的編譯器如針對(duì)TPU的XLA或模型轉(zhuǎn)換工具。成本評(píng)估維度多元化除了比較“每美元能買到的FLOPs浮點(diǎn)運(yùn)算能力”還需要評(píng)估“每美元能處理的token數(shù)”或“每瓦特能支持的并發(fā)請(qǐng)求數(shù)”這些指標(biāo)與定制硬件的關(guān)系更大。4.3 對(duì)開(kāi)源與學(xué)術(shù)研究的啟示如果Anthropic的芯片取得成功并部分開(kāi)放它可能為開(kāi)源模型和學(xué)術(shù)研究提供一條新的路徑。例如發(fā)布一個(gè)在自家芯片上極度優(yōu)化的模型版本其運(yùn)行效率遠(yuǎn)超通用GPU版本。這可能會(huì)激勵(lì)更多研究圍繞特定硬件展開(kāi)推動(dòng)“算法-硬件協(xié)同設(shè)計(jì)”成為AI研究的一個(gè)重要分支。5. 我們的行動(dòng)指南在變革前夜如何布局面對(duì)這場(chǎng)由巨頭引領(lǐng)的軟硬件協(xié)同變革作為身處其中的開(kāi)發(fā)者、技術(shù)團(tuán)隊(duì)或公司現(xiàn)在可以做些什么建立“算力成本”的敏銳度不要只盯著模型的準(zhǔn)確率或效果。開(kāi)始系統(tǒng)地評(píng)估和監(jiān)控你的AI應(yīng)用在訓(xùn)練和推理階段的真實(shí)算力消耗與成本。這是未來(lái)進(jìn)行技術(shù)選型和優(yōu)化決策的基礎(chǔ)。擁抱抽象但理解底層繼續(xù)使用PyTorch、TensorFlow等高級(jí)框架它們會(huì)盡力屏蔽硬件差異。但同時(shí)要有意識(shí)地去理解不同硬件后端CUDA, ROCm, XLA的基本原理和限制。當(dāng)需要極致優(yōu)化時(shí)這些知識(shí)至關(guān)重要。在架構(gòu)設(shè)計(jì)中預(yù)留靈活性在設(shè)計(jì)AI應(yīng)用或服務(wù)架構(gòu)時(shí)避免與某一種硬件或云服務(wù)商過(guò)度綁定??紤]使用容器化、無(wú)服務(wù)器計(jì)算等云原生技術(shù)使得遷移或切換底層算力資源的代價(jià)相對(duì)可控。關(guān)注異構(gòu)計(jì)算與專用加速即使不造芯片也可以關(guān)注如何在現(xiàn)有硬件上實(shí)現(xiàn)更高效的計(jì)算。例如探索使用CPU、GPU、乃至專用AI加速卡如英特爾Habana Gaudi的混合計(jì)算架構(gòu)或者利用TensorRT、OpenVINO等工具對(duì)推理模型進(jìn)行深度優(yōu)化。保持開(kāi)放學(xué)習(xí)的心態(tài)AI硬件領(lǐng)域正在快速演進(jìn)。保持對(duì)TPU、Habana、GroqLPU、乃至RISC-V生態(tài)等新架構(gòu)的關(guān)注。理解它們的設(shè)計(jì)哲學(xué)和適用場(chǎng)景是為未來(lái)技術(shù)選型積累認(rèn)知資本。Anthropic聘請(qǐng)TPU之父不僅僅是一家公司的戰(zhàn)略動(dòng)向。它是一個(gè)強(qiáng)烈的信號(hào)標(biāo)志著AI行業(yè)正在穿越從“軟件創(chuàng)新”單輪驅(qū)動(dòng)到“軟件與硬件協(xié)同創(chuàng)新”雙輪驅(qū)動(dòng)的關(guān)鍵隘口。未來(lái)的AI領(lǐng)導(dǎo)者很可能既是算法大師也是系統(tǒng)架構(gòu)大師。這場(chǎng)競(jìng)賽的終點(diǎn)不是做出一個(gè)最聰明的“大腦”而是構(gòu)建一個(gè)最高效、最可靠、最經(jīng)濟(jì)的“智能系統(tǒng)”。對(duì)于我們所有人而言理解這場(chǎng)正在發(fā)生的底層變革或許比等待下一個(gè)GPT-5的發(fā)布更能把握住AI真正融入千行百業(yè)的脈搏。