LLM部署:NVIDIA Agent Skills完整指南)
如何在Jetson上完成BSP定制與端側(cè)LLM部署NVIDIA Agent Skills完整指南【免費(fèi)下載鏈接】skillsAgent Skills for NVIDIA products — install into Claude Code, Codex, and other coding agents to run Physical AI, robotics, simulation, CUDA, and RAG workflows end to end.項(xiàng)目地址: https://gitcode.com/gh_mirrors/skills36/skillsNVIDIA Agent Skills 倉庫中的Jetson 系列技能幫助你在 AI 編碼助手Claude Code、Codex 等中一鍵完成 NVIDIA Jetson 的兩大核心任務(wù)從零定制 Jetson BSP 鏡像攝像頭、PCIe、USB、引腳復(fù)用等 I/O 定制以及在 Jetson 端側(cè)部署、調(diào)優(yōu)和壓測大語言模型vLLM / SGLang / Ollama。本文帶你用一套「問問題」的方式把原來要查十幾個官方文檔才能搞定的工作流變成和 AI 助手對話就能跑通的端到端流程。1?? 為什么需要 Jetson 系列技能Jetson 是 NVIDIA 面向邊緣計算的 SoC 平臺AGX Orin、Orin NX、Orin Nano、Thor 等。做兩件事時新手最容易卡住場景傳統(tǒng)做法的痛點(diǎn)技能化的收益BSP 定制做自己的開發(fā)板鏡像要理解 L4T、BCT、DTSI、ODMDATA、pinmux XLSM 等十幾個概念按向?qū)е鸩絾柎鹱詣咏馕鲆_表并生成配置端側(cè) LLM 部署不同 JetPack 版本要用不同容器內(nèi)存參數(shù)全憑猜自動審計內(nèi)存、推薦運(yùn)行時和啟動參數(shù)、標(biāo)準(zhǔn)化壓測該系列共分為BSP 定制組22 個技能和設(shè)備側(cè)組15 個技能組件定義分別見 components.d/jetson-bsp.yml 和 components.d/jetson-device.yml。2?? 快速安裝一條命令接入你的 AI 助手無需手動克隆倉庫使用官方skillsCLI 即可按需安裝npx skills add nvidia/skillsCLI 會列出所有技能供你選擇安裝目標(biāo)。只裝單個技能可以用--skill參數(shù)直接指定例如安裝 LLM 壓測技能npx skills add nvidia/skills --skill jetson-llm-benchmark --yes安裝后在 Claude Code 中執(zhí)行/reload-skills即可生效。更多安裝細(xì)節(jié)見 docs/advanced-install.mdx。3?? 第一部分BSP 定制工作流 —— 打造你自己的 Jetson 鏡像BSP 定制面向「我有自己的載板carrier board要基于官方 BSP 出鏡像」的場景。整套流程由入口技能 jetson-quick-start 統(tǒng)一調(diào)度。3.1 從/jetson-quick-start進(jìn)入向?qū)皆O(shè)置這是 BSP 定制的唯一入口。它會打印免責(zé)聲明刷機(jī)會擦除設(shè)備存儲務(wù)必先備份打開一張點(diǎn)選問卷只問 4 個路由關(guān)鍵問題modeAuto Setup全新環(huán)境自動下載/Guided Setup已有素材/Use Existing Workspace工作區(qū)已就緒active_platform選擇芯片型號Orin 或 Thor 全列表bsp_release指定 BSP 發(fā)布版本如38.4、R36.4.4custom_carrier是否有自定義載板把答案打包成quick_start_prefill分發(fā)給下游技能。 設(shè)計亮點(diǎn)quick-start 本身不下載、不編譯、不改任何文件只負(fù)責(zé)問對問題、路由正確真正的活由專門技能完成。3.2 下載 BSP 并初始化工作區(qū)問卷提交后Auto Setup 路徑會依次執(zhí)行順序技能職責(zé)1jetson-set-target / jetson-init-target切換或創(chuàng)建目標(biāo)平臺 Profile2jetson-download-bsp從官方檔案下載對應(yīng) BSP 并校驗(yàn)平臺兼容性3jetson-init-image解壓鏡像、跑apply_binaries.sh落地 rootfs4jetson-init-source落地 BSP 源碼樹5jetson-link-docs綁定載板原理圖、pinmux 表格等文檔6jetson-generate-kb生成知識庫供后續(xù)技能查詢3.3 I/O 定制引腳、USB、PCIe、攝像頭一次配齊綁定了載板文檔后quick-start 會建議按「先 pinmux 和 UPHY再按控制器分支」的順序定制。每個定制技能都會解析官方 pinmux XLSM 表格逐引腳問答并直接生成 BCT DTSI 配置jetson-customize-pinmux每引腳 SFIO / 方向 / 初始狀態(tài)一次產(chǎn)出 pinmux、gpio、padvoltage 三份 DTSIjetson-customize-usbUSB2 / USB3 端口啟用與禁用jetson-customize-pciePCIe 控制器接線jetson-customize-mgbe多千兆網(wǎng) PHY 接線jetson-customize-cameraCSI / MIPI 攝像頭傳感器點(diǎn)亮jetson-customize-uphy通過 ODMDATA 配置 UPHY 通道分配。此外還有 jetson-customize-clocks時鐘、jetson-customize-fan風(fēng)扇、jetson-customize-nvpmodel性能模式、jetson-derive-carrier派生自定義載板等配套技能。3.4 編譯、刷寫與驗(yàn)證階段技能說明編譯jetson-build-source構(gòu)建定制后的 BSP刷寫jetson-flash-image將鏡像刷入目標(biāo)設(shè)備?? 會擦除存儲驗(yàn)證jetson-validate-image校驗(yàn)刷寫結(jié)果晉級jetson-promote-image將驗(yàn)證通過的鏡像晉級為正式版本4?? 第二部分端側(cè) LLM 部署 —— 在 Jetson 上跑大模型設(shè)備側(cè)技能面向已經(jīng)開機(jī)的 Jetson形成一條「體檢 → 省內(nèi)存 → 選運(yùn)行時 → 起服務(wù) → 壓測 → 加速」的閉環(huán)。4.1 設(shè)備快照與內(nèi)存審計先量后治jetson-diagnostic只讀健康快照一次性覆蓋身份、內(nèi)存、GPU、溫度、功耗、存儲、服務(wù)狀態(tài)替代你記住tegrastats/jtop/nvpmodel各自的輸出含義jetson-memory-audit測量 DRAM / NvMap 實(shí)際占用并驗(yàn)證「停掉 vLLM 后內(nèi)存真的釋放了嗎」——它還專門處理了舊版 JetPack 上 CUDA 進(jìn)程退出后內(nèi)存「假性不釋放」的經(jīng)典坑自動給出drop_caches修復(fù)建議jetson-headless-mode關(guān)閉 GUI 等桌面服務(wù)把寶貴的 DRAM 讓給模型。4.2 選擇推理運(yùn)行時技能幫你按芯片「對號入座」jetson-llm-serve 內(nèi)置了按芯片代際的運(yùn)行時選擇規(guī)則Jetson 家族推薦運(yùn)行時ThorT5000 / T4000上游 vLLM 0.20 或 NVIDIA SGLang 26.01適合 RAG、工具調(diào)用OrinJetPack 7.2 / L4T r39上游 vLLM 0.20vllm/vllm-openai:latest更老的 OrinNVIDIA-AI-IOT 預(yù)構(gòu)建 vLLM 容器自帶匹配的 CUDA/cuDNN/TensorRT 棧配合 jetson-inference-mem-tune讀取內(nèi)存審計的 JSON 快照自動推薦「用哪個運(yùn)行時 傳哪些內(nèi)存參數(shù)」比如 vLLM 報 OOM 時它會直接給出--gpu-memory-utilization和--max-model-len的具體取值甚至建議換到更省內(nèi)存的 llama.cpp GGUF 路線。4.3 啟動 OpenAI 兼容服務(wù)技能給出的標(biāo)準(zhǔn)部署套路對 LLM 和 VLM 均適用切到 MAXN 滿血功耗模式nvpmodel -m 0 jetson_clocks否則基準(zhǔn)數(shù)據(jù)不可復(fù)現(xiàn)用 Docker 啟動服務(wù)監(jiān)聽0.0.0.0:8000得到 OpenAI 兼容端點(diǎn)http://jetson-ip:8000/v1直接對接 Open WebUI 或你自己的應(yīng)用用curl http://localhost:8000/v1/models驗(yàn)證模型在線。4.4 性能基準(zhǔn)測試結(jié)構(gòu)化 JSON 輸出jetson-llm-benchmark 內(nèi)置三套壓測腳本分別對應(yīng) vLLMbench_vllm.sh、llama.cppbench_llama_cpp.sh、Ollamabench_ollama.sh自動處理預(yù)熱和容器選擇輸出結(jié)構(gòu)化 JSONTTFT、TPOT、吞吐量方便在改參數(shù)前后橫向?qū)Ρ取?.5 進(jìn)階推測解碼把吐字速度再提一檔jetson-speculative-decoding 面向「首 token 很快、但逐字生成太慢」的場景用小的 draft 模型先猜 token目標(biāo)模型一次前向驗(yàn)證。關(guān)鍵約束技能會替你把關(guān)只適用于Thor 或 AGX Orin——Orin Nano/NX 的顯存裝不下目標(biāo)模型 draft 模型只適合單流或低并發(fā)≤2高并發(fā)下批量解碼反而更快開啟前先用jetson-llm-benchmark留一份基線改完對比 TPOT 是否真的下降。4.6 附贈視頻推理與打包技能設(shè)備側(cè)還有完整的多媒體線jetson-video-capability查解碼能力、jetson-video-setup、jetson-video-pipeline、jetson-video-benchmark以及 jetson-package 指導(dǎo)你把運(yùn)行環(huán)境打包成可分發(fā)的形態(tài)。5?? 技能速查表分類核心技能BSP 入口jetson-quick-start、jetson-set-targetBSP 下載/初始化jetson-download-bsp、jetson-init-image、jetson-init-source、jetson-link-docsI/O 定制jetson-customize-pinmux、jetson-customize-camera、jetson-customize-pcie、jetson-customize-usb刷寫驗(yàn)證jetson-flash-image、jetson-validate-image、jetson-promote-image設(shè)備體檢jetson-diagnostic、jetson-memory-audit、jetson-headless-modeLLM 部署jetson-llm-serve、jetson-inference-mem-tune、jetson-llm-benchmark、jetson-speculative-decoding6?? 常見問題FAQQ1BSP 定制會弄壞我的設(shè)備嗎刷寫操作會擦除目標(biāo)設(shè)備存儲。技能在入口處強(qiáng)制顯示免責(zé)聲明并要求你確認(rèn)且會反復(fù)提醒你核對目標(biāo)平臺、BSP 版本和硬件狀態(tài)后再執(zhí)行刷寫。Q2Orin Nano 8GB 能跑 7B 模型嗎可以問 jetson-inference-mem-tune——它會基于真實(shí)內(nèi)存審計結(jié)果推薦 llama.cpp GGUF 4-bit 這類低內(nèi)存路線并給出具體啟動參數(shù)。Q3停掉 vLLM 后free -h顯示內(nèi)存沒回來這是舊版 JetPack7.2 之前上最常見的「內(nèi)存假死」jetson-memory-audit 已內(nèi)置根因解釋和驗(yàn)證步驟。Q4技能會替我盲改配置文件嗎不會。所有技能生成的計劃、命令、diff 都需你確認(rèn)后才落地官方文檔與工程評審始終優(yōu)先。7?? 寫在最后NVIDIA Agent Skills 的 Jetson 系列把「查文檔、背參數(shù)、踩坑」變成了「提問、確認(rèn)、執(zhí)行」BSP 側(cè)用 jetson-quick-start 一條向?qū)Т?22 個定制技能設(shè)備側(cè)用「審計 → 調(diào)優(yōu) → 服務(wù) → 壓測」閉環(huán)搞定端側(cè) LLM。建議先安裝jetson-quick-start和jetson-llm-serve這兩個入口技能跑通體驗(yàn)再按需補(bǔ)齊其余技能。技能目錄持續(xù)更新中完整清單可參考倉庫根目錄的 skills.sh.json 與 skills/README.md?!久赓M(fèi)下載鏈接】skillsAgent Skills for NVIDIA products — install into Claude Code, Codex, and other coding agents to run Physical AI, robotics, simulation, CUDA, and RAG workflows end to end.項(xiàng)目地址: https://gitcode.com/gh_mirrors/skills36/skills創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考