
簡介面向AI初學者與本地部署愛好者的DeepSeek完整落地教程以保姆級方式講解從零開始在個人電腦上部署DeepSeek、配置WebUI可視化界面并借助nomic-embed-text與AnythingLLM完成數(shù)據(jù)投喂訓練。資源為單一docx文檔共1個文件壓縮包大小2.76MB內(nèi)容按本地部署、WebUI可視化、數(shù)據(jù)投喂訓練三大模塊展開包含Ollama安裝與模型選型、Page Assist插件配置、AnythingLLM工作區(qū)搭建及知識庫嵌入等關鍵環(huán)節(jié)步驟清晰且附有命令行示例與界面操作說明即使無AI基礎也能按圖索驥。目前已有1186人學習下載適合希望擺脫官方服務不穩(wěn)定、追求本地運行與個性化知識庫的玩家收藏使用。1. DeepSeek 本地部署與其在網(wǎng)頁端排隊不如把它裝進自己的機器最近 DeepSeek 的熱度不用我多說了網(wǎng)頁端動不動就是“服務器繁忙”高峰時段一個問句要轉(zhuǎn)半天才出結(jié)果。其實 DeepSeek 是開源模型完全可以在本地部署大語言模型把對話、知識庫、訓練數(shù)據(jù)全部攥在自己手里。這篇文章要把整條鏈路拆開講清楚用 Ollama 部署 DeepSeek-R1、用 Page Assist 做 WebUI 可視化再用 AnythingLLM 配合 nomic-embed-text 做數(shù)據(jù)投喂訓練 AI。整個過程不涉及改代碼、不需要懂 Transformer 原理只要你有一臺 Windows 電腦跟著步驟走就能拿到一個隨時能對話、還能查看并回答自己私有文檔內(nèi)容的專屬大模型。這也是近兩個月我?guī)团笥押屯麓盍似甙颂字笳沓鰜淼囊粭l最穩(wěn)的路徑。2. 從零裝好 Ollama 并拉取 DeepSeek-R1命令、選型與顯存邊界2.1 為什么先裝 Ollama本地大模型運行時的角色拆解大模型不是一個安裝包雙擊就能跑的。它下載下來是幾十 GB 的權重文件運行時要加載到顯存、做推理、管理上下文長度這些工作如果讓你手動做得配置 Python 環(huán)境、下載 PyTorch、寫推理腳本新手基本勸退。Ollama 做的事就是把“下載模型、加載模型、運行模型”這三件事封裝成一條命令它底層調(diào)用 llama.cpp 這類推理引擎對外只暴露一個簡潔的 CLI 和本地 HTTP API。你只要裝好 Ollama之后無論是用命令行直接對話還是讓 WebUI、知識庫工具通過接口調(diào)用模型都由它統(tǒng)一托管省掉大量環(huán)境折騰。我一般會把它理解為“本地大模型的 Docker”你不用關心權重文件放在哪個目錄、CUDA 版本對不對、模型量化格式是什么Ollama 全包了。說個選型理由目前本地部署大語言模型的方案不少有寫 Python 腳本直接調(diào) transformers 的有用 vLLM 做高性能推理的但新手最穩(wěn)的路徑就是 Ollama。它對 Windows 支持好、顯存不足時會自動退到 CPU 推理慢而已官方模型庫一行命令就能拉模型而且用戶基數(shù)大出問題隨便一搜就是別人的踩坑記錄不用你一個人對著黑匣子發(fā)愁。2.2 安裝與驗證三步確認環(huán)境沒問題到 Ollama 官網(wǎng) https://ollama.com 下載 Windows 安裝包安裝過程沒什么可選的一路下一步就行。安裝完成后打開 Windows 自帶的命令行工具cmd 或 PowerShell輸入# 驗證 Ollama 是否安裝成功 ollama --version正常情況下會輸出類似ollama version 0.x.x的版本號。如果提示“不是內(nèi)部或外部命令”說明安裝路徑?jīng)]加進系統(tǒng)環(huán)境變量 PATH重新開一個終端窗口再試還不行就找到 Ollama 的安裝目錄默認在C:\Users\你的用戶名\AppData\Local\Programs\Ollama手動把這個路徑加進系統(tǒng)環(huán)境變量。Ollama 安裝好之后默認在本機監(jiān)聽11434端口這個信息后面配置 Page Assist 和 AnythingLLM 都要用。想確認服務真的在跑瀏覽器訪問http://localhost:11434能看到一行Ollama is running的提示就代表正常。提示Ollama 默認監(jiān)聽 11434 端口后續(xù) WebUI 和知識庫工具都通過這個端口與模型通信如果哪一步連不上模型先回來看這個端口通不通。2.3 按顯存選 DeepSeek 版本1.5b 到 671b 的取舍Ollama 裝好后下一步是選模型版本。DeepSeek-R1 系列從 1.5b 一直到 671b參數(shù)量差了幾百倍顯存需求也天差地別。你可以在 Ollama 官網(wǎng)的 Models 頁面找到 DeepSeek-R1 模型詳情它會列出每個 tag 對應的參數(shù)量和推薦顯存。我的選型經(jīng)驗是這樣4GB-6GB 顯存老老實實選 1.5b8GB 顯存可以試 7b16GB 以上再考慮 14b 或 32b至于 671b 滿血版那是多卡服務器的事普通 PC 不用想。這里的 bbillion指參數(shù)量參數(shù)量越大模型推理時占用顯存越高回答質(zhì)量也相對越好。本地部署的核心矛盾永遠是“你的硬件能跑得起多大的模型”。我自己用的是 4GB 顯存的 Windows 筆記本所以全程以 1.5b 版本為基準寫操作步驟。下面這張表是我常用的參考模型版本參數(shù)量建議顯存典型用途deepseek-r1:1.5b1.5B4GB 以上簡單對話、文本分類、文檔問答deepseek-r1:7b7B8GB - 12GB日常問答、代碼片段生成deepseek-r1:14b14B16GB 以上較復雜推理、長文本理解deepseek-r1:32b32B24GB 以上高質(zhì)量問答、知識庫分析deepseek-r1:671b671B多卡服務器滿血版本地幾乎不看注意表里的顯存建議是“模型全量加載到 GPU”的情況。如果顯存不夠Ollama 會自動把部分層放到 CPU 上跑也能出結(jié)果但速度會明顯下降后面避坑章節(jié)我會詳細說這個現(xiàn)象的典型表現(xiàn)。2.4 拉取 DeepSeek-R1 模型并完成首次命令行對話決定好版本之后直接復制 Ollama 頁面上的模型名在命令行執(zhí)行拉取命令# 拉取 1.5b 版本對應原文中 4GB 顯存的例子 ollama pull deepseek-r1:1.5b顯存更大就改成deepseek-r1:7b或deepseek-r1:14bpull命令不區(qū)分模型大小只是下載的數(shù)據(jù)量不同。下載過程中看不到百分比進度條是正常的它只會顯示連接狀態(tài)耐心等即可。如果不小心關掉了窗口重新執(zhí)行一次ollama pull會從斷點繼續(xù)不用從頭拉。下載完成后直接執(zhí)行# 進入交互式對話模式 ollama run deepseek-r1:1.5b這個命令會進入一個命令行聊天界面你輸入一句它回一句行為和網(wǎng)頁端 DeepSeek 類似只是沒有圖形界面。第一次運行需要加載模型4GB 顯存跑 1.5b 大概 5 到 10 秒出結(jié)果速度可以接受。確認能對話之后命令行這一層就算跑通了接下來加 WebUI。3. WebUI 可視化用 Page Assist 給 DeepSeek 裝一個瀏覽器界面3.1 命令行交互的痛點與 WebUI 選型命令行能跑通但這離“好用”還差得遠。ollama run這種交互方式有幾個明顯問題第一沒有對話歷史列表對話一長就翻不到前面的內(nèi)容第二不直觀想引用一張圖或一段網(wǎng)頁內(nèi)容都做不到第三日常用很別扭每句話都得在終端里敲。所以我建議加一層 WebUI。目前社區(qū)里最常見的兩個方案是 Open WebUI 和 Page Assist。Open WebUI 功能很強但需要 Docker 或 Python 環(huán)境安裝門檻略高Page Assist 是瀏覽器插件直接從 Chrome/Edge 擴展商店裝代碼倉庫在 https://github.com/n4ze3m/page-assist面向的就是 Ollama 這類本地推理引擎。裝好后能在瀏覽器側(cè)邊欄里和本地模型對話還能讀取當前網(wǎng)頁內(nèi)容、和 PDF 對話對大部分開發(fā)者來說功能密度足夠覆蓋日常需求了。我之所以推薦 Page Assist核心原因是它不需要額外起服務不用配端口、不用管 Docker 容器一個插件解決可視化訴求非常適合新手。3.2 安裝 Page Assist 并接入 Ollama操作路徑打開 Chrome 或 Edge 瀏覽器進入擴展管理頁面地址欄輸入edge://extensions或chrome://extensions搜索 Page Assist點擊獲取安裝。裝完擴展列表里會出現(xiàn) Page Assist 的圖標點擊圖標打開側(cè)邊欄對話界面。打開之后頁面上有模型選擇下拉框。如果里面沒有 DeepSeek 模型檢查兩件事一是確認 Ollama 服務在運行二是確認模型已經(jīng)下載成功。Page Assist 通過 Ollama 的本地 API 自動發(fā)現(xiàn)已安裝模型正常情況下列表里會直接出現(xiàn)deepseek-r1:1.5b。選擇模型后直接輸入問題即可對話。本質(zhì)上是 Page Assist 把瀏覽器里的對話請求轉(zhuǎn)發(fā)給 Ollama 的http://localhost:11434/api/chat接口模型推理完再把結(jié)果渲染到側(cè)邊欄。整個鏈路里沒有遠程服務器參與所有對話都在本機完成。這里有個值得注意的細節(jié)如果 Page Assist 連不上本地服務去 Ollama 的環(huán)境變量里檢查一下OLLAMA_HOST是否被改過默認應該是127.0.0.1:11434。3.3 聯(lián)網(wǎng)開關與視覺支持的邊界Page Assist 的側(cè)邊欄下方有一個“聯(lián)網(wǎng)”開關打開后它會把當前網(wǎng)頁的內(nèi)容作為上下文一并交給本地模型再讓模型結(jié)合網(wǎng)頁內(nèi)容回答。我建議這樣用搜索類任務打開聯(lián)網(wǎng)讓模型先讀當前頁面再做總結(jié)純知識問答保持關閉即可這樣響應更快也更穩(wěn)定。需要說清楚的一點聯(lián)網(wǎng)開關并沒有讓 DeepSeek 真正“上網(wǎng)”只是讓模型多了一個網(wǎng)頁內(nèi)容來源。DeepSeek-R1 的訓練數(shù)據(jù)有截止時間點對于之后的新信息唯一能讓它“知道”的辦法就是把內(nèi)容喂給它——無論是開 Page Assist 的聯(lián)網(wǎng)開關還是后面 AnythingLLM 的數(shù)據(jù)投喂本質(zhì)都是給模型看它沒見過的資料。另外Page Assist 支持視覺模型但 DeepSeek-R1 文本版不支持圖片輸入。如果你想用截圖識別、圖片問答這類能力需要額外拉一個支持視覺的模型比如llava或qwen2-vl。這個屬于進階玩法新手先把文本鏈路跑通后面有需求再補。4. 數(shù)據(jù)投喂訓練 AIAnythingLLM 與 nomic-embed-text 搭建私有知識庫4.1 方案鏈路拆解為什么一定要嵌入模型“數(shù)據(jù)投喂訓練 AI”這個詞其實容易讓人誤解。嚴格來說接下來做的不是改模型權重不是重新訓練而是把文檔切塊、向量化、存進向量數(shù)據(jù)庫在問答時檢索最相關的文本片段把片段作為上下文交給大模型讓它基于你的私有資料回答。這套方案的專業(yè)叫法是 RAG檢索增強生成對新手最友好因為它不需要額外訓練、不需要改權重卻能實現(xiàn)“AI 能看懂我的文檔”的效果。在這條鏈路里nomic-embed-text 扮演的角色是“把文本變成向量”的嵌入模型。文檔投喂進系統(tǒng)時每段文字都要統(tǒng)一編碼成一組數(shù)字向量這樣才能計算相似度、才能被檢索出來。AnythingLLM 本身不內(nèi)置嵌入模型它通過 Ollama 調(diào)用 nomic-embed-text 完成文檔向量化。這也是為什么在執(zhí)行數(shù)據(jù)投喂之前要先ollama pull nomic-embed-text。4.2 拉取嵌入模型并安裝 AnythingLLM先執(zhí)行命令拉取嵌入模型# 拉取 nomic-embed-text 嵌入模型 ollama pull nomic-embed-text這個模型很小幾百 MB下載很快。嵌入模型和對話模型是兩類角色對話模型負責“生成回答”嵌入模型負責“理解并向量化文本”兩者缺一不可。拉取完之后去 AnythingLLM 官網(wǎng)下載對應 Windows 版本的安裝包。安裝過程中有一個細節(jié)默認安裝路徑在 C 盤可以在向?qū)Ю锇崖窂绞鬃帜父某善渌P符比如F:\AnythingLLM避免把模型數(shù)據(jù)和應用全堆在系統(tǒng)盤。安裝完打開軟件首次啟動有個引導界面點擊 Get started然后輸入工作區(qū)名稱。工作區(qū)相當于一個獨立的項目空間每個工作區(qū)可以投喂不同數(shù)據(jù)集、指定不同模型互不干擾。之后進入主界面如果顯示英文點左下角設置Settings在 Customization 里把語言切換成 Chinese重啟軟件生效。4.3 三處關鍵配置LLM、Embedder 與代理AnythingLLM 的主界面需要配置三層每一層都指向 Ollama 提供的本地服務。第一層是全局 LLM 設置進入“設置” - “LLM 首選項”提供商選OllamaOllama Model 選擇下載好的deepseek-r1:1.5b保存更改。含義是所有對話默認用這個模型推理。第二層是 Embedder 設置在“Embedder 首選項”里提供商選Ollama嵌入模型選nomic-embed-text保存。第三層是工作區(qū)級別的模型覆蓋在工作區(qū)設置里選“聊天設置”把工作區(qū) LLM 提供者、聊天模型都設為 Ollama 和 deepseek-r1點 Update workspace agent代理配置同樣指向 Ollama 和 deepseek-r1。這層的意義是讓每個工作區(qū)可以獨立覆蓋全局設定多個項目的數(shù)據(jù)不會串味。不配置代理模型一般不影響基本對話但 AnythingLLM 的 Agent 功能也就是讓 AI 執(zhí)行多步操作、調(diào)用工具的能力依賴這個字段。建議新人一并配齊省得后面要用時再回來補。4.4 上傳文檔與向量化投喂完整操作步驟配置完成后回到工作區(qū)主界面點“上傳”按鈕選擇需要投喂的文檔。AnythingLLM 支持 PDF、TXT、Word、Excel、PPT 等常見格式文本類文件基本通吃。文件上傳后會出現(xiàn)在臨時文件列表里勾選要投喂的文件點擊 Move to Workspace 把文件移入當前工作區(qū)然后再點 Save and Embed 執(zhí)行向量化。所謂 Embed就是把文檔切塊并調(diào)用 nomic-embed-text 生成向量存入 AnythingLLM 自帶的向量數(shù)據(jù)庫。這一步就是“數(shù)據(jù)投喂訓練 AI”的字面執(zhí)行。執(zhí)行完之后關掉文檔窗口直接在對話框提問。如果你問的問題在文檔里有明確答案AnythingLLM 會先檢索相關片段再把片段拼進 prompt 交給 deepseek-r1 生成回答。這套方案的邊界是它擅長回答文檔中有原文依據(jù)的問題文檔里沒提到的內(nèi)容模型會退化回自己的常識回答甚至明確告訴你不知道。這不算缺陷反而是 RAG 方案的安全邊界防止模型把知識庫之外的內(nèi)容編造出來。5. 避坑與排查從“拉不下來”到“答非所問”的五條實戰(zhàn)記錄5.1 現(xiàn)象ollama pull卡住不動提示網(wǎng)絡錯誤原因Ollama 拉取模型走的是官方模型倉庫國內(nèi)網(wǎng)絡訪問時鏈路不穩(wěn)定尤其在大模型下載過程中經(jīng)常中斷。解決我的習慣分三步。第一步重新執(zhí)行ollama pullOllama 支持斷點續(xù)傳多試幾次經(jīng)常能拉完第二步如果反復失敗檢查 Ollama 的環(huán)境變量看是否配置了OLLAMA_MODELS指向的模型存儲路徑有足夠磁盤空間同時可以在 Ollama 官方文檔里查詢鏡像倉庫配置方式換一個訪問更快的鏡像源第三步實在不行換個網(wǎng)絡環(huán)境比如手機熱點拉通之后再切回原網(wǎng)絡。這個坑基本每個新手都會遇到是網(wǎng)絡環(huán)境問題不是配置錯誤不用反復懷疑自己。5.2 現(xiàn)象模型加載成功但回答速度極慢一個字一個字往外蹦原因顯存不夠Ollama 自動把部分層放到了 CPU 上推理。4GB 顯存跑 7b 就是這種體驗能出結(jié)果但基本沒法用。解決回到選型環(huán)節(jié)把模型換成deepseek-r1:1.5b或者關掉其他占用顯存的軟件瀏覽器多開標簽頁也會吃顯存再或者把 Ollama 的并行參數(shù)OLLAMA_NUM_PARALLEL設置為 1減少并發(fā)任務對顯存的占用。我自己的測試里4GB 顯存跑 1.5b 流暢對話跑 7b 基本不可用所以在選版本這件事上寧小勿大先跑通再升級。5.3 現(xiàn)象文檔投喂完之后提問時 AI 還是回答不上來原因常見有三種。第一種投喂后沒點 Save and Embed文檔只是上傳了沒做向量化檢索不到內(nèi)容第二種提問的措辭和文檔原文差異太大嵌入檢索匹配不上第三種對話界面選錯了工作區(qū)當前工作區(qū)里根本沒有投喂數(shù)據(jù)。解決重新確認上傳流程三步都執(zhí)行完畢特別是最后的 Save and Embed提問時盡量用文檔里的原詞比如文檔寫的是“正點原子”你問“這家公司是做什么的”能答出來但換一個完全不同的說法可能就匹配不上最后確認對話界面對應的就是投喂數(shù)據(jù)的工作區(qū)。5.4 現(xiàn)象Page Assist 打開聯(lián)網(wǎng)開關后回答質(zhì)量反而變差原因聯(lián)網(wǎng)后模型收到了當前網(wǎng)頁的大段無關文本作為上下文這些干擾文本沖淡了模型對問題的理解回答自然跑偏。解決聯(lián)網(wǎng)開關保持關閉只在需要總結(jié)當前網(wǎng)頁內(nèi)容時開啟。頁面內(nèi)容過長時手動復制關鍵段落投喂給模型效果比讓模型讀全文好得多。這里有個經(jīng)驗RAG 的關鍵不是給更多內(nèi)容而是給更相關的內(nèi)容。5.5 現(xiàn)象AnythingLLM 界面全英文找不到中文選項原因語言選項藏在 Customization 外觀定制菜單里而不是 Settings 首頁新用戶容易忽略。解決進入 Settings - Customization找到 Language 或語言下拉框選擇 Chinese保存后重啟 AnythingLLM。如果你的版本里連這個選項都沒有確認安裝的是最新版舊版本對中文界面支持不完整。6. 驗證投喂成果與兩條進階玩法把 AI 變成團隊的文檔庫驗證整套本地部署值不值得關鍵看你能不能從“能對話”走到“能用”。我自己驗證投喂效果的方式很簡單問一個只有文檔里才有的答案。比如投喂的是公司介紹文檔里面有句“正點原子成立于某年某地”我就問“正點原子公司成立于哪一年、在哪個城市”。如果 AI 能準確回復出來說明嵌入、檢索、生成這條鏈路全通了如果回得不對回到上一章的 5.3 逐項排查。進階玩法第一個是多工作區(qū)隔離。AnythingLLM 支持每個工作區(qū)獨立投喂數(shù)據(jù)、獨立選模型我一般每個項目開一個工作區(qū)項目 A 的合同文本放工作區(qū) A項目 B 的技術手冊放工作區(qū) B兩邊提問互不干擾。這個做法對團隊協(xié)作特別實用相當于給每個項目建了一個獨立的私有知識庫。第二個進階玩法是把 Ollama 的能力接進自己的腳本。Ollama 在 11434 端口提供 OpenAI 兼容 APIAnythingLLM 之外的代碼也能直接調(diào)用。比如用 Python 的ollama庫或 Node 的ollama/ollama-js在腳本里封裝對話請求把本地模型嵌入到業(yè)務流程中。我做一個日報自動生成工具時就是這么干的腳本讀取項目文檔調(diào)用本地deepseek-r1:1.5b生成摘要再寫入 Excel全程不出本機不產(chǎn)生任何 API 費用。從那以后我每次幫人部署本地大模型都強制走一遍“裝 Ollama - 拉模型 - 接 WebUI - 建工作區(qū) - 投喂測試文檔”的完整流程。這套流程看著長跑熟了一次不到二十分鐘但能確保每一層環(huán)境都是通的而不是只在命令行里能回話。希望這篇教程里的鏈路和坑位記錄能幫到你特別是第一次碰本地大模型的朋友按著文檔一步步來大概率不會再翻車。本文還有配套的精品資源點擊獲取