檢測(cè)實(shí)戰(zhàn):基于YOLO與PyTorch的深度學(xué)習(xí)方案)
簡(jiǎn)介面向Python深度學(xué)習(xí)初學(xué)者的番茄葉片病害目標(biāo)檢測(cè)完整項(xiàng)目基于YOLO與PyTorch實(shí)現(xiàn)涵蓋數(shù)據(jù)集制作、模型訓(xùn)練與PyQt可視化識(shí)別全流程。壓縮包共1470個(gè)文件、約40.55MB包含730張jpg葉片圖像、363個(gè)txt標(biāo)簽、358個(gè)xml標(biāo)注文件、3個(gè)YOLO配置文件、3個(gè)Python腳本及3個(gè)已訓(xùn)練模型pt權(quán)重其中數(shù)據(jù)劃分腳本可自動(dòng)將原始標(biāo)注轉(zhuǎn)為YOLO格式并生成訓(xùn)練/驗(yàn)證集訓(xùn)練腳本輸出results.csv、驗(yàn)證集預(yù)測(cè)圖與TensorBoard事件文件便于直觀評(píng)估模型效果。已有110人學(xué)習(xí)下載適合需要快速搭建植株病害識(shí)別實(shí)驗(yàn)、熟悉YOLO訓(xùn)練流程或開展畢業(yè)設(shè)計(jì)/課程項(xiàng)目的讀者。通過(guò)運(yùn)行代碼既能了解數(shù)據(jù)標(biāo)注格式轉(zhuǎn)換與訓(xùn)練參數(shù)調(diào)優(yōu)方法也能直接使用PyQt界面加載圖片完成病害類別檢測(cè)是一份從理論到部署的綜合性參考樣例。1. 番茄葉片病害目標(biāo)檢測(cè)別急著解壓跑模型先搞清楚這個(gè)方案在解決什么拿到“基于python深度學(xué)習(xí)對(duì)番茄葉片病害目標(biāo)檢測(cè)-含數(shù)據(jù)集和代碼.zip”這個(gè)壓縮包我勸你別急著解壓敲訓(xùn)練命令。農(nóng)業(yè)視覺項(xiàng)目里決定模型能不能用的往往不是深度學(xué)習(xí)算法本身而是數(shù)據(jù)集里那些框得歪歪扭扭的標(biāo)注。這個(gè)方案本身很直白輸入番茄葉片照片用 python 做目標(biāo)檢測(cè)框出早疫病、晚疫病、細(xì)菌性斑點(diǎn)等病害的位置和類別輸出帶預(yù)測(cè)框和置信度的結(jié)果圖。它對(duì)應(yīng)的是農(nóng)業(yè)巡檢里的真實(shí)痛點(diǎn)人工逐葉翻看效率低病害特征又非常相似肉眼很容易把早疫病和晚疫病看混。適合誰(shuí)的場(chǎng)景本科或研究生階段做農(nóng)業(yè)AI課題的學(xué)生想給溫室或大棚配一個(gè)低成本病害篩查工具的工程師以及剛接觸深度學(xué)習(xí)、恰好拿到一份帶數(shù)據(jù)集和代碼的初學(xué)者。在動(dòng)手訓(xùn)練之前先想清楚模型選型、數(shù)據(jù)格式、訓(xùn)練參數(shù)、問題排錯(cuò)、結(jié)果驗(yàn)證這五步后面才能少走彎路。2. 選型決定省力程度目標(biāo)檢測(cè)模型、框架與標(biāo)注工具怎么配很多人拿到包含數(shù)據(jù)集和代碼的項(xiàng)目包第一反應(yīng)是“用什么模型更?!?。真實(shí)經(jīng)驗(yàn)恰恰相反選型階段省下來(lái)的力氣最后都會(huì)在數(shù)據(jù)清洗階段加倍還回來(lái)。番茄葉片病害檢測(cè)有兩個(gè)明顯特征一是目標(biāo)在整張圖里占比小葉片邊緣還有卷曲、陰影和露水反光二是病害類別之間的視覺差異極小早疫病和晚疫病都呈現(xiàn)為葉片上的同心環(huán)紋連人都容易看錯(cuò)。這種場(chǎng)景下模型選型要優(yōu)先考慮標(biāo)注成本低、迭代速度快、單卡能訓(xùn)練而不是單純追求 mAP 刷高多少。2.1 YOLO 為什么是番茄葉片的默認(rèn)答案和 Faster R-CNN、SSD 放在一起看先給結(jié)論這類項(xiàng)目我一般會(huì)把 YOLO 系列作為默認(rèn)選項(xiàng)只有特殊需求才回頭用兩階段檢測(cè)器。原因是病害檢測(cè)對(duì)“框得準(zhǔn)”的要求遠(yuǎn)低于“找得到、分得對(duì)”而 YOLO 把定位和分類放進(jìn)同一個(gè)網(wǎng)絡(luò)里一次推理完成訓(xùn)練只需要一份標(biāo)注框不用為候選區(qū)域生成額外寫采樣邏輯。Faster R-CNN 在極端小目標(biāo)上有理論精度優(yōu)勢(shì)但訓(xùn)練時(shí)要跑 RPN顯存占用和單 epoch 耗時(shí)明顯更高SSD 處于兩者之間工程生態(tài)這些年幾乎不再更新遇到問題連可抄的教程都少。算法定位與分類方式單卡可訓(xùn)性工程生態(tài)適合場(chǎng)景Faster R-CNN兩階段先提候選框再分類一般顯存和耗時(shí)高成熟但配置繁瑣對(duì)精度極致敏感、機(jī)器資源充足SSD單階段多尺度預(yù)測(cè)較好更新停滯已有舊代碼要維護(hù)YOLO 系列單階段anchor-free 演進(jìn)好顯存可控活躍教程和預(yù)訓(xùn)練權(quán)重最全病害檢測(cè)這類快速迭代項(xiàng)目選 YOLO 而不是更花哨的模型還有個(gè)務(wù)實(shí)原因預(yù)訓(xùn)練權(quán)重。COCO 上訓(xùn)出來(lái)的 YOLO 權(quán)重對(duì)葉片紋理、莖稈背景已經(jīng)有不錯(cuò)的底層特征提取能力遷移到番茄病害上只需微調(diào)高層幾百?gòu)垐D也能訓(xùn)出能看的初版。相比之下從零訓(xùn)練一個(gè)商業(yè)級(jí)模型同樣數(shù)據(jù)量往往連收斂方向都找不到。這項(xiàng)“借用預(yù)訓(xùn)練權(quán)重”的能力也是標(biāo)題里“深度學(xué)習(xí)”三個(gè)字價(jià)值最大的地方。不過(guò)這里有個(gè)邊界要認(rèn)清如果你最終要做的不只是框出病害還要統(tǒng)計(jì)病斑面積占比那就得換成 YOLO-seg 這類實(shí)例分割模型檢測(cè)框給不了像素級(jí)面積。2.2 框架、標(biāo)注工具、硬件搭配給純小白的選型清單框架上我默認(rèn) PyTorch。不否認(rèn) TensorFlow 在工業(yè)部署里也有一席之地但 YOLO 系工程幾乎全部以 PyTorch 實(shí)現(xiàn)網(wǎng)上能被搜到的“超詳細(xì)配置教程”大多也是這條路線。PyTorch 的調(diào)試手感也更適合入門print 一個(gè)張量的 shape 立刻就知道數(shù)據(jù)流到哪一步出了錯(cuò)斷點(diǎn)打在 loss.backward() 前后能直接看到梯度是否消失這份直覺對(duì)第一次做目標(biāo)檢測(cè)的人非常重要。標(biāo)注工具方面常見做法是先用 LabelImg 這類輕量工具把最初的 200 張圖標(biāo)完再換 X-AnyLabeling 這類帶自動(dòng)輔助標(biāo)注的工具做增量擴(kuò)充。工具選型不用糾結(jié)能導(dǎo)出 YOLO 格式 txt 就行。關(guān)鍵在導(dǎo)出后必須看一遍標(biāo)注文件類別 ID 有沒有和類別名錯(cuò)位、框的坐標(biāo)是不是負(fù)數(shù)、葉片重疊區(qū)域有沒有漏標(biāo)。如果數(shù)據(jù)集是多批次采集的還要注意批次間的光照和色溫差異最好在訓(xùn)練前做一次全局的亮度歸一化否則模型會(huì)把“偏暗環(huán)境”當(dāng)成一個(gè)隱性類別。硬件上一張 6GB 顯存的顯卡就夠完成訓(xùn)練沒有 GPU 就用 CPU 先把流程跑通只是速度會(huì)慢幾十倍。真到調(diào)參階段再租卡也不遲。配置環(huán)境時(shí)如果遇到 Windows 報(bào)缺 msvcp140.dll別急著重裝系統(tǒng)裝一下 VC 運(yùn)行庫(kù)就能解決具體在 4.1 小節(jié)細(xì)說(shuō)。2.3 拿到的壓縮包先別訓(xùn)解壓自檢三步第一步看目錄結(jié)構(gòu)。常見做法是數(shù)據(jù)集解壓后出現(xiàn)兩個(gè)頂層目錄images 放圖片labels 放同名 txt 標(biāo)簽各自里面再分 train 和 val。如果壓縮包里的圖片按病害類別分文件夾說(shuō)明它還是分類數(shù)據(jù)集格式得先轉(zhuǎn)成檢測(cè)格式第三章會(huì)給轉(zhuǎn)換腳本。第二步看標(biāo)簽文件的數(shù)值。YOLO 格式的每一行是“類別ID 中心點(diǎn)x 中心點(diǎn)y 框?qū)?框高”坐標(biāo)全部歸一化到 0~1。用文本編輯器隨便開一個(gè) txt如果看到 x_center 大于 1.5、寬度是 0、或者行里的數(shù)字超過(guò) 6 列這份數(shù)據(jù)基本不能直接進(jìn)訓(xùn)練。第三步檢查標(biāo)簽和圖片是否能對(duì)上。統(tǒng)計(jì)每個(gè)類別有多少目標(biāo)順便看圖片尺寸是否統(tǒng)一。快速命令# 統(tǒng)計(jì)訓(xùn)練集圖片數(shù)量 find dataset/images/train -name *.jpg | wc -l # 抽查前 20 個(gè)標(biāo)簽文件里各有多少個(gè)標(biāo)注框 for f in dataset/labels/train/*.txt; do echo $(basename $f): $(wc -l $f); done | head -20 # 按標(biāo)簽文件的第一列聚類統(tǒng)計(jì)每個(gè)類別目標(biāo)總數(shù) cat dataset/labels/train/*.txt | awk {print $1} | sort | uniq -c第一行命令看圖片總量第二行抽查標(biāo)簽框數(shù)量第三行直接用 awk 按第一列聚類得到每個(gè)病害類別在訓(xùn)練集里的目標(biāo)總數(shù)。如果某個(gè)類別只有個(gè)位數(shù)目標(biāo)要盡早決定是擴(kuò)充數(shù)據(jù)還是調(diào) loss 權(quán)重等到訓(xùn)練結(jié)束才發(fā)現(xiàn)類別不平衡前面幾十個(gè) epoch 等于白跑。另外建議用 file 命令抽查幾張圖片的實(shí)際格式防止擴(kuò)展名是 jpg 內(nèi)容卻是 png 的混入情況這類文件在統(tǒng)一縮放的訓(xùn)練流程里會(huì)造成偶發(fā)的解碼報(bào)錯(cuò)。3. 把數(shù)據(jù)集喂給訓(xùn)練腳本目錄重組、格式轉(zhuǎn)換與可視化自查數(shù)據(jù)準(zhǔn)備這個(gè)環(huán)節(jié)最花時(shí)間也最容易被跳過(guò)。我見過(guò)太多人拿到數(shù)據(jù)集后直接開訓(xùn)第一次跑通后才發(fā)現(xiàn)標(biāo)注框畫錯(cuò)了方位回頭改數(shù)據(jù)等于把整個(gè)訓(xùn)練流程重做一遍。與其賭運(yùn)氣不如先花半小時(shí)做三件事把目錄按 YOLO 規(guī)范重組、把非 YOLO 格式的標(biāo)注轉(zhuǎn)成統(tǒng)一 txt、把標(biāo)注可視化逐張看一遍。這三步做完模型訓(xùn)練才算有了一個(gè)可信的輸入。3.1 目錄重組與 train/val 劃分一個(gè)能直接跑的 Python 腳本如果壓縮包里的圖片和標(biāo)注文件在同一目錄、共用同一文件名前綴還要按 8:2 劃分訓(xùn)練集和驗(yàn)證集。下面這份腳本可以直接放到數(shù)據(jù)集根目錄運(yùn)行它會(huì)把圖片和標(biāo)簽同步復(fù)制到 YOLO 要求的布局里。# split_dataset.py import os import shutil import random random.seed(42) # 固定隨機(jī)種子保證多次運(yùn)行劃分一致 src_images raw_data/images # 原始圖片目錄 src_labels raw_data/labels # 原始標(biāo)簽?zāi)夸?out_images dataset/images # 輸出圖片目錄 out_labels dataset/labels # 輸出標(biāo)簽?zāi)夸?for sub in [train, val]: os.makedirs(f{out_images}/{sub}, exist_okTrue) os.makedirs(f{out_labels}/{sub}, exist_okTrue) imgs [f for f in os.listdir(src_images) if f.endswith((.jpg, .jpeg, .png))] imgs.sort() random.shuffle(imgs) val_count max(1, int(len(imgs) * 0.2)) val_imgs set(imgs[:val_count]) for img in imgs: sub val if img in val_imgs else train stem os.path.splitext(img)[0] src_txt os.path.join(src_labels, stem .txt) if not os.path.exists(src_txt): continue # 圖片沒有對(duì)應(yīng)標(biāo)簽時(shí)跳過(guò)避免把臟數(shù)據(jù)帶進(jìn)訓(xùn)練 shutil.copy(os.path.join(src_images, img), os.path.join(out_images, sub, img)) shutil.copy(src_txt, os.path.join(out_labels, sub, stem .txt))邏輯說(shuō)明腳本先按擴(kuò)展名篩出圖片通過(guò) sort 和 random.seed 保證劃分可復(fù)現(xiàn)再按 20% 比例取前 n 張作驗(yàn)證集最后把圖片和同名 txt 一起復(fù)制過(guò)去。這里最重要的一點(diǎn)是“同步”圖片和標(biāo)簽文件共用文件名前綴只要不同步訓(xùn)練時(shí)會(huì)報(bào)“找不到標(biāo)簽”或者把兩張圖的標(biāo)簽錯(cuò)配到一張圖上。參數(shù)說(shuō)明src_labels 沒有對(duì)應(yīng) txt 時(shí)直接跳過(guò)避免把未標(biāo)注圖片帶進(jìn)訓(xùn)練想改成 9:1把 0.2 改成 0.1 即可shutil.copy 是復(fù)制而不是移動(dòng)原目錄文件還在跑錯(cuò)了可以刪掉 dataset 重來(lái)這算一個(gè)低成本后悔藥。3.2 把 VOC/COCO 標(biāo)注轉(zhuǎn)成 YOLO 格式轉(zhuǎn)換腳本與四個(gè)邊界坑很多公開數(shù)據(jù)集給的是 VOC 的 xml 或 COCO 的 json 標(biāo)注YOLO 訓(xùn)練讀不了這兩種格式必須先轉(zhuǎn)換。VOC 格式里每個(gè)目標(biāo)對(duì)應(yīng)一個(gè) bndbox 節(jié)點(diǎn)里面是 xmin、ymin、xmax、ymax 四個(gè)像素坐標(biāo)YOLO 要的是相對(duì)圖片寬高的中心點(diǎn)和寬高比例。核心換算只有幾行但真正的坑全在換算之外。# voc2yolo.py import os import xml.etree.ElementTree as ET class_map {healthy: 0, early_blight: 1, late_blight: 2, bacterial_spot: 3} def convert_one(xml_path, img_w, img_h, out_txt): tree ET.parse(xml_path) root tree.getroot() lines [] for obj in root.findall(object): name obj.find(name).text if name not in class_map: continue # 類別名不在映射表里直接跳過(guò) box obj.find(bndbox) x1 float(box.find(xmin).text) y1 float(box.find(ymin).text) x2 float(box.find(xmax).text) y2 float(box.find(ymax).text) # 越界裁剪坐標(biāo)小于 0 按 0大于寬高按寬高 x1 max(0, x1); y1 max(0, y1) x2 min(img_w, x2); y2 min(img_h, y2) if x2 x1 or y2 y1: continue # 裁剪后框?yàn)榭照f(shuō)明原始標(biāo)注有問題 x_center (x1 x2) / 2 / img_w y_center (y1 y2) / 2 / img_h w (x2 - x1) / img_w h (y2 - y1) / img_h lines.append(f{class_map[name]} {x_center:.6f} {y_center:.6f} {w:.6f} {h:.6f}) with open(out_txt, w, encodingutf-8) as f: f.write(\n.join(lines)) # 使用時(shí)傳入圖片實(shí)際寬高不要用 xml 里的假設(shè)值 convert_one(annotations/tomato_001.xml, 1280, 960, labels/tomato_001.txt)邏輯說(shuō)明代碼遍歷每個(gè) object 節(jié)點(diǎn)從 bndbox 拿四角像素坐標(biāo)裁剪到圖片邊界內(nèi)再歸一化。裁剪很重要人工標(biāo)注經(jīng)常把框畫出圖片邊緣不裁會(huì)讓后續(xù)數(shù)據(jù)增強(qiáng)在越界坐標(biāo)上產(chǎn)生空 box。類別 ID 由 class_map 映射不在表里的名稱直接跳過(guò)便于反向排查數(shù)據(jù)里有沒有未知病害類別。參數(shù)說(shuō)明輸出精度保留 6 位小數(shù)夠 YOLO 使用如果手里是 COCO 的 json 格式需要換 pycocotools 讀取換算公式一樣。四個(gè)邊界坑提前說(shuō)清楚一是 xml 里的圖片尺寸可能是 0 或錯(cuò)誤值轉(zhuǎn)換前先查實(shí)際尺寸二是坐標(biāo)越界要裁剪而不是直接丟棄丟棄會(huì)丟目標(biāo)三是不同數(shù)據(jù)集里 bndbox 字段名可能寫錯(cuò)寫成 xmin、ymax 之外的名字會(huì)直接 KeyError四是一張圖可能包含多個(gè)同名 object代碼里的 for 循環(huán)天然支持多目標(biāo)別只取第一個(gè)。3.3 標(biāo)注可視化自查把 txt 畫到圖上60 秒內(nèi)發(fā)現(xiàn)問題格式正確不等于標(biāo)注正確。最有效的自查方法就是把標(biāo)簽框畫回原圖逐張翻看。下面這段代碼讀一張圖和同名 txt用 OpenCV 畫出目標(biāo)框和類別 ID輸出到檢查目錄跑一遍就能看出坐標(biāo)是否錯(cuò)位、框是否框住了整片葉、類別是否標(biāo)錯(cuò)。# check_annotations.py import os import cv2 img_dir dataset/images/train label_dir dataset/labels/train out_dir check_output os.makedirs(out_dir, exist_okTrue) for img_name in os.listdir(img_dir): stem os.path.splitext(img_name)[0] label_path os.path.join(label_dir, stem .txt) if not os.path.exists(label_path): continue img cv2.imread(os.path.join(img_dir, img_name)) img_h, img_w img.shape[:2] with open(label_path, r, encodingutf-8) as f: for line in f: parts line.strip().split() if len(parts) ! 5: continue # 行格式不對(duì)直接跳過(guò) cls_id, xc, yc, w, h parts cls_id int(cls_id); xc float(xc); yc float(yc) w float(w); h float(h) x1 int((xc - w / 2) * img_w) y1 int((yc - h / 2) * img_h) x2 int((xc w / 2) * img_w) y2 int((yc h / 2) * img_h) cv2.rectangle(img, (x1, y1), (x2, y2), (0, 0, 255), 2) cv2.putText(img, str(cls_id), (x1, max(0, y1 - 5)), cv2.FONT_HERSHEY_SIMPLEX, 0.6, (0, 0, 255), 2) cv2.imwrite(os.path.join(out_dir, img_name), img)邏輯說(shuō)明腳本按文件名前綴找對(duì)應(yīng)標(biāo)簽把歸一化坐標(biāo)還原成像素坐標(biāo)后用 cv2.rectangle 畫框cv2.putText 在框上方寫類別 ID處理完保存到 check_output。如果發(fā)現(xiàn)大量框偏到葉片外側(cè)通常是標(biāo)簽歸一化公式錯(cuò)了如果框位置基本正確但類別 ID 對(duì)不上病害說(shuō)明 class_map 映射寫歪了。參數(shù)說(shuō)明建議把檢查圖片放到統(tǒng)一目錄里用看圖工具快速翻頁(yè)。一次性檢查幾百?gòu)垐D時(shí)可以把圖片先縮到 640 寬度再保存減少翻頁(yè)體量。這一步不產(chǎn)生任何模型收益但能省掉后面無(wú)數(shù)次調(diào)試時(shí)瞎猜的時(shí)間是整條流程里性價(jià)比最高的一步。4. 訓(xùn)練落地用 PyTorch 把訓(xùn)練跑順記住這組參數(shù)數(shù)據(jù)準(zhǔn)備好了接下來(lái)是把訓(xùn)練腳本跑起來(lái)。這里最大的風(fēng)險(xiǎn)不是模型不懂番茄葉片而是環(huán)境裝不好、參數(shù)設(shè)置不合理、訓(xùn)練中斷后不知道怎么續(xù)上。建議嚴(yán)格按“環(huán)境 → 配置 → 監(jiān)控”三步走每一步只做最小必要的事不要一上來(lái)就去調(diào)花里胡哨的訓(xùn)練技巧。4.1 環(huán)境準(zhǔn)備conda 虛擬環(huán)境與依賴安裝為了不讓系統(tǒng)里已有的 Python 包污染項(xiàng)目我一般先建獨(dú)立的 conda 環(huán)境。下面這段命令在終端里按順序執(zhí)行。conda create -n tomato python3.10 -y conda activate tomato pip install torch torchvision pip install ultralytics邏輯說(shuō)明第一行創(chuàng)建名為 tomato 的 Python 3.10 虛擬環(huán)境第二行激活第三行安裝 PyTorch 和配套 torchvision第四行安裝 ultralytics——這個(gè)庫(kù)封裝了 YOLO 系列的訓(xùn)練、驗(yàn)證、導(dǎo)出接口。torch 和 torchvision 需要配套版本直接 pip 安裝通常會(huì)自動(dòng)匹配但要確認(rèn) torch 能用 GPU方法是在 Python 里執(zhí)行 import torch; print(torch.cuda.is_available())輸出 True 才說(shuō)明 CUDA 可用。參數(shù)說(shuō)明Python 3.10 是這幾年 PyTorch 兼容性最穩(wěn)的版本之一純小白照抄即可如果機(jī)器是純 CPU不裝 CUDA 版 torch 也能跑只是慢很多。Windows 上最容易翻車的點(diǎn)有兩個(gè)一個(gè)是缺 VC 運(yùn)行庫(kù)報(bào)錯(cuò)文字里出現(xiàn) msvcp140.dll裝一下運(yùn)行庫(kù)就好另一個(gè)是顯卡驅(qū)動(dòng)太舊torch 報(bào)“CUDA driver version is insufficient”去顯卡廠商官網(wǎng)更新驅(qū)動(dòng)即可不用自己亂改 torch 版本。裝完后建議跑一下 yolo --version 確認(rèn)命令行可用很多環(huán)境問題在這一步就能暴露。4.2 數(shù)據(jù)集配置與訓(xùn)練命令參數(shù)表里哪些是安全區(qū)哪些是玄學(xué)ultralytics 的訓(xùn)練接口要求先用一個(gè) yaml 文件描述數(shù)據(jù)路徑和類別信息。文件名隨意結(jié)構(gòu)固定。假設(shè)只做四類健康葉片、早疫病、晚疫病、細(xì)菌性斑點(diǎn)內(nèi)容如下。# tomato.yaml path: dataset train: images/train val: images/val nc: 4 names: 0: healthy 1: early_blight 2: late_blight 3: bacterial_spot邏輯說(shuō)明path 是數(shù)據(jù)集根目錄train 和 val 是相對(duì)路徑nc 是類別總數(shù)names 給每個(gè)類別 ID 一個(gè)名字。訓(xùn)練腳本讀這個(gè)文件就知道去哪里找圖片、驗(yàn)證集用哪份數(shù)據(jù)、輸出多少個(gè)類別。最容易翻車的配置是 path 寫成絕對(duì)路徑換機(jī)器后路徑失效相對(duì)路徑則要求執(zhí)行訓(xùn)練命令時(shí)的工作目錄在數(shù)據(jù)集上層我會(huì)在命令前用 cd 進(jìn)入項(xiàng)目根目錄來(lái)規(guī)避。訓(xùn)練命令如下cd tomato_project yolo detect train modelyolov8n.pt datatomato.yaml \ epochs80 imgsz640 batch8 device0 workers4 \ lr00.01 patience15邏輯說(shuō)明modelyolov8n.pt 表示加載官方預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)n 是 nano 版本顯存占用小、適合入門datatomato.yaml 指向剛才的配置epochs80 是完整遍歷訓(xùn)練集 80 次imgsz640 讓圖片縮放成 640x640 再進(jìn)網(wǎng)絡(luò)batch8 是每次送入 GPU 的圖片數(shù)量patience15 表示驗(yàn)證指標(biāo)連續(xù) 15 個(gè) epoch 不提升就提前停止防過(guò)擬合還能省時(shí)間。參數(shù)我的默認(rèn)值影響說(shuō)明modelyolov8n.pt模型容量與速度顯存小用 n數(shù)據(jù)多再換 s 或 mepochs80訓(xùn)練輪數(shù)幾百?gòu)垐D時(shí) 80 夠用imgsz640輸入分辨率分辨率越高越吃顯存小目標(biāo)多再調(diào) 960batch8單輪顯存占用6GB 顯存安全區(qū)是 8溢出就減半lr00.01初始學(xué)習(xí)率遷移學(xué)習(xí)時(shí) 0.01 是保守安全值patience15早停耐心值驗(yàn)證指標(biāo)不升就停防無(wú)效等待參數(shù)說(shuō)明imgsz 和 batch 的乘積直接決定顯存占用6GB 顯存跑 6408 是比較穩(wěn)的搭配如果數(shù)據(jù)里葉片只占很小一塊可以試 imgsz960但 batch 要降一半。lr0 是最容易踩的玄學(xué)參數(shù)調(diào)大了 loss 早期爆炸調(diào)小了 40 輪還在原地晃遷移學(xué)習(xí)場(chǎng)景下 0.01 基本不會(huì)出錯(cuò)。顯存溢出時(shí)優(yōu)先把 batch 減半而不是換更小的模型因?yàn)?batch 減半不影響模型表達(dá)能力只是梯度估計(jì)噪聲變大。4.3 訓(xùn)練過(guò)程怎么監(jiān)控從 loss 數(shù)值到 best.pt 的完整閉環(huán)訓(xùn)練開始后終端會(huì)打印每個(gè) epoch 的進(jìn)度條和一堆指標(biāo)要有取舍地看。第一優(yōu)先看 box_loss 和 cls_loss前者是定位損失后者是分類損失兩者都應(yīng)隨 epoch 數(shù)增加而下降下降速度變緩是正?,F(xiàn)象。第二看 val 行的 mAP50這是最能說(shuō)明模型真實(shí)水平的數(shù)字不要只看最終值要關(guān)注它在訓(xùn)練中期的爬升趨勢(shì)。訓(xùn)練結(jié)束時(shí)runs/detect/train 目錄下會(huì)出現(xiàn)兩個(gè)權(quán)重文件best.pt 是驗(yàn)證指標(biāo)最好的權(quán)重last.pt 是最后一輪權(quán)重。默認(rèn)用 best.pt不要只拿 last.pt 做推理因?yàn)橛?xùn)練后期可能出現(xiàn)輕微過(guò)擬合best.pt 才是泛化能力最強(qiáng)的快照。中斷恢復(fù)也有后悔藥訓(xùn)練中途崩了在命令最后加 resumeTrue腳本會(huì)從 last.pt 斷點(diǎn)繼續(xù)不用從頭再來(lái)。如果 mAP50 到某個(gè) epoch 后突然掉一截別急著加正則化先回第三章把可視化自查再做一遍看是不是訓(xùn)練集里混進(jìn)了貼錯(cuò)標(biāo)簽的圖。數(shù)據(jù)層面干凈了指標(biāo)才會(huì)恢復(fù)正常。另外值得記的一個(gè)經(jīng)驗(yàn)是batch 小的時(shí)候 loss 曲線更抖這是正常的不用過(guò)度緊張真正要警惕的是 loss 徘徊在高位完全不降那種情況多半是標(biāo)簽坐標(biāo)越界回 3.2 小節(jié)的轉(zhuǎn)換腳本檢查邊界裁剪邏輯。5. 番茄葉片病害檢測(cè)的典型翻車現(xiàn)場(chǎng)排查與避坑訓(xùn)練和推理跑通之后真正的疑難雜癥才開始浮出來(lái)。下面五條是從實(shí)際項(xiàng)目里反復(fù)遇到、且在新手身上出現(xiàn)頻率最高的問題按現(xiàn)象、原因、解決的順序?qū)懨恳粭l都盡量給一個(gè)能直接抄的判斷路徑方便你在訓(xùn)練失敗時(shí)按圖索驥。5.1 顯存溢出不只是換顯卡就能解決現(xiàn)象訓(xùn)練跑到十幾個(gè) epoch 后進(jìn)程突然報(bào) CUDA error: out of memory前面十幾個(gè) epoch 的進(jìn)度全部作廢。原因最典型根源是 batch 和 imgsz 的乘積超過(guò)顯存上限尤其是帶數(shù)據(jù)增強(qiáng)的 YOLO 訓(xùn)練顯存峰值往往出現(xiàn)在增強(qiáng)后的大圖堆疊階段而不是推理階段。有時(shí)候 6GB 顯存跑 batch8 能啟動(dòng)、卻在某 epoch 中途溢出是因?yàn)樵鰪?qiáng)操作隨機(jī)生成了比平時(shí)更大的輸入圖瞬時(shí)峰值比平均值高出一截。解決先把 batch 減半到 4同時(shí)把 imgsz 降到 512大多數(shù) 6GB 卡能穩(wěn)定跑完如果還溢出再看 workers 是否太大workers4 會(huì)讓數(shù)據(jù)加載線程同時(shí)準(zhǔn)備多批數(shù)據(jù)顯存和內(nèi)存都被推高。改完參數(shù)重新訓(xùn)練因?yàn)?best.pt 還沒生成沒有斷點(diǎn)可以利用。這條經(jīng)驗(yàn)的關(guān)鍵是顯存溢出不是換顯卡的信號(hào)先把參數(shù)調(diào)回安全區(qū)再說(shuō)。5.2 標(biāo)注框口徑不統(tǒng)一模型學(xué)的到底是葉片還是病斑現(xiàn)象訓(xùn)練完的模型在真實(shí)照片上表現(xiàn)尚可但預(yù)測(cè)框總是只框住病斑區(qū)域而不是整片葉或者反過(guò)來(lái)該框病斑卻框了整片葉子。原因這是標(biāo)注階段埋下的鍋。同一批數(shù)據(jù)里一部分人標(biāo)整片葉另一部分人只標(biāo)病斑模型在矛盾中學(xué)會(huì)了“最小化損失”的折中方案輸出框忽大忽小。整片葉占圖面積大、病斑占圖面積小兩者混合會(huì)讓置信度分布非常奇怪。解決沒有捷徑只能回標(biāo)注環(huán)節(jié)統(tǒng)一口徑。建議定成“目標(biāo)是葉片類別是病害”如果真正關(guān)心病斑面積占比就定成“目標(biāo)是病斑類別是病害類型”。定好之后把不符合的標(biāo)注批量改成統(tǒng)一規(guī)則再跑一次 3.3 小節(jié)的可視化自查確認(rèn)每個(gè)框都符合新口徑再重新訓(xùn)練。這個(gè)問題越早發(fā)現(xiàn)代價(jià)越小訓(xùn)練完才發(fā)現(xiàn)等于前幾十個(gè) epoch 全部作廢。5.3 類別嚴(yán)重不平衡整體指標(biāo)還行細(xì)看某個(gè)類別幾乎不檢現(xiàn)象訓(xùn)練完看驗(yàn)證結(jié)果mAP50 有 0.7但按類別拆開統(tǒng)計(jì)晚疫病這一類精確率和召回率雙雙接近 0模型把所有相似目標(biāo)都判成了早疫病。原因數(shù)據(jù)集中晚疫病樣本只有早疫病的十分之一。目標(biāo)檢測(cè)的損失函數(shù)在加權(quán)求和時(shí)樣本多的類別貢獻(xiàn)的梯度更大模型很容易傾向把所有相似紋理都判成大類。病害之間的視覺相似性會(huì)放大這個(gè)問題早疫病和晚疫病的同心環(huán)差幾層紋理細(xì)節(jié)樣本不足時(shí)模型根本學(xué)不到區(qū)分特征。解決優(yōu)先做數(shù)據(jù)擴(kuò)充找更多晚疫病照片或做旋轉(zhuǎn)、亮度、雨露等增廣把數(shù)量拉到一個(gè)相對(duì)均衡的水平確實(shí)找不到素材再調(diào)整損失權(quán)重比如給 cls loss 按類別占比反比加權(quán)或者換 focal loss 讓模型更關(guān)注難分的少數(shù)類。我的經(jīng)驗(yàn)是調(diào) loss 權(quán)重只能把指標(biāo)從幾乎為零拉回“勉強(qiáng)能用”真正有效的還是數(shù)據(jù)量本身。5.4 loss 不降先查標(biāo)簽再調(diào)學(xué)習(xí)率現(xiàn)象訓(xùn)練到第 30 輪box_loss 和 cls_loss 都停在一個(gè)較高水平不再下降驗(yàn)證集 mAP50 也在低位震蕩調(diào) epochs 也沒用。原因排在前列的三類原因分別是標(biāo)簽坐標(biāo)越界或歸一化錯(cuò)誤、學(xué)習(xí)率過(guò)高導(dǎo)致 loss 反復(fù)震蕩、模型容量不足。最常見的是第一種因?yàn)檗D(zhuǎn)換腳本如果沒做邊界裁剪x_center 和 w 會(huì)偶爾出現(xiàn)大于 1 或小于 0 的數(shù)值模型看到的標(biāo)簽和實(shí)際目標(biāo)框?qū)Σ簧献匀粚W(xué)不下去。解決不要先動(dòng)模型先執(zhí)行第三章的可視化自查腳本逐張看標(biāo)注框是否貼合葉片??蛉空T贆z查 lr0把 0.01 降到 0.002 重跑數(shù)據(jù)量大且模型是 yolov8n可以換 yolov8s 提高容量。這三步按順序排查能覆蓋九成“l(fā)oss 不降”的現(xiàn)場(chǎng)。很多人一上來(lái)就換高級(jí)損失函數(shù)或加注意力模塊但在這類項(xiàng)目里數(shù)據(jù)問題占比遠(yuǎn)高于模型能力問題先把數(shù)據(jù)釘死再談模型。5.5 推理階段誤檢滿天飛把 conf 閾值調(diào)高只是治標(biāo)現(xiàn)象模型在訓(xùn)練集上的指標(biāo)很好看但把訓(xùn)練時(shí)沒見過(guò)的真實(shí)照片喂進(jìn)去預(yù)測(cè)結(jié)果里到處是框連土壤、莖稈甚至背景紋理都被標(biāo)注成病害。原因訓(xùn)練正樣本里幾乎全是“葉片居中、背景干凈”的照片模型沒見過(guò)不帶葉子的負(fù)樣本于是在推理階段對(duì)一切有紋理的區(qū)域都打了高分。這是數(shù)據(jù)分布和真實(shí)場(chǎng)景不匹配造成的問題不是單純過(guò)擬合。解決治本的手段是往訓(xùn)練集里加入背景圖片作為負(fù)樣本再配合 mosaic 和 mixup 增強(qiáng)讓模型學(xué)會(huì)忽略無(wú)關(guān)區(qū)域。治標(biāo)的手段是把推理時(shí)的 conf 參數(shù)調(diào)高例如從默認(rèn)的 0.25 提到 0.5誤檢數(shù)量會(huì)明顯下降但會(huì)犧牲一部分真目標(biāo)召回。建議一起做先用 conf0.5 把眼前誤檢壓下去同時(shí)補(bǔ)一批帶背景的負(fù)樣本重新訓(xùn)練雙管齊下才算真正解決。提示這五條經(jīng)驗(yàn)的共同點(diǎn)是現(xiàn)象在訓(xùn)練或推理中暴露根源卻都在數(shù)據(jù)或參數(shù)上。遇到問題按“數(shù)據(jù) → 參數(shù) → 模型”的順序排查不要一上來(lái)就換網(wǎng)絡(luò)結(jié)構(gòu)。6. 把模型從“能跑”變成“能用”驗(yàn)證指標(biāo)與落地前的最后一步訓(xùn)練完成不代表項(xiàng)目結(jié)束模型要在沒見過(guò)的真實(shí)照片上證明自己。驗(yàn)證階段最有參考價(jià)值的數(shù)字是 mAP50 和混淆矩陣比單獨(dú)看訓(xùn)練 loss 誠(chéng)實(shí)得多。yolo detect val modelruns/detect/train/best.pt datatomato.yaml這條命令會(huì)在驗(yàn)證集上跑一遍最優(yōu)權(quán)重打印 box_loss、mAP50、mAP50-95 等指標(biāo)同時(shí)生成混淆矩陣圖。混淆矩陣的閱讀方法是看對(duì)角線對(duì)角線數(shù)值越高說(shuō)明每個(gè)類別分得越清楚如果早疫病和晚疫病之間出現(xiàn)大片非對(duì)角區(qū)域說(shuō)明這兩個(gè)類別在特征空間里確實(shí)太接近優(yōu)先回 5.3 小節(jié)補(bǔ)數(shù)據(jù)。推理階段的驗(yàn)證要換一批照片最好用手機(jī)在真實(shí)溫室拍幾張分別覆蓋單葉片、多葉片、背景雜亂、光線不均四種情況。下面這段代碼可以快速做批量預(yù)測(cè)并保存結(jié)果。from ultralytics import YOLO model YOLO(runs/detect/train/best.pt) results model.predict( sourcereal_photos/, conf0.45, saveTrue, imgsz640, projectpredict_output )邏輯說(shuō)明model 加載訓(xùn)練好的 best.ptsource 指向真實(shí)照片目錄conf0.45 比默認(rèn)值略高以過(guò)濾誤檢saveTrue 保存畫好框的結(jié)果圖project 指定輸出目錄。參數(shù)說(shuō)明如果真實(shí)場(chǎng)景里葉片占整圖比例很小imgsz 可調(diào)到 960 再試一次代價(jià)是推理變慢但小目標(biāo)檢出率通常會(huì)提高。這里有一個(gè)我從第一次做葉片檢測(cè)就記住的習(xí)慣永遠(yuǎn)同時(shí)保存兩份驗(yàn)證輸出一份按默認(rèn)參數(shù)一份按高 conf對(duì)比著看模型的邊界在哪里。如果兩份輸出差異極大說(shuō)明模型對(duì)置信度非常敏感部署時(shí)要仔細(xì)標(biāo)定閾值。這套流程走完這個(gè)基于 python 深度學(xué)習(xí)的番茄葉片病害檢測(cè)項(xiàng)目才真正從“代碼能跑”變成了“檢測(cè)能信”。我早年第一次做完類似項(xiàng)目時(shí)花在換模型上的時(shí)間遠(yuǎn)超花在查數(shù)據(jù)上的時(shí)間結(jié)果每個(gè)模型的指標(biāo)都類似地差。后來(lái)養(yǎng)成先做數(shù)據(jù)自查、再看混淆矩陣、最后用真實(shí)照片兜底的順序返工次數(shù)驟降。希望這個(gè)順序也能幫你在番茄葉片病害檢測(cè)上少走幾步彎路。本文還有配套的精品資源點(diǎn)擊獲取