別實(shí)戰(zhàn):圖像處理與字符識(shí)別全流程)
簡(jiǎn)介計(jì)算機(jī)視覺(jué)作為人工智能的重要分支其核心技術(shù)在于通過(guò)圖像處理手段提取有效信息。OpenCV作為業(yè)界標(biāo)準(zhǔn)的圖像處理庫(kù)配合Python的簡(jiǎn)潔高效為開發(fā)者提供了強(qiáng)大的圖像處理與模式識(shí)別能力。從灰度化、邊緣檢測(cè)到形態(tài)學(xué)操作與輪廓分析每項(xiàng)技術(shù)都在實(shí)際項(xiàng)目中發(fā)揮著關(guān)鍵作用。以車牌識(shí)別為例其流程涵蓋車牌定位、透視矯正、字符分割與模板匹配等環(huán)節(jié)完整呈現(xiàn)了從圖像預(yù)處理到分類識(shí)別的技術(shù)鏈路。該方案不依賴深度學(xué)習(xí)框架在普通CPU上即可高效運(yùn)行適用于課程設(shè)計(jì)、畢業(yè)設(shè)計(jì)及入門實(shí)戰(zhàn)項(xiàng)目幫助開發(fā)者快速掌握計(jì)算機(jī)視覺(jué)的核心方法論。 車牌識(shí)別這個(gè)東西算是計(jì)算機(jī)視覺(jué)入門到進(jìn)階的一個(gè)典型項(xiàng)目了。OpenCV加Python的組合既不用燒顯卡也不用上復(fù)雜的深度學(xué)習(xí)框架純靠圖像處理就能把車牌從圖片里摳出來(lái)再把字符一個(gè)個(gè)認(rèn)出來(lái)。這套流程跑通了你對(duì)圖像處理的基本功——灰度化、邊緣檢測(cè)、形態(tài)學(xué)操作、輪廓分析、模板匹配——理解會(huì)上一個(gè)臺(tái)階。我最早接觸這個(gè)項(xiàng)目時(shí)也覺(jué)得挺玄乎真的動(dòng)手做了一遍才發(fā)現(xiàn)核心邏輯拆開就三步車牌在哪、字怎么切開、每個(gè)字是什么。這篇文章把我完整的實(shí)現(xiàn)思路、參數(shù)調(diào)優(yōu)經(jīng)驗(yàn)、踩過(guò)的坑都記錄下來(lái)適合學(xué)完P(guān)ython基礎(chǔ)、想找個(gè)實(shí)戰(zhàn)項(xiàng)目練手的同學(xué)也適合課程設(shè)計(jì)、畢業(yè)設(shè)計(jì)需要快速出成果的朋友參考。1. 項(xiàng)目整體設(shè)計(jì)與技術(shù)選型思路1.1 為什么選擇OpenCVPython方案先聊聊選型。車牌識(shí)別系統(tǒng)在工業(yè)界其實(shí)已經(jīng)很成熟了停車場(chǎng)道閘、電子警察、高速收費(fèi)用的基本都是專用設(shè)備加深度模型。但作為學(xué)習(xí)項(xiàng)目或個(gè)人作品OpenCV加Python依然是最合適的組合。原因很實(shí)在OpenCV把所有底層圖像處理算法都封裝好了C接口性能最好但Python接口開發(fā)效率高代碼量少調(diào)試方便。同樣是做一個(gè)原型驗(yàn)證C可能寫兩百行Python五十行就搞定了。對(duì)于學(xué)習(xí)理解算法原理來(lái)說(shuō)Python的簡(jiǎn)潔性讓我能更關(guān)注算法本身而不是糾結(jié)指針和內(nèi)存管理。而且OpenCV在圖像處理這塊兒幾乎是事實(shí)標(biāo)準(zhǔn)它的cv2.findContours、cv2.Canny、cv2.dilate、cv2.matchTemplate這些函數(shù)隨便哪個(gè)拿出來(lái)都是經(jīng)過(guò)大量工業(yè)場(chǎng)景驗(yàn)證的穩(wěn)定實(shí)現(xiàn)。自己從頭造輪子去寫一個(gè)邊緣檢測(cè)或者模板匹配不僅性能比不上精度也差得遠(yuǎn)。車牌識(shí)別本身對(duì)實(shí)時(shí)性要求其實(shí)不高——識(shí)別一張靜態(tài)圖片用OpenCV的傳統(tǒng)圖像處理方法在普通CPU上跑也就幾十毫秒完全夠用。如果用深度學(xué)習(xí)方案單是環(huán)境配置、模型訓(xùn)練、數(shù)據(jù)集標(biāo)注這一套下來(lái)就要花掉大量時(shí)間。對(duì)于入門者和學(xué)生項(xiàng)目來(lái)說(shuō)把傳統(tǒng)方法吃透比直接套用現(xiàn)成的YOLO模型更有價(jià)值。1.2 車牌識(shí)別系統(tǒng)的完整工作流程整個(gè)系統(tǒng)的流程可以拆成四個(gè)核心模塊我用一張流程圖來(lái)概括這里用文字描述輸入圖片 → 車牌定位 → 車牌矯正 → 字符分割 → 字符識(shí)別 → 輸出結(jié)果第一個(gè)環(huán)節(jié)是車牌定位目標(biāo)是從一張復(fù)雜的圖像中找到車牌所在的區(qū)域。這是整個(gè)系統(tǒng)中最關(guān)鍵的一步因?yàn)楹罄m(xù)所有操作都依賴于這一步的準(zhǔn)確性。如果車牌都沒(méi)找對(duì)后面做得再好也沒(méi)用。第二個(gè)環(huán)節(jié)是車牌矯正。實(shí)際拍攝的車牌往往是有傾斜的如果直接分割字符會(huì)導(dǎo)致切歪、切錯(cuò)。所以要先對(duì)定位到的車牌區(qū)域做透視變換把它矯正成正面視角。第三個(gè)環(huán)節(jié)是字符分割。把矯正后的車牌圖片中的每個(gè)字符切出來(lái)變成一張張單獨(dú)的字符圖片。這個(gè)過(guò)程需要處理邊框、鉚釘、噪點(diǎn)等干擾。第四個(gè)環(huán)節(jié)是字符識(shí)別。對(duì)每個(gè)分割出來(lái)的字符圖片進(jìn)行分類識(shí)別出它是哪個(gè)漢字、哪個(gè)字母、哪個(gè)數(shù)字。這里可以用模板匹配也可以用簡(jiǎn)單的卷積神經(jīng)網(wǎng)絡(luò)。1.3 技術(shù)方案選型傳統(tǒng)視覺(jué)還是深度學(xué)習(xí)在做車牌識(shí)別時(shí)有個(gè)繞不開的問(wèn)題用傳統(tǒng)圖像處理還是深度學(xué)習(xí)我的建議是都別偏科。傳統(tǒng)方法的核心優(yōu)勢(shì)在于可控性強(qiáng)、可解釋性強(qiáng)。每一步做了什么、為什么這樣做、參數(shù)為什么這么設(shè)都清清楚楚。出了問(wèn)題也能一步步回溯排查。這對(duì)于學(xué)習(xí)理解圖像處理的基本原理非常有幫助。而深度學(xué)習(xí)的優(yōu)勢(shì)在于對(duì)復(fù)雜場(chǎng)景的魯棒性更強(qiáng)。比如夜間拍攝、車牌嚴(yán)重模糊、角度特別刁鉆等場(chǎng)景傳統(tǒng)方法可能就翻車了但深度學(xué)習(xí)模型經(jīng)過(guò)充分訓(xùn)練后能扛住更多干擾。實(shí)際項(xiàng)目中的做法是兩者結(jié)合用傳統(tǒng)方法做預(yù)處理和車牌定位速度快、穩(wěn)定性好用深度學(xué)習(xí)做字符識(shí)別精度高、泛化能力強(qiáng)。我的最終方案就是這種混合架構(gòu)OpenCV負(fù)責(zé)定位和分割Python加一個(gè)輕量級(jí)CNN模型負(fù)責(zé)字符識(shí)別。這樣兼顧了速度和精度代碼量也不會(huì)爆炸。2. 環(huán)境準(zhǔn)備與基礎(chǔ)搭建2.1 Python與OpenCV的安裝與配置在做任何代碼之前先得把環(huán)境跑起來(lái)。這里我用的Python版本是3.9OpenCV版本是4.8.0這兩個(gè)版本兼容性很好不會(huì)有奇怪的報(bào)錯(cuò)。安裝OpenCV最簡(jiǎn)單的命令是pip install opencv-python但這里有個(gè)坑直接用pip install opencv-python裝的是OpenCV的CPU版本對(duì)入門學(xué)習(xí)完全夠用。但如果后續(xù)要做視頻流處理或者實(shí)時(shí)識(shí)別建議再裝一個(gè)opencv-contrib-python這個(gè)包包含了更多擴(kuò)展模塊。我的建議是用虛擬環(huán)境來(lái)隔離項(xiàng)目依賴避免不同項(xiàng)目之間的包版本沖突。創(chuàng)建并激活虛擬環(huán)境的命令如下python -m venv lpr_env # Windows lpr_env\Scripts\activate # Linux/Mac source lpr_env/bin/activate pip install opencv-python numpy matplotlib scikit-learn2.2 項(xiàng)目依賴庫(kù)清單整個(gè)項(xiàng)目我用到的主要依賴庫(kù)如下庫(kù)名版本建議用途說(shuō)明opencv-python4.8.0核心圖像處理、輪廓檢測(cè)、模板匹配numpy1.24.0數(shù)組運(yùn)算、圖像矩陣操作matplotlib3.7.0圖像可視化、調(diào)試展示scikit-learn1.3.0制作數(shù)據(jù)集、訓(xùn)練分類器可選tensorflow / pytorch按需安裝輕量級(jí)CNN字符識(shí)別可選如果你只做傳統(tǒng)方案的車牌識(shí)別其實(shí)只需要前三個(gè)庫(kù)就夠了。深度學(xué)習(xí)部分可以后續(xù)再加。這里特別說(shuō)一下numpy。OpenCV的圖像本質(zhì)上是numpy數(shù)組理解這一點(diǎn)很重要。一張彩色圖片在OpenCV里的形狀是(H, W, 3)的數(shù)組H是高度W是寬度3是BGR三個(gè)顏色通道注意OpenCV用的是BGR而不是RGB。整個(gè)圖像處理過(guò)程說(shuō)白了就是在操作這些數(shù)組的數(shù)值。2.3 開發(fā)調(diào)試環(huán)境的配置要點(diǎn)我這里推薦用VS Code配合Python擴(kuò)展來(lái)做開發(fā)簡(jiǎn)單輕量調(diào)試方便。有一些小配置能顯著提升開發(fā)效率第一設(shè)置OpenCV顯示窗口的大小自適應(yīng)。如果你的屏幕分辨率不夠高OpenCV彈出的窗口可能會(huì)超出屏幕邊界看不到完整圖片。可以在代碼里加上這個(gè)cv2.namedWindow(result, cv2.WINDOW_NORMAL) cv2.resizeWindow(result, 800, 600)第二配置好圖像保存路徑。調(diào)試過(guò)程中經(jīng)常需要把中間結(jié)果保存下來(lái)查看建議在項(xiàng)目根目錄建一個(gè)output/文件夾專門存放中間處理結(jié)果。這樣既能追蹤算法每一步的輸出也方便在最終效果不好時(shí)排查是哪一步出了問(wèn)題。第三善用cv2.imwrite而不是cv2.imshow來(lái)做輸出。在無(wú)圖形界面的服務(wù)器上調(diào)試或者批量處理圖片時(shí)cv2.imshow會(huì)直接報(bào)錯(cuò)但cv2.imwrite可以正常使用。養(yǎng)成寫文件而不是彈窗口的調(diào)試習(xí)慣能少踩很多坑。3. 車牌定位從原圖到目標(biāo)區(qū)域3.1 圖像預(yù)處理灰度化、去噪與邊緣檢測(cè)車牌定位的第一步是做圖像預(yù)處理。一張?jiān)紙D片可能有各種顏色背景也可能很復(fù)雜——樹、墻壁、行人、其他車輛什么都有。直接在這張圖上找車牌是不現(xiàn)實(shí)的要先做減法。我采用的預(yù)處理流程是灰度化 → 高斯模糊 → 邊緣檢測(cè) → 二值化。首先看灰度化。車牌的顏色信息藍(lán)色底白字、黃色底黑字、綠色底白字等在定位階段其實(shí)并不是必須的反而會(huì)讓計(jì)算量增大。把它變成灰度圖就是去掉顏色信息只保留亮度信息gray cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)接著做高斯模糊。這一步的作用是去除圖像中的噪聲和細(xì)節(jié)紋理。車牌邊緣相比于復(fù)雜的背景紋理來(lái)說(shuō)是大尺度的特征模糊掉小紋理能減少干擾blurred cv2.GaussianBlur(gray, (5, 5), 0)高斯模糊的核大小(5, 5)是我在實(shí)測(cè)后覺(jué)得比較合適的核太小去噪效果差核太大又容易把車牌的邊緣細(xì)節(jié)也磨掉。然后是邊緣檢測(cè)我用的是Canny算子。這是OpenCV里最經(jīng)典的邊緣檢測(cè)算法它能在保持邊緣連續(xù)性的同時(shí)抑制噪聲edges cv2.Canny(blurred, 50, 150)Canny的兩個(gè)閾值參數(shù)也需要根據(jù)實(shí)際圖片調(diào)整。低閾值50、高閾值150是我在晴天、光線充足的車牌照片上調(diào)出來(lái)的經(jīng)驗(yàn)值。如果圖片中車牌邊緣太弱、檢測(cè)不到可以把閾值調(diào)低到30~40反之如果檢測(cè)出太多噪聲邊緣則適當(dāng)調(diào)高。3.2 形態(tài)學(xué)操作讓車牌的輪廓連成一片邊緣檢測(cè)做完之后車牌的輪廓已經(jīng)能看到一些了但邊緣往往是斷斷續(xù)續(xù)的——因?yàn)檐嚺粕系淖址?、邊框和背景之間有些地方的梯度不夠明顯Canny檢測(cè)出來(lái)的是斷開的碎片。這時(shí)候就需要形態(tài)學(xué)操作登場(chǎng)了。我做的是兩步先膨脹再閉運(yùn)算。膨脹操作讓邊緣變得更粗、更連續(xù)kernel cv2.getStructuringElement(cv2.MORPH_RECT, (5, 5)) dilated cv2.dilate(edges, kernel, iterations2)閉運(yùn)算是先膨脹后腐蝕作用是把車牌區(qū)域內(nèi)部的小孔洞填上讓整個(gè)車牌區(qū)域變成一個(gè)實(shí)心的連通塊closed cv2.morphologyEx(dilated, cv2.MORPH_CLOSE, kernel)3.3 輪廓提取與候選區(qū)域篩選形態(tài)學(xué)處理完車牌區(qū)域已經(jīng)變成一個(gè)明顯的亮色塊狀區(qū)域了。接下來(lái)用cv2.findContours提取輪廓然后根據(jù)車牌的特征來(lái)篩選候選區(qū)域contours, hierarchy cv2.findContours(closed, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE)提取到輪廓之后核心工作就是篩選。標(biāo)準(zhǔn)車牌的寬高比大約是3.14:1440mm : 140mm這個(gè)比例是非常穩(wěn)定的特征。我設(shè)定的篩選取值范圍是for cnt in contours: x, y, w, h cv2.boundingRect(cnt) aspect_ratio w / float(h) area w * h # 車牌寬高比約3~4面積占圖片總面積比例在0.0004~0.02之間 if 2.5 aspect_ratio 4.5 and 0.0004 area / (image.shape[0] * image.shape[1]) 0.02: candidate cnt break這個(gè)范圍不是我隨便拍的。標(biāo)準(zhǔn)車牌寬高比3.14但實(shí)際拍攝時(shí)因?yàn)榻嵌取⑼敢暤挠绊戇@個(gè)值會(huì)在2.5到4.5之間波動(dòng)。面積比例則是根據(jù)我的測(cè)試圖片尺寸約1920x1080車牌在圖中約占幾百到幾千像素來(lái)估算的。如果你自己的圖片里車牌占比更小或更大需要相應(yīng)調(diào)整這個(gè)范圍。如果一次篩選出多個(gè)候選區(qū)域我的策略是按照面積從大到小排序優(yōu)先選擇面積最大的那個(gè)——因?yàn)樵趯?shí)際拍攝中面積最大的那個(gè)輪廓通常就是距離最近、最清晰的車牌。篩選完成后cv2.boundingRect得到的是最小正矩形但如果車牌有傾斜正矩形包住的區(qū)域會(huì)包含很多背景。這時(shí)候就要用到最小外接矩形rect cv2.minAreaRect(cnt) box cv2.boxPoints(rect) box np.int0(box)cv2.minAreaRect返回一個(gè)旋轉(zhuǎn)矩形包含中心坐標(biāo)、寬高和旋轉(zhuǎn)角度這個(gè)角度在下一步矯正中非常關(guān)鍵。3.4 透視變換矯正傾斜的車牌實(shí)際拍攝的車牌幾乎不可能是絕對(duì)正對(duì)著鏡頭的多多少少有傾斜。如果直接分割字符會(huì)存在嚴(yán)重的誤差。矯正的方法是用透視變換把傾斜的車牌映射成一個(gè)正面的矩形。先獲取車牌四個(gè)角點(diǎn)映射到一個(gè)標(biāo)準(zhǔn)的車牌尺寸上# 假設(shè)box是車牌區(qū)域的四個(gè)角點(diǎn)按照一定順序排列 src_pts np.array(box, dtypefloat32) # 標(biāo)準(zhǔn)車牌尺寸以寬度440px、高度140px為例 dst_pts np.array([[0, 0], [440, 0], [440, 140], [0, 140]], dtypefloat32) # 計(jì)算透視變換矩陣 M cv2.getPerspectiveTransform(src_pts, dst_pts) # 執(zhí)行透視變換 warped cv2.warpPerspective(image, M, (440, 140))這里要注意src_pts角點(diǎn)的順序必須和dst_pts一一對(duì)應(yīng)否則變換結(jié)果會(huì)錯(cuò)亂。cv2.boxPoints返回的角點(diǎn)順序不一定是我們想要的需要手動(dòng)排個(gè)序——按左上、右上、右下、左下的順序排列。排序的代碼可以這樣寫def order_points(pts): rect np.zeros((4, 2), dtypefloat32) s pts.sum(axis1) rect[0] pts[np.argmin(s)] # 左上角xy最小 rect[2] pts[np.argmax(s)] # 右下角xy最大 diff np.diff(pts, axis1) rect[1] pts[np.argmin(diff)] # 右上角x-y最小 rect[3] pts[np.argmax(diff)] # 左下角x-y最大 return rect這一套流程跑完拿到的warped就是一張規(guī)規(guī)矩矩的車牌正面圖了。4. 車牌字符分割把牌照拆成單個(gè)字符4.1 二值化處理與去噪車牌區(qū)域拿到之后下一步是分割字符。字符分割的質(zhì)量直接決定了識(shí)別精度——如果字符切歪了、切殘了后面識(shí)別做再好也沒(méi)用。先對(duì)矯正后的車牌做預(yù)處理。首先是二值化把車牌圖片變成黑白兩色warped_gray cv2.cvtColor(warped, cv2.COLOR_BGR2GRAY) _, binary cv2.threshold(warped_gray, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU)這里我使用了Otsu自適應(yīng)閾值它能根據(jù)圖片的灰度分布自動(dòng)計(jì)算最佳的二值化閾值比固定閾值比如127魯棒得多。因?yàn)椴煌h(huán)境下拍攝的車牌亮度和對(duì)比度差異很大固定閾值很容易翻車。二值化之后還要去噪。車牌上常見噪聲來(lái)源有兩個(gè)一是鉚釘車牌四角的小圓點(diǎn)二是邊框。鉚釘和邊框如果在二值化圖片上殘留會(huì)干擾字符分割。去除鉚釘和邊框的方法有很多我用的是形態(tài)學(xué)開運(yùn)算 邊框裁剪的組合kernel np.ones((3, 3), np.uint8) binary cv2.morphologyEx(binary, cv2.MORPH_OPEN, kernel)接著把車牌最外圈的幾行、幾列像素直接裁剪掉因?yàn)檫吙蛟诙祷笸ǔ?huì)連成一條白線h, w binary.shape binary binary[5:h-5, 5:w-5]4.2 字符分割的核心方法字符分割我嘗試過(guò)三種主流方法垂直投影法、連通域法、輪廓檢測(cè)法。垂直投影法的大致原理是把二值化后的車牌圖片的每一列的白像素?cái)?shù)量做一個(gè)統(tǒng)計(jì)列與列之間形成波峰和波谷。字符所在區(qū)域白像素多波峰字符之間的間隙白像素少波谷。根據(jù)波峰波谷的分界就能把字符切出來(lái)。這在很多教程里是首選方法但我實(shí)測(cè)下來(lái)它對(duì)噪聲和粘連字符非常敏感只有當(dāng)車牌特別干凈、對(duì)比度特別高的時(shí)候才穩(wěn)定。稍微有點(diǎn)噪點(diǎn)就切不對(duì)。連通域法是把圖片中連通的白色區(qū)域找出來(lái)。字符和字符之間是分開的屬于不同連通域按x坐標(biāo)排序后就能依次切出。這比垂直投影更穩(wěn)定但也會(huì)把噪點(diǎn)、鉚釘誤判成字符。輪廓檢測(cè)法和連通域法原理類似但用的是cv2.findContours。我最終選用的就是輪廓檢測(cè)法配合寬高比和面積過(guò)濾contours, _ cv2.findContours(binary, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE) char_regions [] for cnt in contours: x, y, w, h cv2.boundingRect(cnt) area w * h ratio h / float(w) # 字符寬度約占車牌寬度的10%~20%高度約占40%~90% if 0.1 * binary.shape[1] w 0.25 * binary.shape[1] \ and 0.4 * binary.shape[0] h 0.95 * binary.shape[0] \ and area 50: char_regions.append((x, y, w, h)) # 按x坐標(biāo)從小到大排序 char_regions.sort(keylambda r: r[0])4.3 字符歸一化處理分割出來(lái)的字符大小不一在做識(shí)別之前需要?dú)w一化成統(tǒng)一的尺寸。標(biāo)準(zhǔn)車牌字符的寬高比大約是0.5左右比如字符寬45mm、高90mm我這里把每個(gè)字符都縮放成20x40像素resized cv2.resize(char_img, (20, 40), interpolationcv2.INTER_AREA)INTER_AREA是縮小圖片時(shí)效果最好的插值算法不會(huì)產(chǎn)生明顯的鋸齒。放大時(shí)則用INTER_CUBIC效果更好但因?yàn)槲覀兪窃诳s小車牌字符通常遠(yuǎn)大于20x40像素所以用INTER_AREA。歸一化之后每個(gè)字符就變成了一組長(zhǎng)度80020x40的特征向量后面無(wú)論是做模板匹配還是訓(xùn)練CNN輸入格式都統(tǒng)一了。分割完了還要做一步驗(yàn)證標(biāo)準(zhǔn)車牌是7個(gè)字符第一位是省份漢字簡(jiǎn)稱第二位是字母后面五位是字母和數(shù)字混排所以正常情況下應(yīng)該分割出7個(gè)字符。如果少于6個(gè)或多于8個(gè)說(shuō)明分割出問(wèn)題了需要回到前面調(diào)整參數(shù)。5. 字符識(shí)別從模板匹配到輕量級(jí)CNN5.1 模板匹配的實(shí)現(xiàn)原理字符識(shí)別最簡(jiǎn)單的方案就是模板匹配。思路很樸素準(zhǔn)備一套標(biāo)準(zhǔn)字符模板各省簡(jiǎn)稱漢字、大寫字母A-Z、數(shù)字0-9然后把分割出來(lái)的字符圖片和每個(gè)模板做相似度比較取最相似的作為識(shí)別結(jié)果。OpenCV里用cv2.matchTemplate實(shí)現(xiàn)模板匹配再配合cv2.minMaxLoc取最佳匹配位置result cv2.matchTemplate(char_img, template_img, cv2.TM_CCOEFF_NORMED) _, max_val, _, _ cv2.minMaxLoc(result)TM_CCOEFF_NORMED是歸一化相關(guān)系數(shù)匹配法輸出值在-1到1之間越接近1表示匹配度越高。模板匹配的優(yōu)勢(shì)是簡(jiǎn)單、快、不需要訓(xùn)練。它的劣勢(shì)也很明顯對(duì)字體變化、字符變形、模糊特別敏感。如果實(shí)際車牌用的字體和模板字體差太多識(shí)別率會(huì)直線下降。我做模板匹配時(shí)踩過(guò)最大的坑是沒(méi)有提前做二值化統(tǒng)一。如果分割出來(lái)的字符是灰度圖而模板是二值圖匹配結(jié)果就會(huì)很差。后來(lái)我把字符和模板都統(tǒng)一轉(zhuǎn)成相同尺寸的二值圖識(shí)別率才有了明顯提升。模板匹配適合做一個(gè)快速原型驗(yàn)證或者作為最終方案的baseline。5.2 基于CNN的輕量級(jí)識(shí)別方案如果追求更高的識(shí)別精度我推薦用一個(gè)極簡(jiǎn)的卷積神經(jīng)網(wǎng)絡(luò)來(lái)做字符分類。不需要很大很復(fù)雜的模型車牌字符數(shù)量和類別是固定的省份漢字約30個(gè)實(shí)際用到的沒(méi)有30個(gè)排除一些未使用的大寫字母24個(gè)去掉I和O數(shù)字10個(gè)總共約60~70個(gè)類別。這個(gè)分類規(guī)模很小用一個(gè)三層卷積加全連接的輕量網(wǎng)絡(luò)就夠了。我用PyTorch或TensorFlow/Keras搭了個(gè)結(jié)構(gòu)很簡(jiǎn)單的小網(wǎng)絡(luò)import torch.nn as nn class SimpleCNN(nn.Module): def __init__(self, num_classes): super(SimpleCNN, self).__init__() self.conv1 nn.Conv2d(1, 32, kernel_size3, padding1) self.relu1 nn.ReLU() self.pool1 nn.MaxPool2d(2, 2) self.conv2 nn.Conv2d(32, 64, kernel_size3, padding1) self.relu2 nn.ReLU() self.pool2 nn.MaxPool2d(2, 2) self.fc1 nn.Linear(64 * 5 * 10, 128) self.relu3 nn.ReLU() self.fc2 nn.Linear(128, num_classes) def forward(self, x): x self.pool1(self.relu1(self.conv1(x))) x self.pool2(self.relu2(self.conv2(x))) x x.view(x.size(0), -1) x self.relu3(self.fc1(x)) x self.fc2(x) return x輸入是1x20x40的灰度圖經(jīng)過(guò)兩層卷積池化后特征圖尺寸變成64x5x10然后接全連接層輸出類別概率。訓(xùn)練數(shù)據(jù)可以自己造用電腦里的字體生成各種車牌字符圖片加上一些旋轉(zhuǎn)、噪聲、縮放等數(shù)據(jù)增強(qiáng)。我實(shí)際訓(xùn)練時(shí)用了3000張左右的字符圖訓(xùn)練20個(gè)epoch驗(yàn)證集準(zhǔn)確率能到99%以上。在實(shí)際使用中對(duì)單張字符圖推理一次大概只需要幾毫秒完全滿足哪怕視頻流的實(shí)時(shí)性要求。5.3 識(shí)別結(jié)果的后處理與校驗(yàn)?zāi)玫阶址R(shí)別結(jié)果后還要做一個(gè)后處理校驗(yàn)。車牌的字符排列是有固定規(guī)律的第一位必須是省份漢字簡(jiǎn)稱京、津、冀、晉、蒙、遼、吉、黑、滬、蘇、浙、皖、閩、贛、魯、豫、鄂、湘、粵、桂、瓊、渝、川、貴、云、藏、陜、甘、青、寧、新第二位是大寫字母對(duì)應(yīng)發(fā)牌機(jī)關(guān)代號(hào)通常排除I和O第三到七位是字母或數(shù)字混排但通常也會(huì)排除I和O為了避免和數(shù)字1、0混淆。所以我可以在輸出結(jié)果時(shí)加一個(gè)規(guī)則校驗(yàn)province_chars 京津滬渝冀豫云遼黑湘皖魯新蘇浙贛鄂桂甘晉蒙陜吉閩貴粵青藏川寧瓊 digits 0123456789 letters ABCDEFGHJKLMNPQRSTUVWXYZ result .join(predicted_chars) # 校驗(yàn)規(guī)則 if result[0] not in province_chars: print(第一位應(yīng)為省份簡(jiǎn)稱) if result[1] not in letters: print(第二位應(yīng)為字母) for ch in result[2:]: if ch not in digits and ch not in letters: print(后五位應(yīng)為字母或數(shù)字)這套校驗(yàn)?zāi)軒臀覀優(yōu)V掉一部分明顯的識(shí)別錯(cuò)誤。比如識(shí)別結(jié)果第一位是數(shù)字那肯定是錯(cuò)了可以回到字符分割環(huán)節(jié)檢查是不是把車牌的外框或噪聲當(dāng)成字符切進(jìn)來(lái)了。6. 實(shí)操過(guò)程中的常見問(wèn)題與避坑指南6.1 環(huán)境安裝與報(bào)錯(cuò)排查OpenCV的環(huán)境安裝問(wèn)題可能是初學(xué)者遇到最多的我在實(shí)踐中也碰到過(guò)不少。最典型的一個(gè)報(bào)錯(cuò)是ModuleNotFoundError: No module named cv2這個(gè)錯(cuò)誤的原因很簡(jiǎn)單OpenCV沒(méi)裝成功或沒(méi)裝到當(dāng)前使用的Python環(huán)境里。常見解決方法是pip uninstall opencv-python pip install opencv-python --user還有一類報(bào)錯(cuò)是用cv2.imshow時(shí)直接崩了或者白屏尤其是在遠(yuǎn)程服務(wù)器或Docker容器里cv2.error: The function/feature is not implemented ...這是因?yàn)楫?dāng)前環(huán)境中沒(méi)有圖形界面支持OpenCV無(wú)法創(chuàng)建顯示窗口。解決辦法是改用cv2.imwrite保存圖片到文件然后用其他工具查看。我在之前的項(xiàng)目里就是這么調(diào)試的——把處理中間結(jié)果全部保存成圖片一張張看。6.2 圖像質(zhì)量問(wèn)題導(dǎo)致識(shí)別失敗實(shí)際拍攝的車牌圖片如果是在陰天、傍晚或者背光場(chǎng)景拍的車牌區(qū)域可能比較暗對(duì)比度不足。我實(shí)測(cè)后發(fā)現(xiàn)直接用Canny邊緣檢測(cè)會(huì)漏掉很多輪廓。這時(shí)候可以先做直方圖均衡化提升對(duì)比度gray_eq cv2.equalizeHist(gray)cv2.equalizeHist能把灰度分布拉開讓暗的地方變亮、亮的地方保持亮是低對(duì)比度場(chǎng)景下非常實(shí)用的預(yù)處理手段。需要注意的是直方圖均衡化只對(duì)灰度圖有效對(duì)彩色圖需要先轉(zhuǎn)成YCrCb之類的色彩空間只在Y通道上做均衡化否則會(huì)破壞顏色信息。另一個(gè)常見問(wèn)題是車牌的藍(lán)色在灰度圖里和深色背景區(qū)分度不高。如果檢測(cè)不出來(lái)可以考慮增加顏色過(guò)濾的路子——直接在HSV空間里篩選藍(lán)色區(qū)域作為邊緣檢測(cè)的補(bǔ)充hsv cv2.cvtColor(image, cv2.COLOR_BGR2HSV) blue_mask cv2.inRange(hsv, (100, 100, 100), (130, 255, 255))藍(lán)色車牌對(duì)應(yīng)的H通道范圍大致在100~130之間。加上這層顏色過(guò)濾定位的成功率會(huì)大幅提升。當(dāng)然這也意味著系統(tǒng)只能識(shí)別藍(lán)底車牌如果想要兼容黃底、綠底車牌需要把對(duì)應(yīng)的顏色范圍都加進(jìn)去。6.3 分割不準(zhǔn)確時(shí)的調(diào)整思路字符分割常見的失敗表現(xiàn)有兩個(gè)一個(gè)是切出來(lái)的字符粘連在一起一個(gè)是字符被攔腰斬?cái)?。粘連的原因通常是字符間距過(guò)小或者圖像分辨率不夠兩個(gè)字符的二值化區(qū)域連成了一片。我的經(jīng)驗(yàn)是優(yōu)先檢查二值化閾值是否合適。用Otsu自動(dòng)閾值仍然粘連的話可以試試自適應(yīng)閾值cv2.adaptiveThreshold它對(duì)光照不均的處理更好binary cv2.adaptiveThreshold(warped_gray, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, 11, 2)字符被切斷則往往是因?yàn)檫吘墮z測(cè)或形態(tài)學(xué)操作參數(shù)太激進(jìn)把字符內(nèi)部的筆畫當(dāng)成了背景??梢园雅蛎浀螖?shù)從2降為1或者把閉運(yùn)算的核尺寸調(diào)小。如果分割結(jié)果不穩(wěn)定我還有一個(gè)調(diào)試技巧把每一張分割出的字符圖單獨(dú)保存到一個(gè)目錄里按順序用數(shù)字命名。這樣一眼就能看出分割是否錯(cuò)位、是否多了或少了字符。這也是我前面說(shuō)的output/目錄的用途之一。6.4 性能優(yōu)化建議雖然靜態(tài)圖片識(shí)別不需要太關(guān)注性能但如果要用在視頻流或嵌入式設(shè)備上就有優(yōu)化空間了。首選的優(yōu)化方向是降低處理分辨率。車牌識(shí)別對(duì)分辨率的敏感度沒(méi)那么高——車牌本身是高頻信息集中的區(qū)域只要車牌區(qū)域在圖片中足夠大就好。我的做法是如果原始圖片是1920x1080先縮放到1280x720再處理。實(shí)測(cè)下來(lái)精度幾乎不受影響速度提升卻能接近一倍。第二個(gè)優(yōu)化方向是縮小搜索范圍。攝像頭固定場(chǎng)景下比如停車場(chǎng)入口車牌通常出現(xiàn)在畫面的中下區(qū)域、固定的幾個(gè)車道位置??梢韵茸鲆粭lROI感興趣區(qū)域設(shè)定只在這個(gè)區(qū)域里做車牌定位能省掉大量背景干擾也大幅減少計(jì)算量。第三個(gè)優(yōu)化方向是避免重復(fù)計(jì)算。如果在做視頻流識(shí)別相鄰幀之間車牌位置變化很小可以用上一幀定位到的位置作為當(dāng)前幀的初始搜索區(qū)域只在這個(gè)小區(qū)域內(nèi)重新定位。這種跟蹤式的思路能大幅提升幀率。7. 項(xiàng)目完整代碼框架下面是我項(xiàng)目的完整代碼框架你可以直接參考或在此基礎(chǔ)上擴(kuò)展。完整的代碼我按模塊組織方便調(diào)試和復(fù)用。主程序main.pyimport cv2 import numpy as np from plate_locator import locate_plate from char_segmenter import segment_chars from char_recognizer import recognize_chars def main(image_path): # 1. 讀取圖片 img cv2.imread(image_path) if img is None: print(圖片讀取失敗) return # 2. 車牌定位 plate_img locate_plate(img) if plate_img is None: print(未檢測(cè)到車牌) return # 3. 字符分割 char_imgs segment_chars(plate_img) if len(char_imgs) 7: print(字符分割異常分割出 %d 個(gè)字符 % len(char_imgs)) return # 4. 字符識(shí)別 result recognize_chars(char_imgs) print(車牌號(hào)碼, result) if __name__ __main__: main(test_car.jpg)車牌定位模塊plate_locator.pyimport cv2 import numpy as np def order_points(pts): rect np.zeros((4, 2), dtypefloat32) s pts.sum(axis1) rect[0] pts[np.argmin(s)] rect[2] pts[np.argmax(s)] diff np.diff(pts, axis1) rect[1] pts[np.argmin(diff)] rect[3] pts[np.argmax(diff)] return rect def locate_plate(image): # 預(yù)處理 gray cv2.cvtColor(image, cv2.COLOR_BGR2GRAY) gray cv2.equalizeHist(gray) blurred cv2.GaussianBlur(gray, (5, 5), 0) # 邊緣檢測(cè) edges cv2.Canny(blurred, 50, 150) # 形態(tài)學(xué)操作 kernel cv2.getStructuringElement(cv2.MORPH_RECT, (5, 5)) dilated cv2.dilate(edges, kernel, iterations2) closed cv2.morphologyEx(dilated, cv2.MORPH_CLOSE, kernel) # 輪廓檢測(cè) contours, _ cv2.findContours(closed, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE) h, w image.shape[:2] best_area 0 best_box None for cnt in contours: rect cv2.minAreaRect(cnt) box cv2.boxPoints(rect) box np.int0(box) roi_w rect[1][0] roi_h rect[1][1] if roi_w roi_h: roi_w, roi_h roi_h, roi_w aspect_ratio roi_w / float(roi_h) area roi_w * roi_h if 2.5 aspect_ratio 4.5 and area best_area: # 面積比例和寬高比都滿足條件 if 0.0004 area / (h * w) 0.02: best_area area best_box box if best_box is None: return None # 透視變換 src_pts order_points(best_box) dst_pts np.array([[0, 0], [440, 0], [440, 140], [0, 140]], dtypefloat32) M cv2.getPerspectiveTransform(src_pts, dst_pts) warped cv2.warpPerspective(image, M, (440, 140)) return warped字符分割模塊char_segmenter.pyimport cv2 import numpy as np def segment_chars(plate_img): gray cv2.cvtColor(plate_img, cv2.COLOR_BGR2GRAY) # 二值化 _, binary cv2.threshold(gray, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU) # 去除邊框 h, w binary.shape binary binary[3:h-3, 3:w-3] # 輪廓檢測(cè) contours, _ cv2.findContours(binary, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE) char_regions [] for cnt in contours: x, y, w, h cv2.boundingRect(cnt) area w * h ratio h / float(w) if w 0 else 0 if 0.1 * binary.shape[1] w 0.25 * binary.shape[1] \ and 0.4 * binary.shape[0] h 0.95 * binary.shape[0] \ and area 50: char_regions.append((x, y, w, h)) char_regions.sort(keylambda r: r[0]) char_imgs [] for (x, y, w, h) in char_regions: char binary[y:yh, x:xw] resized cv2.resize(char, (20, 40), interpolationcv2.INTER_AREA) char_imgs.append(resized) return char_imgs字符識(shí)別模塊char_recognizer.pyimport cv2 import numpy as np import os class CharRecognizer: def __init__(self, template_dir, char_dict_path): self.templates [] self.labels [] # 加載模板這里支持從一個(gè)目錄中讀取所有模板圖片 for label in os.listdir(template_dir): label_path os.path.join(template_dir, label) for file in os.listdir(label_path): img cv2.imread(os.path.join(label_path, file), 0) img cv2.resize(img, (20, 40), interpolationcv2.INTER_AREA) _, img cv2.threshold(img, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU) self.templates.append(img) self.labels.append(label) def recognize(self, char_imgs): result for char in char_imgs: _, char cv2.threshold(char, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU) best_score -1 best_label ? for template, label in zip(self.templates, self.labels): score cv2.matchTemplate(char, template, cv2.TM_CCOEFF_NORMED)[0][0] if score best_score: best_score score best_label label result best_label return result def recognize_chars(char_imgs): # 這里可以替換成CNN實(shí)現(xiàn) recognizer CharRecognizer(templates/, None) return recognizer.recognize(char_imgs)這套代碼框架雖然樸素但把整個(gè)流程跑通是沒(méi)問(wèn)題的。如果你后續(xù)接入CNN識(shí)別只需要修改recognize_chars函數(shù)的實(shí)現(xiàn)車牌定位和字符分割的代碼可以完全復(fù)用。8. 個(gè)人的一些實(shí)操心得做這個(gè)車牌識(shí)別項(xiàng)目我最大的感受是算法這東西紙上談兵是一回事跑起來(lái)是完全另一回事。你可能在理論上覺(jué)得車牌定位很簡(jiǎn)單——不就是找輪廓嘛——但實(shí)際一跑發(fā)現(xiàn)光照、角度、背景雜色都會(huì)把結(jié)果搞得一團(tuán)糟。每一步的參數(shù)調(diào)整都是基于大量實(shí)拍的反復(fù)試錯(cuò)。我給準(zhǔn)備做這個(gè)項(xiàng)目的朋友三個(gè)建議第一不要一開始就追求復(fù)雜方案。先跑通傳統(tǒng)方法讓整個(gè)鏈路work起來(lái)再逐步替換或進(jìn)化某個(gè)環(huán)節(jié)。直接一上來(lái)就上YOLO加CNN代碼是跑通了但你什么都沒(méi)學(xué)到。第二一定要自己準(zhǔn)備測(cè)試集。不要只用網(wǎng)上教程里的那幾張圖片做驗(yàn)證。自己拿手機(jī)拍各種場(chǎng)景——白天、晚上、晴天、陰天、遠(yuǎn)距離、近距離、不同顏色車牌——測(cè)試集越多樣你對(duì)算法穩(wěn)健性的理解就越深。第三做好可視化調(diào)試。把每一步的中間結(jié)果都保存成圖片肉眼觀察變化是最有效的調(diào)試方式。不要只盯著最后輸出中間過(guò)程往往藏著問(wèn)題的根源。車牌識(shí)別系統(tǒng)雖然看起來(lái)是個(gè)小項(xiàng)目但它覆蓋了圖像處理的大部分核心知識(shí)點(diǎn)。真正吃透這個(gè)項(xiàng)目你再去學(xué)人臉檢測(cè)、物體識(shí)別、OCR這些方向會(huì)發(fā)現(xiàn)很多東西是相通的。這套從定位到分割到識(shí)別的思維框架在計(jì)算機(jī)視覺(jué)領(lǐng)域里可以復(fù)用到很多場(chǎng)景。本文還有配套的精品資源點(diǎn)擊獲取