習(xí)rPPG心率估計(jì):從人臉視頻到非接觸心率監(jiān)測(cè))
簡(jiǎn)介面向基于 rPPG 的深度學(xué)習(xí)心率估計(jì)任務(wù)這份 MATLAB 源碼包集成了多種經(jīng)典算法與可運(yùn)行案例數(shù)據(jù)。適用于計(jì)算機(jī)、電子信息工程、數(shù)學(xué)等專業(yè)的課程設(shè)計(jì)、期末大作業(yè)及畢業(yè)設(shè)計(jì)也適合研究者快速?gòu)?fù)現(xiàn)和擴(kuò)展實(shí)驗(yàn)。包內(nèi)共 118 個(gè)文件以 m 腳本為核心輔以 xml 配置文件、png 示意圖、pdf 文檔與 prj 工程文件整體約 7.31MB目錄結(jié)構(gòu)清晰便于按需取用。代碼采用參數(shù)化編程參數(shù)易調(diào)整思路與注釋均較為細(xì)致能幫助使用者理解圖像處理、信號(hào)分析和深度學(xué)習(xí)在心率估計(jì)中的完整流程。目前已有 121 人學(xué)習(xí)下載對(duì)希望入門(mén)或深化 rPPG 技術(shù)、開(kāi)展生物醫(yī)學(xué)信號(hào)處理實(shí)踐的學(xué)生與開(kāi)發(fā)者而言是一份可直接上手的學(xué)習(xí)與實(shí)驗(yàn)資料。1. 一個(gè) zip 背后的非接觸心率估計(jì)它解決什么問(wèn)題適合誰(shuí)用拿到類似《基于深度學(xué)習(xí)的基于 rPPG 心率估計(jì).zip》這種工程打包我一般會(huì)先做三件事解壓看目錄、查環(huán)境依賴、確認(rèn)里面的數(shù)據(jù)是原始視頻還是已經(jīng)切好的真值標(biāo)注。這類項(xiàng)目解決的其實(shí)是一個(gè)很具體的訴求只靠普通攝像頭對(duì)著人臉拍視頻就能把心率估出來(lái)不用胸帶、不用指夾、不用任何接觸式傳感器。rPPGremote Photoplethysmography遠(yuǎn)程光電容積描記就是這套技術(shù)的統(tǒng)稱深度學(xué)習(xí)要學(xué)的是人臉視頻到脈搏波信號(hào)之間的映射關(guān)系。它適合三類人做疲勞駕駛或健康監(jiān)測(cè)產(chǎn)品的工程師想低成本驗(yàn)證非接觸生理信號(hào)方案的硬件團(tuán)隊(duì)以及拿這個(gè)方向做畢業(yè)設(shè)計(jì)、需要快速跑通完整鏈路的同學(xué)。但我要先說(shuō)清楚這類 zip 包大多數(shù)不是開(kāi)箱即用數(shù)據(jù)格式、時(shí)間戳對(duì)齊、訓(xùn)練和推理的幀率差異坑都在代碼外面。這篇筆記按我自己的實(shí)踐路徑把數(shù)據(jù)準(zhǔn)備、模型選型、訓(xùn)練、推理和排錯(cuò)整條鏈路講完。2. 先立住信號(hào)假設(shè)rPPG 為什么能被深度學(xué)習(xí)學(xué)會(huì)2.1 傳統(tǒng)方法的三條假設(shè)以及它們?yōu)槭裁丛谡鎸?shí)場(chǎng)景翻車(chē)rPPG 的物理基礎(chǔ)不復(fù)雜心臟每搏動(dòng)一次面部皮膚毛細(xì)血管里的血容量就變化一次血紅蛋白對(duì)綠光的吸收率隨之波動(dòng)攝像頭拍到的 RGB 信號(hào)里就攜帶了這個(gè)微弱的周期分量。傳統(tǒng)方法比如 POS、CHROM、ICA本質(zhì)上是做信號(hào)分解——從面部 ROI 的平均 RGB 序列里把和心跳相關(guān)的色度變化分量分離出來(lái)。這些方法依賴三條隱含假設(shè)第一光照是穩(wěn)定的第二人臉是靜止的第三皮膚區(qū)域的顏色變化主要來(lái)自血流而不是陰影或反光。實(shí)驗(yàn)室環(huán)境滿足這三條所以傳統(tǒng)方法在公開(kāi)數(shù)據(jù)集上表現(xiàn)不差。一旦進(jìn)到真實(shí)場(chǎng)景日光燈頻閃、頭部轉(zhuǎn)動(dòng)、說(shuō)話時(shí)的肌肉牽拉、手機(jī)自動(dòng)白平衡都會(huì)把 RGB 信號(hào)里的非周期分量放大導(dǎo)致傳統(tǒng)方法的輸出心率要么劇烈抖動(dòng)要么直接鎖在環(huán)境光的整數(shù)倍頻率上。深度學(xué)習(xí)換了個(gè)思路不去手工定義哪個(gè)色度子空間是“干凈”的而是用標(biāo)注好的視頻直接學(xué)“RGB 時(shí)序 → PPG 波形”這段映射。網(wǎng)絡(luò)能看到傳統(tǒng)方法看不到的非線性耦合比如運(yùn)動(dòng)帶來(lái)的膚色變化和血流帶來(lái)的膚色變化在空間紋理上的差異。代價(jià)是它需要足夠多樣的訓(xùn)練數(shù)據(jù)否則會(huì)過(guò)擬合到某個(gè)數(shù)據(jù)集特有的光照模式上這個(gè)是后面避坑章節(jié)的重點(diǎn)。2.2 深度模型的輸入輸出設(shè)計(jì)把視頻回歸成 PPG 波形在動(dòng)手搭模型之前先要把輸入輸出定下來(lái)。我給這個(gè)方向的項(xiàng)目定過(guò)不同方案最常見(jiàn)的有三種建模方式各有側(cè)重點(diǎn)。建模方式輸入輸出優(yōu)點(diǎn)工程代價(jià)PPG 波形回歸T 幀人臉 ROI 序列長(zhǎng)度 T 的一維 PPG 信號(hào)中間量可檢查、可后處理心率從頻譜計(jì)算需要波形級(jí)標(biāo)注或由 R-peak 生成參考波形心率直接回歸T 幀人臉 ROI 序列單個(gè) bpm 數(shù)值鏈路最短訓(xùn)練簡(jiǎn)單輸出不可解釋窗口長(zhǎng)度選擇敏感心率區(qū)間分類T 幀人臉 ROI 序列若干心率區(qū)間的概率邏輯簡(jiǎn)單精度粗糙只能做粗篩我一般選波形回歸。原因很實(shí)際輸出是一段信號(hào)我能拿它的頻譜圖去定位問(wèn)題。如果模型輸出的波形頻譜在 0.75 到 4Hz 之間有清晰單峰說(shuō)明網(wǎng)絡(luò)學(xué)到了東西如果頻譜一片混沌我就可以判斷是數(shù)據(jù)問(wèn)題還是后處理問(wèn)題。直接回歸心率值等于把后處理交給了黑匣子排查難度大得多。輸入側(cè)有兩個(gè)關(guān)鍵參數(shù)先定每段采樣幀數(shù) T 和 ROI 分辨率。T 至少要覆蓋兩個(gè)完整心跳周期按最低心率 45bpm 算一個(gè)周期約 1.33 秒30fps 下兩個(gè)周期就是 80 幀我通常取 128 幀約 4.3 秒留出余量。ROI 分辨率不需要高36x36 到 64x64 足夠因?yàn)?rPPG 利用的是區(qū)域平均顏色變化局部紋理信息反而可能引入運(yùn)動(dòng)噪聲。2.3 評(píng)價(jià)指標(biāo)怎么定MAE、±5bpm 準(zhǔn)確率和使用場(chǎng)景的關(guān)系訓(xùn)練和驗(yàn)證階段我建議同時(shí)看三個(gè)指標(biāo)別只盯 loss。MAE平均絕對(duì)誤差反映整體偏差單位是 bpm疲勞監(jiān)測(cè)場(chǎng)景我要求 MAE 小于 6bpm±5bpm 準(zhǔn)確率反映有多少時(shí)間窗口的估計(jì)誤差落在 5bpm 以內(nèi)這個(gè)指標(biāo)對(duì)報(bào)警類應(yīng)用更重要因?yàn)檎`報(bào)比均值偏差更傷人RMSE 則用于暴露個(gè)別窗口的大誤差。對(duì)比論文數(shù)據(jù)時(shí)要小心統(tǒng)計(jì)口徑。有的工作報(bào)的是段級(jí)指標(biāo)比如對(duì)整段 30 秒視頻只算一個(gè)心率誤差有的工作報(bào)的是窗口級(jí)指標(biāo)每 5 秒算一次。同一套模型前者的 MAE 會(huì)比后者低 2 到 3bpm。我自己的習(xí)慣是固定用窗口級(jí)指標(biāo)窗口長(zhǎng)度 10 秒、步長(zhǎng) 1 秒這樣測(cè)試結(jié)果能和部署場(chǎng)景對(duì)齊。新手最容易犯的錯(cuò)是拿段級(jí)結(jié)果去對(duì)標(biāo)論文里的窗口級(jí)數(shù)字以為自己復(fù)現(xiàn)成功了。3. 把最小閉環(huán)跑通公開(kāi)數(shù)據(jù)集、切塊預(yù)處理與訓(xùn)練腳本3.1 準(zhǔn)備數(shù)據(jù)集公開(kāi)數(shù)據(jù)的標(biāo)簽讀取與文件組織做這類項(xiàng)目第一步不是寫(xiě)模型而是把數(shù)據(jù)組織好。公開(kāi)數(shù)據(jù)集我常用的是 UBFC-rPPG 和 PURE 這類前者是用相機(jī)錄制的面部視頻加 R-peak 標(biāo)注后者包含多個(gè)受試者在不同運(yùn)動(dòng)狀態(tài)下的樣本。下載下來(lái)大多是 zip 或 tar 包解壓后每個(gè)受試者一個(gè)目錄里面有視頻文件和標(biāo)注文件。我習(xí)慣先把原始目錄重排成統(tǒng)一結(jié)構(gòu)避免后續(xù)寫(xiě)死在路徑里。rppg_project/ data/ raw/ subject01/ video.avi peaks.txt subject02/ video.avi peaks.txt processed/ subject01_128.npy subject01_hr.npy dataset.py train.py config.yaml標(biāo)注文件最需要小心。不同數(shù)據(jù)集的 R-peak 文件格式不一樣有的每行一個(gè)峰值時(shí)間戳單位是秒有的則是兩列數(shù)據(jù)需要先查文件頭再?zèng)Q定解析方式。我吃過(guò)虧的地方是直接用 np.loadtxt 整批加載結(jié)果某個(gè)文件的列數(shù)不對(duì)訓(xùn)練到一半才報(bào)錯(cuò)。先讀幾行確認(rèn)格式再寫(xiě)完整的加載函數(shù)這一步能省下半天排錯(cuò)時(shí)間。import numpy as np def load_peaks(txt_path, fs_label60.0): # 先看前幾行確認(rèn)是單列還是多列、單位是秒還是毫秒 with open(txt_path, r) as f: head [next(f).strip() for _ in range(3)] print(head:, head) # 常見(jiàn)格式每行一個(gè)峰值時(shí)間戳單位秒 peaks np.loadtxt(txt_path, dtypenp.float64) if np.nanmax(peaks) 300: # 如果數(shù)值大于300大概率是毫秒轉(zhuǎn)成秒 peaks peaks / 1000.0 return peaks這段代碼的邏輯是先打印標(biāo)注文件頭確認(rèn)格式后再解析。參數(shù)說(shuō)明fs_label 是標(biāo)注系統(tǒng)的采樣率這類數(shù)據(jù)集里 R-peak 時(shí)間戳的精度至少要毫秒級(jí)否則后續(xù)算逐幀心率真值時(shí)會(huì)引入額外抖動(dòng)。單位判斷用最大值是否超過(guò) 300 只是經(jīng)驗(yàn)法則因?yàn)橐欢螏资氲囊曨l不可能出現(xiàn)超過(guò) 300 秒的峰間隔遇到特殊格式還是要回到文件頭確認(rèn)。3.2 切塊與增強(qiáng)T、ROI 尺寸、幀率歸一化這三個(gè)參數(shù)先定下來(lái)視頻不能整段塞進(jìn)網(wǎng)絡(luò)。我按 T128 幀切塊滑動(dòng)步長(zhǎng) 64 幀這樣相鄰樣本有 50% 重疊既增加了訓(xùn)練樣本量也起到輕微的平滑正則作用。每個(gè)樣本先做人臉檢測(cè)把臉部區(qū)域裁剪并縮放到 64x64再做 z-score 歸一化。幀率歸一化容易被忽略如果數(shù)據(jù)集的標(biāo)注視頻是 30fps推理端是 15fps模型在時(shí)間維度上的卷積核就完全錯(cuò)位了。訓(xùn)練時(shí)統(tǒng)一把視頻重采樣到固定幀率是必做項(xiàng)。def preprocess_video(video_path, T128, resize64, fs_target30.0): cap cv2.VideoCapture(video_path) fs_native cap.get(cv2.CAP_PROP_FPS) frames [] while True: ret, frame cap.read() if not ret: break # 這里用 OpenCV 的人臉檢測(cè)器拿 bbox后續(xù)會(huì)替換成關(guān)鍵點(diǎn)對(duì)齊 boxes face_detector(frame) x, y, w, h pick_face_box(boxes) roi frame[y:yh, x:xw] roi cv2.resize(roi, (resize, resize)) frames.append(roi) cap.release() # 重采樣到目標(biāo)幀率避免訓(xùn)練和推理幀率不一致 n_total len(frames) idx np.linspace(0, n_total - 1, int(n_total * fs_target / fs_native)) frames [frames[int(i)] for i in idx] return np.stack(frames[:T])重采樣這步的 idx 計(jì)算本質(zhì)上是在時(shí)間軸上做了線性插值。如果原生幀率是 30、目標(biāo)是 25相當(dāng)于每 6 幀抽 5 幀能接受如果幀率差太多比如從 60fps 降到 15fps建議先用平均池化做平滑再抽幀否則會(huì)引入混疊噪聲。ROI 尺寸這個(gè)參數(shù)容易被盲目加大實(shí)際 64x64 在多數(shù)設(shè)備上已經(jīng)夠了加到 128x128 不會(huì)提升精度只會(huì)增加顯存壓力。3.3 最小訓(xùn)練腳本PyTorch3D-CNN 基線與負(fù) Pearson loss模型結(jié)構(gòu)我不建議一上來(lái)就上很重的網(wǎng)絡(luò)。一個(gè)能跑通的最小深度學(xué)習(xí)項(xiàng)目用 3D-CNN 做基線就夠了。輸入是 B x 3 x T x 64 x 64輸出是 B x T 的 PPG 波形。下面這個(gè)結(jié)構(gòu)是我常用的起點(diǎn)它把空間分辨率逐層壓縮保留時(shí)間維度最后通過(guò)線性插值對(duì)齊到目標(biāo)長(zhǎng)度。import torch import torch.nn as nn import torch.nn.functional as F class MiniRPPGNet(nn.Module): def __init__(self, in_ch3, T128, roi64): super().__init__() # 三層 3D 卷積逐步壓縮空間分辨率保留時(shí)間信息 self.backbone nn.Sequential( nn.Conv3d(in_ch, 32, kernel_size(3, 5, 5), stride(1, 2, 2), padding(1, 2, 2)), nn.BatchNorm3d(32), nn.ReLU(inplaceTrue), nn.Conv3d(32, 64, kernel_size(3, 3, 3), stride(2, 2, 2), padding(1, 1, 1)), nn.BatchNorm3d(64), nn.ReLU(inplaceTrue), nn.Conv3d(64, 128, kernel_size(3, 3, 3), stride(2, 2, 2), padding(1, 1, 1)), nn.BatchNorm3d(128), nn.ReLU(inplaceTrue), ) self.head nn.Sequential( nn.AdaptiveAvgPool3d((1, 1, 1)), # 空間和時(shí)間全局池化 nn.Conv3d(128, 1, kernel_size1), # 輸出單通道 ) def forward(self, x): # x: (B, 3, T, roi, roi) x self.backbone(x) # 時(shí)間長(zhǎng)度因?yàn)閟tride減半空間降到 16x16 x self.head(x) # (B, 1, 1, 1, 1) return x.view(x.size(0), -1) # 塌縮成 (B, 1)注意這里只輸出了一個(gè)標(biāo)量等等這段代碼有個(gè)問(wèn)題AdaptiveAvgPool3d((1,1,1)) 會(huì)把整段時(shí)間壓成一個(gè)點(diǎn)波形回歸就退化成標(biāo)量回歸了。正確的做法是只池化空間維度保留時(shí)間長(zhǎng)度。修正后的頭部應(yīng)該是先 AdaptiveAvgPool3d((1,1,1)) 不對(duì)應(yīng)該用 AdaptiveAvgPool3d 輸出完整時(shí)間長(zhǎng)度然后接 1x1 卷積。class MiniRPPGNet(nn.Module): def __init__(self, in_ch3, T128): super().__init__() self.backbone nn.Sequential( nn.Conv3d(in_ch, 32, kernel_size(3, 5, 5), stride(1, 2, 2), padding(1, 2, 2)), nn.BatchNorm3d(32), nn.ReLU(inplaceTrue), nn.Conv3d(32, 64, kernel_size(3, 3, 3), stride(2, 2, 2), padding(1, 1, 1)), nn.BatchNorm3d(64), nn.ReLU(inplaceTrue), nn.Conv3d(64, 128, kernel_size(3, 3, 3), stride(2, 2, 2), padding(1, 1, 1)), nn.BatchNorm3d(128), nn.ReLU(inplaceTrue), ) # 只壓縮空間時(shí)間交給后面的 interpolate 對(duì)齊 self.head nn.Sequential( nn.AdaptiveAvgPool3d((None, 1, 1)), # 時(shí)間維度不變空間壓到1x1 nn.Conv3d(128, 1, kernel_size(1, 1, 1)), ) def forward(self, x): # x: (B, 3, T, 64, 64) x self.backbone(x) # (B, 128, T_out, 16, 16)T_out 因?yàn)閟tride變小 x self.head(x) # (B, 1, T_out, 1, 1) x x.squeeze(-1).squeeze(-1) # (B, 1, T_out) x F.interpolate(x, size(128,), modelinear, align_cornersFalse) # 等比回到128 return x.squeeze(1) # (B, 128)這里的 AdaptiveAvgPool3d((None, 1, 1)) 寫(xiě)法可能不是所有 PyTorch 版本都支持 None實(shí)際工程里我用 torch.nn.AdaptiveAvgPool3d 時(shí)會(huì)用一個(gè)包裝函數(shù)處理時(shí)間維度的保留。更穩(wěn)妥的做法是不靠池化直接在卷積后對(duì)時(shí)間維度做線性插值代碼里我用 F.interpolate 把輸出長(zhǎng)度對(duì)齊到 128。反正對(duì)齊這一步必須有因?yàn)?backbone 的三個(gè) stride 已經(jīng)把時(shí)間維度縮短到約 32不插值回來(lái)沒(méi)法算 loss。loss 用負(fù) Pearson 相關(guān)系數(shù)它衡量的是預(yù)測(cè)波形和真值波形的形狀相似度對(duì)振幅不敏感。rPPG 的 PPG 幅度本身受膚色和光照影響絕對(duì)誤差 loss 會(huì)讓模型把精力花在擬合幅度上而不是波形形狀。def pearson_loss(pred, target, eps1e-6): # pred, target: (B, T) pred pred - pred.mean(dim1, keepdimTrue) target target - target.mean(dim1, keepdimTrue) cov (pred * target).mean(dim1) std_pred pred.std(dim1) std_target target.std(dim1) return - (cov / (std_pred * std_target eps)).mean()訓(xùn)練循環(huán)本身不復(fù)雜關(guān)鍵是每輪驗(yàn)證時(shí)算一次 Pearson 相關(guān)系數(shù)而不是只看 loss 下降。相關(guān)系數(shù)到 0.5 以上才能說(shuō)明模型開(kāi)始學(xué)習(xí)到與心跳相關(guān)的周期成分低于 0.3 基本是沒(méi)學(xué)到需要回去查數(shù)據(jù)。model MiniRPPGNet(in_ch3, T128) optimizer torch.optim.AdamW(model.parameters(), lr1e-3, weight_decay1e-4) scheduler torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_max30) for epoch in range(30): for frames, label_ppg in train_loader: # frames: (B, 3, 128, 64, 64)label_ppg: (B, 128) out model(frames) loss pearson_loss(out, label_ppg) optimizer.zero_grad() loss.backward() optimizer.step() scheduler.step()訓(xùn)練參數(shù)說(shuō)明AdamW 配合 CosineAnnealing 在小數(shù)據(jù)集上表現(xiàn)穩(wěn)定learning rate 從 1e-3 開(kāi)始30 個(gè) epoch 后基本收斂。batch size 顯存能吃下就設(shè) 8吃不下就把 ROI 改成 48x48或者把 T 降到 64。驗(yàn)證集上每 5 個(gè) epoch 手動(dòng)算一次 MAE比 loss 更直觀。如果訓(xùn)練時(shí) loss 下降但驗(yàn)證集 Pearson 不漲優(yōu)先檢查標(biāo)簽對(duì)齊。3.4 啟動(dòng)前先做兩件事看真值波形、看數(shù)據(jù) loader 輸出這一步我給新手強(qiáng)烈建議能篩掉一半玄學(xué)問(wèn)題。第一件事是把一個(gè)樣本的真值 PPG 畫(huà)出來(lái)確認(rèn)它有明顯的周期峰峰間隔對(duì)應(yīng)的心率在 45 到 100bpm 之間。如果真值波形平得像噪聲后面訓(xùn)練沒(méi)有意義。第二件事是跑一遍數(shù)據(jù) loader打印一個(gè) batch 的輸入輸出 shape確認(rèn)和模型 forward 的第一行注釋一致。import matplotlib.pyplot as plt sample train_set[0] frames, label_ppg sample print(frames shape:, frames.shape, ppg shape:, label_ppg.shape) plt.plot(label_ppg[:256]) # 畫(huà)256個(gè)采樣點(diǎn)看是否周期性 plt.show()真值波形如果出現(xiàn)臺(tái)階狀或突變通常是 R-peak 換算成逐幀心率時(shí)用了階躍插值而不是線性插值。這類問(wèn)題模型學(xué)不到東西還會(huì)讓你誤以為是網(wǎng)絡(luò)結(jié)構(gòu)不行。4. 從模型權(quán)重到心率數(shù)值推理鏈路與參數(shù)落地4.1 人臉對(duì)齊與 ROI 選取不只框臉還要避開(kāi)眼睛和嘴訓(xùn)練時(shí)做的是全臉裁剪推理時(shí)如果照搬就會(huì)出現(xiàn)問(wèn)題。眼睛的眨動(dòng)、嘴部的說(shuō)話動(dòng)作會(huì)產(chǎn)生大幅度的像素位移這些運(yùn)動(dòng)成分和血流信號(hào)混在一起。常見(jiàn)做法是做人臉關(guān)鍵點(diǎn)檢測(cè)然后取臉頰區(qū)域作為 ROI——兩眼連線以下、嘴部以上的梯形區(qū)域。這個(gè)區(qū)域皮膚暴露面積大肌肉運(yùn)動(dòng)少血流信號(hào)最干凈。我一般用關(guān)鍵點(diǎn)里的左右眼中心和鼻尖三個(gè)點(diǎn)來(lái)確定一個(gè)矩形再往下擴(kuò)一點(diǎn)點(diǎn)。逐幀跑關(guān)鍵點(diǎn)檢測(cè)在 CPU 上會(huì)拖垮幀率推理時(shí)通常每 5 幀檢測(cè)一次中間幀用線性插值補(bǔ)出關(guān)鍵點(diǎn)坐標(biāo)。頭部小幅轉(zhuǎn)動(dòng)時(shí)這種方式比逐幀檢測(cè)的抖動(dòng)還小因?yàn)闄z測(cè)器本身的輸出也有幀間跳動(dòng)插值相當(dāng)于做了平滑。如果頭部運(yùn)動(dòng)劇烈線性插值會(huì)失效那就只能縮短檢測(cè)間隔或者后端加一個(gè)跟蹤器。ROI 分辨率這里我明確建議 64x64不要學(xué)分類任務(wù)那樣加大。rPPG 要的是區(qū)域平均色度不是高頻紋理。分辨率太高會(huì)把皮膚毛孔、胡渣的噪聲學(xué)進(jìn)模型而且增加推理耗時(shí)。4.2 后處理三板斧去趨勢(shì)、帶通濾波、FFT 找峰模型輸出的是一段連續(xù) PPG 波形不能直接除 60 變成心率。三個(gè)固定操作去趨勢(shì)去掉基線漂移、帶通濾波限定到心率頻帶、FFT 找峰換算 bpm。這里的帶通濾波必須用零相位濾波普通 Butterworth 濾波會(huì)引入相位延遲導(dǎo)致峰的位置偏移心率計(jì)算結(jié)果偏差可達(dá)幾 bpm。import numpy as np from scipy import signal as sig def ppg_to_hr(ppg, fs30.0, low0.75, high4.0): # ppg: 1D array長(zhǎng)度對(duì)應(yīng)輸入幀數(shù) ppg sig.detrend(ppg, typelinear) # 去線性趨勢(shì)去掉呼吸和光照基線漂移 b, a sig.butter(2, [low / (fs / 2), high / (fs / 2)], btypeband) ppg sig.filtfilt(b, a, ppg) # 零相位濾波避免相位偏移 n len(ppg) win np.hanning(n) # 加窗減少頻譜泄漏 spec np.abs(np.fft.rfft(ppg * win)) freqs np.fft.rfftfreq(n, d1.0 / fs) idx np.where((freqs low) (freqs high))[0] peak_freq freqs[idx[np.argmax(spec[idx])]] return peak_freq * 60.0參數(shù)說(shuō)明帶通下限 0.75Hz 對(duì)應(yīng) 45bpm上限 4Hz 對(duì)應(yīng) 240bpm覆蓋絕大多數(shù)應(yīng)用場(chǎng)景。FFT 的頻率分辨率是 fs / nn128、fs30 時(shí)分辨率約 0.23Hz折合心率約 14bpm太粗了。所以要保證送入 FFT 的序列足夠長(zhǎng)推理時(shí)多個(gè)窗口拼接后的 PPG 序列至少有 256 點(diǎn)。如果只有 128 點(diǎn)心率結(jié)果只能到 ±7bpm 的精度這是我踩過(guò)的坑。4.3 輸出平滑瞬時(shí)心率做 EMA報(bào)警看趨勢(shì)FFT 峰值跳動(dòng)很大哪怕模型很準(zhǔn)相鄰兩個(gè)窗口的心率也能差出 8 到 10bpm。直接把這個(gè)值顯示給用戶體驗(yàn)很差。我常用的平滑方式是 EMAalpha 取 0.4讓當(dāng)前心率 60% 來(lái)自新結(jié)果、40% 來(lái)自歷史。再激進(jìn)一點(diǎn)取最近 10 個(gè)窗口的中位數(shù)。報(bào)警邏輯不要用瞬時(shí)值用最近 60 秒內(nèi)中位心率持續(xù)超過(guò)閾值這種趨勢(shì)判斷。ema_hr None alpha 0.4 def update_hr(raw_hr): global ema_hr if ema_hr is None: ema_hr raw_hr else: ema_hr alpha * raw_hr (1 - alpha) * ema_hr return ema_hrEMA 的 alpha 參數(shù)在設(shè)備上實(shí)測(cè)調(diào)alpha 太小響應(yīng)慢心率已經(jīng)變化了 10bpm 界面還停在舊值alpha 太大又抖動(dòng)明顯。我一般先取 0.4再根據(jù)實(shí)際視頻的抖動(dòng)幅度上下微調(diào) 0.1。5. rPPG 工程化的 4 個(gè)常見(jiàn)問(wèn)題與避坑指南5.1 幀率不一致訓(xùn)練 30fps部署 15fps波形全亂現(xiàn)象模型訓(xùn)練時(shí)輸入視頻是 30fps部署端攝像頭輸出 15fps。推理時(shí)模型輸出的 PPG 波形頻率整體減半心率看起來(lái)只有真實(shí)值的一半或者頻譜上出現(xiàn)奇怪的諧波峰。原因3D 卷積的時(shí)間維度是按絕對(duì)幀數(shù)設(shè)計(jì)的它默認(rèn)相鄰兩幀的時(shí)間間隔是固定的。把 15fps 的視頻直接喂給按 30fps 訓(xùn)練的網(wǎng)絡(luò)等于把時(shí)間軸拉長(zhǎng)了一倍所有頻率分量全部加倍。這個(gè)問(wèn)題在訓(xùn)練時(shí)幾乎不會(huì)暴露因?yàn)閿?shù)據(jù)集大多是統(tǒng)一幀率。解決推理端先讀攝像頭的真實(shí)幀率如果和訓(xùn)練幀率不一致先做時(shí)間軸重采樣。最簡(jiǎn)單的做法是拉普拉斯插值把 15fps 補(bǔ)到 30fps再做推理。更省事的方案是訓(xùn)練時(shí)就做幀率擾動(dòng)每個(gè) epoch 隨機(jī)把視頻抽幀到 20 到 30fps 之間再訓(xùn)練讓模型學(xué)到幀率不變性。5.2 光源頻閃為什么輸出心率死死貼在 60 或 120現(xiàn)象在室內(nèi)日光燈下測(cè)試心率輸出恒定為 60bpm 或者 120bpm且怎么動(dòng)都不變。換到自然光環(huán)境輸出又正常了。原因交流電驅(qū)動(dòng)的日光燈有 50Hz 或 60Hz 的亮度脈動(dòng)攝像頭采樣后這些高頻分量會(huì)混疊到低頻落在 0.75 到 4Hz 的心率頻帶內(nèi)。模型可能學(xué)到的是燈光周期而不是心跳周期。更隱蔽的是訓(xùn)練集里如果有大量室內(nèi)燈光數(shù)據(jù)模型會(huì)被訓(xùn)練得偏向輸出 60 的倍數(shù)。解決拍攝時(shí)控制曝光時(shí)間。對(duì)著 50Hz 光源把曝光時(shí)間設(shè)為 10ms 的整數(shù)倍讓每個(gè)幀內(nèi)累積的光能量相等從源頭消掉頻閃。已經(jīng)污染的數(shù)據(jù)做離線處理時(shí)用陷波濾波器在 50Hz、100Hz 處做衰減但前提是視頻幀率足夠高奈奎斯特頻率覆蓋這些頻點(diǎn)。還有一個(gè)快速診斷方法關(guān)燈只用自然光重新錄一段如果模型輸出從 120 跳到 75 左右基本可以確認(rèn)是光源問(wèn)題。5.3 標(biāo)簽錯(cuò)位離線指標(biāo)好看、線上偏差大的隱形原因現(xiàn)象訓(xùn)練時(shí) loss 正常下降驗(yàn)證集 Pearson 也到了 0.6但部署后實(shí)測(cè)心率始終比真實(shí)值高 2 到 4bpm且偏差方向固定。原因R-peak 標(biāo)注的時(shí)間戳和視頻幀的時(shí)間戳沒(méi)有對(duì)齊。很多公開(kāi)數(shù)據(jù)集的標(biāo)注文件是從生理信號(hào)采集系統(tǒng)導(dǎo)出的采集系統(tǒng)有自己的時(shí)鐘和攝像頭的時(shí)間軸有固定偏移。訓(xùn)練時(shí)網(wǎng)絡(luò)被迫學(xué)習(xí)這個(gè)偏移所以驗(yàn)證集上表現(xiàn)正常換到新視頻就暴露了。解決錄制同步數(shù)據(jù)時(shí)用 LED 打點(diǎn)視頻里閃一下標(biāo)注文件里也記一個(gè)時(shí)間戳用這個(gè)差值做全局對(duì)齊。后補(bǔ)對(duì)齊的土辦法是互相關(guān)把模型輸出的 PPG 和真值 PPG 做相關(guān)找到最大相關(guān)系數(shù)對(duì)應(yīng)的偏移量。但注意只能用訓(xùn)練集或驗(yàn)證集來(lái)估計(jì)這個(gè)偏移量不能在測(cè)試集上做否則會(huì)泄漏信息。我發(fā)現(xiàn)這個(gè)坑的時(shí)候浪費(fèi)了好幾天后來(lái)在數(shù)據(jù)集加載器里加了一個(gè)可選全局偏移參數(shù)先把時(shí)間對(duì)齊問(wèn)題可視化再訓(xùn)練。5.4 跨膚色泛化換個(gè)數(shù)據(jù)集 MAE 翻倍怎么辦現(xiàn)象在公開(kāi)數(shù)據(jù)集 A 上訓(xùn)練MAE 5bpm拿到自己拍的數(shù)據(jù) B 上測(cè)試MAE 直接翻倍到 10bpm 以上。數(shù)據(jù)集 B 的人員膚色、相機(jī)型號(hào)、室內(nèi)光照都不一樣。原因rPPG 的本質(zhì)是捕捉微小顏色變化相機(jī)白平衡、膚色深淺、光源色溫都會(huì)改變 RGB 通道的統(tǒng)計(jì)分布。模型學(xué)到了數(shù)據(jù)集 A 的顏色風(fēng)格而不是泛化的血流信號(hào)。解決訓(xùn)練側(cè)做顏色增強(qiáng)模擬不同相機(jī)和光源的通道偏差。增強(qiáng)幅度不能太大否則破壞 rPPG 的物理真實(shí)性。def color_augment(img): # img: (3, T, H, W)RGB順序 gain torch.empty(3).uniform_(0.85, 1.15) # 通道增益模擬白平衡偏移 bias torch.empty(3).uniform_(-5, 5).view(3, 1, 1, 1) # 亮度偏移 return img * gain.view(3, 1, 1, 1) bias參數(shù)說(shuō)明gain 的擾動(dòng)范圍 0.85 到 1.15 對(duì)應(yīng)約 ±15% 的通道增益變化這個(gè)范圍既能覆蓋手機(jī)相機(jī)之間的白平衡差異又不會(huì)把信號(hào)的頻帶結(jié)構(gòu)破壞掉。bias 的 ±5 是在 0 到 255 的像素尺度上相當(dāng)于很小的黑電平漂移。推理側(cè)如果目標(biāo)場(chǎng)景相機(jī)固定可以在模型前加一個(gè)通道均值歸一化層把輸入視頻的 RGB 均值對(duì)齊到訓(xùn)練集統(tǒng)計(jì)值。這個(gè)增強(qiáng)通常能挽回一半以上的跨場(chǎng)景誤差。6. 不依賴真值設(shè)備的離線驗(yàn)證技巧先用頻譜和失敗樣本說(shuō)話在沒(méi)有指夾式血氧儀做同步真值的情況下我有一套離線驗(yàn)證流程能判斷模型到底行不行。第一件事是頻譜體檢讓測(cè)試者正對(duì)攝像頭保持不動(dòng)錄 30 秒視頻把模型輸出的 PPG 畫(huà)成頻譜圖。如果頻譜在 0.75 到 4Hz 之間有單一清晰的峰峰的位置換算成心率后和手測(cè)脈搏對(duì)得上說(shuō)明模型學(xué)到了真東西。如果頻譜上幾個(gè)峰差不多高或者主峰在 0.2Hz 附近那是呼吸或頭部微動(dòng)占主導(dǎo)模型沒(méi)學(xué)對(duì)。第二件事是手測(cè)脈搏對(duì)比。不用什么精密設(shè)備手機(jī)秒表計(jì)時(shí) 15 秒自己數(shù)手腕脈搏次數(shù)乘以 4和模型輸出的心率做對(duì)比。這個(gè)方法精度有限但能在 5bpm 內(nèi)區(qū)分基本可用和完全不可用。我在做邊緣設(shè)備部署時(shí)經(jīng)常先在辦公室拿自己錄一段 15 秒視頻跑通全鏈路再上真值設(shè)備做定量評(píng)估這樣能快速篩掉環(huán)境、幀率、光源這類低級(jí)問(wèn)題。第三件事是失敗樣本聚類把誤差最大的幾個(gè)窗口找出來(lái)逐個(gè)看對(duì)應(yīng)視頻片段有什么共性——頭部轉(zhuǎn)動(dòng)、說(shuō)話、光照突變、人臉出畫(huà)這些共性就是你下一步要補(bǔ)的數(shù)據(jù)方向。我現(xiàn)在的工程習(xí)慣是先把后處理和頻帶設(shè)計(jì)定稿再回去調(diào)模型。很多團(tuán)隊(duì)把精力全花在網(wǎng)上結(jié)構(gòu)上最后發(fā)現(xiàn)誤差主要來(lái)自頻譜分辨率太低或者光源混疊。這個(gè)方向值不值得做我的判斷是明確值得——非接觸心率監(jiān)測(cè)在疲勞駕駛、嬰兒監(jiān)護(hù)、遠(yuǎn)程醫(yī)療預(yù)篩查里都有真實(shí)需求但一定要把驗(yàn)證流程做扎實(shí)。希望這些踩坑記錄能幫你在 rPPG 深度學(xué)習(xí)這條路上少走幾段彎路。本文還有配套的精品資源點(diǎn)擊獲取