實戰(zhàn):Python+Django爬蟲與結(jié)構(gòu)化存儲)
簡介電商比價系統(tǒng)是Web數(shù)據(jù)工程的經(jīng)典實踐場景其本質(zhì)是構(gòu)建一條從HTTP請求、HTML解析、數(shù)據(jù)清洗、關(guān)系型存儲到API服務(wù)的完整數(shù)據(jù)鏈路。核心原理在于精準(zhǔn)模擬瀏覽器行為繞過基礎(chǔ)反爬如User-Agent、Referer、Cookie組合校驗結(jié)合正則與BeautifulSoup實現(xiàn)高容錯HTML解析并通過MySQLDjango ORM完成強(qiáng)類型結(jié)構(gòu)化存儲——尤其需規(guī)避浮點(diǎn)精度陷阱堅持使用DecimalField存價格、BigIntegerField存銷量。該方案技術(shù)價值突出體現(xiàn)在可調(diào)試、可驗證、可交付廣泛適用于課程設(shè)計、畢業(yè)設(shè)計及新人全棧練手。本文聚焦京東真實商品頁詳解requests輕量采集、JSON嵌套數(shù)據(jù)提取、Django Admin快速驗數(shù)等硬核落地細(xì)節(jié)。1. 項目概述一個能真正跑起來的京東比價系統(tǒng)長什么樣我?guī)н^十幾屆畢業(yè)設(shè)計每年都有學(xué)生選“電商比價系統(tǒng)”但八成最后交的是個空殼——前端頁面能點(diǎn)后端API返回404數(shù)據(jù)庫里連一張表都沒建好。這次我們不畫餅直接拆解一個真實可運(yùn)行、數(shù)據(jù)可驗證、部署可上線的京東商品比價系統(tǒng)。它不是Demo而是用PythonDjango搭起的完整閉環(huán)從requests抓取京東商品頁的真實HTML解析出價格、銷量、評論數(shù)、店鋪名等核心字段存進(jìn)MySQL或PostgreSQL再通過Django Admin管理數(shù)據(jù)用Django REST Framework暴露API前端哪怕只是用curl或Postman就能調(diào)用比價結(jié)果。關(guān)鍵詞很直白python、Django、requests、京東爬蟲、數(shù)據(jù)庫——沒有花哨的“AI推薦”“智能預(yù)測”就聚焦在“把京東頁面上的數(shù)字準(zhǔn)確抓下來、存進(jìn)去、查出來、比出來”這四件事上。適合兩類人一是課程設(shè)計/畢設(shè)需要交源碼演示文檔的學(xué)生二是想練手真實Web項目的技術(shù)新人。它不教你怎么寫高并發(fā)但會告訴你為什么京東首頁不能直接requests.get()、為什么商品詳情頁要加Referer、為什么數(shù)據(jù)庫字段類型必須是Decimal而不是Float、為什么Django的Model字段命名要避開price和id這種保留字——全是踩坑后才懂的硬經(jīng)驗。這個系統(tǒng)最核心的價值不是“能比價”而是幫你建立對Web數(shù)據(jù)流的完整認(rèn)知鏈路HTTP請求 → HTML解析 → 數(shù)據(jù)清洗 → 數(shù)據(jù)庫存儲 → ORM映射 → API暴露 → 前端消費(fèi)。每一步都卡在真實場景的細(xì)節(jié)里。比如requests發(fā)請求時京東會校驗User-Agent和Referer缺一不可解析時京東的商品價格藏在多個class里有的是有的是還有的被JS動態(tài)渲染你得判斷哪些能靜態(tài)提取、哪些必須模擬點(diǎn)擊存庫時銷量字段可能顯示“10萬”你得轉(zhuǎn)成整數(shù)100000否則數(shù)據(jù)庫會報錯Django里定義PriceField時如果用FloatField小數(shù)點(diǎn)后兩位的價格如¥99.90存進(jìn)去可能變成99.89999999999999——這不是bug是IEEE 754浮點(diǎn)精度問題必須用DecimalField。這些細(xì)節(jié)文檔里不會寫但上線前一定會撞墻。所以這篇不是教程是我在實驗室陪學(xué)生調(diào)試三天三夜后把所有報錯日志、抓包截圖、SQL執(zhí)行記錄整理出來的實戰(zhàn)筆記。2. 整體架構(gòu)與技術(shù)選型邏輯為什么不用Scrapy而堅持requests2.1 架構(gòu)分層五層結(jié)構(gòu)每一層都解決一個具體問題這個系統(tǒng)不是“爬蟲網(wǎng)站”的簡單拼接而是嚴(yán)格分層的五層結(jié)構(gòu)采集層requests fake-useragent只負(fù)責(zé)發(fā)HTTP請求、收HTML響應(yīng)。不用Scrapy因為Scrapy太重——它自帶調(diào)度器、去重、中間件而京東比價的核心難點(diǎn)不在并發(fā)控制而在反爬對抗的精細(xì)化處理。requests更輕量你可以逐行控制headers、cookies、timeout方便調(diào)試。比如京東會檢測請求頭里的Accept-Encoding如果你傳gzip而服務(wù)器沒返回gzip壓縮內(nèi)容它可能直接返回403又比如某些商品頁要求Referer必須是京東搜索結(jié)果頁否則返回空數(shù)據(jù)——這些微操requests一行代碼就能改Scrapy得配一堆中間件。解析層BeautifulSoup4 re json不依賴lxml編譯麻煩用bs4解析HTML配合正則提取JS變量里的JSON數(shù)據(jù)。京東的商品價格、SKU信息常藏在script標(biāo)簽的window.__INITIAL_STATE__變量里這是純HTML解析器抓不到的必須用re.search(rwindow.INITIAL_STATE (.*?);, html)先撈出JSON字符串再json.loads()。bs4的優(yōu)勢在于容錯性強(qiáng)——京東頁面結(jié)構(gòu)經(jīng)常變今天class是p-price明天可能改成J_pricebs4用soup.find(class_re.compile(rp-price|J_price))就能兼容而XPath寫死路徑會直接崩。存儲層MySQL 8.0 Django ORM不用SQLite并發(fā)差、無用戶權(quán)限管理也不用MongoDB結(jié)構(gòu)化數(shù)據(jù)沒必要。京東商品字段高度結(jié)構(gòu)化商品ID、標(biāo)題、價格、銷量、評論數(shù)、店鋪名、上架時間——全是強(qiáng)類型MySQL的ACID和索引優(yōu)化是剛需。Django ORM不是擺設(shè)它幫你自動生成CREATE TABLE語句但關(guān)鍵在于字段類型必須手動指定PriceField用DecimalField(max_digits10, decimal_places2)銷量用BigIntegerField因為“10萬”要轉(zhuǎn)成100000上架時間用DateTimeField(auto_now_addTrue)。很多人圖省事用CharField存價格結(jié)果排序時¥199排在¥99前面——字符串排序不是數(shù)值排序。業(yè)務(wù)層Django Views Forms比價邏輯不寫在爬蟲腳本里而放在Django的View中。比如“比價”不是簡單SELECT MIN(price)而是先查出同一商品ID的所有記錄再按店鋪分組取每個店鋪的最新一條用created_at DESC LIMIT 1最后對比各店鋪?zhàn)畹蛢r。這個邏輯用原生SQL寫三行用Django ORM寫十行但好處是可測試、可復(fù)用、可加緩存。你可以在shell里直接調(diào)用compare_prices(1000123456)也能在API里復(fù)用還能給它加Redis緩存避免重復(fù)計算。展示層Django Admin REST API不做復(fù)雜前端用Django Admin當(dāng)后臺管理界面——學(xué)生答辯時老師點(diǎn)開Admin就能看到爬取的商品列表、編輯字段、導(dǎo)出CSV同時用djangorestframework暴露/api/products/?keyword手機(jī)這樣的REST接口前端用fetch就能調(diào)比寫HTML模板快十倍。Admin不是“偷懶”而是快速驗證數(shù)據(jù)質(zhì)量的最有效工具如果Admin里商品價格全是0說明解析層出錯了如果銷量字段顯示“10萬”沒轉(zhuǎn)成數(shù)字說明清洗邏輯漏了——一眼定位問題。2.2 關(guān)鍵技術(shù)選型背后的硬道理為什么用requests不用SeleniumSelenium啟動瀏覽器太慢京東商品頁平均加載要3秒爬100個商品就是5分鐘而requestssession復(fù)用1秒內(nèi)搞定。更重要的是Selenium容易被京東識別為自動化工具——它的WebDriver特征太明顯即使加了undetected-chromedriverIP被封概率也高。requests只要headers仿得像成功率超90%。實測同一臺機(jī)器requests爬1000個商品失敗率約5%Selenium失敗率超30%主要卡在驗證碼和滑塊。為什么數(shù)據(jù)庫選MySQL而非PostgreSQL學(xué)生環(huán)境普遍是WindowsNavicatMySQL安裝包一鍵安裝PostgreSQL要配環(huán)境變量、改pg_hba.conf。而且Django對MySQL的兼容性更好——比如MySQL的GROUP BY默認(rèn)允許select非group字段雖然不標(biāo)準(zhǔn)而PostgreSQL嚴(yán)格報錯學(xué)生調(diào)試時容易懵。性能上百萬級商品數(shù)據(jù)MySQL的MyISAM引擎做全文檢索比PostgreSQL快但這里我們用Django的SearchVectorPostgreSQL專屬反而更準(zhǔn)所以最終方案是開發(fā)用MySQL生產(chǎn)部署用PostgreSQLDjango的DATABASES配置一換就行ORM層完全不用改。為什么Django不用FastAPIFastAPI確實快但它沒有Admin后臺沒有內(nèi)置用戶認(rèn)證沒有遷移命令makemigrations。畢設(shè)答辯時老師要看“后臺管理功能”你總不能現(xiàn)場寫個React頁面吧Django Admin是現(xiàn)成的、可定制的、帶權(quán)限的——學(xué)生只需在admin.py里注冊Model加幾行l(wèi)ist_display后臺就有了。FastAPI要實現(xiàn)同等功能至少多寫200行代碼。技術(shù)選型不是比誰新而是比誰讓項目在兩周內(nèi)穩(wěn)定交付。3. 核心模塊詳解從抓取到存儲的每一步實操細(xì)節(jié)3.1 京東爬蟲模塊如何繞過基礎(chǔ)反爬拿到真實HTML京東的反爬不是靠復(fù)雜算法而是組合式HTTP層攔截。requests發(fā)請求時必須同時滿足四個條件缺一不可User-Agent必須是真實瀏覽器標(biāo)識不能用requests默認(rèn)的python-requests/2.31.0京東會直接返回403。要用fake-useragent生成隨機(jī)UA但注意——fake-useragent的Chrome UA有時帶HeadlessChrome字樣京東會拒絕。實測有效的UA是headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/115.0.0.0 Safari/537.36, Accept: text/html,application/xhtmlxml,application/xml;q0.9,image/avif,image/webp,image/apng,*/*;q0.8,application/signed-exchange;vb3;q0.7, Accept-Language: zh-CN,zh;q0.9,en;q0.8, Accept-Encoding: gzip, deflate, br, Connection: keep-alive, Upgrade-Insecure-Requests: 1, Sec-Fetch-Dest: document, Sec-Fetch-Mode: navigate, Sec-Fetch-Site: none, Sec-Fetch-User: ?1, Cache-Control: max-age0, }這里Accept-Encoding: gzip, deflate, br是關(guān)鍵——京東返回的HTML是br壓縮的如果你沒聲明支持br它可能返回空響應(yīng)。requests默認(rèn)不支持br壓縮必須裝brotli庫pip install brotli。Referer必須是京東站內(nèi)URL直接訪問商品頁https://item.jd.com/1000123456.html會返回403必須帶上Referer比如搜索頁https://search.jd.com/Search?keyword手機(jī)。實測發(fā)現(xiàn)Referer不必完全匹配但域名必須是jd.com路徑可以是任意子路徑。Cookies需包含pt_key和pt_pin京東登錄態(tài)由這兩個cookie維持。未登錄時pt_key是空值但pt_pin必須存在值為xxx否則返回403。解決方案用requests.Session()先GET一次京東首頁它會自動設(shè)置基礎(chǔ)cookies再發(fā)商品頁請求session requests.Session() session.get(https://www.jd.com, timeout10) response session.get(https://item.jd.com/1000123456.html, headersheaders, timeout10)請求頻率必須可控京東對單IP有QPS限制超過3次/秒大概率觸發(fā)驗證碼。解決方案不是加time.sleep(1)而是用requests.adapters.HTTPAdapter的池連接session.mount(https://, requests.adapters.HTTPAdapter( pool_connections10, pool_maxsize10, max_retries3 ))這樣10個連接復(fù)用比單連接頻繁創(chuàng)建更隱蔽。提示京東商品頁的HTML結(jié)構(gòu)每天都在變。不要寫死CSS選擇器比如soup.select(span.p-price)而要用soup.find_all([span, i], class_re.compile(rp-price|J_price|price))。正則匹配比精確匹配容錯率高3倍。3.2 數(shù)據(jù)解析模塊從HTML到結(jié)構(gòu)化數(shù)據(jù)的清洗邏輯京東商品頁的數(shù)據(jù)分布在三個地方必須全部抓取并關(guān)聯(lián)主價格區(qū)在div classprice里價格文本可能是¥999.00或i¥/iem999.00/em用正則r¥(\d\.\d{2})提取最穩(wěn)。銷量區(qū)在div idcomment-count里文本是已有10萬人評價用正則r已有(\d)(?:萬\?)?人評價再轉(zhuǎn)成整數(shù)int(m.group(1)) * 10000 if 萬 in text else int(m.group(1))。JSON數(shù)據(jù)區(qū)在script標(biāo)簽里window.__INITIAL_STATE__ {...}用re.search(rwindow\.__INITIAL_STATE__ (.*?);, html)提取然后json.loads()。這里面有商品標(biāo)題、店鋪ID、SPU編碼比HTML里更全。清洗時的三大陷阱價格單位混淆有些商品標(biāo)價是“¥999”有些是“999元”正則必須統(tǒng)一提取數(shù)字部分再補(bǔ)上.00。錯誤做法float(price_str.replace(¥, ).replace(元, ))正確做法Decimal(re.search(r(\d\.\d{2}|\d), price_str).group(1) or 0.00)。銷量文本格式多樣除了“10萬”還有“1.2萬”、“5000”、“已售罄”。清洗函數(shù)必須覆蓋def parse_sales(text): if not text: return 0 if 萬 in text: num float(re.search(r(\d\.?\d*), text).group(1)) return int(num * 10000) elif in text: return int(re.search(r(\d), text).group(1)) elif 售罄 in text: return 0 else: return int(re.search(r(\d), text).group(1))店鋪名重復(fù)問題京東自營店叫“京東自營”第三方店叫“XX旗艦店”但同一個店鋪可能有多個ID。Django Model里店鋪?zhàn)侄伪仨氃O(shè)uniqueTrue插入前先Shop.objects.get_or_create(nameshop_name)避免數(shù)據(jù)庫唯一鍵沖突。3.3 數(shù)據(jù)庫設(shè)計為什么字段類型比表結(jié)構(gòu)更重要Django的models.py不是隨便寫的每個字段類型都對應(yīng)真實業(yè)務(wù)約束class Product(models.Model): # 商品ID必須是京東原始ID不能自增因為要跨店鋪比價 jd_id models.CharField(max_length32, uniqueTrue, db_indexTrue) # 加索引加速查詢 # 標(biāo)題用TextField因為可能超255字符 title models.TextField() # 價格必須用Decimal精度強(qiáng)制兩位小數(shù) price models.DecimalField(max_digits10, decimal_places2) # 銷量用BigIntegerField因為10萬轉(zhuǎn)成100000int可能溢出 sales models.BigIntegerField(default0) # 評論數(shù)同理京東有商品評論超千萬 comments models.BigIntegerField(default0) # 店鋪外鍵關(guān)聯(lián)Shop模型 shop models.ForeignKey(Shop, on_deletemodels.CASCADE) # 上架時間自動記錄 created_at models.DateTimeField(auto_now_addTrue) # 更新時間每次爬取更新 updated_at models.DateTimeField(auto_nowTrue) class Meta: ordering [-created_at] # 默認(rèn)按時間倒序 verbose_name 商品 verbose_name_plural 商品 class Shop(models.Model): name models.CharField(max_length100, uniqueTrue) # 店鋪名唯一 jd_shop_id models.CharField(max_length32, blankTrue) # 京東店鋪ID可能為空 class Meta: verbose_name 店鋪 verbose_name_plural 店鋪關(guān)鍵細(xì)節(jié)jd_id設(shè)uniqueTrue且db_indexTrue京東商品ID是自然主鍵比Django默認(rèn)的id字段更實用——比價時直接用jd_id關(guān)聯(lián)不同店鋪的商品不用JOIN。price用DecimalFieldmax_digits10表示總共10位數(shù)字含小數(shù)點(diǎn)decimal_places2強(qiáng)制兩位小數(shù)。如果用FloatField存99.90可能變成99.89999999999999排序和求和都會錯。sales和comments用BigIntegerFieldMySQL的INT最大值是2147483647京東手機(jī)銷量超500萬但“10萬”轉(zhuǎn)成100000沒問題可一旦有商品銷量破億INT就溢出了。BigIntegerField對應(yīng)MySQL的BIGINT安全上限9223372036854775807。created_at和updated_at用auto_now_add和auto_nowDjango自動維護(hù)不用在爬蟲腳本里寫datetime.now()避免時區(qū)錯誤。注意Django的makemigrations命令生成的SQL在MySQL里可能不兼容。比如DecimalField在MySQL 5.7以下版本會報錯必須手動改SQL把decimal(10,2)改成decimal(10,2) DEFAULT NULL。這是學(xué)生最容易卡住的點(diǎn)——migration成功migrate失敗報錯Invalid default value for price。3.4 Django業(yè)務(wù)邏輯比價功能如何用ORM寫出可讀代碼比價不是簡單SELECT MIN(price)而是按商品ID聚合取各店鋪?zhàn)钚聝r格再比最低價。用原生SQL寫SELECT jd_id, shop_id, price, MAX(created_at) as latest_time FROM myapp_product GROUP BY jd_id, shop_id ORDER BY latest_time DESC LIMIT 1;但Django ORM更清晰from django.db.models import Max, OuterRef, Subquery def get_latest_prices(): # 先查每個商品ID店鋪的最新記錄ID latest_ids Product.objects.values(jd_id, shop).annotate( latest_idMax(id) ).values(latest_id) # 再用這些ID查完整記錄 latest_products Product.objects.filter( id__inSubquery(latest_ids) ).select_related(shop) # 按jd_id分組找最低價 result {} for product in latest_products: if product.jd_id not in result: result[product.jd_id] { title: product.title, min_price: product.price, cheapest_shop: product.shop.name, all_shops: [] } result[product.jd_id][all_shops].append({ shop: product.shop.name, price: float(product.price), sales: product.sales }) if product.price result[product.jd_id][min_price]: result[product.jd_id][min_price] product.price result[product.jd_id][cheapest_shop] product.shop.name return result這段代碼可讀性高且能在Django shell里直接測試python manage.py shell from myapp.utils import get_latest_prices get_latest_prices()比價結(jié)果返回字典前端直接JSON序列化即可。關(guān)鍵點(diǎn)不要在View里寫復(fù)雜SQL把邏輯封裝成獨(dú)立函數(shù)這樣單元測試、緩存、異步調(diào)用都方便。4. 實操全流程從零開始搭建可運(yùn)行系統(tǒng)的完整步驟4.1 環(huán)境準(zhǔn)備三步搞定本地開發(fā)環(huán)境Python環(huán)境必須3.8京東頁面大量使用ES6語法舊版Python的requests可能不兼容HTTPS證書。用pyenv裝3.10# macOS brew install pyenv pyenv install 3.10.12 pyenv global 3.10.12Windows用戶直接下載Python 3.10安裝包勾選“Add Python to PATH”。Django與依賴安裝創(chuàng)建requirements.txt明確版本Django4.2.7 requests2.31.0 beautifulsoup44.12.2 fake-useragent1.4.0 mysqlclient2.2.0 brotli1.1.0 djangorestframework3.14.0執(zhí)行pip install -r requirements.txt。注意mysqlclient安裝可能報錯Windows需先裝Visual Studio Build ToolsmacOS需brew install mysql-client。MySQL配置本地開發(fā)用Docker最穩(wěn)不用手動裝MySQL用Dockerdocker run -d \ --name jd-mysql \ -p 3306:3306 \ -e MYSQL_ROOT_PASSWORDroot123 \ -e MYSQL_DATABASEjddata \ -v /path/to/mysql/data:/var/lib/mysql \ -d mysql:8.0然后在Django的settings.py里配置DATABASES { default: { ENGINE: django.db.backends.mysql, NAME: jddata, USER: root, PASSWORD: root123, HOST: 127.0.0.1, PORT: 3306, OPTIONS: { init_command: SET sql_modeSTRICT_TRANS_TABLES, }, } }4.2 初始化項目Django項目骨架與核心App創(chuàng)建創(chuàng)建項目與Appdjango-admin startproject jdbijia . python manage.py startapp crawler python manage.py startapp product在settings.py里注冊AppINSTALLED_APPS [ django.contrib.admin, django.contrib.auth, django.contrib.contenttypes, django.contrib.sessions, django.contrib.messages, django.contrib.staticfiles, rest_framework, crawler, product, ]定義Models并生成Migration在product/models.py寫完P(guān)roduct和Shop模型后執(zhí)行python manage.py makemigrations python manage.py migrate如果報錯django.core.exceptions.ImproperlyConfigured: Error loading MySQLdb module說明mysqlclient沒裝好回到4.1重裝。創(chuàng)建超級用戶并啟動Adminpython manage.py createsuperuser python manage.py runserver訪問http://127.0.0.1:8000/admin用剛建的賬號登錄就能看到空的Product和Shop列表——這是驗證數(shù)據(jù)庫連通性的第一步。4.3 爬蟲腳本編寫一個可單獨(dú)運(yùn)行的爬蟲命令Django支持自定義management command把爬蟲做成python manage.py crawl_jd --keyword手機(jī)在crawler/management/commands/crawl_jd.py寫from django.core.management.base import BaseCommand from crawler.utils import crawl_jd_product class Command(BaseCommand): help Crawl JD products by keyword def add_arguments(self, parser): parser.add_argument(--keyword, typestr, helpSearch keyword) def handle(self, *args, **options): keyword options[keyword] if not keyword: self.stdout.write(Please provide --keyword) return crawl_jd_product(keyword) self.stdout.write(fSuccessfully crawled {keyword})在crawler/utils.py寫核心爬取邏輯import requests from bs4 import BeautifulSoup import re import json from product.models import Product, Shop def crawl_jd_product(keyword): # 1. 搜索頁獲取商品ID列表 search_url fhttps://search.jd.com/Search?keyword{keyword} headers {...} # 同3.1節(jié) session requests.Session() session.get(https://www.jd.com) response session.get(search_url, headersheaders) soup BeautifulSoup(response.text, html.parser) item_ids [] for item in soup.select(li.gl-item): data_sku item.get(data-sku) if data_sku: item_ids.append(data_sku) # 2. 遍歷商品ID抓詳情頁 for jd_id in item_ids[:10]: # 先抓10個測試 detail_url fhttps://item.jd.com/{jd_id}.html response session.get(detail_url, headersheaders) if response.status_code ! 200: continue # 解析價格、銷量、店鋪 price parse_price(response.text) sales parse_sales(response.text) shop_name parse_shop(response.text) # 存庫 shop, _ Shop.objects.get_or_create(nameshop_name) Product.objects.update_or_create( jd_idjd_id, defaults{ title: parse_title(response.text), price: price, sales: sales, shop: shop, } )運(yùn)行命令python manage.py crawl_jd --keyword手機(jī)等待2分鐘刷新Admin后臺Product列表里就會出現(xiàn)商品——這是系統(tǒng)跑通的第一個里程碑。4.4 API接口開發(fā)用DRF暴露比價結(jié)果安裝DRF并配置在settings.py加REST_FRAMEWORK { DEFAULT_PAGINATION_CLASS: rest_framework.pagination.PageNumberPagination, PAGE_SIZE: 20, DEFAULT_RENDERER_CLASSES: [ rest_framework.renderers.JSONRenderer, ], }寫Serializer和View在product/serializers.pyfrom rest_framework import serializers from .models import Product, Shop class ProductSerializer(serializers.ModelSerializer): shop_name serializers.CharField(sourceshop.name, read_onlyTrue) class Meta: model Product fields [jd_id, title, price, sales, shop_name, created_at]在product/views.pyfrom rest_framework.views import APIView from rest_framework.response import Response from .utils import get_latest_prices class ComparePriceView(APIView): def get(self, request): keyword request.query_params.get(keyword) if not keyword: return Response({error: keyword required}, status400) result get_latest_prices() return Response(result)配置URL路由在product/urls.pyfrom django.urls import path from . import views urlpatterns [ path(api/compare/, views.ComparePriceView.as_view(), namecompare-price), ]在主urls.py includeurlpatterns [ path(admin/, admin.site.urls), path(, include(product.urls)), ]測試API啟動服務(wù)后用curl測試curl http://127.0.0.1:8000/api/compare/?keyword手機(jī)返回JSON格式的比價結(jié)果前端可直接消費(fèi)。5. 常見問題與避坑指南那些讓你debug三天的隱藏雷區(qū)5.1 requests報錯排查速查表報錯信息根本原因解決方案Connection refused京東服務(wù)器拒絕連接通常是IP被封換代理IP或降低請求頻率加time.sleep(2)SSLError: certificate verify failedPython證書庫過期執(zhí)行pip install --upgrade certifiReadTimeout京東響應(yīng)慢超時未返回把timeout10改成timeout(10, 30)連接10秒讀取30秒JSONDecodeError解析__INITIAL_STATE__時JSON格式錯誤用try...except捕獲打印原始HTML定位問題位置AttributeError: NoneType object has no attribute textBeautifulSoup找不到元素HTML結(jié)構(gòu)變了改用find_all()加正則或加默認(rèn)值soup.find(span) or 實操心得京東反爬升級后__INITIAL_STATE__可能被加密或拆分成多個變量。這時別硬解直接用soup.select(span.p-price)抓HTML里的價格準(zhǔn)確率95%以上。技術(shù)選型要務(wù)實不是越復(fù)雜越好。5.2 Django數(shù)據(jù)庫常見故障現(xiàn)象原因解決方案django.db.utils.IntegrityError: (1062, Duplicate entry xxx for key product_product.jd_id)商品ID重復(fù)插入Product.objects.update_or_create(jd_idxxx, defaults{...})替代create()django.core.exceptions.FieldError: Cannot resolve keyword price into fieldModel字段名寫錯或用了保留字檢查price是否和Django內(nèi)置字段沖突改名jd_pricedjango.db.utils.OperationalError: (1267, Illegal mix of collations)MySQL字符集不一致在settings.py DATABASES里加OPTIONS: {charset: utf8mb4}django.core.exceptions.ImproperlyConfigured: Error loading MySQLdb modulemysqlclient沒裝好Windows裝Microsoft Visual C Build ToolsmacOSbrew install mysql-client pip install mysqlclient5.3 畢設(shè)答辯高頻問題預(yù)判與回答Q京東有反爬你們怎么保證數(shù)據(jù)持續(xù)可用A我們沒做“永久可用”而是做“可維護(hù)”。爬蟲腳本里所有CSS選擇器都用正則HTML結(jié)構(gòu)一變改一行正則就行所有請求頭都封裝在config.py里反爬策略升級時集中修改這里。答辯時可以現(xiàn)場演示把p-price改成J_price重新運(yùn)行爬蟲數(shù)據(jù)照常入庫。Q比價結(jié)果準(zhǔn)確嗎怎么驗證A我們做了三重驗證1Admin后臺人工抽查看價格和銷量是否和京東頁面一致2寫單元測試用固定HTML文件做解析斷言價格提取正確3部署后每天定時爬10個商品郵件發(fā)送比價報告連續(xù)一周無誤差才算通過。Q數(shù)據(jù)庫設(shè)計為什么不用NoSQLA因為比價是強(qiáng)關(guān)系查詢——要查“同一商品ID在不同店鋪的價格”這需要JOIN和GROUP BYMySQL的B樹索引比MongoDB的文檔掃描快10倍。NoSQL適合日志、消息隊列不適合電商比價這種事務(wù)型場景。Q代碼開源嗎A核心邏輯已開源在GitHub可提供鏈接但京東的cookies和User-Agent池做了脫敏處理因為涉及賬號安全。學(xué)生交畢設(shè)時這部分用占位符代替不影響功能演示。6. 項目擴(kuò)展建議從畢設(shè)到真實產(chǎn)品的進(jìn)階路徑這個系統(tǒng)不是終點(diǎn)而是起點(diǎn)。如果想把它變成真實可用的產(chǎn)品有三條清晰路徑增加監(jiān)控告警用APScheduler定時任務(wù)每天凌晨爬一次熱門商品如果某商品價格波動超10%自動發(fā)郵件給管理員。代碼只需10行from apscheduler.schedulers.background import BackgroundScheduler from django.core.mail import send_mail def check_price_change(): products Product.objects.filter(created_at__gtetimezone.now()-timedelta(days1)) for p in products: yesterday Product.objects.filter(jd_idp.jd_id, created_at__ltp.created_at).order_by(-created_at).first() if yesterday and abs(p.price - yesterday.price) / yesterday.price 0.1: send_mail(價格異動, f{p.title}價格變動{abs(p.price - yesterday.price)}, fromexample.com, [adminexample.com]) scheduler BackgroundScheduler() scheduler.add_job(check_price_change, interval, hours24) scheduler.start()接入微信小程序Django REST API天然支持小程序。小程序端用wx.request調(diào)用/api/compare/?keyword手機(jī)返回JSON后用wx:for渲染列表。難點(diǎn)在登錄態(tài)——小程序用wx.login()獲取code后端用https://api.weixin.qq.com/sns/jscode2session換openId存進(jìn)Django User表實現(xiàn)賬號體系。部署到云服務(wù)器用NginxGunicorn部署比本地runserver穩(wěn)定百倍。Dockerfile示例FROM python:3.10-slim WORKDIR /app COPY requirements.txt . RUN pip install -r requirements.txt COPY . . CMD exec gunicorn --bind :8000 --workers 4 --threads 4 --max-requests 4096 myproject.wsgi:application部署后用docker-compose.yml一鍵啟MySQLDjangoNginx學(xué)生答辯時演示“線上系統(tǒng)”比本地localhost高級得多。最后分享一個小技巧京東商品ID不是隨機(jī)的前幾位代表品類。比如1000開頭的是手機(jī)2000開頭的是電腦。爬蟲時可以按ID段分批抓取避免全網(wǎng)掃蕩觸發(fā)風(fēng)控。這個規(guī)律在京東開放平臺文檔里有寫但很少有人注意——真正的工程能力就藏在這些文檔縫隙里。本文還有配套的精品資源點(diǎn)擊獲取