站爬蟲實戰(zhàn):構(gòu)建合規(guī)穩(wěn)定的數(shù)據(jù)采集管道)
簡介這是一套面向Python初學者與數(shù)據(jù)采集實踐者的招聘網(wǎng)站爬蟲實戰(zhàn)源碼聚焦人力資源領(lǐng)域數(shù)據(jù)獲取痛點助力企業(yè)人才篩選與崗位分析。資源包含33個文件涵蓋10個核心Python腳本含主爬蟲pachong.py及多個模塊化子項目、14個文本文件含readme.txt使用說明與HTML緩存樣本、4個XML配置文件、3個CSV結(jié)構(gòu)化輸出樣例以及IDE和Git相關(guān)配置文件整體壓縮包僅2.93MB輕量易部署。已有511人學習下載適合開展網(wǎng)絡(luò)爬蟲入門訓練、反爬策略理解與招聘數(shù)據(jù)清洗實踐。讀者可直接運行項目復現(xiàn)完整采集流程獲得從網(wǎng)頁請求、HTML解析、字段抽取到CSV落地的全鏈路代碼范例目錄按功能分層如zhilianzhaopin_python*系列子模塊、htmltxt緩存區(qū)、to_csv導出區(qū)結(jié)構(gòu)清晰便于二次開發(fā)與調(diào)試同時附帶多份真實抓取的HTML樣本與日志記錄為排錯與規(guī)則適配提供可靠依據(jù)。1. 這不是“寫個腳本抓點數(shù)據(jù)”那么簡單一個真實招聘網(wǎng)站爬蟲項目的底層邏輯我做招聘數(shù)據(jù)相關(guān)項目快八年了從最早用Excel手動整理BOSS直聘的崗位列表到后來給獵頭公司搭整套人才畫像系統(tǒng)再到去年幫一家HR SaaS廠商重構(gòu)他們的職位數(shù)據(jù)清洗管道——所有這些起點都是同一個動作從招聘網(wǎng)站上穩(wěn)定、合規(guī)、可持續(xù)地獲取結(jié)構(gòu)化崗位信息。很多人看到“Python招聘網(wǎng)站數(shù)據(jù)爬蟲”這個標題第一反應(yīng)是“哦又一個教requestsBeautifulSoup的入門教程”。但現(xiàn)實里你真把它當個練手小項目去跑不出三天就會被封IP、被驗證碼卡死、被反爬規(guī)則逼到重寫三次代碼。這不是技術(shù)難度問題而是對招聘網(wǎng)站運行機制、數(shù)據(jù)價值鏈條和工程落地約束的系統(tǒng)性認知缺失。核心關(guān)鍵詞——Python、招聘網(wǎng)站、數(shù)據(jù)爬蟲、源碼——背后藏著三重真實需求第一層是業(yè)務(wù)需求HR要批量比對薪資帶寬、技術(shù)棧熱度、JD關(guān)鍵詞分布第二層是工程需求要扛住每分鐘上百次請求、自動識別動態(tài)渲染、應(yīng)對JS加密字段、處理Cookie會話漂移第三層是合規(guī)需求必須繞開robots.txt限制區(qū)域、避開登錄態(tài)敏感數(shù)據(jù)、控制請求頻次不干擾網(wǎng)站服務(wù)。這四詞組合本質(zhì)上是在問“如何用Python構(gòu)建一條合法、穩(wěn)定、可維護的數(shù)據(jù)采集流水線而非一次性的網(wǎng)頁截圖腳本”它適合三類人正在搭建企業(yè)人才數(shù)據(jù)庫的HRBP、需要競品崗位分析的招聘經(jīng)理、以及剛學完基礎(chǔ)語法、想接觸真實Web生態(tài)的Python學習者——但最后這類人最容易踩坑因為網(wǎng)上90%的“源碼”只展示了最光鮮的第一步卻把后面八步的血淚教訓全刪了。我見過太多人卡在第一步連目標網(wǎng)站都選錯了。智聯(lián)、前程無憂、獵聘、BOSS直聘、拉勾表面都是招聘平臺底層架構(gòu)天差地別。智聯(lián)用傳統(tǒng)服務(wù)端渲染XPath能直接定位BOSS直聘大量依賴WebSocket推送實時消息靜態(tài)HTML里根本沒數(shù)據(jù)拉勾的職位詳情頁URL帶加密參數(shù)不還原算法就拿不到完整JD。所謂“通用爬蟲”根本不存在每個網(wǎng)站都是獨立戰(zhàn)場。所以這篇內(nèi)容不提供“一鍵復制粘貼就能跑”的萬能源碼而是帶你拆解為什么選這個技術(shù)棧、為什么這樣設(shè)計請求鏈路、為什么某個字段要單獨加解密模塊、為什么日志里必須記錄User-Agent變更軌跡。所有代碼細節(jié)都錨定在真實運維場景里——比如某次凌晨三點報警發(fā)現(xiàn)拉勾的反爬策略升級所有請求返回403而根源竟是他們把Referer校驗從域名級收緊到了路徑級。這種細節(jié)只有天天盯著監(jiān)控面板的人才懂。2. 項目整體設(shè)計與思路拆解為什么放棄“簡單粗暴”選擇“分層防御”2.1 不是寫爬蟲是建數(shù)據(jù)管道四個不可妥協(xié)的設(shè)計原則很多初學者把爬蟲當成“發(fā)HTTP請求→解析HTML→存CSV”三步流程這在測試環(huán)境能跑通上線后必然崩。真實招聘數(shù)據(jù)采集必須遵循四個硬性原則它們直接決定了架構(gòu)選型第一請求隔離原則。同一IP不能同時請求職位列表頁和詳情頁。招聘網(wǎng)站的風控系統(tǒng)會關(guān)聯(lián)行為鏈如果A IP在1秒內(nèi)先刷10個列表頁再瞬間跳轉(zhuǎn)到50個詳情頁立刻觸發(fā)流量異常模型。我們采用“雙代理池”設(shè)計——列表頁走數(shù)據(jù)中心代理高并發(fā)、低延遲詳情頁走住宅代理IP分散、會話真實兩者完全隔離。實測下來列表頁QPS可壓到80詳情頁維持在3-5整體成功率從62%提升到91.7%。第二渲染解耦原則。BOSS直聘和脈脈的職位卡片是React動態(tài)渲染但關(guān)鍵字段如“薪資范圍”“工作年限”藏在JSON-LD結(jié)構(gòu)化數(shù)據(jù)里而智聯(lián)的薪資卻是CSS隱藏文字偽元素拼接。我們不統(tǒng)一用Selenium模擬瀏覽器——太重、太慢、太不穩(wěn)定。而是分三層處理純靜態(tài)頁用lxml直接解析JS渲染頁用Playwright無頭模式截取DOM快照JSON-LD數(shù)據(jù)則用正則預提取json.loads二次校驗。這樣既避免了全量渲染的資源消耗又保證了字段抽取的準確率。第三狀態(tài)保鮮原則。招聘網(wǎng)站的Cookie有效期極短BOSS直聘的token 15分鐘失效獵聘的session_id 30分鐘過期。我們放棄“登錄一次用一整天”的幻想改為“按需續(xù)簽”每次請求前檢查Cookie時效失效則自動觸發(fā)模擬登錄流程賬號密碼短信驗證碼雙因子登錄成功后更新全局會話池。這個模塊單獨封裝成SessionManager類內(nèi)部維護LRU緩存最多保留20個有效會話避免賬號被鎖。第四字段契約原則。不同網(wǎng)站對“工作經(jīng)驗”字段的表述五花八門“3-5年”“三年以上”“5年經(jīng)驗優(yōu)先”“應(yīng)屆生亦可”。我們不直接存原始文本而是定義標準化字段契約experience_min整數(shù)、experience_max整數(shù)、experience_flexible布爾值。解析時調(diào)用ExperienceNormalizer模塊用規(guī)則引擎模糊匹配雙重校驗。比如遇到“5年以上”設(shè)min5, maxNone, flexibleTrue遇到“3-5年”設(shè)min3, max5, flexibleFalse。這樣下游分析時薪資與經(jīng)驗的相關(guān)性計算才有意義。2.2 技術(shù)棧選型為什么不用Scrapy而用RequestsPlaywright組合網(wǎng)上90%的招聘爬蟲教程推薦Scrapy但我在線上項目中已全面棄用。原因很實在Scrapy的中間件機制在面對招聘網(wǎng)站復雜的反爬時調(diào)試成本太高。比如BOSS直聘的請求頭校驗不僅檢查User-Agent還驗證sec-ch-ua-mobile、sec-fetch-site等Chrome專用頭Scrapy默認不生成這些字段你得寫一堆DownloaderMiddleware去偽造而每個網(wǎng)站的頭規(guī)則都不一樣維護起來像在填無底洞。我們最終選定Requests Playwright組合理由非常務(wù)實Requests負責80%的穩(wěn)態(tài)請求列表頁、搜索頁、公司主頁等靜態(tài)或半靜態(tài)頁面用Requests發(fā)GET請求配合requests.adapters.HTTPAdapter設(shè)置連接池pool_connections10, pool_maxsize20復用TCP連接。關(guān)鍵技巧是所有Headers都從真實瀏覽器抓包中復制包括Accept-Encoding: gzip, deflate, br和Sec-Fetch-Dest: document而不是用requests默認的簡版頭。Playwright負責20%的動態(tài)攻堅僅在必須執(zhí)行JS的場景啟用比如拉勾的職位詳情頁需要滾動到底部觸發(fā)“查看更多公司信息”或者獵聘的薪資彈窗需要點擊展開。Playwright的優(yōu)勢在于它能導出完整的瀏覽器上下文包括localStorage、IndexedDB我們把登錄態(tài)保存為context.zip下次直接加載省去重復登錄。實測單個詳情頁解析耗時從Selenium的3.2秒降到1.7秒內(nèi)存占用減少65%。Pandas不是用來存數(shù)據(jù)的而是做數(shù)據(jù)契約校驗的所有解析后的數(shù)據(jù)先塞進DataFrame用df[salary].apply(validate_salary_format)做字段清洗再用df.to_sql()寫入數(shù)據(jù)庫。這樣能在入庫前攔截90%的臟數(shù)據(jù)比如“面議”“年薪20W提成”這類非結(jié)構(gòu)化文本直接標為salary_raw字段存檔不污染主表。這套組合沒有炫技成分全是被線上事故逼出來的選擇。去年有次獵聘改版把職位列表的分頁參數(shù)從page2改成offset20Scrapy的CrawlSpider規(guī)則全失效我們花了6小時重寫Rule而我們的Requests方案只需改一行params{offset: page*20}10分鐘搞定。2.3 架構(gòu)圖解一個請求從發(fā)出到落庫的七道關(guān)卡整個數(shù)據(jù)管道不是線性流程而是七層防御式架構(gòu)每一層都有明確職責和熔斷機制路由層Router根據(jù)URL域名分發(fā)請求。zhilian.com走靜態(tài)解析流zhipin.com走Playwright流liepin.com走登錄態(tài)會話流。配置文件router_rules.yaml定義路由策略支持熱更新。代理層ProxyManager維護兩個獨立代理池。列表代理池含50個數(shù)據(jù)中心IP輪詢使用詳情代理池含200個住宅IP按地理位置分組北上廣深優(yōu)先每個IP綁定獨立User-Agent指紋。會話層SessionManager管理登錄態(tài)。每個賬號對應(yīng)一個SessionSlot對象包含cookie、token、last_used時間戳。請求前調(diào)用get_valid_session(domain)自動剔除過期會話并觸發(fā)續(xù)簽。渲染層Renderer靜態(tài)頁直接返回HTMLJS頁交由Playwright集群處理。我們部署了3臺Playwright WorkerDocker容器每臺限10個并發(fā)瀏覽器實例防內(nèi)存溢出。解析層Parser按網(wǎng)站定制Xpath/CSS選擇器。關(guān)鍵字段如job_title、company_name、salary_text必須有fallback邏輯。例如拉勾的薪資字段首選//span[classsalary]失敗則嘗試//meta[itempropbaseSalary]/content。歸一化層Normalizer將原始字段映射到標準Schema。salary_text經(jīng)SalaryExtractor模塊輸出salary_min、salary_max、salary_currencyjob_description經(jīng)JdCleaner模塊刪除HTML標簽、廣告語、聯(lián)系方式。存儲層Storage數(shù)據(jù)先寫入Kafka Topictopic_job_raw經(jīng)Flink實時清洗后落庫到MySQL分表按城市分表job_shanghai_2024q3。原始HTML存OSS保留30天供審計。這個架構(gòu)最大的好處是可替換性。去年BOSS直聘升級了Canvas指紋檢測我們只替換了Renderer層的Playwright配置增加--disable-blink-featuresAutomationControlled參數(shù)其他六層完全不動。如果是Scrapy單體架構(gòu)就得重跑整個Pipeline。3. 核心細節(jié)解析與實操要點那些教科書絕不會寫的“臟活”3.1 招聘網(wǎng)站的反爬暗礁從User-Agent到Canvas指紋的實戰(zhàn)對抗你以為設(shè)置個隨機User-Agent就萬事大吉招聘網(wǎng)站的反爬早已進化到硬件級。以BOSS直聘為例他們檢測的不僅是HTTP頭還有瀏覽器指紋的17個維度Canvas指紋在頁面注入一段JS讓Canvas繪制特定圖形讀取toDataURL()生成的哈希值。我們用Playwright的page.add_init_script()注入補丁canvas_patch const originalToDataURL HTMLCanvasElement.prototype.toDataURL; HTMLCanvasElement.prototype.toDataURL function() { return data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAAEAAAABCAIAAACQd1PeAAAADElEQVQI12P4//8/AAXAv7czFnnAAAAAElFTkSuQmCC; }; page.add_init_script(canvas_patch)這段代碼把所有Canvas輸出強制替換為固定PNG的base64既繞過檢測又不影響頁面功能。WebGL指紋讀取gl.getParameter(gl.VENDOR)返回顯卡廠商。我們禁用WebGL渲染playwright.launch(headlessTrue, args[--disable-webgl])代價是部分3D效果頁面無法加載但招聘網(wǎng)站根本不用WebGL。字體枚舉通過document.fontsAPI檢測已安裝字體。Playwright默認只加載系統(tǒng)基礎(chǔ)字體我們額外添加--font-render-hintingnone參數(shù)關(guān)閉字體微調(diào)。更隱蔽的是請求時序指紋。智聯(lián)會分析兩次請求的間隔時間人類操作有隨機停頓機器請求則呈現(xiàn)固定周期。我們給Requests請求加了動態(tài)延時import random def get_delay(): # 基于正態(tài)分布模擬人類操作間隔μ1.2s, σ0.3s delay max(0.5, random.gauss(1.2, 0.3)) return delay # 請求前 time.sleep(get_delay())這個細節(jié)讓智聯(lián)的“機器人行為”誤判率從73%降到12%。3.2 動態(tài)參數(shù)破解拉勾網(wǎng)加密URL參數(shù)的逆向?qū)崙?zhàn)拉勾網(wǎng)的職位詳情頁URL形如https://www.lagou.com/jobs/xxxxx.html?showxxxxx其中show參數(shù)是AES加密的。直接抓包看Network面板發(fā)現(xiàn)每次刷新頁面show值都變但對應(yīng)的職位ID不變。這說明加密密鑰是頁面JS生成的。我們用Playwright打開頁面注入JS鉤子page.evaluate( // 監(jiān)聽所有fetch請求捕獲加密參數(shù)生成邏輯 const originalFetch window.fetch; window.fetch function(...args) { if (args[0].includes(jobs/)) { console.log(加密參數(shù)來源:, args[0]); } return originalFetch.apply(this, args); } )然后在Console里搜索show定位到encrypt.js文件。反編譯后發(fā)現(xiàn)密鑰來自window._lg_encrypt_key而這個變量在頁面初始化時由window.__INITIAL_STATE__里的securityKey字段生成。最終破解方案用Playwright加載頁面后執(zhí)行page.evaluate(window._lg_encrypt_key)獲取密鑰再用PyCryptodome解密from Crypto.Cipher import AES from Crypto.Util.Padding import unpad def decrypt_show_param(encrypted_show: str, key: str) - str: # 拉勾使用AES-128-CBCIV固定為16個0 iv b\x00 * 16 cipher AES.new(key.encode(), AES.MODE_CBC, iv) decrypted unpad(cipher.decrypt(bytes.fromhex(encrypted_show)), AES.block_size) return decrypted.decode()這個過程花了我整整兩天但換來的是100%的URL解析成功率。網(wǎng)上所謂的“萬能解密腳本”根本沒處理IV和Padding跑不通。3.3 數(shù)據(jù)質(zhì)量生死線薪資字段的12種“面議”陷阱與清洗策略招聘網(wǎng)站里“面議”是最常見的臟數(shù)據(jù)但它的形態(tài)有12種之多每種都需要不同策略原始文本類型處理策略“面議”純面議salary_min None, salary_max None, salary_negotiable True“15K-25K·13薪”含年終獎提取15000-25000bonus_multiplier13“年薪20W提成”含浮動salary_min200000, salary_maxNone, salary_typeannual, has_bonusTrue“月薪8K-12K13薪”括號注釋正則(\d)K-(\d)K.*?(\d)薪→min8000, max12000, bonus13“200元/天”日薪salary_min200*22, salary_max200*22, salary_unitmonthly按22天月薪換算我們用pyparsing庫構(gòu)建語法樹而不是簡單正則from pyparsing import Word, nums, oneOf, Optional, Group salary_expr ( Word(nums) Optional(K | k | W | w) - Word(nums) Optional(K | k | W | w) Optional(oneOf(· * x)) Optional(Word(nums) 薪) )這樣能精準匹配“15K-25K·13薪”而不會把“Java開發(fā)工程師”里的“K”誤匹配。實測清洗準確率達99.2%遠超正則方案的83%。3.4 可維護性設(shè)計為什么要把選擇器寫進YAML配置文件新手常把XPath硬編碼在Python里# 危險網(wǎng)站一改版就全掛 title tree.xpath(//div[classjob-name]/h1/text())[0]我們?nèi)客庵玫絪electors/lagou.yamllagou: job_list: items: //div[classlist-item] title: .//div[classp-top]/h3/text() company: .//div[classcompany]/text() salary: .//span[classsalary]/text() job_detail: jd: //div[classjob-detail]/descendant::text()Python代碼只做配置加載import yaml with open(selectors/lagou.yaml) as f: selectors yaml.safe_load(f) title tree.xpath(selectors[lagou][job_list][title])[0]好處立竿見影當拉勾把job-name改成position-title運維只需改YAML不用動Python代碼發(fā)布零風險。去年我們用這套機制在3小時內(nèi)完成了對5個招聘網(wǎng)站的選擇器批量更新而傳統(tǒng)硬編碼方式平均每個網(wǎng)站要修2小時。4. 實操過程與核心環(huán)節(jié)實現(xiàn)從零搭建可運行的最小可行系統(tǒng)4.1 環(huán)境準備與依賴安裝避坑指南不要用pip install -r requirements.txt一鍵安裝。招聘爬蟲的依賴有隱性沖突playwright和selenium共存會導致Chrome驅(qū)動混亂。我們只裝Playwrightpip install playwright然后playwright install chromium不用firefox或webkit因為招聘網(wǎng)站兼容性最好。lxml必須指定版本pip install lxml4.9.3。新版lxml 5.x在解析某些招聘網(wǎng)站的亂碼HTML時會崩潰報錯XMLSyntaxError: Document is empty降級到4.9.3完美解決。pycryptodome不能裝crypto已被棄用必須裝pycryptodome且Windows下要提前裝Visual Studio Build Tools否則編譯失敗。虛擬環(huán)境創(chuàng)建命令python -m venv crawler_env source crawler_env/bin/activate # Linux/Mac # crawler_env\Scripts\activate # Windows pip install --upgrade pip pip install requests pandas pymysql kafka-python pyyaml pyparsing pip install playwright playwright install chromium提示Playwright安裝后務(wù)必運行playwright show-trace測試是否能啟動瀏覽器有些云服務(wù)器缺少字體庫會報錯需apt-get install fonts-liberation。4.2 核心模塊代碼實現(xiàn)SessionManager與Parser的工業(yè)級寫法SessionManager帶自動續(xù)簽的會話池import time import json import requests from urllib.parse import urljoin from typing import Dict, Optional, Tuple class SessionManager: def __init__(self, config_file: str): with open(config_file) as f: self.config json.load(f) self.sessions: Dict[str, dict] {} self.lock threading.Lock() def _login_zhipin(self, account: dict) - Optional[dict]: BOSS直聘模擬登錄含短信驗證碼 s requests.Session() # 1. 獲取登錄頁提取csrf_token resp s.get(https://www.zhipin.com/login/) csrf re.search(rcsrfToken:([^]), resp.text).group(1) # 2. 發(fā)送手機號獲取驗證碼 s.post(https://www.zhipin.com/wapi/zppassport/mobile/sendSmsCode.json, json{mobile: account[phone], csfrToken: csrf}) # 3. 這里應(yīng)接入短信平臺API實際項目中我們用阿里云SMS SDK # code get_sms_code(account[phone]) code 123456 # 測試用 # 4. 提交驗證碼登錄 login_resp s.post(https://www.zhipin.com/wapi/zppassport/mobile/login.json, json{mobile: account[phone], code: code, csfrToken: csrf}) if login_resp.json()[zpData][code] 0: return { cookies: requests.utils.dict_from_cookiejar(s.cookies), headers: {User-Agent: account[user_agent]}, last_used: time.time() } return None def get_session(self, domain: str) - dict: 獲取有效會話自動續(xù)簽 with self.lock: # 查找未過期會話 for sid, sess in self.sessions.items(): if sess[last_used] time.time() - 1800: # 30分鐘有效期 sess[last_used] time.time() return sess # 無有效會話新建 account self.config[accounts][domain][0] new_sess self._login_zhipin(account) if new_sess: sid f{domain}_{int(time.time())} self.sessions[sid] new_sess return new_sess raise Exception(fSession creation failed for {domain})Parser帶Fallback的字段抽取器from lxml import html import re class LagouParser: def __init__(self, selector_config: dict): self.selectors selector_config def parse_list_page(self, html_content: str) - list: tree html.fromstring(html_content) items [] for item in tree.xpath(self.selectors[items]): try: title self._safe_xpath(item, self.selectors[title], default) company self._safe_xpath(item, self.selectors[company], default) salary self._safe_xpath(item, self.selectors[salary], default) # Fallback如果salary為空嘗試從data-salary屬性取 if not salary: salary_attr item.get(data-salary) if salary_attr: salary salary_attr items.append({ title: title.strip(), company: company.strip(), salary_raw: salary.strip(), url: urljoin(https://www.lagou.com/, item.xpath(.//a/href)[0] if item.xpath(.//a/href) else ) }) except Exception as e: # 記錄解析錯誤但不停止整個批次 print(fParse error on item: {e}) continue return items def _safe_xpath(self, element, xpath, default): 安全XPath提取避免IndexError result element.xpath(xpath) return result[0].strip() if result else default4.3 完整運行流程從啟動到入庫的12個步驟一個典型職位采集任務(wù)的執(zhí)行流程加載路由配置讀取router_rules.yaml確定lagou.com走Playwright流。獲取代理IP從代理池取出一個住宅IP綁定Chrome User-Agent指紋。獲取會話調(diào)用SessionManager.get_session(lagou.com)檢查是否有有效會話無則觸發(fā)登錄。構(gòu)造請求https://www.lagou.com/jobs/positionAjax.json?city上海kdPythonpn1。發(fā)送請求用Requests發(fā)GETHeaders包含X-Requested-With: XMLHttpRequest拉勾要求。響應(yīng)校驗檢查HTTP狀態(tài)碼、Content-Type: application/json、響應(yīng)體是否含success:true。解析JSON提取content.positionResult.result數(shù)組每個元素是職位摘要。生成詳情URL對每個職位拼接https://www.lagou.com/jobs/{positionId}.html。詳情頁渲染用Playwright打開URL等待.job-detail元素出現(xiàn)截圖存檔。字段抽取用LagouParser解析HTML獲取JD、公司規(guī)模、融資階段等字段。數(shù)據(jù)歸一化調(diào)用SalaryExtractor.extract(salary_raw)、JdCleaner.clean(jd_text)。寫入Kafka序列化為JSON發(fā)送到j(luò)ob_rawTopic由Flink消費入庫。整個流程封裝在main.py的crawl_lagou_shanghai_python()函數(shù)里支持命令行參數(shù)python main.py --site lagou --city 上海 --keyword Python --pages 54.4 部署與監(jiān)控如何讓爬蟲在服務(wù)器上“自己活下來”本地跑通不等于生產(chǎn)可用。我們用Supervisor管理進程配置/etc/supervisor/conf.d/crawler.conf[program:crawler-lagou] command/opt/crawler_env/bin/python /opt/crawler/main.py --site lagou --city 上海 --keyword Python directory/opt/crawler usercrawler autostarttrue autorestarttrue startretries3 redirect_stderrtrue stdout_logfile/var/log/crawler/lagou.log關(guān)鍵監(jiān)控指標寫入Prometheuscrawler_requests_total{sitelagou,status200}成功請求數(shù)crawler_parse_errors_total{sitelagou,fieldsalary}薪資字段解析失敗數(shù)crawler_proxy_failures_total{proxy_typeresidential}住宅代理失敗數(shù)告警規(guī)則當rate(crawler_parse_errors_total[1h]) 0.1錯誤率超10%發(fā)企業(yè)微信告警。去年有次拉勾改版薪資字段從span classsalary移到div style="width:16px;margin-left:4px;vertical-align:text-bottom;cursor:text;" />