畫(huà)面的區(qū)別)
有一次我從客戶發(fā)來(lái)的 PDF 里整理產(chǎn)品圖頁(yè)面上圖片清清楚楚右鍵還能“另存為”可真正批量導(dǎo)出以后導(dǎo)出的圖片不是尺寸不對(duì)就是數(shù)量少了很多。后來(lái)?yè)Q了個(gè)思路用 Python 提取 PDF 中的圖片幾行代碼跑通可一放到真實(shí)文件上圖片少、文件亂、原圖變樣、程序中途崩潰這些問(wèn)題又全冒出來(lái)了。那時(shí)候我就意識(shí)到問(wèn)題通常不出在代碼本身而在于很多人沒(méi)有先把需求想清楚你要的是 PDF 里的“原始圖片素材”還是頁(yè)面上肉眼看到的那張圖。這兩類(lèi)需求看著像一回事實(shí)際完全對(duì)應(yīng)著不同的技術(shù)路線也會(huì)得到完全不同的結(jié)果質(zhì)量。這篇文章不是只給你一段能跑的代碼而是想把“用 Python 提取 PDF 圖片”這件事拆成需求判斷、最小實(shí)現(xiàn)、批量工程化、兜底渲染和排查鏈路幾個(gè)層次來(lái)講。你跟著這套思路走一遍以后再拿到奇怪 PDF就不至于每次都靠試。1. 先想清楚你要的是 PDF 里的“原始素材”還是頁(yè)面上的那張圖1.1 兩種需求看起來(lái)一樣結(jié)果邏輯完全不同第一種需求是把 PDF 當(dāng)作一個(gè)容器。你希望把里面嵌入的圖片對(duì)象完整取出來(lái)保留原始編碼、原始尺寸、原始色彩信息。比如一個(gè)排版文件里包含了高質(zhì)量的商品圖你要把它們還原成獨(dú)立圖片這屬于“提取素材”。第二種需求是把 PDF 的頁(yè)面當(dāng)作一張畫(huà)布。你想把頁(yè)面某一塊區(qū)域的視覺(jué)效果保存成圖片比如從一張數(shù)據(jù)報(bào)表里截取一個(gè)圖表區(qū)域或者把掃描件里某個(gè)圖形塊裁出來(lái)這屬于“提取畫(huà)面”。這兩種需求和最終輸出并不完全等價(jià)。PDF 里的圖片對(duì)象不等于閱讀器上顯示給你看的那張圖。一張大圖可以被轉(zhuǎn) 90 度引用可以被局部裁剪可以被半透明遮罩疊加也可以被內(nèi)容流里的矢量圖形蓋住一部分。如果你直接導(dǎo)出圖片對(duì)象得到的很可能是原始未旋轉(zhuǎn)、未裁切、未修飾的圖片。而如果你用頁(yè)面渲染工具去截取某個(gè)區(qū)域得到的又可能是重采樣之后的結(jié)果不是原圖質(zhì)量。所以第一步不是寫(xiě)代碼而是問(wèn)自己到底要原素材還是要視覺(jué)結(jié)果。1.2 為什么不能靠“找文件頭、文件尾”的方式硬摳圖片很多人一上手會(huì)想到用 Python 讀取二進(jìn)制文件然后通過(guò) JPG 的文件頭FF D8 FF或者 PNG 的文件頭去掃描數(shù)據(jù)。這個(gè)思路對(duì)某些簡(jiǎn)單 PDF 也許能跑通但非常脆弱。原因有兩個(gè)。第一PDF 內(nèi)部不是一張張圖片順序排列的圖片數(shù)據(jù)可能經(jīng)過(guò)壓縮、編碼、拆包也可能被對(duì)象間接引用文件里的字節(jié)順序和你讀到的視覺(jué)順序沒(méi)有直接關(guān)系。第二PDF 既有掃描文本也有翻錄還有被壓縮進(jìn)對(duì)象流里的小對(duì)象。直接通過(guò)二進(jìn)制掃描很難準(zhǔn)確判斷一個(gè)圖片數(shù)據(jù)的起止位置很容易把圖片截?cái)嗷蛘哒`識(shí)別成亂碼。正確的方式是先理解 PDF 的底層結(jié)構(gòu)圖片通常是頁(yè)面內(nèi)容流里引用的一種 Image XObject。它帶有寬度、高度、濾鏡、色彩空間等參數(shù)圖片數(shù)據(jù)本身按對(duì)應(yīng)編碼存放在 PDF 對(duì)象中。PyMuPDF 這類(lèi)庫(kù)做的事情就是把這些細(xì)節(jié)封裝成高層接口讓你不需要手動(dòng)拼裝對(duì)象引用關(guān)系。1.3 理解一點(diǎn)對(duì)象概念比多抄幾段代碼更有用你不需要成為 PDF 規(guī)范專家但至少應(yīng)該知道幾個(gè)關(guān)鍵詞。PDF 文件的基本單位是“對(duì)象”每個(gè)對(duì)象有編號(hào)。頁(yè)面對(duì)象通過(guò)資源字典去引用圖片對(duì)象圖片對(duì)象在 PDF 里通常以/Subtype /Image的形式存在。真正要導(dǎo)出圖片時(shí)腳本要做的事可以簡(jiǎn)化成先找到頁(yè)面里引用了哪些圖片對(duì)象再按對(duì)象編號(hào)去 PDF 頂層對(duì)象里把圖片數(shù)據(jù)取出來(lái)。PyMuPDF 的page.get_images(fullTrue)就是負(fù)責(zé)找引用doc.extract_image(xref)就是負(fù)責(zé)按對(duì)象編號(hào)取數(shù)據(jù)。你只要把這兩個(gè)接口組合起來(lái)就能寫(xiě)出一個(gè)最小可用版本。先掌握這個(gè)對(duì)象思維后面遇到問(wèn)題時(shí)排查方向就會(huì)清晰很多。你遇到的很多“圖片提取不出來(lái)”的奇怪現(xiàn)象本質(zhì)上不是 Python 語(yǔ)法問(wèn)題而是“圖片所在的位置”和“提取工具尋找的位置”不匹配。2. 最小閉環(huán)用 PyMuPDF 把嵌入的圖片完整導(dǎo)出2.1 環(huán)境準(zhǔn)備為什么安裝 PyMuPDF 之后導(dǎo)入的模塊叫 fitz先說(shuō)安裝最簡(jiǎn)單的命令是python -m pip install PyMuPDF這里有一個(gè)很常見(jiàn)的困惑裝的是 PyMuPDF代碼里寫(xiě)的卻是import fitz。這是歷史遺留命名不是要故意繞暈?zāi)?。PyMuPDF 在 Python 環(huán)境里對(duì)外的導(dǎo)入模塊一直使用fitz后續(xù)文檔也在延續(xù)這個(gè)習(xí)慣。如果你遇到ModuleNotFoundError: No module named fitz不要改成安裝一個(gè)叫fitz的別的包優(yōu)先檢查當(dāng)前命令行使用的 Python 環(huán)境和 pip 安裝環(huán)境是不是同一個(gè)。在 Windows 上最容易出現(xiàn)這種問(wèn)題因?yàn)橄到y(tǒng)里可能同時(shí)存在多個(gè) Python。最穩(wěn)妥的方式不是直接執(zhí)行pip install而是用當(dāng)前解釋器對(duì)應(yīng)的 pip 命令來(lái)安裝python -m pip install PyMuPDF這樣保證包被你當(dāng)前正在用的 Python 環(huán)境接收。如果還要對(duì)圖片做校驗(yàn)、裁剪、格式轉(zhuǎn)換建議順手安裝 Pillowpython -m pip install Pillow2.2 一個(gè)能真正把原圖落盤(pán)的最小腳本下面這個(gè)腳本結(jié)構(gòu)比較保守用 try/finally 保證 PDF 文件最終會(huì)被關(guān)閉。你不要小看這個(gè)細(xì)節(jié)批量跑幾百個(gè) PDF 時(shí)文件句柄不釋放會(huì)帶來(lái)很隱蔽的資源占用問(wèn)題。import os import fitz def extract_images_from_pdf(pdf_path, out_dirimages_out): os.makedirs(out_dir, exist_okTrue) doc fitz.open(pdf_path) saved_count 0 used_xrefs set() try: for page_index in range(len(doc)): page doc.load_page(page_index) page_images page.get_images(fullTrue) if not page_images: print(f第 {page_index 1} 頁(yè)沒(méi)有找到圖片對(duì)象) continue for xref in {item[0] for item in page_images}: if xref in used_xrefs: continue try: info doc.extract_image(xref) except Exception as exc: print(f第 {page_index 1} 頁(yè)提取圖片失敗xref{xref}原因{exc}) continue image_data info.get(image) image_ext info.get(ext, bin) if not image_data: continue out_path os.path.join(out_dir, fimg_{xref:05d}.{image_ext}) with open(out_path, wb) as f: f.write(image_data) used_xrefs.add(xref) saved_count 1 finally: doc.close() print(f完成共保存 {saved_count} 張圖片) return saved_count if __name__ __main__: extract_images_from_pdf(input.pdf)這段代碼只做了一件事遍歷每一頁(yè)找到頁(yè)面引用的圖片對(duì)象按對(duì)象編號(hào)去 PDF 里取原始圖片數(shù)據(jù)然后直接寫(xiě)成文件。這里有一個(gè)非常關(guān)鍵的選擇保存圖片數(shù)據(jù)時(shí)直接用extract_image返回的image字段和ext擴(kuò)展名中間沒(méi)有經(jīng)過(guò)任何圖片解碼。這意味著你要保存到磁盤(pán)的是 PDF 里嵌入的原始二維碼和原始數(shù)據(jù)而不是重新編碼后的數(shù)據(jù)。對(duì)于 PDF 內(nèi)部的 JPEG 圖片直接保存成.jpg通常是安全的。對(duì)于 PNG、JPX 等你沒(méi)見(jiàn)過(guò)的擴(kuò)展名也不要急著改后綴先用文件頭校驗(yàn)工具確認(rèn)格式再用圖片瀏覽器打開(kāi)看看。2.3 extract_image 返回了什么腳本才能判斷怎么處理很多人把get_images的結(jié)果直接當(dāng)成圖片內(nèi)容來(lái)寫(xiě)文件結(jié)果寫(xiě)出來(lái)的東西打不開(kāi)。實(shí)際上get_images(fullTrue)返回的是一批元組第一個(gè)元素才是圖片對(duì)象的編號(hào)xref。真正要拿到圖片數(shù)據(jù)需要進(jìn)一步調(diào)用doc.extract_image(xref)。extract_image的返回結(jié)果通常是一個(gè)字典里面有這些信息需要注意image圖片數(shù)據(jù)本體可能已經(jīng)是 JPEG 或 PNG 編碼后的字節(jié)直接用二進(jìn)制方式寫(xiě)入文件即可。ext推薦使用的擴(kuò)展名常見(jiàn)可能是jpeg、png、jpx、jb2這類(lèi)值。width和height圖片的原始像素尺寸注意不一定是頁(yè)面上顯示的尺寸。colorspace顏色空間比如 RGB、GRAY、CMYK。不要在extract_image返回的字典里做太強(qiáng)的主觀判斷因?yàn)椴煌?PDF 結(jié)構(gòu)會(huì)有差異。比較穩(wěn)妥的做法是先獲取image和ext保存完用 Pillow 或文件類(lèi)型工具驗(yàn)證生產(chǎn)級(jí)腳本里再考慮用哈希去重。注意如果只執(zhí)行page.get_images(fullTrue)你拿到的只是圖片對(duì)象的信息不是圖片內(nèi)容。你必須把xref傳給doc.extract_image(xref)之后才能拿到可寫(xiě)入文件的字節(jié)流。2.4 第一次跑完以后別急著歡呼單頁(yè) PDF 跑通只能說(shuō)明路徑?jīng)]有斷。這時(shí)候你應(yīng)該先做一個(gè)校驗(yàn)而不是立刻鋪到 1000 個(gè) PDF 上。我建議的校驗(yàn)順序是用普通圖片查看器打開(kāi)導(dǎo)出文件確認(rèn)不是亂碼。對(duì)比 PDF 頁(yè)面里的圖片數(shù)量和實(shí)際導(dǎo)出數(shù)量。檢查尺寸特別小、特別大的圖片確認(rèn)是否合理。用 Pillow 打開(kāi)幾張有代表性的圖片讀取size和mode確認(rèn)沒(méi)有在解碼層出問(wèn)題。如果這一步出現(xiàn)“數(shù)量對(duì)不上”先不要急大概率不是 Python 代碼的 bug而是 PDF 本身對(duì)同一張圖片的引用方式和視覺(jué)呈現(xiàn)方式不同。3. 從“跑通一次”到“批量處理”該補(bǔ)腳本能力而不是循環(huán)3.1 去重同一個(gè)對(duì)象出現(xiàn)在多個(gè)頁(yè)面不應(yīng)該重復(fù)保存一份真實(shí)的 PDF尤其是那種從辦公軟件導(dǎo)出的文件經(jīng)常會(huì)出現(xiàn)同一個(gè) Logo、同一個(gè)背景素材在多頁(yè)里反復(fù)出現(xiàn)的情況。如果簡(jiǎn)單按“頁(yè)碼 圖片序號(hào)”來(lái)命名會(huì)產(chǎn)生大量重復(fù)文件。這里可以通過(guò)xref去重因?yàn)橥粡埱度雸D片在 PDF 里往往會(huì)共享同一個(gè)對(duì)象編號(hào)。上面的最小腳本里已經(jīng)加入了used_xrefs集合核心邏輯就是用xref判斷這張圖是不是已經(jīng)處理過(guò)了。但這里還有一個(gè)更隱蔽的情況有時(shí)候同一個(gè)視覺(jué)圖片會(huì)被保存成兩個(gè)不同的對(duì)象編號(hào)比如一個(gè)文件被重復(fù)嵌入兩次。如果你確定要去重到“內(nèi)容級(jí)別”可以用內(nèi)容哈希來(lái)處理。import hashlib def image_key(data: bytes) - str: return hashlib.sha256(data).hexdigest()在保存前先計(jì)算image_key(image_data)如果這個(gè) key 已經(jīng)出現(xiàn)過(guò)了就跳過(guò)。哈希去重的價(jià)格是額外的 CPU 和內(nèi)存開(kāi)銷(xiāo)。如果 PDF 本身非常大、圖片數(shù)量很多建議先用xref集合去重把大部分明顯重復(fù)擋掉再?zèng)Q定是否做內(nèi)容哈希。3.2 過(guò)濾干擾對(duì)象不要把所有東西都當(dāng)作有效圖片保存真實(shí) PDF 里的圖片對(duì)象千奇百怪常見(jiàn)會(huì)干擾你判斷的對(duì)象包括只有幾個(gè)像素寬的小圖標(biāo)或紋理。用于透明效果的 SMask 遮罩對(duì)象。用于頁(yè)面平鋪背景的 pattern。表單字段的外觀流。被隱藏圖層里的圖片。如果你直接把所有圖片都導(dǎo)出會(huì)得到一堆看起來(lái)沒(méi)用的文件。比較好的過(guò)濾策略是先看尺寸和內(nèi)容類(lèi)型。一個(gè)通用做法是把width或height小于一定閾值的圖片標(biāo)記為低價(jià)值。不過(guò)閾值不能一刀切有些 PDF 里的商品縮略圖可能本來(lái)就只有 200 像素寬。建議第一次先用“不刪文件只打印統(tǒng)計(jì)信息”的方式運(yùn)行把尺寸分布打出來(lái)再?zèng)Q定要不要真正過(guò)濾。還可以在 Pillow 層驗(yàn)證如果 Pillow 打開(kāi)圖片后能確認(rèn)它不是空?qǐng)D、不是純色馬賽克通常說(shuō)明這張圖的二進(jìn)制流是完整的。注意過(guò)濾邏輯寧可保守不要激進(jìn)。直接把小于 100 像素的圖片全刪掉容易誤傷重要素材。更安全的做法是先加一個(gè)“低價(jià)值目錄”把疑似噪聲單獨(dú)放不污染主輸出目錄。3.3 日志、寫(xiě)入校驗(yàn)和異?;謴?fù)少一個(gè)都很難收?qǐng)雠刻幚頃r(shí)最常見(jiàn)的失敗不是提取邏輯本身而是文件系統(tǒng)問(wèn)題、PDF 損壞、權(quán)限受限和路徑?jīng)_突。建議給腳本補(bǔ)充幾件事每一條失敗記錄都要打印頁(yè)碼或 xref不要只打印一句“提取失敗”。圖片寫(xiě)入以后最好校驗(yàn)一次文件大小不是 0。不要因?yàn)橐粡垐D失敗就中斷整個(gè) PDF。對(duì)多 PDF 批量任務(wù)建議給每個(gè) PDF 單獨(dú)建立輸出目錄。這樣即使跑到第 500 個(gè) PDF 時(shí)出了問(wèn)題你也能快速定位到是哪個(gè)輸入文件、哪個(gè) xref 出錯(cuò)而不是盯著控制臺(tái)看只有一行FileNotFoundError。3.4 一個(gè)更實(shí)用的批量腳本骨架在進(jìn)入真實(shí)項(xiàng)目前我會(huì)把腳本組織成三層結(jié)構(gòu)單個(gè) PDF 處理函數(shù)、批量遍歷邏輯、主入口參數(shù)解析。import os import glob import hashlib import fitz def extract_single_pdf(pdf_path, out_dir): os.makedirs(out_dir, exist_okTrue) doc fitz.open(pdf_path) used_xrefs set() stats {total: 0, saved: 0, skipped: 0, failed: 0} try: for page_index in range(len(doc)): page doc.load_page(page_index) images page.get_images(fullTrue) stats[total] len(images) for xref in {item[0] for item in images}: if xref in used_xrefs: stats[skipped] 1 continue try: info doc.extract_image(xref) except Exception as exc: stats[failed] 1 print(fextract failed: {pdf_path} page {page_index 1}, xref {xref}, {exc}) continue data info.get(image) ext info.get(ext, bin) if not data: stats[failed] 1 continue digest hashlib.sha256(data).hexdigest()[:16] out_path os.path.join(out_dir, f{digest}.{ext}) if os.path.exists(out_path): stats[skipped] 1 continue with open(out_path, wb) as f: f.write(data) stats[saved] 1 used_xrefs.add(xref) print(f{pdf_path}: saved{stats[saved]}, skipped{stats[skipped]}, failed{stats[failed]}) return stats finally: doc.close() def process_many(pdf_dir, out_root): for pdf_path in glob.glob(os.path.join(pdf_dir, *.pdf)): basename os.path.splitext(os.path.basename(pdf_path))[0] target_dir os.path.join(out_root, basename) extract_single_pdf(pdf_path, target_dir)這個(gè)骨架并不是最精簡(jiǎn)的但它能覆蓋大多數(shù)批量場(chǎng)景去重、容錯(cuò)、獨(dú)立目錄、統(tǒng)計(jì)信息都齊了。如果你只需要臨時(shí)處理一份 PDF可以去掉批量遍歷層。4. 頁(yè)面里明明看得到圖對(duì)象列表里卻拿不到怎么辦4.1 你看到的不一定是嵌入圖片對(duì)象有幾種情況會(huì)讓get_images返回空列表但頁(yè)面仍然有圖形內(nèi)容。第一種圖片是矢量圖。頁(yè)面里看到的是一個(gè)用路徑、曲線和顏色填充組成的矢量圖形而不是嵌入的位圖對(duì)象。此時(shí)不存在“圖片 XObject”自然也沒(méi)有原圖可提取。你要么接受矢量結(jié)果要么把頁(yè)面渲染成圖片。第二種圖片被嵌在復(fù)雜的表單 XObject 或內(nèi)容流里。PyMuPDF 雖然已經(jīng)會(huì)遞歸搜索頁(yè)面資源但遇到非常規(guī)的 PDF 結(jié)構(gòu)時(shí)你仍然可能拿不到想要的對(duì)象編號(hào)。第三種頁(yè)面顯示的是圖片但整個(gè)圖被放在一個(gè)容器或裁剪區(qū)域里。你從對(duì)象層面拿出來(lái)的圖片是完整的視覺(jué)上卻被裁剪了。遇到這種情況不要反復(fù)折騰get_images。你應(yīng)該把策略切換成“渲染頁(yè)面區(qū)域”直接按視覺(jué)看到的內(nèi)容來(lái)生成圖片。4.2 兜底策略按位置渲染頁(yè)面局部區(qū)域PyMuPDF 的頁(yè)面對(duì)象渲染能力此時(shí)更有用。你可以先通過(guò)page.get_image_info(xrefsTrue)獲取圖片在頁(yè)面上的位置信息再用渲染功能把對(duì)應(yīng)區(qū)域畫(huà)成一張新的 PNG。import fitz def render_region(pdf_path, page_index, bbox, output_path, zoom2): doc fitz.open(pdf_path) try: page doc.load_page(page_index) clip fitz.Rect(bbox) matrix fitz.Matrix(zoom, zoom) pix page.get_pixmap(matrixmatrix, clipclip) pix.save(output_path) finally: doc.close()這里的bbox一般是一個(gè)四元組或 Rect表示頁(yè)面坐標(biāo)系里的左上角 x、左上角 y、右下角 x、右下角 y。直接打印image_info[bbox]把它作為clip傳入即可。zoom參數(shù)影響導(dǎo)出的清晰度。90 是常見(jiàn)的 PDF 頁(yè)面基礎(chǔ)分辨率zoom2意味著按 2 倍去渲染。如果你需要放大原區(qū)域的清晰度可以繼續(xù)提高 zoom但渲染耗時(shí)和內(nèi)存占用也會(huì)增加。4.3 “原圖”和“視覺(jué)圖”的差異在導(dǎo)出素材場(chǎng)景下不能混用做素材導(dǎo)出時(shí)我用一個(gè)很樸素的判斷標(biāo)準(zhǔn)如果對(duì)方要的是“可以直接放進(jìn)設(shè)計(jì)稿的高清原圖”優(yōu)先用extract_image拿原對(duì)象數(shù)據(jù)。如果圖片在 PDF 里已經(jīng)被裁剪過(guò)對(duì)方要的是“頁(yè)面里那個(gè)可見(jiàn)區(qū)域”那么原對(duì)象反而不能直接交付因?yàn)椴眉簟⑿D(zhuǎn)、縮放都沒(méi)有體現(xiàn)在導(dǎo)出對(duì)象上。這兩種結(jié)果沒(méi)有絕對(duì)的好壞只是適用場(chǎng)景不同。最穩(wěn)妥的方式是同一個(gè) PDF 可以同時(shí)生成兩個(gè)文件夾originals存extract_image拿到的原始素材rendered存按頁(yè)面視覺(jué)裁剪出的區(qū)域。先讓使用者自己看哪個(gè)符合需求再根據(jù)結(jié)果固定代碼邏輯。注意如果要處理的是加密 PDF 或設(shè)置了使用權(quán)限的文檔請(qǐng)先確認(rèn)自己有權(quán)訪問(wèn)和提取內(nèi)容并且使用合法獲取的密碼進(jìn)行解密后再操作。不要嘗試?yán)@過(guò)文檔訪問(wèn)控制。5. 別急著選庫(kù)先了解邊界再?zèng)Q定用哪條路線5.1 幾個(gè)常見(jiàn) Python 庫(kù)的大致定位不同庫(kù)處理 PDF 圖片的側(cè)重點(diǎn)不同下面是一個(gè)粗粒度的對(duì)照庫(kù)名適合任務(wù)主要限制PyMuPDF遍歷頁(yè)面圖片對(duì)象、提取原圖、渲染頁(yè)面區(qū)域不是純 Python依賴底層二進(jìn)制庫(kù)pypdf / PyPDF2處理頁(yè)面結(jié)構(gòu)、合并拆分、基礎(chǔ)圖片文件對(duì)象提取對(duì)圖片濾鏡、復(fù)雜 XObject 的覆蓋力不如 PyMuPDFpdfplumber解析文本、表格、頁(yè)面坐標(biāo)信息不是為了提取圖片而設(shè)計(jì)圖片處理不是最佳選擇PyPdfium2頁(yè)面渲染場(chǎng)景主要用于把 PDF 畫(huà)成圖像不是素材提取首選pdfimages命令行工具用于對(duì)照結(jié)果不是 Python 庫(kù)但在批量驗(yàn)證時(shí)很好用我的建議是優(yōu)先用 PyMuPDF 跑通最小流程因?yàn)樗凇罢覉D片對(duì)象”和“渲染頁(yè)面”兩方面都覆蓋得比較完整。pypdf 在純粹做 PDF 元數(shù)據(jù)操作時(shí)也非常方便但用它提取復(fù)雜 PDF 里的圖片你需要處理更多底層細(xì)節(jié)。5.2 一個(gè)通用排查鏈路當(dāng)你發(fā)現(xiàn)提取結(jié)果不對(duì)時(shí)按下面這個(gè)順序排查會(huì)比亂猜高效很多先看現(xiàn)象是根本沒(méi)有輸出還是圖片數(shù)量不匹配還是輸出文件打不開(kāi)還是程序直接崩潰。再看輸入PDF 是否加密是否損壞文件擴(kuò)展名是否只是前綴內(nèi)容是否為空。再確認(rèn)圖片類(lèi)型頁(yè)面上到底是不是位圖是矢量繪圖還是嵌入的圖片對(duì)象。檢查 xref用get_images是否有返回返回的xref是否能被extract_image正常解析。檢查格式輸出文件的擴(kuò)展名是否正確文件大小是否為 0。最后用渲染兜底如果對(duì)象層拿不到就用get_pixmap渲染頁(yè)面區(qū)域。這套鏈路看起來(lái)簡(jiǎn)單卻能覆蓋絕大多數(shù)“圖片為什么提取不出來(lái)”的疑問(wèn)。5.3 工程化建議把腳本當(dāng)成可以被下班后重新跑的東西來(lái)寫(xiě)一旦處理量到了幾十份 PDF 以上腳本就要往“可重復(fù)、可審計(jì)、可恢復(fù)”的方向設(shè)計(jì)。我會(huì)把輸出的每一步都記錄下來(lái)。不是讓你上一套復(fù)雜日志框架而是在關(guān)鍵節(jié)點(diǎn)打印文件名 頁(yè)碼 結(jié)果。最少要能回答三個(gè)問(wèn)題哪一份文件跑過(guò)了成功多少?gòu)埵≡谀睦?。如果同一個(gè)任務(wù)需要反復(fù)修改參數(shù)建議使用命令行參數(shù)而不是改代碼python extract_pdf_images.py --pdf_dir ./input --out_dir ./output --min_width 50同時(shí)把輸出目錄按輸入文件名分開(kāi)避免多份 PDF 的圖片互相覆蓋。注意如果只是臨時(shí)跑一次默認(rèn)配置通常夠用。如果要長(zhǎng)期維護(hù)還需要考慮磁盤(pán)空間、重復(fù)文件清理、任務(wù)斷點(diǎn)續(xù)跑和關(guān)鍵路徑是否存在這些工程問(wèn)題。最后說(shuō)一個(gè)實(shí)際經(jīng)驗(yàn)我見(jiàn)過(guò)很多同學(xué)照著一篇教程復(fù)制代碼把圖片提取出來(lái)以后存到自己都分不清的地方。下一次遇到新 PDF又把代碼翻出來(lái)改兩行再次碰運(yùn)氣。真正高效的做法其實(shí)是在動(dòng)手前先明確兩個(gè)定義第一輸出物是“原始素材”還是“視覺(jué)區(qū)域”第二腳本需要滿足“單次可用”還是“批量反復(fù)使用”。只要這兩個(gè)問(wèn)題回答清楚了技術(shù)路線基本就定了需要原始素材就去頁(yè)面資源里找圖片對(duì)象需要視覺(jué)區(qū)域就做頁(yè)面渲染要反復(fù)使用就補(bǔ)上日志、去重、異常處理、目錄規(guī)劃和結(jié)果校驗(yàn)。PDF 格式本身并不復(fù)雜但它隱藏的邊界情況非常多。圖片提取這件事真正難的不是不會(huì)寫(xiě) Python而是沒(méi)有意識(shí)到 PDF 里“圖片數(shù)據(jù)和圖片顯示”是兩套邏輯。理解了這個(gè)你提取圖片的準(zhǔn)確率和穩(wěn)定性都會(huì)比那些只會(huì)復(fù)制代碼的人高一個(gè)檔次。