采購(gòu)合同變成可檢索Markdown只要3分鐘)
MinerU PDF解析把120頁(yè)采購(gòu)合同變成可檢索Markdown只要3分鐘【免費(fèi)下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/mi/MinerU一份120頁(yè)的采購(gòu)合同把價(jià)格清單手敲進(jìn)表格要多久我的同事敲了兩頁(yè)就放棄了數(shù)字對(duì)不齊表線(xiàn)還斷了。換成MinerU做PDF解析這個(gè)過(guò)程縮成一條命令它接收PDF、DOCX、PPTX、XLSX和圖片輸出結(jié)構(gòu)化Markdown和JSON表格保留成HTML表格公式變成LaTeX閱讀順序跟人的眼睛一致拿到手就能喂給RAG或者檢索系統(tǒng)。 裝一次跑一條命令拿到第一份Markdown安裝環(huán)境、喂路徑、等結(jié)果三步之內(nèi)就能到第一個(gè)可用輸出安裝pip install -U mineru[all]這個(gè)帶后綴的包名裝的是全功能依賴(lài)Windows、Linux、macOS都能跑。運(yùn)行mineru -p ./demo/pdfs -o ./output傳一個(gè)文件或者整個(gè)目錄都行首次會(huì)自動(dòng)下載所需模型如果網(wǎng)絡(luò)訪(fǎng)問(wèn)不了默認(rèn)模型源設(shè)置環(huán)境變量MINERU_MODEL_SOURCEmodelscope切到國(guó)內(nèi)鏡像。檢查輸出目錄下生成Markdown主文件旁邊還有提取出的圖片、表格和一份布局可視化文件方便你核對(duì)結(jié)果。上圖是整個(gè)流程的內(nèi)部管線(xiàn)PDF文檔先經(jīng)過(guò)模型解析層再進(jìn)入管線(xiàn)處理最后驗(yàn)證結(jié)果才算輸出每個(gè)環(huán)節(jié)都有落盤(pán)產(chǎn)物可以回查。跑通這一步之后值得花兩分鐘看看它到底在哪幾處下過(guò)功夫。 看它怎么把表格、公式和版面變成結(jié)構(gòu)化內(nèi)容不需要關(guān)心內(nèi)部結(jié)構(gòu)因?yàn)樗呀馕霾鸪闪巳吹靡?jiàn)的事整體架構(gòu)是預(yù)處理、模型、管線(xiàn)、輸出、質(zhì)檢五層的分工上圖是這套架構(gòu)的總覽落到實(shí)際收益上主要是三條它先把每頁(yè)內(nèi)容分類(lèi)成標(biāo)題、段落、表格、公式等區(qū)塊再按閱讀順序重組所以雙欄、混排的合同和文獻(xiàn)讀起來(lái)不會(huì)亂序條款編號(hào)不會(huì)跳行。它檢測(cè)表格結(jié)構(gòu)并轉(zhuǎn)成HTML還支持跨頁(yè)表格合并所以合同里的價(jià)格清單、條款對(duì)比表在Markdown里是一張完整表而不是斷成兩截的碎片。它識(shí)別公式并輸出LaTeX文本所以技術(shù)文檔里的公式段落可以直接在Markdown和知識(shí)庫(kù)里渲染不用手動(dòng)修亂碼。這三件事做對(duì)的前提是輸入別太差下面說(shuō)說(shuō)它什么時(shí)候好用、什么時(shí)候會(huì)拉胯。?? 判斷你的機(jī)器和文檔適不適合它先坦白邊界高精度的hybrid和vlm后端需要GPU顯存建議8GB起步純CPU機(jī)器只能跑pipeline后端兼容性最好但精度會(huì)降一檔官方評(píng)測(cè)約從95分降到86分。另外手寫(xiě)體和很糊的復(fù)印件掃描件照樣會(huì)出錯(cuò)批量跑之前建議先抽一兩頁(yè)驗(yàn)證效果。兩個(gè)來(lái)自真實(shí)使用的細(xì)節(jié)掃描件先調(diào)300dpi再跑源文件模糊到什么解析器都救不回來(lái)重掃一遍比調(diào)參數(shù)有效。每次跑完打開(kāi)結(jié)果旁邊的{文件名}_layout.pdf色塊是檢測(cè)出的內(nèi)容區(qū)塊數(shù)字是閱讀順序哪里漏讀、亂序一眼就能定位。上圖就是一份布局可視化質(zhì)檢文件不同顏色區(qū)分段落、表格和公式區(qū)塊右上角的數(shù)字標(biāo)出閱讀順序用它排查比翻Markdown快得多。確認(rèn)解析質(zhì)量之后最后一個(gè)問(wèn)題是它和你現(xiàn)在的路徑差在哪。 和轉(zhuǎn)Word再?gòu)?fù)制的路線(xiàn)對(duì)比很多人的習(xí)慣是PDF先轉(zhuǎn)Word再手動(dòng)復(fù)制到Markdown。這條路線(xiàn)和MinerU直接輸出的差別集中在結(jié)構(gòu)信息上傳統(tǒng)轉(zhuǎn)換再?gòu)?fù)制MinerU直接輸出表格表線(xiàn)丟失、列錯(cuò)位HTML表格跨頁(yè)自動(dòng)合并公式亂碼或截圖LaTeX文本頁(yè)眉頁(yè)腳頁(yè)碼手動(dòng)刪自動(dòng)去除如果目標(biāo)是搭合同知識(shí)庫(kù)解析結(jié)果還能直接進(jìn)DataFlow這類(lèi)平臺(tái)當(dāng)語(yǔ)料條款從此可檢索、可對(duì)比上圖是DataFlow智能數(shù)據(jù)平臺(tái)的知識(shí)庫(kù)上傳入口解析好的文檔入庫(kù)后合同條款就能被檢索和引用。想完整走一遍流程打開(kāi)快速入門(mén)指南跟著跑一遍倉(cāng)庫(kù)里的demo樣例docs/zh/quick_start/。生成文件的含義可以查輸出文件說(shuō)明解析邏輯的源碼在mineru/backend/想改行為時(shí)知道該從哪里下手?!久赓M(fèi)下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/mi/MinerU創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考