據(jù)集成平臺(tái):拖拽式ETL與調(diào)度實(shí)戰(zhàn))
簡(jiǎn)介這是一套基于KettlePentaho Data Integration構(gòu)建的Web版數(shù)據(jù)集成平臺(tái)源碼包面向數(shù)據(jù)工程師、ETL開(kāi)發(fā)者及希望降低數(shù)據(jù)采集門(mén)檻的分析人員。它把傳統(tǒng)桌面端Kettle的轉(zhuǎn)換與作業(yè)能力搬到瀏覽器中通過(guò)拖拽式可視化界面完成數(shù)據(jù)源接入、清洗轉(zhuǎn)換與任務(wù)調(diào)度解決非技術(shù)人員難以使用ETL工具、團(tuán)隊(duì)數(shù)據(jù)集難以共享復(fù)用的問(wèn)題。壓縮包共1645個(gè)文件約160.93MB以912個(gè)Java源碼、163個(gè)properties配置、123個(gè)xml、94個(gè)css與74個(gè)vue前端組件為主另含ktr轉(zhuǎn)換文件、Dockerfile、yaml部署配置及少量rpm、sh腳本覆蓋前后端與容器化部署全鏈路。資源已有727人學(xué)習(xí)下載讀者可借此研究Kettle如何被封裝為Web服務(wù)學(xué)習(xí)數(shù)據(jù)源管理、圖形化流程設(shè)計(jì)、執(zhí)行監(jiān)控、版本控制與權(quán)限角色等模塊的實(shí)現(xiàn)思路并基于現(xiàn)有目錄結(jié)構(gòu)進(jìn)行二次開(kāi)發(fā)與定制。1. 拖拽就能跑 ETL這個(gè)基于 Kettle 的 Web 數(shù)據(jù)集成平臺(tái)到底能省多少事如果你做過(guò)數(shù)據(jù)采集大概率經(jīng)歷過(guò)這種場(chǎng)面業(yè)務(wù)方丟來(lái)一個(gè) Excel要求清洗后入庫(kù)還得每天定時(shí)跑。桌面版 Kettle 的 Spoon 確實(shí)能拖拽搞定但裝客戶端、配 JDBC 驅(qū)動(dòng)、調(diào)環(huán)境變量這一套下來(lái)非技術(shù)同事直接勸退。這個(gè)基于 Kettle 實(shí)現(xiàn)的 Web 版數(shù)據(jù)集成平臺(tái)核心價(jià)值就一句話——把 Spoon 的拖拽畫(huà)布搬進(jìn)瀏覽器讓數(shù)據(jù)采集和數(shù)據(jù)集管理變成打開(kāi)網(wǎng)頁(yè)就能干的事。它適合三類(lèi)人需要快速搭 ETL 流程的數(shù)據(jù)工程師、不想裝客戶端的分析師以及想把數(shù)據(jù)集成能力嵌入自己系統(tǒng)的開(kāi)發(fā)者。源碼包>// 畫(huà)布狀態(tài)結(jié)構(gòu)示意基于常見(jiàn)拖拽實(shí)現(xiàn)推斷 const canvasState { nodes: [ { id: node_1, type: TableInput, // 對(duì)應(yīng) Kettle 的“表輸入”步驟 name: 讀取訂單表, config: { connection: mysql_order, // 數(shù)據(jù)源連接名 sql: SELECT * FROM orders WHERE dt ?, variables: [${ETL_DATE}] // 支持變量替換 } }, { id: node_2, type: TableOutput, // 對(duì)應(yīng) Kettle 的“表輸出”步驟 name: 寫(xiě)入結(jié)果表, config: { connection: mysql_dw, table: dw_orders, batchSize: 1000 // 批量提交條數(shù) } } ], edges: [ { from: node_1, to: node_2 } // 節(jié)點(diǎn)間的跳線 ] };這段結(jié)構(gòu)里type字段必須和 Kettle 的步驟插件名對(duì)上否則后端序列化時(shí)會(huì)找不到對(duì)應(yīng)組件。config里的connection不是數(shù)據(jù)庫(kù)連接串而是平臺(tái)里預(yù)先配好的數(shù)據(jù)源名稱(chēng)這樣設(shè)計(jì)是為了避免在畫(huà)布上暴露密碼。batchSize這類(lèi)參數(shù)直接透?jìng)鹘o Kettle 的步驟配置改大了能提升寫(xiě)入吞吐但事務(wù)日志也會(huì)膨脹后面避坑章節(jié)會(huì)細(xì)說(shuō)。前端還有一個(gè)容易忽略的點(diǎn)拖拽回彈。有些瀏覽器里拖拽元素松手后會(huì)彈回原位通常是dragend事件里沒(méi)有正確更新?tīng)顟B(tài)或者dragover沒(méi)阻止默認(rèn)行為。源碼里如果用了 HTML5 原生拖拽檢查dragover.prevent和drop的綁定如果用第三方庫(kù)看版本是否兼容當(dāng)前瀏覽器。2.2 后端調(diào)度層把畫(huà)布 JSON 翻譯成 Kettle 轉(zhuǎn)換后端拿到前端傳來(lái)的 JSON 后要做三件事校驗(yàn)節(jié)點(diǎn)連接是否合法、生成 Kettle 的.ktr或.kjb文件、調(diào)用 Kettle 引擎執(zhí)行。mvnw.cmd的存在說(shuō)明構(gòu)建走 Mavenmysqld.cnf暗示元數(shù)據(jù)庫(kù)用的是 MySQL。平臺(tái)自身的用戶、權(quán)限、數(shù)據(jù)源配置、轉(zhuǎn)換版本這些元數(shù)據(jù)大概率存在 MySQL 里而實(shí)際的數(shù)據(jù)采集任務(wù)由 Kettle 引擎跑。生成 Kettle 轉(zhuǎn)換文件這一步是關(guān)鍵。Kettle 的.ktr是 XML 格式每個(gè)步驟對(duì)應(yīng)一個(gè)step元素跳線對(duì)應(yīng)hop。后端需要把畫(huà)布 JSON 里的節(jié)點(diǎn)類(lèi)型映射到 Kettle 的步驟插件 ID比如TableInput對(duì)應(yīng)TableInputTableOutput對(duì)應(yīng)TableOutput。參數(shù)名也要對(duì)齊Kettle 的 XML 里字段名是大小寫(xiě)敏感的。// 后端生成 Kettle 轉(zhuǎn)換 XML 的簡(jiǎn)化邏輯Java 偽代碼 public String generateKtr(CanvasState state) { StringBuilder xml new StringBuilder(); xml.append(transformation); xml.append(infoname).append(state.getName()).append(/name/info); // 遍歷畫(huà)布節(jié)點(diǎn)生成 step 元素 for (Node node : state.getNodes()) { xml.append(step); xml.append(name).append(node.getName()).append(/name); xml.append(type).append(node.getType()).append(/type); // 將 config 中的參數(shù)逐個(gè)寫(xiě)入 XML for (Map.EntryString, String entry : node.getConfig().entrySet()) { xml.append().append(entry.getKey()).append() .append(entry.getValue()) .append(/).append(entry.getKey()).append(); } xml.append(/step); } // 遍歷邊生成 hop 元素 for (Edge edge : state.getEdges()) { xml.append(hop); xml.append(from).append(edge.getFrom()).append(/from); xml.append(to).append(edge.getTo()).append(/to); xml.append(enabledY/enabled); xml.append(/hop); } xml.append(/transformation); return xml.toString(); }這段邏輯里enabledY/enabled控制跳線是否啟用調(diào)試時(shí)可以把某條線設(shè)為N來(lái)隔離問(wèn)題節(jié)點(diǎn)。生成的 XML 要寫(xiě)到臨時(shí)目錄再通過(guò) Kettle 的TransMeta和Trans類(lèi)加載執(zhí)行。執(zhí)行時(shí)建議用獨(dú)立線程池避免一個(gè)長(zhǎng)任務(wù)阻塞 Web 請(qǐng)求。如果平臺(tái)支持定時(shí)調(diào)度底層通常用 Quartz 或 Spring Schedule 觸發(fā)每次觸發(fā)重新生成 XML 再執(zhí)行保證畫(huà)布改動(dòng)即時(shí)生效。2.3 數(shù)據(jù)源與數(shù)據(jù)集管理連接池和元數(shù)據(jù)表怎么設(shè)計(jì)平臺(tái)要支持多種數(shù)據(jù)源關(guān)系型數(shù)據(jù)庫(kù)、文件系統(tǒng)、Web 服務(wù)都得能接。源碼里mysqld.cnf只是 MySQL 服務(wù)端配置平臺(tái)自身的數(shù)據(jù)源管理模塊需要維護(hù)一張連接信息表。常見(jiàn)設(shè)計(jì)是datasource表存連接名、類(lèi)型、JDBC URL、用戶名、加密后的密碼dataset表存數(shù)據(jù)集名稱(chēng)、來(lái)源轉(zhuǎn)換 ID、目標(biāo)表名、字段映射關(guān)系。連接池是另一個(gè)容易翻車(chē)的地方。Kettle 引擎每次執(zhí)行轉(zhuǎn)換都會(huì)創(chuàng)建數(shù)據(jù)庫(kù)連接如果不在平臺(tái)層做池化高頻調(diào)度時(shí)數(shù)據(jù)庫(kù)連接數(shù)會(huì)飆升。常見(jiàn)做法是在后端用 HikariCP 或 Druid 管理連接池Kettle 步驟里引用池化后的數(shù)據(jù)源。但 Kettle 的“表輸入”步驟默認(rèn)自己管理連接要讓它走池化數(shù)據(jù)源需要在 Kettle 的kettle.properties里配置連接池參數(shù)或者用“數(shù)據(jù)庫(kù)連接”步驟顯式指定。-- 平臺(tái)元數(shù)據(jù)表設(shè)計(jì)參考MySQL CREATE TABLE datasource ( id BIGINT PRIMARY KEY AUTO_INCREMENT, name VARCHAR(64) NOT NULL UNIQUE COMMENT 連接名畫(huà)布上引用, db_type VARCHAR(32) NOT NULL COMMENT mysql/postgresql/oracle, jdbc_url VARCHAR(512) NOT NULL, username VARCHAR(128) NOT NULL, password_enc VARCHAR(256) NOT NULL COMMENT 加密存儲(chǔ), created_at DATETIME DEFAULT CURRENT_TIMESTAMP ) ENGINEInnoDB DEFAULT CHARSETutf8mb4; CREATE TABLE dataset ( id BIGINT PRIMARY KEY AUTO_INCREMENT, name VARCHAR(128) NOT NULL, trans_id BIGINT NOT NULL COMMENT 關(guān)聯(lián)的轉(zhuǎn)換ID, target_table VARCHAR(128) COMMENT 輸出目標(biāo)表, field_mapping JSON COMMENT 字段映射關(guān)系, created_at DATETIME DEFAULT CURRENT_TIMESTAMP ) ENGINEInnoDB DEFAULT CHARSETutf8mb4;password_enc字段必須加密存儲(chǔ)常見(jiàn)做法是用 AES 對(duì)稱(chēng)加密密鑰放在環(huán)境變量里而不是代碼里。field_mapping用 JSON 類(lèi)型存方便前端動(dòng)態(tài)渲染字段對(duì)應(yīng)關(guān)系。數(shù)據(jù)集和轉(zhuǎn)換的關(guān)聯(lián)用trans_id這樣同一個(gè)轉(zhuǎn)換可以產(chǎn)出多個(gè)數(shù)據(jù)集改轉(zhuǎn)換時(shí)所有關(guān)聯(lián)數(shù)據(jù)集自動(dòng)生效。3. 從零跑起來(lái)環(huán)境準(zhǔn)備、編譯打包與第一個(gè)數(shù)據(jù)采集任務(wù)源碼包能跑通和能跑穩(wěn)是兩回事。這一章按實(shí)際部署順序走一遍把環(huán)境依賴、編譯命令、啟動(dòng)參數(shù)和第一個(gè)任務(wù)的配置細(xì)節(jié)都落到可復(fù)現(xiàn)的步驟上。中間涉及 Kettle 引擎的初始化這是最容易卡住的地方。3.1 環(huán)境依賴清單與版本對(duì)齊先確認(rèn)本機(jī)環(huán)境。后端是 Java 系mvnw.cmd說(shuō)明至少需要 JDK 8 或 11具體看pom.xml里的maven.compiler.source。MySQL 用于存元數(shù)據(jù)mysqld.cnf是服務(wù)端配置模板需要根據(jù)本機(jī)路徑調(diào)整datadir和socket。前端需要 Node.js.babelrc說(shuō)明構(gòu)建鏈里有 Babel通常配合 Webpack 或 Vite。依賴項(xiàng)建議版本用途檢查命令JDK8 或 11后端編譯運(yùn)行java -versionMaven3.6依賴管理與打包mvn -v或./mvnw -vMySQL5.7 或 8.0元數(shù)據(jù)存儲(chǔ)mysql --versionNode.js14 或 16前端構(gòu)建node -vKettle8.x 或 9.xETL 引擎檢查lib/下是否有kettle-engineKettle 引擎的依賴需要單獨(dú)引入。源碼包里不一定包含完整的 Kettle 發(fā)行版通常是在pom.xml里引pentaho-kettle的 Maven 坐標(biāo)或者把 Kettle 的lib目錄作為本地依賴。如果編譯時(shí)報(bào)ClassNotFoundException: org.pentaho.di.trans.Trans就是 Kettle 依賴沒(méi)配好。3.2 編譯打包與數(shù)據(jù)庫(kù)初始化先建庫(kù)。用 MySQL 客戶端連上創(chuàng)建平臺(tái)元數(shù)據(jù)庫(kù)字符集用utf8mb4否則中文任務(wù)名會(huì)亂碼。# 創(chuàng)建元數(shù)據(jù)庫(kù) mysql -u root -p -e CREATE DATABASE kettle_web DEFAULT CHARACTER SET utf8mb4 COLLATE utf8mb4_general_ci; # 導(dǎo)入表結(jié)構(gòu)假設(shè)源碼里有 schema.sql mysql -u root -p kettle_web src/main/resources/schema.sql # 修改 mysqld.cnf 中的關(guān)鍵參數(shù)如果要用源碼里的配置模板 # datadir/var/lib/mysql # socket/var/lib/mysql/mysql.sock # character-set-serverutf8mb4然后編譯后端。Windows 下用mvnw.cmdLinux 或 Mac 下用./mvnw。第一次編譯會(huì)下載大量依賴建議配好 Maven 鏡像。# Linux/Mac 編譯打包跳過(guò)測(cè)試加快速度 ./mvnw clean package -DskipTests # Windows 下 mvnw.cmd clean package -DskipTests # 打包完成后 target 目錄下會(huì)有可執(zhí)行 jar java -jar target/data-integration-1.0.jar --spring.profiles.activeprod啟動(dòng)參數(shù)里--spring.profiles.activeprod會(huì)加載生產(chǎn)配置數(shù)據(jù)庫(kù)連接、Kettle 倉(cāng)庫(kù)路徑這些都在對(duì)應(yīng)配置文件里。如果啟動(dòng)報(bào)數(shù)據(jù)庫(kù)連接失敗檢查application-prod.yml里的spring.datasource.url是否指向剛建的kettle_web庫(kù)。前端構(gòu)建單獨(dú)走。進(jìn)入前端目錄裝依賴再打包。# 前端構(gòu)建 npm install npm run build # 開(kāi)發(fā)模式啟動(dòng)方便調(diào)試拖拽交互 npm run dev構(gòu)建產(chǎn)物通常輸出到dist目錄后端配置里指定靜態(tài)資源路徑指向它。開(kāi)發(fā)模式下前端跑在 3000 或 8080 端口后端跑在 8081需要配代理解決跨域。3.3 配置第一個(gè)數(shù)據(jù)采集任務(wù)表輸入到表輸出環(huán)境跑起來(lái)后登錄平臺(tái)先加數(shù)據(jù)源。點(diǎn)“數(shù)據(jù)源管理”新建一個(gè) MySQL 連接填 JDBC URL、用戶名、密碼。測(cè)試連接通過(guò)后保存。這一步的密碼會(huì)加密存到datasource表。然后新建轉(zhuǎn)換。從左側(cè)組件面板拖一個(gè)“表輸入”到畫(huà)布雙擊配置選剛建的數(shù)據(jù)源寫(xiě) SQL。SQL 里可以用${變量名}引用平臺(tái)變量比如${ETL_DATE}執(zhí)行時(shí)動(dòng)態(tài)替換。-- 表輸入步驟的 SQL 示例 SELECT order_id, customer_id, order_amount, order_date FROM orders WHERE order_date ${ETL_DATE} AND order_amount 0再拖一個(gè)“表輸出”到畫(huà)布配置目標(biāo)數(shù)據(jù)源和目標(biāo)表做字段映射。把“表輸入”的跳線連到“表輸出”。點(diǎn)執(zhí)行平臺(tái)會(huì)生成.ktr文件并調(diào) Kettle 引擎跑。執(zhí)行時(shí)看日志。如果報(bào)“字段未找到”檢查 SQL 里的字段名和表輸出的字段映射是否一致。如果報(bào)“連接失敗”檢查數(shù)據(jù)源配置里的 JDBC URL 是否帶了useSSLfalse和serverTimezoneAsia/ShanghaiMySQL 8 不配時(shí)區(qū)會(huì)連不上。4. 避坑排查Kettle Web 化路上最容易翻車(chē)的五個(gè)地方這一章全是血淚經(jīng)驗(yàn)。Web 版 Kettle 和桌面版 Spoon 的差異在環(huán)境、依賴、并發(fā)、編碼、權(quán)限這五個(gè)維度上體現(xiàn)得最明顯。每條按現(xiàn)象、原因、解決來(lái)寫(xiě)照著排查能省不少時(shí)間。4.1 現(xiàn)象轉(zhuǎn)換在 Spoon 里能跑Web 平臺(tái)執(zhí)行報(bào)“找不到步驟插件”原因Kettle 的步驟插件是運(yùn)行時(shí)動(dòng)態(tài)加載的桌面版 Spoon 啟動(dòng)時(shí)會(huì)掃描plugins目錄Web 平臺(tái)如果只引了kettle-engine核心包沒(méi)把插件目錄配進(jìn)去就會(huì)缺步驟類(lèi)型。常見(jiàn)缺失的是“表輸入”“表輸出”之外的擴(kuò)展步驟比如“JSON 輸入”“Excel 輸出”。解決在平臺(tái)啟動(dòng)參數(shù)里指定 Kettle 的插件目錄或者把需要的插件 jar 顯式加到 classpath。檢查KETTLE_HOME環(huán)境變量是否指向完整的 Kettle 安裝目錄。如果用的是 Maven 依賴確認(rèn)pentaho-kettle的版本和插件版本一致混用版本會(huì)出兼容問(wèn)題。4.2 現(xiàn)象定時(shí)任務(wù)跑著跑著數(shù)據(jù)庫(kù)連接數(shù)滿了新任務(wù)全部阻塞原因Kettle 每個(gè)轉(zhuǎn)換執(zhí)行時(shí)默認(rèn)創(chuàng)建獨(dú)立數(shù)據(jù)庫(kù)連接任務(wù)并發(fā)高時(shí)連接數(shù)線性增長(zhǎng)。平臺(tái)層如果沒(méi)做連接池MySQL 的max_connections很快被打滿。另一個(gè)隱蔽原因是轉(zhuǎn)換執(zhí)行完沒(méi)釋放連接Kettle 的Trans對(duì)象沒(méi)調(diào)cleanup()。解決在 Kettle 的kettle.properties里配置連接池把KETTLE_DB_CONNECTION_POOLING設(shè)為true并限制最大連接數(shù)。平臺(tái)層用 HikariCP 管理元數(shù)據(jù)庫(kù)連接和 Kettle 的業(yè)務(wù)連接分開(kāi)。定時(shí)任務(wù)加并發(fā)上限比如用信號(hào)量控制同時(shí)執(zhí)行的轉(zhuǎn)換數(shù)不超過(guò) 5 個(gè)。4.3 現(xiàn)象中文任務(wù)名或字段名在 Web 端顯示正常寫(xiě)入數(shù)據(jù)庫(kù)后變成亂碼原因字符集鏈路沒(méi)對(duì)齊。前端頁(yè)面用 UTF-8后端 Java 文件編碼用 UTF-8但 MySQL 連接串沒(méi)指定characterEncodingutf8或者數(shù)據(jù)庫(kù)表建的時(shí)候用了latin1。Kettle 生成.ktr文件時(shí)如果沒(méi)指定編碼XML 聲明里默認(rèn)是 UTF-8但寫(xiě)入文件時(shí)用了系統(tǒng)默認(rèn)編碼。解決JDBC URL 加characterEncodingutf8useUnicodetrue。建庫(kù)建表統(tǒng)一用utf8mb4。Kettle 生成 XML 時(shí)顯式指定編碼Java 里用OutputStreamWriter并傳StandardCharsets.UTF_8。檢查mysqld.cnf里的character-set-server是否為utf8mb4。4.4 現(xiàn)象拖拽畫(huà)布時(shí)節(jié)點(diǎn)能拖出來(lái)但連線連不上或者連上后執(zhí)行報(bào)“跳線無(wú)效”原因前端畫(huà)布的坐標(biāo)計(jì)算和命中檢測(cè)有偏差。連線通常靠 SVG 或 Canvas 繪制如果節(jié)點(diǎn)的getBoundingClientRect在滾動(dòng)容器里沒(méi)做偏移修正連線的起點(diǎn)終點(diǎn)會(huì)對(duì)不上。另一個(gè)原因是后端校驗(yàn)時(shí)把跳線方向搞反了Kettle 的hop里from和to必須和步驟名完全一致。解決前端連線時(shí)用節(jié)點(diǎn) ID 而不是坐標(biāo)來(lái)建立關(guān)系坐標(biāo)只用于渲染。后端生成hop時(shí)校驗(yàn)from和to是否都在節(jié)點(diǎn)列表里。如果用了 Vue 的v-for渲染節(jié)點(diǎn)確保:key用節(jié)點(diǎn) ID 而不是索引否則拖拽排序后連線會(huì)錯(cuò)亂。4.5 現(xiàn)象平臺(tái)部署到 Linux 服務(wù)器后文件輸入步驟讀不到本地文件原因Web 平臺(tái)跑在應(yīng)用服務(wù)器里工作目錄和桌面版 Spoon 不一樣。文件輸入步驟如果用相對(duì)路徑會(huì)相對(duì)于 Tomcat 或 Spring Boot 的啟動(dòng)目錄而不是用戶以為的目錄。另一個(gè)原因是權(quán)限應(yīng)用服務(wù)器用戶沒(méi)有目標(biāo)文件的讀權(quán)限。解決文件路徑統(tǒng)一用絕對(duì)路徑或者在平臺(tái)里配一個(gè)“文件根目錄”參數(shù)所有文件輸入步驟基于這個(gè)根目錄拼路徑。檢查應(yīng)用服務(wù)器啟動(dòng)用戶對(duì)目標(biāo)目錄的權(quán)限用ls -l確認(rèn)。如果文件在 HDFS 上確認(rèn) Hadoop 客戶端配置和core-site.xml已正確加載。5. 進(jìn)階技巧用變量和參數(shù)把一份轉(zhuǎn)換復(fù)用到多個(gè)數(shù)據(jù)集平臺(tái)跑通之后真正提升效率的不是多畫(huà)幾個(gè)轉(zhuǎn)換而是讓一份轉(zhuǎn)換能復(fù)用到不同日期、不同業(yè)務(wù)線、不同數(shù)據(jù)集。Kettle 本身支持變量和參數(shù)Web 平臺(tái)要做的是把這些能力暴露到界面上讓用戶不用改畫(huà)布就能換參數(shù)。5.1 平臺(tái)變量與 Kettle 參數(shù)的映射關(guān)系Kettle 里有兩類(lèi)動(dòng)態(tài)值變量Variable和參數(shù)Parameter。變量是全局的用${VAR}引用參數(shù)是轉(zhuǎn)換級(jí)別的用?或命名參數(shù)引用。Web 平臺(tái)通常把平臺(tái)變量注入到 Kettle 的變量空間執(zhí)行前調(diào)Trans.setVariable()設(shè)置。// 執(zhí)行轉(zhuǎn)換前注入平臺(tái)變量 Trans trans new Trans(transMeta); trans.setVariable(ETL_DATE, 2024-01-15); trans.setVariable(BIZ_LINE, retail); trans.setVariable(BATCH_ID, UUID.randomUUID().toString()); // 如果轉(zhuǎn)換里用了命名參數(shù) trans.setParameterValue(target_table, dw_orders_retail); trans.execute(null); trans.waitUntilFinished();setVariable設(shè)置的變量在整個(gè)轉(zhuǎn)換里可見(jiàn)包括 SQL 里的${ETL_DATE}和文件路徑里的${BIZ_LINE}。setParameterValue設(shè)置的參數(shù)只對(duì)當(dāng)前轉(zhuǎn)換生效適合目標(biāo)表名這種每次執(zhí)行都可能變的值。執(zhí)行完記得調(diào)trans.cleanup()釋放資源否則連接和線程會(huì)泄漏。5.2 數(shù)據(jù)集版本管理與回溯平臺(tái)如果支持?jǐn)?shù)據(jù)集版本每次轉(zhuǎn)換執(zhí)行產(chǎn)出新數(shù)據(jù)時(shí)舊版本要能回溯。常見(jiàn)做法是在目標(biāo)表加batch_id和etl_date字段每次寫(xiě)入打上批次標(biāo)記。查詢時(shí)按批次過(guò)濾回溯時(shí)指定舊批次。-- 目標(biāo)表加批次字段 ALTER TABLE dw_orders ADD COLUMN batch_id VARCHAR(64) COMMENT 批次ID; ALTER TABLE dw_orders ADD COLUMN etl_date DATE COMMENT 數(shù)據(jù)日期; -- 查詢指定批次的數(shù)據(jù) SELECT * FROM dw_orders WHERE batch_id abc-123 AND etl_date 2024-01-15; -- 回溯時(shí)刪除錯(cuò)誤批次 DELETE FROM dw_orders WHERE batch_id abc-123;平臺(tái)界面上可以做一個(gè)“執(zhí)行歷史”列表每次執(zhí)行記錄批次 ID、開(kāi)始時(shí)間、結(jié)束時(shí)間、狀態(tài)、影響行數(shù)。點(diǎn)某個(gè)歷史記錄能查看當(dāng)時(shí)的轉(zhuǎn)換參數(shù)和日志。這樣出問(wèn)題時(shí)不用翻服務(wù)器日志在界面上就能定位。5.3 性能調(diào)優(yōu)批量提交與并行執(zhí)行數(shù)據(jù)采集量大時(shí)逐條提交會(huì)慢得離譜。Kettle 的“表輸出”步驟有batchSize參數(shù)設(shè)成 1000 到 5000 之間通常比較平衡。設(shè)太大事務(wù)日志膨脹回滾代價(jià)高設(shè)太小網(wǎng)絡(luò)往返次數(shù)多。# kettle.properties 里的性能相關(guān)配置 KETTLE_DB_CONNECTION_POOLINGtrue KETTLE_DB_CONNECTION_POOL_SIZE10 KETTLE_TRANS_STEP_PERFORMANCE_SNAPSHOTtrue并行執(zhí)行要謹(jǐn)慎。Kettle 的轉(zhuǎn)換默認(rèn)是單線程流水線步驟之間可以并行但同一個(gè)步驟內(nèi)是串行的。如果數(shù)據(jù)源支持分區(qū)讀取可以在“表輸入”里配多個(gè) SQL 分區(qū)Kettle 會(huì)并行跑。但并行度不是越高越好數(shù)據(jù)庫(kù)連接數(shù)和 CPU 核數(shù)是上限。我一般會(huì)先跑一個(gè)基準(zhǔn)測(cè)試記錄單線程的吞吐再逐步加并行度觀察數(shù)據(jù)庫(kù)負(fù)載找到拐點(diǎn)就停。從那以后我每次配新轉(zhuǎn)換都強(qiáng)制先跑一遍小批量數(shù)據(jù)驗(yàn)證字段映射和編碼再放大批量。這個(gè)習(xí)慣幫我省了至少三次全量重跑。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取