本篇文章將延續《環境建置篇》完成的三台伺服器主機配置,實作 Oracle 資料庫與 Microsoft SQL Server 之間的標準與稽核模式資料表同步抄寫,整體架構如下圖所示。首先,我們將透過 IDR 管理主控台,分別建立與這兩個資料庫的連線。接著,新增二個訂閱任務:第一個是一對一資料表的標準同步鏡映訂閱(Mirror);第二個則是包含稽核軌跡記錄的一對一資料表稽核模式同步鏡映訂閱(LiveAudit)。啟動這兩個訂閱工作後,我們會在中控端主機執行 Python 程式,對 Oracle 資料庫中的 CREDIT_APP 資料表發動新增、修改與刪除等 SQL 操作,觀察資料是否正確同步至 SQL Server,並且分析整體同步作業的延遲時間。
2025年4月22日 星期二
2025年4月15日 星期二
IBM Data Replication (CDC) 資料同步抄寫實作系列《環境建置篇》 Part 3:中控端環境建置(圖文說明)
IBM Data Replication 是一套運用 Change Data Capture(CDC)技術,實現異質資料庫系統即時資料同步與抄寫的資料整合解決方案。作為傳統 ETL 批次式資料整合的補充技術,該方案能即時從來源資料庫的交易日誌中擷取資料異動,並將變更內容傳送至目標資料庫,或是各類第三方中介平台與工具。相較於需要設計批次作業(Batch Job)的 ETL 工具,IBM Data Replication(以下簡稱 IDR)是一種基於配置設定(Config-based)的工具軟體。使用者僅需透過滑鼠操作完成設定與配置,再視需求撰寫少量客製化的衍生表達式(Derived Expressions),即可快速滿足異質資料庫之間的即時資料同步抄寫需求。
本系列文章將帶您逐步了解資料同步與抄寫的實作流程。首先《環境建置篇》將聚焦於整體實作環境所需的軟體安裝與設定,共分為來源端(Part 1)、目的端(Part 2)與中控端(Part 3)等三篇文章。其次在《實作演練篇》則會詳細說明 IDR 如何因應各種常見使用場景的操作流程,共分為標準與稽核模式同步抄寫(Part 1)、自訂客製化稽核欄位(Part 2)、同步抄寫作業的停止與重新啟動(Part 3)以及同步抄寫作業監控與效能瓶頸分析(Part 4)等四篇文章,這些豐富地內容將可協助您快速掌握實務操作的技巧。
IBM Data Replication (CDC) 資料同步抄寫實作系列《環境建置篇》 Part 2:目的端環境建置(圖文說明)
IBM Data Replication 是一套運用 Change Data Capture(CDC)技術,實現異質資料庫系統即時資料同步與抄寫的資料整合解決方案。作為傳統 ETL 批次式資料整合的補充技術,該方案能即時從來源資料庫的交易日誌中擷取資料異動,並將變更內容傳送至目標資料庫,或是各類第三方中介平台與工具。相較於需要設計批次作業(Batch Job)的 ETL 工具,IBM Data Replication(以下簡稱 IDR)是一種基於配置設定(Config-based)的工具軟體。使用者僅需透過滑鼠操作完成設定與配置,再視需求撰寫少量客製化的衍生表達式(Derived Expressions),即可快速滿足異質資料庫之間的即時資料同步抄寫需求。
本系列文章將帶您逐步了解資料同步與抄寫的實作流程。首先《環境建置篇》將聚焦於整體實作環境所需的軟體安裝與設定,共分為來源端(Part 1)、目的端(Part 2)與中控端(Part 3)等三篇文章。其次在《實作演練篇》則會詳細說明 IDR 如何因應各種常見使用場景的操作流程,共分為標準與稽核模式同步抄寫(Part 1)、自訂客製化稽核欄位(Part 2)、同步抄寫作業的停止與重新啟動(Part 3)以及同步抄寫作業監控與效能瓶頸分析(Part 4)等四篇文章,這些豐富地內容將可協助您快速掌握實務操作的技巧。
IBM Data Replication (CDC) 資料同步抄寫實作系列《環境建置篇》 Part 1:來源端環境建置(圖文說明)
IBM Data Replication 是一套運用 Change Data Capture(CDC)技術,實現異質資料庫系統即時資料同步與抄寫的資料整合解決方案。作為傳統 ETL 批次式資料整合的補充技術,該方案能即時從來源資料庫的交易日誌中擷取資料異動,並將變更內容傳送至目標資料庫,或是各類第三方中介平台與工具。相較於需要設計批次作業(Batch Job)的 ETL 工具,IBM Data Replication(以下簡稱 IDR)是一種基於配置設定(Config-based)的工具軟體。使用者僅需透過滑鼠操作完成設定與配置,再視需求撰寫少量客製化的衍生表達式(Derived Expressions),即可快速滿足異質資料庫之間的即時資料同步抄寫需求。
本系列文章將帶您逐步了解資料同步與抄寫的實作流程。首先《環境建置篇》將聚焦於整體實作環境所需的軟體安裝與設定,共分為來源端(Part 1)、目的端(Part 2)與中控端(Part 3)等三篇文章。其次在《實作演練篇》則會詳細說明 IDR 如何因應各種常見使用場景的操作流程,共分為標準與稽核模式同步抄寫(Part 1)、自訂客製化稽核欄位(Part 2)、同步抄寫作業的停止與重新啟動(Part 3)以及同步抄寫作業監控與效能瓶頸分析(Part 4)等四篇文章,這些豐富地內容將可協助您快速掌握實務操作的技巧。
2025年3月13日 星期四
IBM Data Replication (CDC) 系統架構、功能與支援資料庫
在上一篇文章《IBM Data Replication (CDC) 即時資料同步抄寫解決方案》中,我們從企業資料整合基礎架構(Data Integration Infrastructure)的角度,深入探討基於 CDC 技術的 IBM Data Replication 的運作原理,並分析它能為企業帶來的價值與效益。此外,文章也分享了四種常見的 CDC 商業應用場景,包括主機系統報表查詢外移、數據中台資料共享架構、混合雲資料庫即時同步,以及集中式主資料管理系統等。在本篇文章中,我們將進一步介紹 IBM Data Replication 的系統架構與功能特性,以及它所支援的各類來源與目標資料庫系統。
2025年2月23日 星期日
IBM Data Replication (CDC) 即時資料同步抄寫解決方案
隨著我們逐步邁向人工智慧的成熟時代,AI 對工作方式的影響將日益明顯。目前常見的智能客服、語音及影像辨識、內容生成、需求與風險預測等 AI 應用,未來將進一步發展為具備自主決策和學習能力的 AI Agent(人工智慧代理人)。這些 AI 代理人可以透過多任務協作,實現更高效且自動化的工作流程,滿足企業提升收入與降低成本的目標。
作為 AI 核心基石的重要元素:資料(Data),將是直接影響企業能否成功發展 AI 應用的一項關鍵能力。隨著資料量不斷增長,企業的資料整合基礎架構(Data Integration Infrastructure)必須與時俱進,如果前一天的營運資料已無法滿足經營管理高層即時的商業決策需求,企業就必須思考如何縮短資料搬移的時間。本篇文章將介紹基於 Change Data Capture (CDC) 技術的 IBM Data Replication 即時資料同步抄寫解決方案,它能夠以近乎即時(Near real-time)的方式可靠地將業務系統產生的營運資料傳遞給需要採取行動的人員和流程,進而推動數位轉型、提高運營效率並有效降低風險。
2024年9月17日 星期二
IBM SPSS Modeler 基礎操作:常用節點速查表
IBM SPSS Modeler 是一個功能強大的視覺化資料科學應用解決方案,它是由節點與串流所組合出的獨特圖形化介面,節點代表對資料進行的個別作業,將一系列節點鏈結在一起稱之為串流,代表資料經過每個作業的流程。依據資料處理的不同階段,節點可以被簡單劃分為來源節點、處理節點以及輸出節點。節點位於視窗介面下方的節點工具箱中,包含:來源、資料列處理、資料欄位處理、統計圖、建模、輸出、匯出、IBM SPSS Statistics、Python 以及 Spark 等 10 個工具箱。為了方便大家快速選擇並取用合適的節點完成所需工作,本篇文章將常用的節點整理成表格,包含節點的圖示、名稱、用法說明以及官方文件連結,另外我也加上網頁版介面的圖示與名稱,希望可協助 SPSS Modeler 的初學者可以更快地熟悉它的操作介面。
2024年9月11日 星期三
IBM SPSS Modeler 基礎操作:重塑資料的結構(圖文教學)
對於資料科學家而言,定義和建立「分析的單位 (Unit of analysis)」是一件重要的工作。簡單來說,這指的是在進行分析時,一筆資料代表什麼才能讓分析有意義。假設專案的分析目的是預測哪些客戶可能會接受促銷方案,那麼預測模型可能需要每一筆都是不同的客戶而非不同的交易;換個角度,如果分析目的是識別購買演唱會門票的欺詐行為,那麼模型可能需要的是每一筆交易的樣本資料。
因此,當我們確定預測分析目的之後,接下來就得仔細觀察原始資料的結構與內容,除了必要的資料清理處理之外,有時候也需要重塑資料的結構。例如,我們需要分析客戶層面的問題,那麼就需要從客戶歷史交易記錄、購買行為與互動記錄中找出一個方法將多筆資料進行彙整,並將它們表示為每個人的單一筆資料 (Single record)。在本篇文章中,我們將介紹「相異的」、「聚集」、「設成旗標」這三個常用於重塑資料結構的節點,同時我們也會連帶介紹統計圖中的「Web」節點,並使用它來分析資料與資料之間的關聯性。
2024年9月9日 星期一
IBM SPSS Modeler 基礎操作:資料剖析與清洗(圖文教學)
進行資料探勘或預測分析專案之前,徹底探索資料是一件必要且重要的工作。這是因為資料科學家不僅需要了解資料欄位實際的內容以及值域的分佈,同時他們也需要處理資料品質的問題。造成資料存在錯誤或不準確的問題,其原因可能是:輸入數值時偶爾出現的錯誤、未嚴格控制資料輸入內容而導致的缺失值、欺騙性回應(Fraudulent Responses)、員工培訓不足導致的誤解和資料不一致。因此,CRISP-DM 方法論中的資料理解階段是機器學習建模專案中關鍵的一個步驟,因為這是資料科學家有機會藉由取得的資料來評估專案目標可行性的重要開始。IBM SPSS Modeler 提供了許多方法來解決這些問題,在本篇文章中,我們將重點介紹「過濾器」、「類型」、「資料審核」這三個常用於資料剖析與清洗的節點。
2024年9月5日 星期四
IBM SPSS Modeler 基礎操作:合併異質資料來源(圖文教學)
對於熟悉資料庫應用操作與商業智慧分析(Business Intelligence)的朋友們應該對 Join Table 這個技術不陌生,基本上就是透過資料庫 SQL 語言中的 JOIN 指令將來自於相同資料庫中的不同資料表(Table)關聯在一起,形成一個基於共用鍵值(Key)欄位的合併資料表,例如透過 Join 的方式關聯訂單主表與訂單明細表,最終產生一個完整的訂單資料表。在 IBM SPSS Modeler 中,我們不需要撰寫 SQL JOIN 指令就能實現資料表關聯,甚至還可以透過簡單的操作將來自不同來源的資料進行整合,這種作法稱之為 Data blending(數據混合)。本篇文章將透過圖文教學的方式引導大家使用 SPSS Modeler 進行異質資料來源的整合,同時我也會分享快速進行欄位篩選與建立衍生欄位的方法。
訂閱:
文章 (Atom)








