UNiSOFT Education Centre
🎓 Power Automate with AI Class 將於 2026年9月21日 開始 Limited Seats 🚀 Gemini AI Class 將於 2026年9月23日 開始 Early Bird 優惠
先理解 · 再使用 AI

AI 會寫分析程式,但你要看得懂數據與模型。

使用 AI 進行數據分析之前,你需要先掌握 Python、Pandas 及 Machine Learning 的基礎,學會閱讀、理解及判斷資料處理與模型如何運作;然後才使用 AI 協助產生分析程式、清理資料、尋找錯誤及提出模型建議。課程亦提供 AI 整理的時間章節和課後測驗,讓你按需要跳到任何重點,並檢查自己是否真正掌握所學。

AI 時間章節 · 快速跳轉直接前往需要學習或重溫的數據分析段落。
課後 Quiz · 即時評估測試理解程度,找出仍需加強的學習重點。
30 小時完整錄影12 節課堂完整 AI 章節導航每課附設 Quiz一年無限重播

從基礎數據技術,到可控制、可驗證的 AI 輔助分析

THE RIGHT LEARNING ORDER

不是先叫 AI 分析,而是先知道數據怎樣運作

整個學習路徑分為兩個清楚階段。第一階段刻意不依賴 AI,第二階段才把 AI 加入真實數據科學流程。

STAGE 01不使用 AI

基礎技術 · 20 小時

先親手理解數據如何匯入、清理、分析,並建立可驗證的預測模型。

  • Python:語法、Pandas、資料清理、視覺化及 Excel 輸出
  • Machine Learning:資料準備、Regression、Classification 及模型評估
  • 真正能力:能閱讀、執行、測試及手動檢查自己的分析程式
STAGE 02加入 AI

AI 實戰 · 10 小時

有了基礎後,再以 AI 作為數據科學助手,提高速度而不失去控制。

  • 規劃:用清晰提示定義分析問題、資料流程與特徵工程
  • 建模:建立、比較及解釋預測模型,而不是盲目複製結果
  • 報告:把預測、圖表及洞察整理成可交付的數據科學報告
💡

課程原則:AI 是加速器,不是代替理解的捷徑

如果不明白數據與模型,便無法判斷 AI 是否製造了錯誤、偏差或不適合的分析。完成兩個階段後,你不只懂得叫 AI 寫分析程式,更懂得審查、修正及延伸它。

讀得懂理解資料結構與分析流程
驗證到判斷 AI 輸出是否正確
修正到定位錯誤並選擇合理方案
應用到把預測結果用於真實決策
WATCH BEFORE YOU ENROL

先看課程片段,再決定是否適合你

免費觀看課程介紹及實際教學內容,了解講解方式、技術深度,以及 Python、Pandas 數據處理與機器學習的實作流程。

免費試看 · 4 段
正在播放AI 數據科學課程介紹

按播放鍵即可觀看;選擇右方片段可切換內容。

循序學習 · 完整章節 · 課後 QUIZ

Python、Machine Learning 與 AI Data Science 錄影課程

先用 Python、Pandas 與 Machine Learning 建立真正的數據分析基礎,再學習如何運用 AI 規劃分析、處理資料、建立及檢查預測模型。AI 可以加速工作,但理解數據的人才有能力判斷結果是否正確。

STAGE 01 · WITHOUT AI ASSISTANCE

先建立數據分析基礎

Python/Pandas 數據處理與 Machine Learning 預測模型,先學懂資料、特徵及模型如何真正運作。

Certificate in Python Data Analysis 4 LESSONS · 10 HOURS
CDA2025

Python 數據分析證書課程

Certificate in Python Data Analysis

從 Python 基礎開始,利用 Pandas 處理大型資料集、清理數據並建立分析及視覺化結果。

完整逐課內容、摘要及時間章節

以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。

4 課58 個章節80 題題庫
LESSON 01 Lesson 1 14 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本節課全面介紹了Python編程的基礎與實際應用。課程從環境架設開始,教導學員使用命令提示字元安裝Python並設定環境變數。隨後比較了直譯器與記事本編程,並引導安裝Jupyter Notebook以提升效率。核心涵蓋變數宣告、資料轉換、f-string格式化及條件判斷。接著探討List與Dictionary資料結構的操作,並結合for迴圈處理資料。進階內容包含自訂函式編寫、回傳值設定及自訂模組匯入。最後介紹datetime與math內建模組、檔案讀寫模式(覆寫與附加),並以建立Pandas DataFrame作結,為資料分析奠定基礎。

完整章節內容
  1. Python環境設定與安裝注意事項

    介紹如何透過命令提示字元操作,下載並安裝Python,強調設定PATH環境變數的重要性。

  2. 使用PIP安裝套件與Jupyter Notebook

    示範使用pip指令安裝外部套件,並啟動Jupyter Notebook作為主要程式開發環境。

  3. 變數宣告與資料型態轉換

    講解變數定義、字串與整數相加時的錯誤排解,以及使用f-string進行字串格式化。

  4. List清單資料結構的增刪操作

    介紹清單結構(List)的概念與索引(Index),並示範利用append及insert進行資料增減。

  5. For迴圈的基礎應用與資料批次處理

    教導如何使用for迴圈逐一抽出清單內的元素,並結合條件判斷篩選成績及格與否。

  6. 認識Dictionary字典的鍵值對結構

    介紹字典(Dictionary)格式,透過Key對應Value的方式儲存與查詢特定學生的成績資料。

  7. 定義與呼叫函式(Function)

    講解如何使用def定義無參數與帶有參數的函式,並說明return回傳值的必要性。

  8. 結合range與len控制迴圈範圍

    利用len取得清單長度並搭配range產生數字索引,藉此同時操作與迴圈存取多個資料陣列。

  9. 將資料結構合併為List of Dictionaries

    示範透過迴圈將姓名與分數打包成多個字典結構,並集中存入單一清單中以便管理。

  10. 建立自訂模組與import匯入

    將寫好的功能儲存為獨立的.py檔案,並在Notebook中使用import語法匯入與重複呼叫。

  11. 運用datetime模組處理時間格式

    匯入datetime模組取得當前時間、定義特定日期,並利用strftime自訂日期輸出的文字格式。

  12. 載入math模組進行數學運算

    介紹math模組的實用功能,包含計算開平方根、無條件進位與捨去等數理操作。

  13. 檔案讀取、寫入與附加模式(File I/O)

    示範利用open函式處理文字檔,詳解讀取(r)、覆寫(w)與附加(a)模式的差異及換行技巧。

  14. 認識Pandas與建立DataFrame

    安裝資料分析核心套件Pandas,並示範將字典資料轉換為類似Excel表格的DataFrame結構。

查看本課 Quiz 示例(3 題)
1. Windows安裝Python時,哪一個選項必須打勾才能在任何路徑執行Python指令?
  • AInstall Now
  • BAdd python.exe to PATH
  • CCustomize installation
  • DDownload pip
顯示答案與解釋

答案:B
老師提醒在安裝時要特別注意勾選將 python.exe 加到路徑 (PATH) 的選項,否則日後必須切換到特定資料夾才能執行。

2. 在 List (清單) 資料結構中,第一筆資料的索引值 (Index Number) 預設是從多少開始?
  • A1
  • B0
  • C-1
  • DA
顯示答案與解釋

答案:B
老師以置物櫃編號為例,說明索引值 0 代表第一筆資料,1 代表第二筆資料,以此類推。

3. 在 Python 中定義自訂函式 (Function) 時,必須使用哪一個關鍵字開頭?
  • Afunction
  • Bdef
  • Cfun
  • Ddefine
顯示答案與解釋

答案:B
課程中示範打出 def 來宣告函式的名稱與參數區塊。

LESSON 02 Lesson 2 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本節課涵蓋了使用Python進行數據處理與資料視覺化的實用技術。前半部說明如何在雲端與本地端建置開發環境,並透過Pandas套件讀寫Excel資料,執行DataFrame的建立、Slicer行列篩選、字串操作、自定義函數與Apply批次運算,最終將資料匯出回Excel或打包為獨立的Python腳本。後半段則深入介紹Matplotlib繪圖庫,示範如何繪製並美化折線圖、長條圖與圓餅圖,包括設定分離區塊與起始角度。此外,課程進階解析了Figure與Axes的畫中畫架構及Subplot圖表分割配置,最後藉由Numpy產生常態分佈隨機數據,繪製盒鬚圖與直方圖,探討中位數與標準差等統計學知識在數據分析中的重要意義。

完整章節內容
  1. Python雲端與本地開發環境簡介

    介紹如何使用Google Colab與本地端Jupyter Notebook建立Python開發環境。

  2. 安裝openpyxl與讀取Excel檔案

    指導學生解決讀取Excel時的錯誤,並透過pip安裝openpyxl套件以順利讀取資料。

  3. DataFrame分數運算與處理

    示範在Pandas中如何對整列分數進行加分或乘法運算,取代傳統Excel的公式複製操作。

  4. 使用Slicer進行資料行與列篩選

    講解資料篩選的技巧,包含如何透過指定的起訖與間隔參數(slicer)來提取特定範圍的行或列。

  5. 字串大小寫轉換與擷取

    示範如何將DataFrame內的字串轉換為小寫,以及如何擷取特定字元並與其他欄位合併產生新編碼。

  6. 自定義Function與評分邏輯

    教導如何定義check_pass與check_grade等Python函數,透過多重條件判斷學生成績等級。

  7. Apply函數的實際應用

    利用apply功能將自定義的成績判斷函數快速套用至整個DataFrame的分數欄位中。

  8. 將處理完的DataFrame匯出為Excel

    介紹to_excel指令將處理結果匯出成Excel檔案,並說明如何處理檔案被佔用的錯誤及隱藏index。

  9. 打包Python程式碼為獨立py腳本

    將測試完成的資料處理程式碼整理至純文字編輯器中並儲存為py檔,以利後續的批次處理與自動化。

  10. Matplotlib視覺化庫的安裝與載入

    開始介紹圖表繪製,帶領學生安裝matplotlib套件並使用pyplot模組建立基本環境。

  11. 繪製與自訂折線圖(Line Chart)

    示範如何繪製折線圖,並調整線條寬度、顏色及標記點(marker)的大小與面色。

  12. 繪製長條圖與圓餅圖

    講解長條圖語法,並介紹如何繪製圓餅圖、分離特定區塊(explode)及旋轉起始角度。

  13. Figure與Axes:建構畫中畫圖表

    解釋Figure與Axes的概念,並透過設定坐標與長寬比例實作在一張圖中繪製多重圖表的畫中畫效果。

  14. Subplot圖表切割與配置

    利用subplot指令在單一畫布上分割出多個子圖表區塊,實現多個圖表並排比較的效果。

  15. 盒鬚圖與直方圖分析應用

    匯入Numpy產生隨機數據,並繪製盒鬚圖與直方圖,深入探討中位數、標準差等統計分佈意義。

查看本課 Quiz 示例(3 題)
1. 為了在Python中處理類似Excel的表格資料,講者主要匯入了哪一個套件?
  • ANumpy
  • BMatplotlib
  • COpenpyxl
  • DPandas
顯示答案與解釋

答案:D
講者指示使用「import pandas as pd」來載入Pandas套件,以便處理DataFrame與表格式數據。

2. 若要將自定義的函數 (例如 check_pass) 一次性套用到DataFrame的某個欄位上,應使用哪個方法?
  • A.apply(check_pass)
  • B.run(check_pass)
  • C.execute(check_pass)
  • D.call(check_pass)
顯示答案與解釋

答案:A
講者示範使用「df['mark'].apply(check_pass)」指令,將自定義的函數一步到位套用至整行資料。

3. 在繪製折線圖時,用來控制線條寬度(粗細)的參數縮寫是什麼?
  • Als
  • Bms
  • Clw
  • Dlc
顯示答案與解釋

答案:C
講者示範在繪製函數中,使用「lw」(linewidth 的簡寫) 參數來改變折線圖線條的粗細。

LESSON 03 Lesson 3 14 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本次課程延續Python數據處理的基礎,重點教授如何使用OpenPyXL套件自動化操作Excel檔案,並展示Python與Power BI的整合應用。課程從建立與載入活頁簿及工作表開始,引導學員精準讀取特定儲存格的數值,並將計算結果寫回Excel中存檔。隨後進入實戰案例,指導學員如何透過迴圈與條件判斷,自動化讀取大量結構相同的發票檔案,精確擷取發票號碼、日期及商品明細,並將多個活頁簿與工作表中的數據整併到單一總表中。此外,還解決了迴圈讀寫過程中座標位移與空白儲存格防錯的問題,並引入PathLib模組實現資料夾批次處理。課程最後階段,講師介紹如何在Power BI中引入Python腳本,利用Pandas與正則表達式進行數據清洗,例如自動遮蔽私人電話號碼與過濾無效的電子郵件地址,展示了Python在商業數據自動化處理上的強大實用性。

完整章節內容
  1. 課程開場與OpenPyXL簡介

    介紹專門用來操作Excel的OpenPyXL套件,並設定Jupyter Notebook開發環境。

  2. 讀取工作表與儲存格數值

    示範如何存取現有活頁簿的作用中工作表,並利用座標讀取儲存格內的資料。

  3. 運用迴圈讀取連續儲存格

    介紹使用cell方法配合for迴圈,自動依序讀取多列數值並進行加總。

  4. 實戰案例:發票資料整併

    說明如何從多份散落的發票檔案中,擷取特定欄位並準備彙整至總表。

  5. 建立目的地活頁簿與標題列

    教學如何用程式建立一個全新的活頁簿,並為準備寫入的總表設定第一行標題列。

  6. 程式碼重組與優化

    指導學員整理與重構程式碼,將讀取與寫入的流程對齊並加上註解以便維護。

  7. 處理單一發票的多行明細

    加入迴圈功能,使程式能自動讀取單張發票內的多筆商品紀錄。

  8. 動態座標的計算與對齊

    解決讀取與寫入時行列數字不一致的問題,透過數學加減來對齊正確的儲存格。

  9. 空白儲存格的條件判斷防錯

    示範運用if語句檢查讀取到的儲存格是否為None,避免無資料時發生錯誤。

  10. 運用迴圈處理多個工作表

    講解如何將工作表物件放入迴圈,自動走訪同一個Excel檔案內的所有分頁。

  11. 控制寫入列數的計數器

    設立獨立的總表寫入列計數器,確保來自不同工作表的資料能依序往下寫入而不被覆蓋。

  12. 運用PathLib巡覽資料夾檔案

    教學使用PathLib模組,自動讀取指定資料夾內所有副檔名為.xlsx的Excel檔案。

  13. Python與Power BI整合介紹

    示範如何將Python腳本匯入微軟的Power BI工具中進行進階數據匯入與處理。

  14. 運用正則表達式進行數據清洗

    展示如何利用Pandas與正則表達式遮蔽機敏資料(如電話號碼)與過濾無效電子郵件。

查看本課 Quiz 示例(3 題)
1. 若要取得目前被選取的(作用中的)工作表,應該使用活頁簿物件的哪一個屬性?
  • Acurrent
  • Bselect
  • Cactive
  • Dsheet1
顯示答案與解釋

答案:C
腳本中提到利用 Workbook.active 來存取作用中的工作表。

2. 在寫入多筆不同發票資料至總表時,為什麼要獨立使用一個計數器(如RowCount)來控制列數?
  • A為了限制輸出的總列數
  • B為了讓程式執行更快
  • C為了避免跳至下個檔案時,行數被重置而覆寫原本的資料
  • D避免讀取到空白的儲存格
顯示答案與解釋

答案:C
因為如果依賴單一迴圈的索引,下一張工作表會重新由頭計算位置導致資料覆蓋,所以需要一個獨立持續遞增的計數器。

3. 如果不使用像['A1']這樣的字串格式,我們還可以使用哪一個方法搭配數字座標來存取儲存格?
  • Aloc
  • Brange
  • Cindex
  • Dcell
顯示答案與解釋

答案:D
講師介紹了另一招,使用 .cell 方法來存取特定行列的儲存格。

LESSON 04 Lesson 4 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本課程主要教授如何利用 Python 進行 Excel 自動化處理以及與 Power BI 的整合應用。前半部分重點介紹使用 openpyxl 套件,透過編寫迴圈自動讀取指定資料夾內的多個 Excel 發票檔案及工作表,精確提取特定的儲存格數據(如發票號碼、日期、客戶編號、商品明細等),並將這些散落的數據整合到一個全新的總表檔案中,實現日常辦公的自動化。後半部分則轉向 Power BI 的進階應用,示範如何將 Python 腳本無縫嵌入 Power BI 中以進行數據載入、變形與視覺化。課程詳細演練了在 Power Query 編輯器中使用 Python 的 pandas 及 re 正則表達式模組,進行資料清理與敏感資訊遮蔽(如隱藏身份證字號、電話號碼及剔除無效的電子郵件地址),最後示範如何利用 matplotlib 在 Power BI 畫布上繪製自訂的視覺化圖表,大幅提升數據分析與處理的效率。

完整章節內容
  1. 課程簡介與 Openpyxl 應用場景

    介紹利用 openpyxl 套件進行 Excel 自動化處理的基本概念與情境。

  2. 開啟與讀取 Excel 活頁簿

    示範如何匯入套件並建立及讀取目標資料夾中的 Excel 活頁簿與工作表。

  3. 精確讀取特定儲存格數據

    教學如何精確定位並讀取指定行與列的發票數據儲存格,如客戶名稱與日期。

  4. 運用迴圈讀取表格資料

    透過迴圈自動掃描發票明細列,以取得具有資料的商品項目與金額。

  5. 將數據寫入新的匯總表

    示範如何將提取出的變數資料,按順序寫入至準備好的合併報表檔案中。

  6. 修正資料寫入的覆蓋問題

    透過調整迴圈位置與 current_row 變數,確保每筆資料與標題能正確寫入下一行。

  7. 更新公式與腳本自動化測試

    測試資料合併腳本,並將其另存為獨立的 Python 執行檔方便日後自動化處理。

  8. 認識 Power BI 的分析流程

    簡介 Power BI 的載入數據、資料變形與建立視覺化這三大基本步驟。

  9. 使用 Python 匯入資料至 Power BI

    教學如何利用 Python 腳本配合 pandas 直接從外部讀取數據進 Power BI。

  10. 在 Power Query 執行 Python 腳本

    示範如何利用 Power Query 的 Python 功能進行自訂的資料變形與欄位計算。

  11. Python 數據分組與條件判斷

    運用 pandas 的 apply 功能為銷售數據添加分類標籤欄位,分辨銷售額高低。

  12. 呼叫 Matplotlib 建立視覺化圖表

    在 Power BI 畫布中呼叫 Python 的 matplotlib 模組來繪製自訂長條圖。

  13. 利用正則表達式遮蔽敏感資訊

    教學使用 re 模組設定字串匹配規則,隱藏留言檔案中的電話號碼與社會安全碼。

  14. 應用清理腳本至 Power BI 數據集

    實際將敏感資訊遮蔽與無效電郵刪除的 Python 程式碼應用於 Power BI 中。

  15. 課程總結與檔案儲存

    儲存具有 Python 腳本的 Power BI 分析專案並結束本次課程教學。

查看本課 Quiz 示例(3 題)
1. 在建構正則表達式 (Regular Expression) 時,用來代表數字 (digit) 的符號標籤是什麼?
  • A\w
  • B\s
  • C\d
顯示答案與解釋

答案:C
在正則表達式中,'\d' 是用來匹配任意數字的特殊字元。

2. Power BI 在執行 Python 變形腳本前,為了防止日期欄位被 Python 誤認為未知物件導致出錯,講師建議先在 Power BI 中將其轉換為何種格式?
  • A數字 (Number)
  • B布林值 (Boolean)
  • C文字 (Text / ABC)
  • D圖片 (Image)
顯示答案與解釋

答案:C
為了讓 Python 腳本能正常接收與處理,講師建議在進入 Python 腳本前將日期欄位先轉為文字格式。

3. 在 Power Query 的 Transform 步驟執行 Python 腳本時,系統會將前一步驟產生的表格放入哪一個預設的變數之中?
  • Adataframe
  • Bdataset
  • Ctable
  • Dquery
顯示答案與解釋

答案:B
Power BI 會自動將讀取到的表單封裝至名為 `dataset` 的變數中,供後續 Python 腳本操作。

Certificate in Python Machine Learning 4 LESSONS · 10 HOURS
CPM2025

Python 機器學習與數據預測證書課程

Certificate in Python Machine Learning

利用 Python 和 Machine Learning 從歷史資料建立預測模型,並把預測結果帶回 Excel 支援決策。

完整逐課內容、摘要及時間章節

以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。

3 課47 個章節60 題題庫
LESSON 01 Lesson 1 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本次課程為機器學習的第一堂課,重點教授如何使用Python進行基礎數據分析與模型建構。課程初期,導師帶領學員在Windows環境下安裝Python,強調設定環境變數路徑的重要性,並講解如何透過命令列工具(cmd)安裝Jupyter Notebook與必備套件,如pandas、openpyxl、scikit-learn與matplotlib。掌握基本開發環境操作後,課程進入實戰階段,導師以學生成績的Excel檔案為例,示範機器學習的標準工作流程。流程包含:讀取數據、分割特徵(Features)與標籤(Labels)、使用LabelEncoder將文字標籤轉換為數字編碼,並透過train_test_split函數將數據集劃分為八成訓練集與兩成測試集。接著,學員學習匯入決策樹分類器(Decision Tree)進行模型訓練與預測,並繪製決策樹圖形來觀察AI的決策邏輯。課程後半段,導師指導學員從Kaggle平台下載真實的糖尿病預測數據集,進行完整流程的二次實作,並介紹Google Colab作為免安裝的雲端開發替代方案。過程中深入探討了模型過度擬合(Overfitting)的問題,教授透過設定最大深度(max_depth)來控制決策樹的複雜度。最後,課程介紹準確率(Accuracy Score)等模型評估指標,為學員建立日後優化模型的基礎觀念。

完整章節內容
  1. 課程簡介與安裝Python準備

    導師介紹機器學習課程大綱,並開始指導學員檢查本機電腦的Python環境。

  2. 下載安裝Python與路徑設定

    示範從官網下載Python,並強調安裝時必須勾選將Python加入系統路徑。

  3. 安裝Jupyter Notebook開發環境

    在命令提示字元中使用pip指令下載並安裝Jupyter Notebook作為後續開發工具。

  4. 啟動Jupyter Notebook與基本操作

    透過指令啟動伺服器進入Jupyter環境,並講解基本的Python變數與格式化字串列印。

  5. 安裝pandas套件與讀取資料

    遇到缺少套件的錯誤時停止伺服器,安裝pandas與openpyxl後成功讀取Excel資料集。

  6. 資料預處理:分割特徵與標籤

    講解並實作將數據集拆分為用作預測的特徵集(X)與目標結果的標籤集(Y)。

  7. 標籤編碼轉換 (Label Encoding)

    介紹機器學習套件scikit-learn,並使用LabelEncoder將文字標籤轉換為數字格式。

  8. 分割訓練集與測試集

    使用train_test_split函數將資料隨機分為八成訓練集與兩成測試集,並設定隨機種子。

  9. 介紹Google Colab雲端開發環境

    介紹免安裝的Google Colab平台,示範如何上傳資料集並在雲端執行相同的程式碼。

  10. 匯入並訓練決策樹模型

    匯入決策樹分類器建立模型物件,並使用訓練集資料進行擬合(Fit)訓練。

  11. 基於測試集進行模型預測

    使用已經訓練完成的決策樹模型,對測試集資料進行預測並輸出結果進行比對。

  12. 繪製與解析決策樹視覺化圖形

    安裝繪圖套件matplotlib,透過plot_tree指令將決策樹的判斷條件邏輯視覺化呈現。

  13. 實戰演練:Kaggle糖尿病預測資料集

    從Kaggle下載真實的糖尿病診斷CSV數據集,重新實作一次機器學習的完整流程。

  14. 探討過度擬合與限制樹的深度

    講解模型層數過多導致的過度擬合問題,並透過調整max_depth參數來簡化決策樹。

  15. 模型評估與總結

    使用混淆矩陣與準確率等指標檢驗模型效能,並總結機器學習的自動化預測流程觀念。

查看本課 Quiz 示例(3 題)
1. 為了解決過度擬合的問題,導師示範在建立模型時設定了哪一個超參數來強制限制樹的最大層數?
  • Amax_width
  • Bmin_samples
  • Cmax_depth
  • Drandom_state
顯示答案與解釋

答案:C
導師示範透過加入參數max_depth=3或2來把樹的深度壓低,藉此提升模型的泛化能力。

2. 在Python撰寫程式時,如果要在字串中直接嵌入變數(如k)的值,應該在字串最前方加上哪一個英文字母?
  • Av
  • Bf
  • Cp
  • Ds
顯示答案與解釋

答案:B
導師說明在字串前加上「f」(代表format string),並用大括號包住變數名稱,即可順利印出變數內容。

3. 如果學員不想在本機電腦安裝Python環境,導師推薦使用哪一個免安裝的雲端開發平台?
  • AGoogle Drive
  • BGoogle Colab
  • CGoogle Cloud
  • DGoogle Analytics
顯示答案與解釋

答案:B
導師帶領學生在瀏覽器搜尋Google Colab,說明它提供了免費的雲端Jupyter Notebook環境與計算資源。

LESSON 02 Lesson 2 17 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本課程深入探討機器學習中的資料預處理與線性迴歸模型實作。首先,講師介紹了監督式學習的兩大核心類別:分類(Classification)與迴歸(Regression),並詳細解說資料預處理的四大步驟。課程透過 Jupyter Notebook 搭配 Pandas 與 NumPy 等工具,帶領學生實作計算平均數、中位數,並利用四分位距(IQR)與箱形圖(Boxplot)來尋找、分析及處理異常值(Outliers)。隨後,示範了如何以刪除(dropna)或填補(fillna)的方式來處理缺失值(Missing Values),並深入介紹 Label Encoder、Ordinal Encoder 及 One-Hot Encoder 以處理不同特性的類別標籤轉換。最後階段,課程引導學生使用 train_test_split 分割訓練集與測試集,並透過 MinMaxScaler 進行特徵縮放。實作部分則建立 Linear Regression 線性迴歸模型,利用 R2 Score 與 Mean Squared Error (MSE) 評估模型預測學生考試成績與同步機器數據的準確度,並結合散佈圖視覺化預測結果與實際數據的差異。

完整章節內容
  1. 啟動環境與基礎設定

    介紹如何透過 Command Prompt 啟動 Jupyter Notebook,並匯入 Pandas 模組進行準備。

  2. 監督式學習簡介

    講解監督式學習的兩大陣營:處理明確答案的分類問題與處理連續實數的迴歸問題。

  3. 計算基礎統計數值

    實作使用 NumPy 計算資料的平均數、中位數及眾數,了解資料的分佈狀況。

  4. 四分位數與四分位距 (IQR)

    介紹 Q1、Q2、Q3 的概念,並示範如何計算四分位距 (IQR) 來界定資料的正常範圍。

  5. 計算邊界與尋找異常值

    利用 IQR 計算上下邊界,藉此找出偏離正常軌跡的異常值 (Outliers)。

  6. 使用 Seaborn 繪製箱形圖

    安裝 Seaborn 套件並繪製箱形圖 (Boxplot),透過視覺化方式直觀辨識出資料中的異常值。

  7. 處理異常值策略

    示範在 Pandas DataFrame 中,如何使用中位數或平均數來替換掉異常值,或者直接將其移除。

  8. 處理缺失值 (Missing Value)

    解說處理缺失值 (NaN) 的常見方法,包括直接刪除整行資料或以中位數進行填補。

  9. 標籤編碼 (Label Encoder)

    介紹如何使用 Label Encoder 將性別等非數值類別型資料轉換為 0 與 1 的純數字編碼。

  10. 順序編碼 (Ordinal Encoder)

    針對具有次序意義的資料(如星期一到星期日),使用 Ordinal Encoder 依照指定順序進行編碼。

  11. 獨熱編碼 (One-Hot Encoder)

    示範 One-Hot Encoder 如何將分類資料轉換為二進制向量矩陣,避免數值大小影響模型判斷。

  12. 載入 Iris 資料集與特徵分離

    透過經典的鳶尾花 (Iris) 資料集,示範如何將資料分離出特徵 (X) 與目標標籤 (Y)。

  13. 分割訓練集與測試集

    使用 train_test_split 函數,依 7:3 比例將資料隨機分割為訓練集與測試集。

  14. 特徵縮放 (MinMaxScaler)

    使用 MinMaxScaler 進行標準化,將不同範圍的特徵數值統一縮放至 0 到 1 之間以求公平比較。

  15. 建立與訓練線性迴歸模型

    建立 Linear Regression 模型,並解釋模型本質上是建立一條帶有係數與截距的方程式。

  16. 評估模型與視覺化結果

    利用 MSE 與 R2 Score 打分評估預測成效,並繪製散佈圖對比實際值與預測值的差異。

  17. 實作 Synchronize Machines 數據預測

    載入全新工業機器數據集實作線性迴歸,展現模型在理想狀態下取得 R2 Score 滿分的精準度。

查看本課 Quiz 示例(3 題)
1. 若資料本身具備明確次序(例如星期一至星期日),為了保留順序特性,應使用哪種編碼器?
  • AOne-Hot Encoder
  • BOrdinal Encoder
  • CLabel Encoder
  • DMean Encoder
顯示答案與解釋

答案:B
講師說明 Ordinal Encoder 可以根據設定的順序要求(如週一到週日)來編碼,以保留其先後次序意義。

2. 除了 R2 Score,課程中還提到了另一個評估指標 Mean Squared Error (MSE),請問其理想狀況為何?
  • A數值越高越好
  • B數值必須為負數
  • C數值越低越好,代表平均誤差小
  • D必須剛好等於 1
顯示答案與解釋

答案:C
講師解釋 MSE (平均誤差) 的數值越細 (越低),代表模型預測的表現越漂亮、越準確。

3. 處理缺失值 (Missing Value) 時,若想直接把有空值的資料行刪除,應使用 Pandas 的哪個功能?
  • Afillna()
  • Bdrop_duplicates()
  • Creplace()
  • Ddropna()
顯示答案與解釋

答案:D
講師示範了使用 dropna 就能直接將含有缺失值 (NaN) 的該行資料刪除。

LESSON 03 Lesson 4 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

這堂機器學習課程涵蓋了無監督學習、模型部署以及大型語言模型(LLM)的應用。首先,課程詳細介紹了K-means分群演算法,透過Excel手動計算距離來解釋其運作原理,並在Jupyter Notebook中使用Python與Scikit-Learn實作數據分群。接著,課程教授如何使用Streamlit快速建立互動式網頁應用程式,並透過Git與GitHub將訓練好的鳶尾花(Iris)隨機森林模型部署到Streamlit Community Cloud上。最後,課程進入LLM領域,探討Transformer架構及其注意力機制(Attention Mechanism),並實作如何透過Ollama在本地端執行Gemma 2B與Llava模型進行文字與影像分析。此外,還介紹了LangChain框架的應用,展示如何將本地文件(如美國憲法文本與PDF)切割成小片段(Chunks),轉換為向量(Embeddings)並儲存於ChromaDB向量資料庫中,從而實現基於本地知識庫的LLM查詢系統。

完整章節內容
  1. 課程概述與 K-means Clustering

    課程開始介紹將涵蓋 K-means 分群、Streamlit 部署以及本地大型語言模型(LLM)的應用。

  2. 無監督學習與 K-means 原理

    導師解釋無監督學習的特色,並說明 K-means 如何隨機選擇中心點並計算距離來進行分群。

  3. 使用 Excel 實作計算

    透過 Excel 手動輸入座標點,利用開根號公式計算點與中心點的距離以理解演算法邏輯。

  4. Jupyter Notebook K-means 實作

    使用 Python、Numpy 產生散佈圖,並透過 Scikit-Learn 訓練 K-means 模型以觀察分群結果。

  5. Streamlit 網頁應用程式

    介紹並安裝 Streamlit,說明如何使用簡單 Python 語法免除 HTML 快速建立互動式網頁。

  6. GitHub 與版本控制

    為將應用程式部署至雲端,教學下載 Git、申請 GitHub 帳戶並進行基本的版本控制。

  7. 推送至 GitHub 雲端

    演練 git init、add、commit 與 push 等指令,成功將本地端的程式碼上傳至 GitHub。

  8. 部署至 Streamlit Cloud

    示範如何連結 GitHub 儲存庫,在 Streamlit Community Cloud 上免費部署並產生公開網址。

  9. Iris 預測應用實作

    使用隨機森林演算法訓練鳶尾花模型,並將模型以 Pickle 儲存,結合 Streamlit 製作介面。

  10. 大型語言模型與 Transformer

    介紹 Transformer 模型中的注意力機制,以及編碼器與解碼器於大語言模型中的不同應用。

  11. Ollama 平台安裝與應用

    帶領下載 Ollama,並透過指令拉取 Gemma 2B 模型進行本地端的問題與文字回答實作。

  12. Llava 模型影像分析

    使用具備視覺分析能力的 Llava 模型,在本地端輸入紅貓圖片並成功解析圖片內容。

  13. LangChain 文件處理流程

    說明 LangChain 開發流程,包含載入文字與 PDF 檔案,準備進行本地知識庫的檢索訓練。

  14. 文字向量化與 ChromaDB

    示範如何將文件切割成 Chunks,轉換為 Embeddings,並儲存至 ChromaDB 向量資料庫中。

  15. 課程總結與本地 LLM 回顧

    總結機器學習部署與本地大語言模型實作流程,並鼓勵課後練習與申請外部 API Key。

查看本課 Quiz 示例(3 題)
1. 在完成相似度檢索 (Similarity Search) 後,為何通常還需要將檢索出的片段交給本地 LLM 處理?
  • A為了重新訓練並更新向量資料庫
  • B為了讓 LLM 將原始且冗長的擷取文字總結為精簡、易讀的答案
  • C為了將擷取出的文字自動翻譯成圖像
  • D為了刪除資料庫中不相關的檔案
顯示答案與解釋

答案:B
直接檢索出的資料往往是原始文件片段,交給 LLM 處理可以幫助將片段內容簡化,並整理出確切回答問題的精要答案。

2. 課程中提及使用 Llava 模型時,展示了該模型具備哪一種特殊能力?
  • A進行即時語音辨識
  • B將文字直接翻譯成多國語言
  • C分析並描述影像/圖片中的內容
  • D生成 3D 虛擬人物
顯示答案與解釋

答案:C
導師透過 Ollama 輸入了一張紅貓的照片,並利用 Llava 模型成功辨識並以文字描述出圖片中的內容。

3. 為了將 Streamlit 應用程式部署到雲端 (Community Cloud),必須先將程式碼推送到哪一個版本控制平台?
  • AGitLab
  • BBitbucket
  • CGitHub
  • DDocker Hub
顯示答案與解釋

答案:C
課程強調在部署至 Streamlit Community Cloud 之前,必須先將程式碼發佈 (publish) 存放到 GitHub 上。

STAGE 02 · AI-ASSISTED ANALYTICS

再用 AI 加速分析與建模

把已掌握的技術結合 ChatGPT、Claude、Copilot 與 Gemini,規劃分析、處理資料並檢查預測模型。

Certificate in AI Data Science 4 LESSONS · 10 HOURS
AIDS2026

AI 數據科學及預測分析證書課程

Certificate in AI Data Science

以 AI 輔助完成數據科學工作流程,由 Pandas 資料準備、探索分析及特徵工程,到建立、評估及解釋預測模型。

完整逐課內容、摘要及時間章節

以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。

4 課60 個章節80 題題庫
LESSON 01 Lesson 1 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本課程為Data Science的Python開發基礎第一堂課。課程從最基礎的環境建置開始,指導學生如何使用命令提示字元、安裝Python及VS Code,並學習使用pip管理套件與啟動Jupyter Notebook。課程涵蓋了變數宣告、四大基本資料型態(字串、整數、浮點數、布林值)、F-string字串格式化技巧、條件判斷式(if-else)以及迴圈(for-loop)等核心程式邏輯。隨後進階介紹清單(List)與字典(Dictionary)兩種重要資料結構的操作,並教學如何定義自訂函數(Function)、建立與匯入模組(Modules)以利程式碼重用。此外,亦示範了如何操作檔案讀寫,並引導學生運用AI輔助工具加速編程與除錯,全面奠定Python資料科學開發的扎實基礎。

完整章節內容
  1. 課程簡介與開發環境預備

    介紹Data Science Python課程大綱,並引導學生開啟命令提示字元建立工作資料夾。

  2. 安裝Python與環境變數設定

    示範從官網下載Python,並強調安裝時必須勾選加入PATH路徑的重要性。

  3. 安裝VS Code與基礎操作

    下載安裝VS Code編輯器,並教學如何開啟資料夾與建立第一個Python檔案。

  4. 使用PIP管理Python套件

    教學如何使用pip指令安裝、查看及移除Python擴充模組。

  5. 啟動與操作Jupyter Notebook

    安裝Jupyter Notebook並示範如何啟動伺服器及新增筆記本檔案進行互動式編程。

  6. 變數宣告與基礎資料型態

    講解變數概念與常用的四大資料型態:字串、整數、布林值與浮點數。

  7. 條件判斷與資料型態轉換

    示範如何使用if-else進行條件決策,並解決輸入資料型態不符的轉換問題。

  8. 清單(List)資料結構基礎

    介紹清單結構,教學如何建立清單並透過索引值取得特定元素。

  9. 清單的進階操作(CRUD)

    學習對清單執行附加(append)、插入(insert)、修改及刪除(remove)等實用操作。

  10. 結合迴圈處理清單資料

    示範如何運用for迴圈遍歷清單,將符合特定條件的分數分類到不同的新清單中。

  11. 建立與呼叫自訂函數(Function)

    介紹如何使用def關鍵字定義函數,並透過傳遞參數讓程式碼具備動態處理能力。

  12. 函數的回傳值(Return)設計

    講解函數為何應使用return回傳結果而非單純列印,以便後續的資料處理。

  13. 建立模組(Modules)與跨檔案匯入

    教學如何將函數儲存為獨立的.py模組,並在Jupyter Notebook中匯入呼叫。

  14. OS檔案讀寫操作與內建模組

    介紹內建模組運用,並實作文字檔的開啟、讀取(read/readline)與附加寫入(append)。

  15. 字典(Dictionary)結構與總結

    學習由鍵與值(Key-Value)組成的字典結構,並預告後續Pandas的應用方向。

查看本課 Quiz 示例(3 題)
1. 導師強烈推薦使用哪種技巧來印出包含變數的字串,可免除手動轉換型態的麻煩?
  • AF-string (在字串前加 f 並使用大括號)
  • BC-style 格式化
  • C使用加號無限串聯
  • D呼叫 print_all 函數
顯示答案與解釋

答案:A
F-string 能在字串中直接透過大括號填入變數,自動處理型態轉換,大幅減少語法錯誤。

2. 當嘗試將字串與浮點數合併列印發生錯誤時,最傳統的解決方式是?
  • A將字串刪除只印數字
  • B用 int() 把字串包起來
  • C用 str() 將浮點數包覆進行轉型
  • D直接加上逗號即可
顯示答案與解釋

答案:C
在 Python 中,字串與數字無法直接串接,必須先用 str() 將數字暫時轉換為字串型態。

3. 在名為 fruits 的清單中,若要取出第一個元素,索引值(Index)應填入多少?
  • A1
  • B0
  • C-1
  • D2
顯示答案與解釋

答案:B
在 Python 中,清單的索引值永遠從 0 開始計算。

LESSON 02 Lesson 2 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本堂課為數據科學的第二節課,主要教授 Python 在數據處理與可視化方面的核心應用。課程首先指導學員如何在命令提示字元啟動 Jupyter Notebook,並安裝必備的 Pandas 模組。接著深入講解 DataFrame 的建立、讀取與寫入 Excel/CSV 檔案,以及各種實用的資料操作,包括數值運算、字串切片處理、日期時間(Datetime)的轉換與加減、資料過濾篩選、排序與群組化(Groupby)聚合運算。此外,課程也示範了如何利用 merge 功能合併多個資料表,以及定義函數並透過 apply 與 lambda 進行進階資料運算。最後,課程引入 Matplotlib 模組,帶領學員實作繪製折線圖、長條圖與圓餅圖,並強調學員應善用 AI 工具來輔助編寫程式碼與快速除錯,以大幅提升開發效率。

完整章節內容
  1. 啟動 Jupyter Notebook

    指導學員進入指定資料夾,並透過 CMD 啟動 Jupyter Notebook 伺服器。

  2. 安裝與匯入 Pandas 模組

    示範如何使用 pip 指令安裝 Pandas 模組,並在 Notebook 成功匯入。

  3. 建立第一個 DataFrame

    講解 DataFrame 的基礎觀念,並透過字典結構建立包含人名與分數的資料表。

  4. 讀取 Excel 檔案與安裝套件

    示範如何利用 Pandas 讀取 Excel 檔案,並說明如何安裝缺少的 openpyxl 模組。

  5. 欄位數值計算與字串操作

    示範對整欄資料進行加分運算,以及使用 .str 對字串進行小寫轉換與字元切片。

  6. 日期時間轉換與 AI 除錯應用

    探討日期字串轉換為 datetime 格式的方法,並指導如何將錯誤訊息交給 AI 輔助除錯。

  7. 讀取 CSV 與資料選取

    示範讀取 CSV 格式的學生成績資料,並運用 iloc 語法選取特定的行列範圍。

  8. 資料統計分析 (describe)

    介紹 describe 函數,一鍵快速產生資料的平均值、中位數、最大最小值等統計指標。

  9. 資料過濾與多重條件篩選

    利用 loc 搭配邏輯運算子過濾特定性別,以及示範多重條件的資料篩選方式。

  10. 資料排序與 Groupby 群組運算

    解說 sort_values 的排序功能,並展示如何使用 groupby 計算不同群組的平均或加總分數。

  11. 讀取多工作表與合併表單

    示範從同一個 Excel 檔讀取不同工作表,並利用 merge 函數進行資料表的關聯合併。

  12. 自訂函數與 Apply Lambda

    教導撰寫 Python 判斷式函數,並透過 apply 搭配 lambda 將運算邏輯套用至整欄資料。

  13. Matplotlib 與繪製折線圖

    介紹 Matplotlib 套件,示範繪製基本的折線圖並自訂線條顏色、寬度及資料點標記。

  14. 繪製長條圖與圓餅圖

    運用 plt.bar 繪製長條圖,添加圖表標題與座標軸標籤,並實作 plt.pie 繪製圓餅圖及分離區塊。

  15. 課程總結與檔案儲存

    總結本節課所學,提醒學員儲存開發進度,並預告下一堂課的自動化及機器學習主題。

查看本課 Quiz 示例(3 題)
1. 要將兩份包含不同欄位的 DataFrame 合併起來(類似 Excel 的 VLOOKUP 效果),應該用什麼函數?
  • Apd.combine()
  • Bpd.merge()
  • Cpd.concat()
  • Dpd.join()
顯示答案與解釋

答案:B
導師解釋 pd.merge 可以根據相同的關聯欄位,把 df 和 df2 橫向合併為單一個資料表 df3。

2. 在 Pandas 中,想將 `mark` 欄位所有資料增加 5 分,最簡潔的寫法是?
  • A寫 for 迴圈逐行遞增
  • Bdf.add('mark', 5)
  • Cdf['mark'] + 5
  • Ddf['mark'].append(5)
顯示答案與解釋

答案:C
導師示範只需選擇欄位並直接「+ 5」,即可一步到位計算所有行列,不需要編寫迴圈處理。

3. 進行 DataFrame 多條件過濾時,如果要求兩個條件同時成立(AND 邏輯),應該使用什麼符號且需注意什麼?
  • A使用 AND 關鍵字,不需括號
  • B使用 &&,條件間可直接連接
  • C使用 & 符號,且每個條件都必須用圓括號包起來
  • D使用 + 符號,表示條件疊加
顯示答案與解釋

答案:C
導師遇到錯誤後,經由 AI 輔助釐清在 Pandas 中「AND」必須使用「&」,並強調每個條件式外必須加圓括號包覆。

LESSON 03 Lesson 3 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本節課主要教授如何使用Python的 openpyxl 模組來自動化處理Excel檔案,以及機器學習的入門概念。課程前半部分詳細示範了如何在 Jupyter Notebook 中安裝並匯入 openpyxl,接著透過讀寫特定儲存格、設定迴圈來批次更新學生成績、判斷及格狀態並計算總分。隨後進入實戰演練,講師帶領學員運用 os 模組讀取資料夾內的多張發票 Excel 檔,將每張工作表中的特定數據提取出來,合併並儲存至一個全新的總表中,同時在檔名加上時間戳記以防覆蓋。課程最後階段簡單介紹了機器學習的基本流程,包括資料收集、標記、模型訓練與測試,並實作運用 scikit-learn 模組載入乳癌數據集,快速建立並視覺化決策樹模型,為下一堂課打下基礎。

完整章節內容
  1. 準備工作與環境設定

    講師帶領學員開啟 EZ Drive 並使用命令提示字元進入工作目錄。

  2. 匯入 openpyxl 模組

    在 Jupyter Notebook 中撰寫程式碼匯入 openpyxl 模組以處理 Excel。

  3. 讀取工作表與儲存格數值

    學習如何選取 active worksheet 並讀取特定儲存格的值。

  4. 運用迴圈讀取多個儲存格

    示範使用 row 與 column 座標配合迴圈,批次印出學生成績。

  5. 實作:批次調整成績與新增狀態

    透過程式碼將所有學生成績加分,並依條件判斷是否及格寫入新儲存格。

  6. 計算總分並另存新檔

    在 Excel 中寫入加總公式,並將修改後的資料另存為新的 Excel 檔案。

  7. 發票合併任務介紹與檔案準備

    介紹將多張發票 Excel 檔案中的資料提取並合併到單一工作表的任務。

  8. 使用 os 模組篩選 Excel 檔案

    撰寫程式碼讀取資料夾路徑,並篩選出副檔名為 .xlsx 的目標檔案。

  9. 開啟與讀取發票 Workbook

    利用 AI 輔助生成程式碼,透過檔名正確開啟各個發票的工作簿。

  10. 撰寫迴圈遍歷所有 Worksheet

    加入第二層迴圈,讓程式能夠自動處理每一個工作簿中的所有工作表。

  11. 建立合併總表與寫入標題列

    在迴圈外建立一個新的總表檔案,並寫入發票所需的中文標題列。

  12. 提取發票特定資料並寫入總表

    定位發票中的發票號碼、日期等特定儲存格,將其拷貝並寫入合併總表中。

  13. 檔名加上時間戳記並封裝程式碼

    為了避免檔案覆蓋,在輸出檔名加上時間,並將程式碼儲存為獨立的 .py 執行檔。

  14. 機器學習入門與 Spam Mail 範例

    透過垃圾郵件分類的例子,講解機器學習中資料標記與模型訓練的基礎概念。

  15. 使用 scikit-learn 分析乳癌數據與決策樹

    下載 Kaggle 乳癌數據集,運用 scikit-learn 快速建立並畫出決策樹模型。

查看本課 Quiz 示例(3 題)
1. 使用 openpyxl 載入現有 Excel 檔案 (Workbook) 的正確函式名稱為何?
  • Aopen_excel()
  • Bread_workbook()
  • Cload_workbook()
  • Dget_file()
顯示答案與解釋

答案:C
講師在 00:09:22 說明載入 Excel 檔案的指令是 `load_workbook`。

2. 在程式碼 `train_test_split` 中,講師提到通常會將資料集拆分成兩部分,其中用於「測試 (Test)」的資料比例為多少?
  • A50%
  • B10%
  • C80%
  • D20%
顯示答案與解釋

答案:D
講師在 02:21:14 提到將資料分成兩部分,培訓用的 80%,測試用的 20%。

3. 在 Jupyter Notebook 中,如果要執行當前選中 Cell 的程式碼,可以按下什麼組合鍵?
  • AAlt + Enter
  • BShift + Space
  • CCtrl + Enter
  • DTab + Enter
顯示答案與解釋

答案:C
講師多次提到按 `Ctrl + Enter` 等於執行該 Cell 裡面的 command。

LESSON 04 Lesson 4 15 個完整時間章節 · 3 條 Quiz 示例
本課摘要

本節課堂全面講解了機器學習模型建立前的重要步驟「資料預處理」以及模型訓練與評估的基本流程。課程首先強調了處理缺失值的重要性,示範了使用Scikit-Learn的SimpleImputer以平均數填補數值空缺,以及用出現頻率最高的值填補文字空缺。接著探討如何將文字轉換為數字,介紹了Label Encoder、Ordinal Encoder與One-Hot Encoder的差異與應用場景。隨後,課程介紹了資料標準化,透過MinMaxScaler將數值範圍縮放至0到1之間,以消除不同特徵因數值大小造成的分析偏差。在清理資料的最後階段,講解了利用四分位距或Z-score來尋找並過濾異常值。進入模型訓練階段後,以鳶尾花數據集與學生考試成績為案例,詳細說明了利用train_test_split將數據集切割為訓練集與測試集的標準做法,並探討了固定隨機數種子的重要性。課程帶領學員實作了分類模型(Decision Tree)與迴歸模型(Linear Regression),展示如何畫出決策樹圖表,並強調透過設定最大深度來避免過度擬合。最後,課程也簡單演示了多項式迴歸與多元線性迴歸的概念,以及MSE與R-score等評估指標的意義,為學員建立起扎實的機器學習實作與觀念基礎。

完整章節內容
  1. 機器學習的資料預處理概述

    介紹處理數據集的第一步:清理資料、檢查錯誤值並將文字轉換為數字。

  2. 使用 SimpleImputer 進行缺失值填補

    示範如何利用工具以平均數或最高頻率的值填補數值與文字資料的空洞。

  3. 文字轉數字:Label 與 Ordinal Encoder

    講解如何將有次序性與無次序性的類別文字轉換成機器學習能識別的數字。

  4. 資料標準化與 MinMaxScaler

    介紹透過資料標準化將數字縮放到0至1的範圍,以避免數值範圍過大造成的誤差。

  5. 偵測並處理異常值 (Outliers)

    說明何謂偏離分子,並示範利用 Z-score 與四分位距 (IQR) 的方法找出異常值。

  6. 匯入與準備 Iris 鳶尾花數據集

    載入鳶尾花數據集,觀察特徵數據與目標標籤的結構,為模型訓練做準備。

  7. 分割訓練集與測試集 (Train Test Split)

    示範打橫切割資料集,隨機抽取八成資料用於訓練模型,兩成用於後續測試。

  8. Random State 參數的作用與設定

    解釋固定 Random State 的隨機數種子,確保每次訓練抽取的資料集維持一致。

  9. 建立與訓練決策樹分類器

    引進 Decision Tree Classifier,利用訓練資料(fit)讓模型學習資料的分類規則。

  10. 模型準確度測試與繪製決策樹圖表

    計算測試資料的預測準確率,並利用 plot_tree 指令將決策樹的判斷規則視覺化。

  11. 設定最大深度避免模型過度擬合

    探討決策樹層數過多造成的 Overfit 現象,示範透過 max_depth 參數控制樹的深度。

  12. 線性迴歸模型概念與實作

    介紹 Regression 模型的核心概念,說明如何利用歷史特徵數據預測連續數值。

  13. 繪製 Scatter Plot 與迴歸線

    以學生考試成績為例,利用 Matplotlib 畫出散佈圖並擬合出最佳的線性迴歸線。

  14. 迴歸模型評估指標 (MSE, MAE, R-score)

    講解利用 R 平方 (R-score) 及均方誤差等指標,用具體數字評估迴歸模型的表現。

  15. 多項式迴歸與多維度應用

    示範加入多項式特徵(次方)以繪製曲線迴歸圖,並探討處理多個特徵變數的三維預測。

查看本課 Quiz 示例(3 題)
1. 處理數據集的第一步通常是什麼動作?
  • A訓練模型 (Train Model)
  • B資料預處理 (Preprocessing)
  • C繪製視覺圖表 (Plotting)
  • D發佈模型 (Deployment)
顯示答案與解釋

答案:B
任何 DataSet 的第一步都要先做 Prepositing (預處理),包含檢查錯誤值、轉數字等。

2. 當我們要訓練 (fit) 一個模型時,應該傳入哪些分割後的資料?
  • AX_test 和 y_test
  • B只有 y_train
  • CX_train 和 X_test
  • DX_train 和 y_train
顯示答案與解釋

答案:D
培訓 (fit) 模型的時候,必須傳入訓練專用的特徵 X_train 與標籤 y_train 配合起來做訓練。

3. train_test_split 函數執行後,預設會回傳多少份資料陣列?
  • A兩份 (X, Y)
  • B三份 (Train, Test, Valid)
  • C五份
  • D四份 (X_train, X_test, y_train, y_test)
顯示答案與解釋

答案:D
這個功能會將特徵(X)與目標(Y)同時分割,一共產生四份資料:X_train, X_test, y_train, y_test。

LEARNING OUTCOMES

完成課程後,你將能夠

不只是跟隨影片完成練習,而是真正理解技術、獨立解決問題,並把 AI 變成可控制和可驗證的工作助手。

01

處理真實數據

運用 Python、Pandas 匯入、清理、轉換及視覺化數據,建立可靠的分析流程。

02

建立預測模型

掌握資料準備、Regression、Classification,以及訓練和測試模型的完整步驟。

03

正確評估結果

理解模型指標、限制與偏差,能判斷預測結果是否合理並適合實際應用。

04

有效使用 AI 分析

運用 AI 規劃分析、產生及檢查程式碼,並自行驗證資料處理和模型建議。

05

交付分析成果

把程式、圖表、模型及洞察整理成清楚、可重現及可支援決策的數據專案。

DM
LEAD INSTRUCTOR
導師簡介 · TUTOR PROFILE

Dannis Mok

擁有豐富的商業網頁及應用程式系統開發經驗,以及超過 25 年教學經驗。教學方式清晰直接,擅長把複雜技術拆解成容易理解、可以實際應用的步驟。

曾為知名企業、政府部門及本地大學提供培訓,涵蓋辦公室自動化、數據科學、數據分析,以及商業網頁和 Apps 系統開發;並擔任 NCC Education 及 University of Greenwich 的主要講師。

25+ 年教學經驗商業 Web & Apps 開發BSc · MBA · 2× MSc企業及政府培訓
Microsoft
MOS Master
Microsoft
MCSE · MCDBA
Cisco
CCNP · CCDP
CompTIA Data Plus Microsoft Power BI Data Analyst Associate Python Institute PCAP
查看相關專業認證
  • Microsoft MCSE、MCDBA、Microsoft Certified System Developer
  • Microsoft Office Specialist Master
  • Cisco CCNA、CCDA、CCNP、CCDP
  • Sun Certified Java Programmer、Oracle Certified Database Professional
  • Linux LPI Level 1 & 2、CompTIA Data+
  • Microsoft Power BI Data Analyst Associate、Python Institute PCAP
查看企業及機構培訓經驗
  • 教育局、香港教育大學、VTC 職業訓練局
  • 積金局、房屋署、勞工處及醫管局
  • 中國銀行、香港郵政及香格里拉大酒店
  • Android、iPhone、HTML5、Angular、跨平台及企業系統開發培訓
完整三證書組合

Python、Machine Learning 與 AI Data Science 組合課程

Python, Machine Learning & AI Data Science Package

由 Python 與 Pandas 數據分析、Machine Learning 預測模型,進階至 AI 輔助數據科學實戰,共 12 節、30 小時完整錄影課程。

  • Python Data Analysis
    4 節錄影課:Python、Pandas、資料清理、合併、視覺化及 Excel 輸出。
  • Python Machine Learning
    4 節錄影課:特徵工程、Regression、Classification、模型評估及業務預測。
  • AI Data Science
    4 節錄影課:AI 輔助資料預處理、模型建立、結果解釋及數據科學報告。

本頁所有課程均為錄影課程;報名後即可開始,無需等待開課。

其他付款方式

支付詳情

  • 轉數快: 快速支付系統識別碼: 108329293
  • 銀行轉帳: 恆生銀行 #789-681384-883
    (戶口名稱: UNiSOFT Education Limited)
  • 支票付款: 枱頭請寫 UNiSOFT Education Limited

注意: 如選用轉數快或銀行轉帳完成付款後,請將付款記錄 Whatsapp 到 90455522

校舍地址及聯繫方式

校舍地址: 九龍佐敦德興街12號興富中心5樓501室
辦公時間: 星期一至星期五 上午11時至晚上8時