基礎技術 · 20 小時
先親手理解數據如何匯入、清理、分析,並建立可驗證的預測模型。
- Python:語法、Pandas、資料清理、視覺化及 Excel 輸出
- Machine Learning:資料準備、Regression、Classification 及模型評估
- 真正能力:能閱讀、執行、測試及手動檢查自己的分析程式
使用 AI 進行數據分析之前,你需要先掌握 Python、Pandas 及 Machine Learning 的基礎,學會閱讀、理解及判斷資料處理與模型如何運作;然後才使用 AI 協助產生分析程式、清理資料、尋找錯誤及提出模型建議。課程亦提供 AI 整理的時間章節和課後測驗,讓你按需要跳到任何重點,並檢查自己是否真正掌握所學。
從基礎數據技術,到可控制、可驗證的 AI 輔助分析
整個學習路徑分為兩個清楚階段。第一階段刻意不依賴 AI,第二階段才把 AI 加入真實數據科學流程。
先親手理解數據如何匯入、清理、分析,並建立可驗證的預測模型。
有了基礎後,再以 AI 作為數據科學助手,提高速度而不失去控制。
如果不明白數據與模型,便無法判斷 AI 是否製造了錯誤、偏差或不適合的分析。完成兩個階段後,你不只懂得叫 AI 寫分析程式,更懂得審查、修正及延伸它。
免費觀看課程介紹及實際教學內容,了解講解方式、技術深度,以及 Python、Pandas 數據處理與機器學習的實作流程。
按播放鍵即可觀看;選擇右方片段可切換內容。
先用 Python、Pandas 與 Machine Learning 建立真正的數據分析基礎,再學習如何運用 AI 規劃分析、處理資料、建立及檢查預測模型。AI 可以加速工作,但理解數據的人才有能力判斷結果是否正確。
Python/Pandas 數據處理與 Machine Learning 預測模型,先學懂資料、特徵及模型如何真正運作。
4 LESSONS · 10 HOURS
從 Python 基礎開始,利用 Pandas 處理大型資料集、清理數據並建立分析及視覺化結果。
以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。
本節課全面介紹了Python編程的基礎與實際應用。課程從環境架設開始,教導學員使用命令提示字元安裝Python並設定環境變數。隨後比較了直譯器與記事本編程,並引導安裝Jupyter Notebook以提升效率。核心涵蓋變數宣告、資料轉換、f-string格式化及條件判斷。接著探討List與Dictionary資料結構的操作,並結合for迴圈處理資料。進階內容包含自訂函式編寫、回傳值設定及自訂模組匯入。最後介紹datetime與math內建模組、檔案讀寫模式(覆寫與附加),並以建立Pandas DataFrame作結,為資料分析奠定基礎。
介紹如何透過命令提示字元操作,下載並安裝Python,強調設定PATH環境變數的重要性。
示範使用pip指令安裝外部套件,並啟動Jupyter Notebook作為主要程式開發環境。
講解變數定義、字串與整數相加時的錯誤排解,以及使用f-string進行字串格式化。
介紹清單結構(List)的概念與索引(Index),並示範利用append及insert進行資料增減。
教導如何使用for迴圈逐一抽出清單內的元素,並結合條件判斷篩選成績及格與否。
介紹字典(Dictionary)格式,透過Key對應Value的方式儲存與查詢特定學生的成績資料。
講解如何使用def定義無參數與帶有參數的函式,並說明return回傳值的必要性。
利用len取得清單長度並搭配range產生數字索引,藉此同時操作與迴圈存取多個資料陣列。
示範透過迴圈將姓名與分數打包成多個字典結構,並集中存入單一清單中以便管理。
將寫好的功能儲存為獨立的.py檔案,並在Notebook中使用import語法匯入與重複呼叫。
匯入datetime模組取得當前時間、定義特定日期,並利用strftime自訂日期輸出的文字格式。
介紹math模組的實用功能,包含計算開平方根、無條件進位與捨去等數理操作。
示範利用open函式處理文字檔,詳解讀取(r)、覆寫(w)與附加(a)模式的差異及換行技巧。
安裝資料分析核心套件Pandas,並示範將字典資料轉換為類似Excel表格的DataFrame結構。
答案:C
老師強調 print 只是暫時顯示,必須使用 return 指令才能將結果回傳,並由另一個變數負責接收。
答案:C
老師指示儲存記事本檔案時要將存檔類型改為所有檔案,並將副檔名命名為 .py,讓系統識別為Python程式碼。
答案:C
影片中示範使用 lamps.append('Jack') 來將新的人名加到清單的最後面。
本節課涵蓋了使用Python進行數據處理與資料視覺化的實用技術。前半部說明如何在雲端與本地端建置開發環境,並透過Pandas套件讀寫Excel資料,執行DataFrame的建立、Slicer行列篩選、字串操作、自定義函數與Apply批次運算,最終將資料匯出回Excel或打包為獨立的Python腳本。後半段則深入介紹Matplotlib繪圖庫,示範如何繪製並美化折線圖、長條圖與圓餅圖,包括設定分離區塊與起始角度。此外,課程進階解析了Figure與Axes的畫中畫架構及Subplot圖表分割配置,最後藉由Numpy產生常態分佈隨機數據,繪製盒鬚圖與直方圖,探討中位數與標準差等統計學知識在數據分析中的重要意義。
介紹如何使用Google Colab與本地端Jupyter Notebook建立Python開發環境。
指導學生解決讀取Excel時的錯誤,並透過pip安裝openpyxl套件以順利讀取資料。
示範在Pandas中如何對整列分數進行加分或乘法運算,取代傳統Excel的公式複製操作。
講解資料篩選的技巧,包含如何透過指定的起訖與間隔參數(slicer)來提取特定範圍的行或列。
示範如何將DataFrame內的字串轉換為小寫,以及如何擷取特定字元並與其他欄位合併產生新編碼。
教導如何定義check_pass與check_grade等Python函數,透過多重條件判斷學生成績等級。
利用apply功能將自定義的成績判斷函數快速套用至整個DataFrame的分數欄位中。
介紹to_excel指令將處理結果匯出成Excel檔案,並說明如何處理檔案被佔用的錯誤及隱藏index。
將測試完成的資料處理程式碼整理至純文字編輯器中並儲存為py檔,以利後續的批次處理與自動化。
開始介紹圖表繪製,帶領學生安裝matplotlib套件並使用pyplot模組建立基本環境。
示範如何繪製折線圖,並調整線條寬度、顏色及標記點(marker)的大小與面色。
講解長條圖語法,並介紹如何繪製圓餅圖、分離特定區塊(explode)及旋轉起始角度。
解釋Figure與Axes的概念,並透過設定坐標與長寬比例實作在一張圖中繪製多重圖表的畫中畫效果。
利用subplot指令在單一畫布上分割出多個子圖表區塊,實現多個圖表並排比較的效果。
匯入Numpy產生隨機數據,並繪製盒鬚圖與直方圖,深入探討中位數、標準差等統計分佈意義。
答案:C
講者示範在繪製函數中,使用「lw」(linewidth 的簡寫) 參數來改變折線圖線條的粗細。
答案:C
講者在介紹盒鬚圖(Boxplot)的五項數值時,特別說明中間的線代表Q2,也就是統計學上的中位數(Median)。
答案:C
講者教導使用「df.to_excel('檔名.xlsx')」指令來將DataFrame匯出儲存為Excel檔案。
本次課程延續Python數據處理的基礎,重點教授如何使用OpenPyXL套件自動化操作Excel檔案,並展示Python與Power BI的整合應用。課程從建立與載入活頁簿及工作表開始,引導學員精準讀取特定儲存格的數值,並將計算結果寫回Excel中存檔。隨後進入實戰案例,指導學員如何透過迴圈與條件判斷,自動化讀取大量結構相同的發票檔案,精確擷取發票號碼、日期及商品明細,並將多個活頁簿與工作表中的數據整併到單一總表中。此外,還解決了迴圈讀寫過程中座標位移與空白儲存格防錯的問題,並引入PathLib模組實現資料夾批次處理。課程最後階段,講師介紹如何在Power BI中引入Python腳本,利用Pandas與正則表達式進行數據清洗,例如自動遮蔽私人電話號碼與過濾無效的電子郵件地址,展示了Python在商業數據自動化處理上的強大實用性。
介紹專門用來操作Excel的OpenPyXL套件,並設定Jupyter Notebook開發環境。
示範如何存取現有活頁簿的作用中工作表,並利用座標讀取儲存格內的資料。
介紹使用cell方法配合for迴圈,自動依序讀取多列數值並進行加總。
說明如何從多份散落的發票檔案中,擷取特定欄位並準備彙整至總表。
教學如何用程式建立一個全新的活頁簿,並為準備寫入的總表設定第一行標題列。
指導學員整理與重構程式碼,將讀取與寫入的流程對齊並加上註解以便維護。
加入迴圈功能,使程式能自動讀取單張發票內的多筆商品紀錄。
解決讀取與寫入時行列數字不一致的問題,透過數學加減來對齊正確的儲存格。
示範運用if語句檢查讀取到的儲存格是否為None,避免無資料時發生錯誤。
講解如何將工作表物件放入迴圈,自動走訪同一個Excel檔案內的所有分頁。
設立獨立的總表寫入列計數器,確保來自不同工作表的資料能依序往下寫入而不被覆蓋。
教學使用PathLib模組,自動讀取指定資料夾內所有副檔名為.xlsx的Excel檔案。
示範如何將Python腳本匯入微軟的Power BI工具中進行進階數據匯入與處理。
展示如何利用Pandas與正則表達式遮蔽機敏資料(如電話號碼)與過濾無效電子郵件。
答案:B
講師提醒range是左閉右開,如果寫range(2, 6)才會出2、3、4、5。
答案:C
腳本提到反白後按一下 Tab 鍵就會退入一格進行縮排。
答案:B
講師提到打r可以skip掉wall string問題(跳脫字元),以正確讀取完整的目錄路徑。
本課程主要教授如何利用 Python 進行 Excel 自動化處理以及與 Power BI 的整合應用。前半部分重點介紹使用 openpyxl 套件,透過編寫迴圈自動讀取指定資料夾內的多個 Excel 發票檔案及工作表,精確提取特定的儲存格數據(如發票號碼、日期、客戶編號、商品明細等),並將這些散落的數據整合到一個全新的總表檔案中,實現日常辦公的自動化。後半部分則轉向 Power BI 的進階應用,示範如何將 Python 腳本無縫嵌入 Power BI 中以進行數據載入、變形與視覺化。課程詳細演練了在 Power Query 編輯器中使用 Python 的 pandas 及 re 正則表達式模組,進行資料清理與敏感資訊遮蔽(如隱藏身份證字號、電話號碼及剔除無效的電子郵件地址),最後示範如何利用 matplotlib 在 Power BI 畫布上繪製自訂的視覺化圖表,大幅提升數據分析與處理的效率。
介紹利用 openpyxl 套件進行 Excel 自動化處理的基本概念與情境。
示範如何匯入套件並建立及讀取目標資料夾中的 Excel 活頁簿與工作表。
教學如何精確定位並讀取指定行與列的發票數據儲存格,如客戶名稱與日期。
透過迴圈自動掃描發票明細列,以取得具有資料的商品項目與金額。
示範如何將提取出的變數資料,按順序寫入至準備好的合併報表檔案中。
透過調整迴圈位置與 current_row 變數,確保每筆資料與標題能正確寫入下一行。
測試資料合併腳本,並將其另存為獨立的 Python 執行檔方便日後自動化處理。
簡介 Power BI 的載入數據、資料變形與建立視覺化這三大基本步驟。
教學如何利用 Python 腳本配合 pandas 直接從外部讀取數據進 Power BI。
示範如何利用 Power Query 的 Python 功能進行自訂的資料變形與欄位計算。
運用 pandas 的 apply 功能為銷售數據添加分類標籤欄位,分辨銷售額高低。
在 Power BI 畫布中呼叫 Python 的 matplotlib 模組來繪製自訂長條圖。
教學使用 re 模組設定字串匹配規則,隱藏留言檔案中的電話號碼與社會安全碼。
實際將敏感資訊遮蔽與無效電郵刪除的 Python 程式碼應用於 Power BI 中。
儲存具有 Python 腳本的 Power BI 分析專案並結束本次課程教學。
答案:A
講師示範了使用 if 條件式檢查特定的儲存格 value 是否不等於 None,確保只處理有資料的列。
答案:B
設立 current_row 並每次加 1 是為了將指標移動到下一列,避免迴圈寫入資料時覆蓋掉剛剛填寫的內容。
答案:A
講師示範了導入 pathlib 模組,並使用其中的 Path 方法來獲取資料夾路徑以讀取發票檔案。
4 LESSONS · 10 HOURS
利用 Python 和 Machine Learning 從歷史資料建立預測模型,並把預測結果帶回 Excel 支援決策。
以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。
本次課程為機器學習的第一堂課,重點教授如何使用Python進行基礎數據分析與模型建構。課程初期,導師帶領學員在Windows環境下安裝Python,強調設定環境變數路徑的重要性,並講解如何透過命令列工具(cmd)安裝Jupyter Notebook與必備套件,如pandas、openpyxl、scikit-learn與matplotlib。掌握基本開發環境操作後,課程進入實戰階段,導師以學生成績的Excel檔案為例,示範機器學習的標準工作流程。流程包含:讀取數據、分割特徵(Features)與標籤(Labels)、使用LabelEncoder將文字標籤轉換為數字編碼,並透過train_test_split函數將數據集劃分為八成訓練集與兩成測試集。接著,學員學習匯入決策樹分類器(Decision Tree)進行模型訓練與預測,並繪製決策樹圖形來觀察AI的決策邏輯。課程後半段,導師指導學員從Kaggle平台下載真實的糖尿病預測數據集,進行完整流程的二次實作,並介紹Google Colab作為免安裝的雲端開發替代方案。過程中深入探討了模型過度擬合(Overfitting)的問題,教授透過設定最大深度(max_depth)來控制決策樹的複雜度。最後,課程介紹準確率(Accuracy Score)等模型評估指標,為學員建立日後優化模型的基礎觀念。
導師介紹機器學習課程大綱,並開始指導學員檢查本機電腦的Python環境。
示範從官網下載Python,並強調安裝時必須勾選將Python加入系統路徑。
在命令提示字元中使用pip指令下載並安裝Jupyter Notebook作為後續開發工具。
透過指令啟動伺服器進入Jupyter環境,並講解基本的Python變數與格式化字串列印。
遇到缺少套件的錯誤時停止伺服器,安裝pandas與openpyxl後成功讀取Excel資料集。
講解並實作將數據集拆分為用作預測的特徵集(X)與目標結果的標籤集(Y)。
介紹機器學習套件scikit-learn,並使用LabelEncoder將文字標籤轉換為數字格式。
使用train_test_split函數將資料隨機分為八成訓練集與兩成測試集,並設定隨機種子。
介紹免安裝的Google Colab平台,示範如何上傳資料集並在雲端執行相同的程式碼。
匯入決策樹分類器建立模型物件,並使用訓練集資料進行擬合(Fit)訓練。
使用已經訓練完成的決策樹模型,對測試集資料進行預測並輸出結果進行比對。
安裝繪圖套件matplotlib,透過plot_tree指令將決策樹的判斷條件邏輯視覺化呈現。
從Kaggle下載真實的糖尿病診斷CSV數據集,重新實作一次機器學習的完整流程。
講解模型層數過多導致的過度擬合問題,並透過調整max_depth參數來簡化決策樹。
使用混淆矩陣與準確率等指標檢驗模型效能,並總結機器學習的自動化預測流程觀念。
答案:C
導師示範透過加入參數max_depth=3或2來把樹的深度壓低,藉此提升模型的泛化能力。
答案:C
導師指導輸入model.fit(X_train, y_train)指令,告訴模型開始基於訓練集資料進行學習擬合。
答案:B
導師說明該資料集內容(包含標籤)本身已經整理為純數字,因此直接省略了encode的動作。
本課程深入探討機器學習中的資料預處理與線性迴歸模型實作。首先,講師介紹了監督式學習的兩大核心類別:分類(Classification)與迴歸(Regression),並詳細解說資料預處理的四大步驟。課程透過 Jupyter Notebook 搭配 Pandas 與 NumPy 等工具,帶領學生實作計算平均數、中位數,並利用四分位距(IQR)與箱形圖(Boxplot)來尋找、分析及處理異常值(Outliers)。隨後,示範了如何以刪除(dropna)或填補(fillna)的方式來處理缺失值(Missing Values),並深入介紹 Label Encoder、Ordinal Encoder 及 One-Hot Encoder 以處理不同特性的類別標籤轉換。最後階段,課程引導學生使用 train_test_split 分割訓練集與測試集,並透過 MinMaxScaler 進行特徵縮放。實作部分則建立 Linear Regression 線性迴歸模型,利用 R2 Score 與 Mean Squared Error (MSE) 評估模型預測學生考試成績與同步機器數據的準確度,並結合散佈圖視覺化預測結果與實際數據的差異。
介紹如何透過 Command Prompt 啟動 Jupyter Notebook,並匯入 Pandas 模組進行準備。
講解監督式學習的兩大陣營:處理明確答案的分類問題與處理連續實數的迴歸問題。
實作使用 NumPy 計算資料的平均數、中位數及眾數,了解資料的分佈狀況。
介紹 Q1、Q2、Q3 的概念,並示範如何計算四分位距 (IQR) 來界定資料的正常範圍。
利用 IQR 計算上下邊界,藉此找出偏離正常軌跡的異常值 (Outliers)。
安裝 Seaborn 套件並繪製箱形圖 (Boxplot),透過視覺化方式直觀辨識出資料中的異常值。
示範在 Pandas DataFrame 中,如何使用中位數或平均數來替換掉異常值,或者直接將其移除。
解說處理缺失值 (NaN) 的常見方法,包括直接刪除整行資料或以中位數進行填補。
介紹如何使用 Label Encoder 將性別等非數值類別型資料轉換為 0 與 1 的純數字編碼。
針對具有次序意義的資料(如星期一到星期日),使用 Ordinal Encoder 依照指定順序進行編碼。
示範 One-Hot Encoder 如何將分類資料轉換為二進制向量矩陣,避免數值大小影響模型判斷。
透過經典的鳶尾花 (Iris) 資料集,示範如何將資料分離出特徵 (X) 與目標標籤 (Y)。
使用 train_test_split 函數,依 7:3 比例將資料隨機分割為訓練集與測試集。
使用 MinMaxScaler 進行標準化,將不同範圍的特徵數值統一縮放至 0 到 1 之間以求公平比較。
建立 Linear Regression 模型,並解釋模型本質上是建立一條帶有係數與截距的方程式。
利用 MSE 與 R2 Score 打分評估預測成效,並繪製散佈圖對比實際值與預測值的差異。
載入全新工業機器數據集實作線性迴歸,展現模型在理想狀態下取得 R2 Score 滿分的精準度。
答案:B
講師說明 Ordinal Encoder 可以根據設定的順序要求(如週一到週日)來編碼,以保留其先後次序意義。
答案:C
講師指出,如果預測的資料點能 Overlap (重疊) 在對角線上,就表示預測結果與實際數值極度吻合,估得很準。
答案:B
講師提到 Matplotlib 是基礎畫圖工具,而 Seaborn 是更為進階、美觀的繪圖工具。
這堂機器學習課程涵蓋了無監督學習、模型部署以及大型語言模型(LLM)的應用。首先,課程詳細介紹了K-means分群演算法,透過Excel手動計算距離來解釋其運作原理,並在Jupyter Notebook中使用Python與Scikit-Learn實作數據分群。接著,課程教授如何使用Streamlit快速建立互動式網頁應用程式,並透過Git與GitHub將訓練好的鳶尾花(Iris)隨機森林模型部署到Streamlit Community Cloud上。最後,課程進入LLM領域,探討Transformer架構及其注意力機制(Attention Mechanism),並實作如何透過Ollama在本地端執行Gemma 2B與Llava模型進行文字與影像分析。此外,還介紹了LangChain框架的應用,展示如何將本地文件(如美國憲法文本與PDF)切割成小片段(Chunks),轉換為向量(Embeddings)並儲存於ChromaDB向量資料庫中,從而實現基於本地知識庫的LLM查詢系統。
課程開始介紹將涵蓋 K-means 分群、Streamlit 部署以及本地大型語言模型(LLM)的應用。
導師解釋無監督學習的特色,並說明 K-means 如何隨機選擇中心點並計算距離來進行分群。
透過 Excel 手動輸入座標點,利用開根號公式計算點與中心點的距離以理解演算法邏輯。
使用 Python、Numpy 產生散佈圖,並透過 Scikit-Learn 訓練 K-means 模型以觀察分群結果。
介紹並安裝 Streamlit,說明如何使用簡單 Python 語法免除 HTML 快速建立互動式網頁。
為將應用程式部署至雲端,教學下載 Git、申請 GitHub 帳戶並進行基本的版本控制。
演練 git init、add、commit 與 push 等指令,成功將本地端的程式碼上傳至 GitHub。
示範如何連結 GitHub 儲存庫,在 Streamlit Community Cloud 上免費部署並產生公開網址。
使用隨機森林演算法訓練鳶尾花模型,並將模型以 Pickle 儲存,結合 Streamlit 製作介面。
介紹 Transformer 模型中的注意力機制,以及編碼器與解碼器於大語言模型中的不同應用。
帶領下載 Ollama,並透過指令拉取 Gemma 2B 模型進行本地端的問題與文字回答實作。
使用具備視覺分析能力的 Llava 模型,在本地端輸入紅貓圖片並成功解析圖片內容。
說明 LangChain 開發流程,包含載入文字與 PDF 檔案,準備進行本地知識庫的檢索訓練。
示範如何將文件切割成 Chunks,轉換為 Embeddings,並儲存至 ChromaDB 向量資料庫中。
總結機器學習部署與本地大語言模型實作流程,並鼓勵課後練習與申請外部 API Key。
答案:C
課程中提及使用 matplotlib 的 scatter 方法繪製散佈圖 (scatter chart) 來觀察點的分群狀態與群集中心。
答案:C
課程示範下載模型時,使用了 ollama pull 指令來將目標模型拉取到本地端電腦中。
答案:B
課程說明現在流行的大語言模型(如 ChatGPT)皆是基於 Transformer 架構建構的深度學習模型。
把已掌握的技術結合 ChatGPT、Claude、Copilot 與 Gemini,規劃分析、處理資料並檢查預測模型。
4 LESSONS · 10 HOURS
以 AI 輔助完成數據科學工作流程,由 Pandas 資料準備、探索分析及特徵工程,到建立、評估及解釋預測模型。
以下內容直接取自每段完整課堂錄影及已建立的 AI 學習資料。
本課程為Data Science的Python開發基礎第一堂課。課程從最基礎的環境建置開始,指導學生如何使用命令提示字元、安裝Python及VS Code,並學習使用pip管理套件與啟動Jupyter Notebook。課程涵蓋了變數宣告、四大基本資料型態(字串、整數、浮點數、布林值)、F-string字串格式化技巧、條件判斷式(if-else)以及迴圈(for-loop)等核心程式邏輯。隨後進階介紹清單(List)與字典(Dictionary)兩種重要資料結構的操作,並教學如何定義自訂函數(Function)、建立與匯入模組(Modules)以利程式碼重用。此外,亦示範了如何操作檔案讀寫,並引導學生運用AI輔助工具加速編程與除錯,全面奠定Python資料科學開發的扎實基礎。
介紹Data Science Python課程大綱,並引導學生開啟命令提示字元建立工作資料夾。
示範從官網下載Python,並強調安裝時必須勾選加入PATH路徑的重要性。
下載安裝VS Code編輯器,並教學如何開啟資料夾與建立第一個Python檔案。
教學如何使用pip指令安裝、查看及移除Python擴充模組。
安裝Jupyter Notebook並示範如何啟動伺服器及新增筆記本檔案進行互動式編程。
講解變數概念與常用的四大資料型態:字串、整數、布林值與浮點數。
示範如何使用if-else進行條件決策,並解決輸入資料型態不符的轉換問題。
介紹清單結構,教學如何建立清單並透過索引值取得特定元素。
學習對清單執行附加(append)、插入(insert)、修改及刪除(remove)等實用操作。
示範如何運用for迴圈遍歷清單,將符合特定條件的分數分類到不同的新清單中。
介紹如何使用def關鍵字定義函數,並透過傳遞參數讓程式碼具備動態處理能力。
講解函數為何應使用return回傳結果而非單純列印,以便後續的資料處理。
教學如何將函數儲存為獨立的.py模組,並在Jupyter Notebook中匯入呼叫。
介紹內建模組運用,並實作文字檔的開啟、讀取(read/readline)與附加寫入(append)。
學習由鍵與值(Key-Value)組成的字典結構,並預告後續Pandas的應用方向。
答案:B
def (define) 是 Python 中用來宣告自訂函數的固定語法。
答案:C
在 Python 中,字串與數字無法直接串接,必須先用 str() 將數字暫時轉換為字串型態。
答案:B
字典結構是用大括號包覆,每個單位都是一個 Key 對應一個 Value 的組合。
本堂課為數據科學的第二節課,主要教授 Python 在數據處理與可視化方面的核心應用。課程首先指導學員如何在命令提示字元啟動 Jupyter Notebook,並安裝必備的 Pandas 模組。接著深入講解 DataFrame 的建立、讀取與寫入 Excel/CSV 檔案,以及各種實用的資料操作,包括數值運算、字串切片處理、日期時間(Datetime)的轉換與加減、資料過濾篩選、排序與群組化(Groupby)聚合運算。此外,課程也示範了如何利用 merge 功能合併多個資料表,以及定義函數並透過 apply 與 lambda 進行進階資料運算。最後,課程引入 Matplotlib 模組,帶領學員實作繪製折線圖、長條圖與圓餅圖,並強調學員應善用 AI 工具來輔助編寫程式碼與快速除錯,以大幅提升開發效率。
指導學員進入指定資料夾,並透過 CMD 啟動 Jupyter Notebook 伺服器。
示範如何使用 pip 指令安裝 Pandas 模組,並在 Notebook 成功匯入。
講解 DataFrame 的基礎觀念,並透過字典結構建立包含人名與分數的資料表。
示範如何利用 Pandas 讀取 Excel 檔案,並說明如何安裝缺少的 openpyxl 模組。
示範對整欄資料進行加分運算,以及使用 .str 對字串進行小寫轉換與字元切片。
探討日期字串轉換為 datetime 格式的方法,並指導如何將錯誤訊息交給 AI 輔助除錯。
示範讀取 CSV 格式的學生成績資料,並運用 iloc 語法選取特定的行列範圍。
介紹 describe 函數,一鍵快速產生資料的平均值、中位數、最大最小值等統計指標。
利用 loc 搭配邏輯運算子過濾特定性別,以及示範多重條件的資料篩選方式。
解說 sort_values 的排序功能,並展示如何使用 groupby 計算不同群組的平均或加總分數。
示範從同一個 Excel 檔讀取不同工作表,並利用 merge 函數進行資料表的關聯合併。
教導撰寫 Python 判斷式函數,並透過 apply 搭配 lambda 將運算邏輯套用至整欄資料。
介紹 Matplotlib 套件,示範繪製基本的折線圖並自訂線條顏色、寬度及資料點標記。
運用 plt.bar 繪製長條圖,添加圖表標題與座標軸標籤,並實作 plt.pie 繪製圓餅圖及分離區塊。
總結本節課所學,提醒學員儲存開發進度,並預告下一堂課的自動化及機器學習主題。
答案:C
導師透過 AI 輔助指出,在使用 .apply() 呼叫有參數的函數時,需配合 lambda 匿名函式將整列(row)傳入處理。
答案:C
導師在課堂中指出,在 CMD 進入正確目錄後,需輸入「jupyter notebook」啟動筆記本介面。
答案:B
導師在示範讀取 Excel 時指出,需要先確保環境中已安裝 openpyxl 模組才能成功讀取 xlsx 檔案。
本節課主要教授如何使用Python的 openpyxl 模組來自動化處理Excel檔案,以及機器學習的入門概念。課程前半部分詳細示範了如何在 Jupyter Notebook 中安裝並匯入 openpyxl,接著透過讀寫特定儲存格、設定迴圈來批次更新學生成績、判斷及格狀態並計算總分。隨後進入實戰演練,講師帶領學員運用 os 模組讀取資料夾內的多張發票 Excel 檔,將每張工作表中的特定數據提取出來,合併並儲存至一個全新的總表中,同時在檔名加上時間戳記以防覆蓋。課程最後階段簡單介紹了機器學習的基本流程,包括資料收集、標記、模型訓練與測試,並實作運用 scikit-learn 模組載入乳癌數據集,快速建立並視覺化決策樹模型,為下一堂課打下基礎。
講師帶領學員開啟 EZ Drive 並使用命令提示字元進入工作目錄。
在 Jupyter Notebook 中撰寫程式碼匯入 openpyxl 模組以處理 Excel。
學習如何選取 active worksheet 並讀取特定儲存格的值。
示範使用 row 與 column 座標配合迴圈,批次印出學生成績。
透過程式碼將所有學生成績加分,並依條件判斷是否及格寫入新儲存格。
在 Excel 中寫入加總公式,並將修改後的資料另存為新的 Excel 檔案。
介紹將多張發票 Excel 檔案中的資料提取並合併到單一工作表的任務。
撰寫程式碼讀取資料夾路徑,並篩選出副檔名為 .xlsx 的目標檔案。
利用 AI 輔助生成程式碼,透過檔名正確開啟各個發票的工作簿。
加入第二層迴圈,讓程式能夠自動處理每一個工作簿中的所有工作表。
在迴圈外建立一個新的總表檔案,並寫入發票所需的中文標題列。
定位發票中的發票號碼、日期等特定儲存格,將其拷貝並寫入合併總表中。
為了避免檔案覆蓋,在輸出檔名加上時間,並將程式碼儲存為獨立的 .py 執行檔。
透過垃圾郵件分類的例子,講解機器學習中資料標記與模型訓練的基礎概念。
下載 Kaggle 乳癌數據集,運用 scikit-learn 快速建立並畫出決策樹模型。
答案:D
講師在 00:28:03 指出存檔的 command 是 `wb.save()`。
答案:B
講師在 00:00:12 處提到「麻煩大家先打開你的 EZ Drive」。
答案:B
講師在 02:11:36 解釋 B 就是良性,M 就是惡性。
本節課堂全面講解了機器學習模型建立前的重要步驟「資料預處理」以及模型訓練與評估的基本流程。課程首先強調了處理缺失值的重要性,示範了使用Scikit-Learn的SimpleImputer以平均數填補數值空缺,以及用出現頻率最高的值填補文字空缺。接著探討如何將文字轉換為數字,介紹了Label Encoder、Ordinal Encoder與One-Hot Encoder的差異與應用場景。隨後,課程介紹了資料標準化,透過MinMaxScaler將數值範圍縮放至0到1之間,以消除不同特徵因數值大小造成的分析偏差。在清理資料的最後階段,講解了利用四分位距或Z-score來尋找並過濾異常值。進入模型訓練階段後,以鳶尾花數據集與學生考試成績為案例,詳細說明了利用train_test_split將數據集切割為訓練集與測試集的標準做法,並探討了固定隨機數種子的重要性。課程帶領學員實作了分類模型(Decision Tree)與迴歸模型(Linear Regression),展示如何畫出決策樹圖表,並強調透過設定最大深度來避免過度擬合。最後,課程也簡單演示了多項式迴歸與多元線性迴歸的概念,以及MSE與R-score等評估指標的意義,為學員建立起扎實的機器學習實作與觀念基礎。
介紹處理數據集的第一步:清理資料、檢查錯誤值並將文字轉換為數字。
示範如何利用工具以平均數或最高頻率的值填補數值與文字資料的空洞。
講解如何將有次序性與無次序性的類別文字轉換成機器學習能識別的數字。
介紹透過資料標準化將數字縮放到0至1的範圍,以避免數值範圍過大造成的誤差。
說明何謂偏離分子,並示範利用 Z-score 與四分位距 (IQR) 的方法找出異常值。
載入鳶尾花數據集,觀察特徵數據與目標標籤的結構,為模型訓練做準備。
示範打橫切割資料集,隨機抽取八成資料用於訓練模型,兩成用於後續測試。
解釋固定 Random State 的隨機數種子,確保每次訓練抽取的資料集維持一致。
引進 Decision Tree Classifier,利用訓練資料(fit)讓模型學習資料的分類規則。
計算測試資料的預測準確率,並利用 plot_tree 指令將決策樹的判斷規則視覺化。
探討決策樹層數過多造成的 Overfit 現象,示範透過 max_depth 參數控制樹的深度。
介紹 Regression 模型的核心概念,說明如何利用歷史特徵數據預測連續數值。
以學生考試成績為例,利用 Matplotlib 畫出散佈圖並擬合出最佳的線性迴歸線。
講解利用 R 平方 (R-score) 及均方誤差等指標,用具體數字評估迴歸模型的表現。
示範加入多項式特徵(次方)以繪製曲線迴歸圖,並探討處理多個特徵變數的三維預測。
答案:D
這個功能會將特徵(X)與目標(Y)同時分割,一共產生四份資料:X_train, X_test, y_train, y_test。
答案:D
模型建立後的 coef_ 屬性指的是 Coefficient,代表迴歸直線方程式中對應特徵的斜率。
答案:B
需要設定 feature_names 參數來附加特徵名稱,否則圖中只會顯示難以識別的預設代號。
不只是跟隨影片完成練習,而是真正理解技術、獨立解決問題,並把 AI 變成可控制和可驗證的工作助手。
運用 Python、Pandas 匯入、清理、轉換及視覺化數據,建立可靠的分析流程。
掌握資料準備、Regression、Classification,以及訓練和測試模型的完整步驟。
理解模型指標、限制與偏差,能判斷預測結果是否合理並適合實際應用。
運用 AI 規劃分析、產生及檢查程式碼,並自行驗證資料處理和模型建議。
把程式、圖表、模型及洞察整理成清楚、可重現及可支援決策的數據專案。
擁有豐富的商業網頁及應用程式系統開發經驗,以及超過 25 年教學經驗。教學方式清晰直接,擅長把複雜技術拆解成容易理解、可以實際應用的步驟。
曾為知名企業、政府部門及本地大學提供培訓,涵蓋辦公室自動化、數據科學、數據分析,以及商業網頁和 Apps 系統開發;並擔任 NCC Education 及 University of Greenwich 的主要講師。
由 Python 與 Pandas 數據分析、Machine Learning 預測模型,進階至 AI 輔助數據科學實戰,共 12 節、30 小時完整錄影課程。
本頁所有課程均為錄影課程;報名後即可開始,無需等待開課。
Copyright © 2025 Unisoft Education Centre. All Rights Reserved