本周任務為
(1)
從VISTA資料庫中選出ASTRAL使用到的之變項(共10個),轉換單位不統一之變項後處理缺失值。
(3)
將資料分成train set/validation set/test set三組,並呈現描述性統計、各預測變項與結果變項之相關性。
遇到之困難
(1)
進行上述步驟時,有時候會卡在太過細節,但其實不處理也不會影響大方向的地方。
解決方法:先和學長討論目前遇到的問題,討論及判斷遇到之問題是否為重要且會影響後續步驟。
(2)
各步驟之python code不熟悉
解決方法:
a.
先自己找說明書,確認各個參數的含義及哪種資料型態才能使用此參數。
b.
在編輯code的地方以註解的方式說明各個步驟做了些什麼事情,以區塊做分類。
c.
找學長討論是否有更簡單的方法。
(3)
machine learning的觀念在學長抽考時發現理解錯誤
解決方法:
a.
練習各個概念是否可用簡短的幾句話說明
b.
找人討論
(4)
model 1的結果太接近完全預測,懷疑是否自己在資料清理時有問題,但討論後決定可先看其他2個model之結果後再確認是否為資料清理時篩選的問題
解決方法:
a.
將資料分成train set/validation set/test set三組,並分析各組之描述性統計
b.
分別將三組資料匯入model 1、model 2 (deep neural network) 及model 3(Logistic regression),確認3個model之結果是否都太過接近完全預測
c.
分析各組X與y之相關,確認各個變項之分布
後續預計進行之任務
(1)
確認三組之資料分布
(2)
建立model 2及model 3
(3)
資料匯入3個model及繪製ROC curve

沒有留言:
張貼留言