本周任務
一、 VISTA資料庫
(1) 建立training機器學習Logistic regression(Lr)及deep neural network(DNN)。
(2) 將資料分成train set/validation set/test set三組,分別訓練及驗證3種模型[Random Forest(RF)、Lr及DNN]來預測90天後之MRS之分數。
(3) 使用train set訓練3種模型、validation
set驗證3種模型,最後用test set繪製ROC curve。結果顯示DNN的表現最好(0.77),Lr的表現次之(0.76),RF的表現最差(0.73)。結果與Heo之研究 (Heo et al.,
2019) 相同。繪製之ROC curve如下:
二、 製作9/6衛福部研討會之PPT(COWMEM)及海報(iSAT)
(1) COWMEM之PPT完成大綱(有與學長討論)及部分初稿
(2) iSAT之海報完成大綱
三、 選課:初選未選上統計,因此多選了生物統計學二
遇到之困難
一、 VISTA資料庫
(1) 建立training機器學習model時,不清楚各個model之python code參數應該設定多少。
解決方法:先使用sklearn預設之數值,但run code時出現錯誤或結果無法完全複製Heo之研究(Heo et al., 2019)。確認該研究中是否有寫相關參數、確認code錯誤之原因並作調整。
(2) machine
learning的觀念釐清
解決方法(觀念釐清):
a. over
fitting(過度契合)是指匯入的training data過度契合訓練出來的model,主詞及受詞為model及training data,而非testing data。所以才會造成testing data匯入model時,產生的model表現差。
b. 資料分成train set/validation set/test set三組時,應使用train
set訓練及調整模型、validation set驗證及選擇模型,最後使用test set確認模型之表現。理論上驗證模型與確認模型之模型表現結果不會差太多。切勿使用testing data調整模型。
二、 製作COWMEM研討會之PPT
(1) PPT中關於工作記憶之定義、整體呈現之rationale及資料呈現之取捨有問題時皆找恭宏學長釐清。
後續預計進行之任務
(1) 建立ASTRAL model並比較與RF、Lr與DNN之表現
(2) 8/28送印iSAT計畫之海報
(3) 8/30前找恭宏學長試報COWMEM計畫之PPT
參考資料
1. Heo, J., Yoon, J. G.,
Park, H., Kim, Y. D., Nam, H. S., & Heo, J. H. (2019). Machine
Learning-Based Model for Prediction of Outcomes in Acute Stroke. Stroke, 50(5), 1263-1265.
doi:10.1161/strokeaha.118.024293