2019年8月26日 星期一

[學習]2019.08.27欲討論之內容


本周任務
一、   VISTA資料庫
(1)   建立training機器學習Logistic regressionLr)及deep neural networkDNN)。
(2)   將資料分成train set/validation set/test set三組,分別訓練及驗證3種模型[Random ForestRF)、LrDNN]來預測90天後之MRS之分數。
(3)   使用train set訓練3種模型、validation set驗證3種模型,最後用test set繪製ROC curve。結果顯示DNN的表現最好(0.77),Lr的表現次之(0.76),RF的表現最差(0.73)。結果與Heo之研究 (Heo et al., 2019) 相同。繪製之ROC curve如下:


二、   製作9/6衛福部研討會之PPTCOWMEM)及海報(iSAT
(1)   COWMEMPPT完成大綱(有與學長討論)及部分初稿
(2)   iSAT之海報完成大綱
三、   選課:初選未選上統計,因此多選了生物統計學二

遇到之困難
一、   VISTA資料庫
(1)   建立training機器學習model時,不清楚各個modelpython code參數應該設定多少。
解決方法:先使用sklearn預設之數值,但run code時出現錯誤或結果無法完全複製Heo之研究(Heo et al., 2019)。確認該研究中是否有寫相關參數、確認code錯誤之原因並作調整。
(2)   machine learning的觀念釐清
解決方法(觀念釐清):
a.    over fitting(過度契合)是指匯入的training data過度契合訓練出來的model,主詞及受詞為modeltraining data,而非testing data。所以才會造成testing data匯入model時,產生的model表現差。
b.   資料分成train set/validation set/test set三組時,應使用train set訓練及調整模型、validation set驗證及選擇模型,最後使用test set確認模型之表現。理論上驗證模型與確認模型之模型表現結果不會差太多。切勿使用testing data調整模型。
二、   製作COWMEM研討會之PPT
(1)   PPT中關於工作記憶之定義、整體呈現之rationale及資料呈現之取捨有問題時皆找恭宏學長釐清。

後續預計進行之任務
(1)   建立ASTRAL model並比較與RFLrDNN之表現
(2)   8/28送印iSAT計畫之海報
(3)   8/30前找恭宏學長試報COWMEM計畫之PPT

參考資料
1.     Heo, J., Yoon, J. G., Park, H., Kim, Y. D., Nam, H. S., & Heo, J. H. (2019). Machine Learning-Based Model for Prediction of Outcomes in Acute Stroke. Stroke, 50(5), 1263-1265. doi:10.1161/strokeaha.118.024293


2019年8月19日 星期一

[學習]2019.08.20欲討論之內容


本周任務為
(1)  VISTA資料庫中選出ASTRAL使用到的之變項(共10個),轉換單位不統一之變項後處理缺失值。
(2)  建立training機器學習model 1(random forest)及繪製ROC curve。結果顯示model 1的表現為0.99,繪製之ROC curve如下:

(3)  將資料分成train set/validation set/test set三組,並呈現描述性統計、各預測變項與結果變項之相關性。

2019年8月14日 星期三

[學習]2019.08.13討論整理及口語表達問題檢討


口語表達問題檢討

1.     表達原則:重點越早呈現、越清楚越好
2.     結構化格式:任務內容→任務目的→過程→結果→解決方法(包含前因後果)
3.     討論前一天前將本周要討論之議題依照上述之結構PO部落格