
近日首次報名院內舉辦的POWER BI競賽,相信可以輕鬆進入第二輪並拿下前三名,理由如上所述(POWER BI面板其中一頁)。平日我在院內,在POWER BI領域較不願浮出水面,單位內已有同仁可駕馭此軟體,所以就不想再強出頭(太多領域強出頭其實沒好處,錢沒變多,事情會一直來,所以適時藏著技能是必要的),固守我的SAS和Python等城牆領域(註)即可,前者是「企業級穩定、合行業規則與高安全性」的護城河,後者是「開源、機器學習、靈活彈性」的領土擴張(就是因為近3年額外研究了python才讓SAS著作沒進度,持續停在第6章。不過,有失就是有得,近3年,我的python內力確實大幅增加,可以彌補SAS的弱項-例如爬蟲,而SAS端的推論統計分析,是Python無法取代的,理由我以前講過了,習慣了某統計軟體的輸出報表,難以再適應其它軟體的報表,那需要拿大量的時間來轉換,沒有4至6年的時間是不可能的-不要跟我說可以靠AI,你什麼東西都AI,只會讓人覺得你大腦內沒這方面專業知識)。
註:能同時駕馭這兩軟體的行政人員絕對能擠進全國醫療院所行政人員族群裡的前5%,然後再加上有SAS官方證照,又有受理統計諮詢多年的經歷。
過往我很少使用POWER BI,雖也有實際到友院授課經歷,但我很少將此技術應用於我的業務中,理由在於我在SAS端已寫了多支使用多年的自動化資料分析流程式串。每一分析流執行完畢,就能批次產出一系列圖表,且這些統計圖都是原生高品質統計大圖,可以是.png也可以是高階的.eps(它不是企業每股盈餘嘿,是可供事後原生編輯圖內文字數字再儲存的圖檔)。只要換個條件和參數就可以再產出另一批條件不同的檔案群。本次因為人事時地物都具備,就只差在順手把BI面板做出來,再加上我透過python爬蟲技術挖國內外上市公司財報並轉.xlsx檔分析的技術達鬼斧神工等級,所以就順手做了這個BI面板(爬蟲的Code也是花了多日才寫完並完成測試)並同時參賽。
於Spyder一鍵完成內外網全資料抓取,再於Power BI一鍵完成資料再匯入(透過python指令碼)和統計圖表再更新,真正擺脫耗時且惱人的資料撈取工程。
以下為報名文件背景段落描述:
負責輔導會績效評核三指標「住院案件出院後3日內再急診率」、「門診手術2日內急診或住院率」、「急診轉住院暫留急診逾48小時比率」監測任務。前兩項指標每年比較4次,以今年為例第1次比較為本院114Q3指標健保申報值 vs.113Q3高屏業務組加權平均值、第2、3、4次比較依序為114Q4 vs. 113Q4、115Q1 vs. 114Q1、115Q2 vs. 114Q2。第3項指標以今年為例,應以1至9月本院每月申報值之加權平均值比較高屏業務組醫中同儕群組過往12個季的加權平均值。為應付管理會議呈現當下監測情形,須不斷更新資料。假設現為7月初,資料就須累計到1至6月,而健保資訊公開網一旦有新一季數據上架,就須棄舊季納新季數據,以便符合過往12個季資料的比較。綜上,此監測工作須持續內外網數據比較,內網抓自院內整合系統內多個路徑多個指標資訊化統計報表;外網為健保資訊公開網的各醫院層級各分區業務的指標描述性統計值和各醫院的表現明細等資料。我本身就具Python爬蟲能力,故透過本專案撰寫Python code,一口氣把我要的內外網資料全部撈進地端電腦。在我的Spyder軟體端(慣用的Python IDE, 免費)指令一下,瀏覽器自動開,自動開內網輸入帳密,自動層層點入深埋其中的指標報表,自動下參數(各式維度與日期區間),報表展開後自動抓數據抓病人明細,全數一網打盡,並同時執行資料清理(例如將報表內的 -符號改成0),最後分門別類存入不同的工作頁,再存成xlsx檔。而外網的資料撈取也是如此,全部全自動,兩案最後會得到7個xlsx檔,共計24個工作頁。
由於院內數據不能公開,所以我只張貼外網(註)數據自動撈取過程影片。也因如此,BI多個頁面同時混合了內外網數據,故本文無任何BI面板資料張貼內容。
註:指全民健保資訊公開網,任何人都可以看。全民健康保險醫療品質資訊公開網-民眾版
後記:
我其實也滿適合這類工作的,只是較優的工作大多都在台北市,但偶而有幾件會出現在高雄軟體園區或楠梓科技產業園區(本次呈現李長榮化工,過往曾看過日月光)。













沒有留言:
張貼留言