發表文章

目前顯示的是有「資料科學從頭學」標籤的文章

資料科學從頭學(五) Linear Regression

圖片
(文章內容皆為記錄本人之學習過程,非以分享為目的) 1.數學基礎:    微積分、線性代數、統計學之檢定 2.用途: 1)迴歸分析屬於多變量分析的一種,所謂多變量分析是用於 分析 多個變數間的關聯 。 2)迴歸分析分為線性與非線性,主要用於連續尺度,且至少一個 相依變數 的問題( 獨立變數 可以是一個或多個),針對離散的變數另有變化形式的羅吉斯回歸...等方法處理。 本篇文章純探討線性回歸中的 Simple Linear Regression、Multiple Linear Regression p.s. 相依變數:又稱反應變數,就是真正想比較、想了解的東西。 獨立變數:又稱解釋變數,想藉由本因素找出與相依變數的關聯性。 3)統計學亦有很多迴歸的章節,針對廣義線性模型分類如下 4)多變項線性迴歸的變數選取是一個值得探討的重點主題,其嚴重影響模型的擬合度與解釋性。 3.理論 : Linear Regression 即為用一條直線來擬合點位資料,而縱軸(Y軸)通常是我們比較關心的相依變數,X軸是用來尋找關係的獨立變數,可以一個或多個,也可以多方嘗試找到最好的組合。 該直線的表示方式如下: 上圖可知簡單線性迴歸是多變項線性迴歸的一個特例。 參數估計方法分為最小平方估計法(Least squares estimate method),也就是讓每個真實資料點的y值(相依變數)與擬合線的距離平方總和最小化,此問題可用多變函數求極值的數學方法求解: 上式Q為差的總和,分別對各參數偏微分後可以得到k+1個多項式,如下: 以上可以用正規方程(Normal equation)或是梯度下降法(Gradient descent)來解,但一般特徵不太多的話,用正規方程的效果會比較好,如下: 解完參數後即可帶回方程式,並得到我們的直線。 4. 討論: 1)模型基本假設:     a.線性(Linearity):獨立變數與相依變數為線性關係。     b.條件常態分布(Multivariate normality):     ...

資料科學從頭學(四) SVM(線性)

圖片
(文章內容皆為記錄本人之學習過程,非以分享為目的) 理論參考:林宗勳的網路教學資料 (daniel@cmlab.csie.ntu.edu.tw) 1.數學基礎:   .線性代數(向量空間的直線、平面、距離....等)   .多變數限制條件求極值  Lagrange multiplier method(拉格朗日乘數) 2.用途: SVM (Support Vector Machines)是一種分類演算法,在解決小樣本、非線性及高維模式識別問題中表現出許多特有的優勢。 3.理論: SVM目標是找出一個超平面(Hyperplane),使之將兩個不同的集合分開,以二維的例子來說 希望找到一條線來區分集合點(如下),距離兩邊界最大的就稱為Optimal Separating Hyperplane  (OSH)。 (以上均為向量) 以與 Optimal Separating Hyperplane平行,並且最靠近兩邊的超平面( Support Hyperplane   )來求解。以上圖的例子來說,那兩條虛線就是 Support Hyperplane。 將Support Hyperplane 寫成如下的式子:  因為變數過多,讓等號兩邊同乘常數使δ =1 , 並定義Separating Hyperplane與兩個Support Hyperplane的距離為d,兩個Separating Hyperplan之間的距離margin 是2d,以下計算距離d: (備註:參考兩平行線求距離之公式)  Support Hyperplan與Optimal Separating Hyperplane的距離在±1以內(我們已經先做過尺度調整),所以我們將限制條件寫成下面兩個式子: 限定條件的關係,上面的最佳化問題可以利用Lagrange Multiplier Method將上面的式子轉成一個二次方程式,找出可以使L為最小值的w, b, αi。(αi就是Lagrange Multiplier) 分別對變數 W 、b偏微分後,加上限制條件供三...

資料科學從頭學(三)加快速度

(文章內容皆為記錄本人之學習過程,非以分享為目的) Udemy 4 門資料科學相關課程(總時數  93.5 小時)全聽完有點太慢, 為了快速開始進行研究主題,必須再大幅縮短資學習時間 , 因此先挑選   Course3. Data Science and Machine Learning with Python - Hands On (9 Hours) 先把常用的機器學習演算法看過一遍,並且 將演算法分類後 挑選出第一階段要實作的演算法, 分類參考文章: https://unsupervisedmethods.com/cheat-sheet-of-machine-learning-and-python-and-math-cheat-sheets-a4afe4e791b6 以下是我個人初步分類的準則: • Purpose • Data characteristic • Most popular • Speed demanded • Accuracy  demanded 其中速度和精準度目前我還沒有足夠知識去評估,因此先跳過。 以上準則各別為: Purpose : • Classification • Prediction value • Discovering structure ( Clustering ) • Finding relationship • Dimension reduction  • Special purpose ( EX : Image recognition ) 分類參考文章: https://unsupervisedmethods.com/cheat-sheet-of-machine-learning-and-python-and-math-cheat-sheets-a4afe4e791b6 Data characteristic : • Have answer or not • Type : Numeral 、 String 、 Boolean 、 Time Series 、 Space 、 Text 、 O...

資料科學從頭學(二)初學.Udemy 4門初學課程

圖片
(文章內容皆為記錄本人之學習過程,非以分享為目的) 一、目標:           7 、 8 月完成 Udemy 4 門資料科學相關課程,總時數 93.5 小時。 二、做法:           7 月份完成課程一遍, 8 月份挑出不熟與需要加強的地方精進。         7 月份平均每周 23.4 小時,等於每天 4.6 小時 ( 五天 ) + 2 小時以上練習。         ( google calendar 紀錄課程與累積時數 ) 三、原則:         每堂課邊看邊分類出  1. 基礎 : 一定要懂、 2. 八月份精進精進名單、 3.有概念 就好 四、課程內容: Course1. Data Science A-Z : Real-Life Data Science Exercises (21 Hours) This course will give you a full overview of the Data Science journey. Upon completing this course you will know: How to clean and prepare your data for analysis How to perform basic visualisation of your data How to model your data How to curve-fit your data And finally, how to present your findings and wow the audience In this course you will develop a good understanding of the following tools: SQL SSIS Tableau Gretl 重點: ...