作者question18 (晡)
看板Statistics
標題[問題] 請問logistic reg.當自變數樣本數差很多會有影響嗎
時間Tue May 13 12:31:56 2008
小弟使用SPSS 的logistic regression 來區分
對於某物 感覺好與感覺差的兩個等級 (用應變數代表)
我的自變數有三到四個變數
但是 sample數量為 ~ 感覺好有 45個 : 感覺不好 15個
兩個的差異造成 logistic regression 之後
似乎因為sample數量差異大的關係
classify 結果全部都分到感覺好的類別,感覺不好的都miss classify到感覺好的去了
也就是 感覺好 classifiy correct percentage = 100% (45/45)
感覺不好 classifiy correct percentage = 0 % (0/15)
雖總分類準確度極高(都分到好的等級了)
但這樣應該代表logistic regression equation 區分不開兩種等級吧!!??
請教問題
Q: logistic regression 會因為應變數sample 數量差異,導致學習效果不好的情形嗎?
這種情形在統計裡叫什麼呢 (要寫論文用的)
Q: 是不是該刪減感覺好的sample 到15個左右 讓應變數 sample 約 1:1 會比較好呢
因為我若改刪減後 好:不好 = 15 : 15 samples 的情形 學習出來的
logistic regression equation 可以區分出兩個等級,且miss classify 會比較均勻
分布在兩個等級上
也就是 感覺好 classifiy correct percentage = 66% (10/15)
感覺不好 classifiy correct percentage = 60% (9/15)
這樣是不是代表區分效果比較好?
此外 想問問 logistic regression 的效果除了看分類準確度,還能看什麼呢?
--
※ 發信站: 批踢踢實業坊(ptt.cc)
◆ From: 140.116.164.183
※ 編輯: question18 來自: 140.116.164.183 (05/13 12:33)
※ 編輯: question18 來自: 140.116.164.183 (05/14 13:00)