アットウィキロゴ

OLS002

1.仙台市のデータ

http://www.city.sendai.jp/kikaku/seisaku/toukei/toukeijihou/special_edition/215/sp2/h_3.html

a <- read.table("sendai2001-2.csv",sep=",",skip=1);x
b <- a[,2]#消費支出
c <- a[,3]#うち食糧費
d <- a[,4]#うち家賃・地代
b;c;d;ans1=lm(c~.,data = data.frame(b,c,d))
print(ans1)

1-2.

par(mfrow=c(2,2),oma = c(1,1,2,1),mar = c(4, 4, 2, 1))
plot(ans1,pch=21,bg=2,col=2,cex=1.5)

結果・・・www23.atwiki.jp/waseda2bun_r

(1)

残差とフィット値の散布図である。ここで言うフィット値は予測値である。

図の横軸が予測値、縦軸が残差となっている。図から残差の全体像を概観することができる。

(2)

正規Q-Qプロットはデータの正規性を考察するためにデータを視覚化する方法である。Rでは関数qqplotを用いてQ-Qプロットを作成することができる。データが正規分布に従うと、点が直線上に並べられる。通常の回帰分析では、残差が標準正規分布に従うという仮定の下で行っている。7は標準化した残差のQ-Qプロットである

 

(3)

標準化した残差の絶対値の平和根を縦軸にし、予測値を横軸とした散布図である。この図の目的も残差の変動状況を考察することである。

(4)

Cookの距離は一種の距離の測度であり、Rには関数cooks.distanceが用意されている。Cookの距離は回帰分析における影響度が大きいデータの検出などに多く用いられている。Cookの距離は全てデータ用いた場合と1つのデータを除いた後求めた回帰式による予測値を用いた場合との食い違いに関する距離の測度である。Cookの距離が大きいとそのデータが回帰式による予測値に大きく影響していることを意味する。よって、Cookの距離が大きいデータは異常値である可能性がある。Cookの距離が0.5以上であれば大きいと言われている。

以上:http://mjin.doshisha.ac.jp/R/13.htmlより抜粋


 上記の図の場合

(1) 1,6,7が相対的に大きい。

(2)図は標準化した残差のQ-Qプロットである。ここで用いた例では標本データの数が少ないのでその正規性に関する議論には大きな意味がない。

(3)図から1710の変動が相対的に大きいことが読みとられる。


 

2.体形データ

参考:ttp://www.statistics.co.jp/reference/R/statR_5_reg.pdf

result1 <- lm(体重~身長,data=taikei)
result2 <- lm(体重~身長+ウエスト,data=taikei)
summary(result1);summary(result2)

 結果

2-1 summary(result1);

Call:
lm(formula = 体重 ~ 身長, data = taikei)

Residuals:
   Min     1Q Median     3Q    Max
-8.018 -4.542  1.359  3.269  9.634

Coefficients:
             Estimate Std. Error t value Pr(>|t|)    
(Intercept) -209.9296    45.8064  -4.583 0.001322 **
身長           1.6078     0.2661   6.041 0.000193 ***
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 6.033 on 9 degrees of freedom
Multiple R-squared: 0.8022,     Adjusted R-squared: 0.7802
F-statistic: 36.49 on 1 and 9 DF,  p-value: 0.0001926
 
体重=1.68*身長 -209.9296

決定係数: 0.8022,     
自由度修正済み: 0.7802

決定係数の分析
F-statistic: 36.49 on 1 and 9 DF
p-value: 0.0001926

残さ

   Min     1Q Median     3Q    Max
-8.018 -4.542  1.359  3.269  9.634

2-2.  summary(result2)

Call:
lm(formula = 体重 ~ 身長 + ウエスト, data = taikei)

Residuals:
    Min      1Q  Median      3Q     Max
-1.4666 -0.7947  0.0716  0.5300  2.3601

Coefficients:
              Estimate Std. Error t value Pr(>|t|)   
(Intercept) -146.61156   10.56750  -13.87 7.05e-07 ***
身長           0.89233    0.07528   11.85 2.35e-06 ***
ウエスト       0.80890    0.05742   14.09 6.26e-07 ***
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 1.26 on 8 degrees of freedom
Multiple R-squared: 0.9923,     Adjusted R-squared: 0.9904
F-statistic: 517.8 on 2 and 8 DF,  p-value: 3.454e-09

 

 
体重 = 0.8933*身長 +0.8089*ウエスト -146.61156
決定係数: 0.9923     
自由度修正済み: 0.9904

決定係数の分析
F-statistic: 517.8 on 2 and 8 DF
p-value: 3.454e-09

回帰係数が偶然0とすると…
3.454*{10^-9}位に起きる事象


残さ

    Min      1Q  Median      3Q     Max
-1.4666 -0.7947  0.0716  0.5300  2.3601

 2-3

par(mfrow=c(2,2),oma = c(1,1,2,1),mar = c(4, 4, 2, 1))
plot(result1,pch=21,bg=2,col=2,cex=1.5)

par(mfrow=c(2,2),oma = c(1,1,2,1),mar = c(4, 4, 2, 1))
plot(result2,pch=21,bg=2,col=2,cex=1.5)

 結果(result1)・・・www23.atwiki.jp/waseda2bun_r

結果(result2)・・・www23.atwiki.jp/waseda2bun_r

 

 

 

 

最終更新:2010年08月22日 03:09