作者yccjy (生命很美因为你们)
看板Statistics
标题Re: [问题] R的scatter plot
时间Sat Oct 4 10:02:58 2008
※ 引述《yccjy (生命很美因为你们)》之铭言:
: ※ 引述《yccjy (生命很美因为你们)》之铭言:
: : 请教一下大家
: : R的scatter plot 一个小圆圈是不是不只代表一笔资料呢?
: : 我的资料数是200 用R跑两个变项的scatterplot
: : 却只出现35个小圆圈
: : 不知道是我的script写错了 还是这是正常现象
: : 可以麻烦各位强者指点一下吗?
: ed711data <- read.table("C://Documents and Settings/ed711data.dat",header=T)
: scireg<-lm(gpa~Ef) #produces simple linear model
: plot(Ef,gpa) # provides scatterplot
: 这是我打的指令
: 应该只有最後一行跟scatterplot有关系吧?
: 不知道问题出在哪里
: 先感谢愿意指教的强者喔!
抱歉之前的资料叙述不够清楚
两个变项分别是Ef(努力程度,由某量表得到的分数)
以及GPA(学业平均成绩)
想看Ef是不是可以预测学业成绩
之前的指令 为了节省版面 把一些东西删掉了
以下是完整指令
ed711data <- read.table("C://Documents and Settings/ed711data.dat",header=T)
summary(ed711data) # provides summary statistics
cor(ed711data) # provides correlation matrix
attach(ed711data) # Generally a good idea to add this line
scireg<-lm(gpa~Ef)
#produces simple linear model
plot(Ef,gpa) # provides scatterplot
abline(Ef,gpa) # Adds the estimated regression line
不过我大概知道为什麽跑出来的点只有几十个了
应该是因为资料性质根本不适合用这个图呈现:
这里的两个变项都是discrete variable
(GPA通常是连续变项 但是这边的GPA被转化成非连续变项)
两个变项的排列组合 总共只有45个可能
所以我想 应该是因为有很多资料完全重叠了 所以从图上看到的点远小於资料数(200)
如果这个想法有错 还请大家指证
没有错的话 虽然是自己犯的很初阶的错误 还是留在板上
希望如果有跟我一样的初学者也遇到一样的问题 可以有个参考
抱歉占用大家的版面 感谢大家的指教
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 24.196.80.18
※ 编辑: yccjy 来自: 24.196.80.18 (10/04 10:07)
1F:→ lin15:恩...这样就可以跑了 你说的应该是对的 10/05 17:35
2F:→ yccjy:感谢楼上的帮忙! 10/06 05:18