R再也不用愁变量太多跑回归太麻烦！R语言循环常用方法总结

OStack程序员社区-中国程序员成长平台 › 门户 › 编程› R语言›R语言教程

原作者: [db:作者] 来自: [db:来源] 收藏邀请

在高维数据分析过程中，为了筛选出与目标结局相关的变量，通常会用到回归分析，但是因为自变量较多，往往要进行多次回归。这就是统计编程语言发挥作用的时候了

有些大神们认为超过3次的复制粘贴就可以考虑使用循环了，当然个人“承受能力较强”，在分析过程中还是经常会用复制粘贴来解决相当一部分的问题。但是当变量太多需要多次复制粘贴，并且还要对不同的过程设置不同的编号真的太麻烦了。比如有100个X，就要命名100个模型，从fit1到fit100，显然可操作性太差了。

所以循环必须派上用场，接下来将总结一下在R中使用循环来进行回归分析的几个常用方法。

我们以R自带的state.x77数据集为例进行介绍。由于原始数据集是矩阵，先转变成数据框，再以一个简单的名字命名。数据结构如下：

行代表50个不同的州，列是8个不同的变量：Population：人口数；Income：收入；Illiteracy：文盲率（百分比）；Life Exp：期望寿命；Murder：凶杀案发生率（每10万人）；HS Grad：高中毕业率；Frost：气温低于冰冻的天数；Area：每平方英里的陆地面积。

我们以凶杀案发生率（Murder）为因变量，看哪些因素跟案件发生率有关。

1.根据变量所在的列号进行循环

开始循环之前先建立一个空的向量result1用以在循环过程中储存提取的结果。

模型中states[,i]表示逐个选择states数据框的第1-4个变量，进行线性回归分析。

coef(summary(fit))[2,c(1,2,4)]用以提取目标变量回归分析结果的beta，SE，和p值。提取之后通过colnames(states)[i]加上相应变量的变量名。最后在循环过程中通过rbind将结果合并在一个数据框result1中，结果如下：

可以通过write.csv()等函数将结果输出到本地文件夹中。

这种循环方法适用于变量在数据框中是连续排列的。

2.根据变量名进行循环

如果目标变量在数据框中不是连续的，可以使用这个方法，先建立一个目标变量名的向量，然后在回归方程中加上substitute函数，分别将提前建立的变量名替换到方程中，建立变量名的循环。