基于spss的多元回归分析模型选取的研究毕业论文1.doc
《基于spss的多元回归分析模型选取的研究毕业论文1.doc》由会员分享,可在线阅读,更多相关《基于spss的多元回归分析模型选取的研究毕业论文1.doc(31页珍藏版)》请在三一办公上搜索。
1、 毕 业 论 文题 目 基于SPSS的多元回归分析模型选取的研究 院 (系) 数学与统计学院 专业年级 2010级统计学 学生姓名 殷婷 学号 2010101217 指导教师 安军 职称 副教授 日 期 2014-4-22 基于SPSS的多元回归分析模型选取的研究 数学与统计学院 殷婷 2010101217摘 要 本文不仅对于复杂的统计计算通过常用的计算机应用软件SPSS来实现,同时通过对两组数据的实证分析,来研究统计学中多元回归分析中的变量选取,让大家对统计学中的多元回归分析中模型的选取以及变量的选取和操作方法有更深层次的了解. 一组数据是对于淘宝交易额的未来发展趋势的研究,一组数据时对于我
2、国财政收入的研究. 本文通过两个实证淘宝交易额研究和财政收入研究从不同程度上对非线性回归模型和变量选取的研究运用通俗的语言和浅显的描述将SPSS在多元回归分析中的统计分析方法呈现在大家面前,让大家对多元回归分析以及SPSS软件都可以有更深一步的了解. 通过SPSS软件对数据进行分析,对数据进行处理的方法进行总结,找出SPSS对于数据处理和分析的优缺点,最后得在对变量的选取和软件的操作提出建议. 关键词:统计学,SPSS,变量的选取,多元回归分析 AbstractThis article not only for complex statistical calculations done by
3、the commonly used computer application software of SPSS, through the empirical analysis of the two groups of data at the same time, to study the statistics of the variables in the multivariate regression analysis, let everybody in the multiple regression analysis of statistical model selection as we
4、ll as the selection of variables and operation methods have a deeper understanding. Is a set of data for the future development trend of research taobao transactions, a set of data for the research of our countrys fiscal revenue. In this paper, through two empirical taobao transactions and fiscal re
5、venue research from different degree of the study of nonlinear regression model and variable selection using a common language and plain the SPSS statistical analysis method in multiple regression analysis of present in front of everyone, let everyone to multiple regression analysis and SPSS softwar
6、e can have a deeper understanding. Through SPSS software to analyze data, and summarizes method of data processing, find out the advantages and disadvantages of SPSS for data processing and analysis, finally had to put forward the proposal to the operation of the selection of variables and software.
7、 Keywords: Statistical, SPSS, The selection of variables, multiple regression analysis 目 录摘 要1Abstract1引 言3第一章 多元回归模型的选取41.1 回归分析的概述41.1.1 回归分析的概念及主要内容41.1.2 回归分析研究的问题及应用51.2 相关系数的概述51.3 非线性回归模型的概述61.4 多元线性回归模型自变量的选择6第二章 非线性回归模型案例:淘宝交易额模型的研究72.1 回归模型变量的确定72.1.1 数据的来源72.1.2 复相关系数82.1.3 散点图看线性关系92.1.4
8、 回归分析看拟合度122.1.5 确定回归模型变量122.2 调整后的变量的相关分析122.2.1 散点图122.2.2 计算相关系数142.3 多元线性回归分析172.4 小结18第三章 变量选取案例:财政收入模型的研究193.1 数据的来源及变量的选取193.2 相关分析203.2.1 散点图203.2.2 计算相关系数223.3 回归分析253.4 逐步回归263.5 小结28第四章 总结28参考文献30引 言随着社会的发展,统计的运用范围越来越广泛,统计学作为高等院校经济类专业和工商管理类专业的核心课程,不管是在经济管理领域,或是在军事、医学等领域的研究中对于数量分析与统计分析都需要更
9、高的要求,需要用到的数学知识较多,应用方面的灵活性也较强,计算量大且复杂.然而科学研究的深入,研究的对象也日益变得复杂,复杂系统的研究问题更是成为当今研究的热点. 为了更好的描述一个复杂的现象,就需要大量的数据和信息,如何高效、准确地利用已知的信息便成为当今社会研究的一项重要课题. 在科学技术飞速发展的今天,统计学通过不断吸收和融合相关学科的新理论,开发应用新技术和新方法,拓展新的领域的同时不断深化和丰富了统计学传统领域的理论与方法. 在我国,社会主义市场经济体制的逐步建立,实践发展的需要对统计学提出了新的更多、更高的要求. 随着我国社会主义市场经济的成长和不断完善,统计学的潜在功能将得到更充
10、分更完满的开掘. 从20世纪60年代开始,关于回归自变量的选择成为统计学中研究的热点问题,统计学家提出了许多回归选元的准则,并提出了许多行之有效的选元方法. 在应用回归分析去处理实际问题时,回归自变量选择是首先要解决的重要问题. 通常在做回归分析时,人们根据所研究问题的目的,结合经济理论罗列出对因变量可能有影响的的一些因素作为自变量引进回归模型,把一些对因变量影响很小的,有些甚至是没有影响的自变量,不但使得计算量变大,估计和预测的精度也下降了. 此外,如果遗漏了某些重要变量,回归方程的效果肯定不好. SPSS软件作为当今国际上运用广泛的统计分析软件,其功能齐全带有各种特点,在各个领域内都得到了
11、迅速普及,并成为各个行业提高管理水平、形成科学决策的重要手段. 然而,我国对于该软件的运用和理解始终处于早期应用阶段,无论是在功能的研究开发还是实际生活当中的运用都与西方发达国家相差甚远. 尤其是在管理决策方面,都因为没有进行深度分析而造成了浪费,要么就是利用SPSS软件进行简单分析而未进行深度开发,导致所得的信息有限、各信息间的关系不明确,最终导致管理者的判断出现偏差.基于以上背景,本文通过总结和吸取其他国内外学者对统计学研究的,并结合我国的实际情况,本文采用了案例一对于网络购物这块的的研究,通过对2005年到2012年的居民消费水平,以及我国网络普及度,我国人人均纯收入以及我国的居民消费水
12、平对淘宝网的未来发展趋势进行非线性回归模型的研究以及案例二对于我国财政收入的进行变量选取研究,通过对1992年到2012年的人均国内生产总值,城镇居民家庭人均可支配收入,全社会固定投资,进出口总额,居民消费价格水平对我国财政收入的影响进行定量数据的研究. 通过对数据的选取,回归模型的确定以及软件的操作方法来告知读者如何在SPSS的操作中变量选取的原则、要求和方法. 第一章 多元回归模型的选取1.1 回归分析的概述1.1.1回归分析的概念及主要内容回归分析是确定两种或两种以上变数间相互依赖的定量关系的一种统计分析方法(即寻找具有相关关系的变量减的数学表达式并进行统计推断的一种统计方法). 1)运
13、用十分广泛,按照其所涉及的自变量,可分为一元回归分析和多元回归分析;2)线性回归分析和非线性回归分析是按照自变量和因变量之间的关系划分的.一元线性回归分析是指一个自变量与一个因变量之间的线性关系可以用一条近似直线来表示. 而本文运用了多元线性回归分析中的方法,多元线性回归分析就是指回归分析中包括两个或两个以上的自变量,且因变量和自变量之间是线性关系. 多元回归分析的主要内容为:1)从一组数据出发,确定某些变量之间的定量关系式,即建立数学模型并估计其中的未知参数. 估计参数的常用方法是最小二乘法. 2)对这些关系式的可信程度进行检验. 3)在许多自变量共同影响着一个因变量的关系中,判断哪些自变量
14、的影响是显著的,哪些自变量的影响是不显著的,将影响显著的自变量选入模型中,而剔除影响不显著的变量,通常用逐步回归等方法. 4)利用所求的关系式对某一生产过程进行预测或控制. 在回归分析中,把变量分为两类. 因变量和自变量,因变量是实际问题中所关心的一类指标,通常用表示;而影响因变量取值的变量叫自变量,常用来表示. 1.1.2回归分析研究的主要问题及应用 回归分析研究的主要有如下四个问题:(1)确定与间的定量关系表达式,这种表达式称为回归方程;(2)对求得的回归方程的可信度进行检验;(3)判断自变量对因变量有无影响;(4)利用所求得的回归方程进行预测和控制. 回归分析主要应用于研究两个变量之间到
15、底是哪个变量受哪个变量的影响,影响程度如何,通过分析现象之间相关的具体形式,确定其因果关系,并用数学模型来表现其具体关系,并根据实测数据来求解模型的各个参数,然后评价回归模型是否能够很好的拟合实测数据;如果能够很好的拟合,则可以根据自变量作进一步预测.1.2 相关系数的概述相关关系是一种非确定性的关系,相关系数是研究变量之间线性相关程度的量. 相关关系是现象间客观存在的,但数值又是不严格及不完全确定的相互依存关系. 1)复相关系数 在一元回归分析中我们用相关系数来说明两变量之间线性相关的程度,在多元回归分析中,仍用它来表示与其他自变量之间的线性密切程度,此为复相关系数. 复相关是指因变量与多个
16、自变量之间的相关关系. 复相关系数只是反映变量间表面的非本质的联系,因为变量很有可能受到其他变量的影响. 2)偏相关系数在多变量的情况下,变量之间的相关系数是相当复杂的. 任意两个变量之间都有可能存在着相关关系,因此,只知道被解释变量与解释变量的总的相关程度是不够的. 如果需要了解某两个变量间的相关程度,就应在消除其他变量影响的情况下来计算他们的相关系数,这就是偏相关系数. 偏相关系数与复相关系数不同,复相关系数的取值在0-1之间,而偏相关系数则是有正有负,所以复相关系数与偏相关系数之间也有可能相差很大. 变量之间本存在错综复杂的关系,甚至可能使得符号也相反,但是偏相关系数才是变现变量之间的本
17、质联系的. 偏相关的主要用途:偏相关主要是用来研究自变量与因变量之间的关系的,其通过得到的自变量与因变量数据来进行计算,通过偏相关系数可以看出哪些自变量对因变量的影响更大一些,同时对于偏相关系数较小的变量,可以剔除. 1.3 非线性回归模型的概述非线性回归模型是指在众多的现象中,分析变量之间的关系时不符合解释变量线性和参数线性的一种模型.在实际的经济活动中,经济变量的关系是相当复杂的,直接表示为线性关系的情况也并不多见.但大多数的非线性关系是可以通过一些简单的数学处理,使之转化为线性关系,从而通过线性回归来进行计算.而非线性回归模型又分为可化为线性模型的非线性回归模型和不可化为线性模型的非线性
18、回归模型.本文研究的是可转化为线性模型的非线性回归模型,而可转化为线性模型的非线性回归模型又有好几种方法可以对变量进行转换.其有以下几种模型:1) 多项式函数模型对于形如: ,的模型为多项式模型.令 ,原模型可化为线性形式 ,那么就可以用多元线性回归分析的方法进行处理了.2) 指数函数模型对于形如: ,的模型为指数函数模型. 令 ,原模型可化为线性形式 ,那么就可以用多元线性回归分析的方法进行处理了.3) 双曲线模型;4) 半对数模型和双对数模型等.本文将对指数函数型非线性模型进行案例说明,所以对于其他类型的非线性回归模型的道理是一致的,在这里就不进行一一解释.1.4 多元线性回归模型自变量的
19、选择在多元线性回归模型中自变量的选择实质上就是模型的选择. 现设一切可供选择的变量是个 ,它们组成的回归模型称为全模型(记:),在获得组观测数据后,我们有模型: , 其中:是的观测值,是未知参数向量,是结构矩阵,并假定的秩为. 现从这个变量中选变量,不妨设,那么对全模型中的参数和结构矩阵可作如下的分块(记:): , .我们称下面的回归模型为选模型: ,其中:是的观测值,是未知参数向量, 是结构矩阵,并假定的秩为.自变量的选择可以看成是这样的两个问题,一是究竟是用全模型还是用选模型,二是若用选模型,则究竟应包含多少变量最适合. 然而自变量的选择与相关系数,回归分析都有密切的关系,自变量的选择需要
20、通过一系列的验证,剔除之后才能得到最好的变量从而得到最好的回归模型. 下面我们用两个案例来对多元回归模型的选取来进行解释和探讨.第二章 非线性回归模型案例:淘宝交易额研究2.1 回归模型变量的确定 2.1.1数据的来源 为研究淘宝网未来发展趋势,从新浪官方微博淘宝数据魔方中获得淘宝2009年聚划算中购物群众的年龄比例作为定性数据,进行研究年龄对淘宝购物的影响. 并在新浪财经网上获得淘宝网自2003年到2012年的淘宝交易额以及淘宝注册人数的数据. 在中商情报局里获得我国近网络普及度等数据并从国家统计年鉴中选取统计指标居民消费水平. 淘宝注册人数()在一定程度上反应了网络购物的群众的人数,反应了
21、当今社会网络购物的普遍性. 同时淘宝的注册人数也展现了人们对网络购物的认可度,换言之也就是说接受了网络购物并会在网上进行消费,是对网络购物很大程度上的支持. 我国网络普及度()是指我国近几年网络在我国普及的范围,这一块更好的反映了网络对居民网络消费的影响,因为网络是网络消费的必要条件. 我国网络普及度反映的是在我国日趋发展的经济下,人们对网络的接受程以及信任程度也是直接影响到淘宝的网络购物. 居民消费水平()主要通过消费的物质产品和劳务的数量和质量来反映. 居民消费水平的提高也能很好的展现在网络消费上作出的贡献. 第二产业增加值()是指采矿业,制造业,电力、煤气及水的生产和供应业,建筑业. 而
22、制造业的发展也相继影响着产品的销售,所以在这里采用第二产业对淘宝交易额的影响. 通过对以上这三个定量数据的研究来其与淘宝交易额的关系,从而研究淘宝未来的发展趋势以及优劣态. 原始数据如下:表2.1为消除数据之间因单位不同产生的量纲的影响,对数据进行标准化得如下数据得到表2.2:表2.22.1.2 复相关系数对表2.2 的数据进行复相关系数的研究,看变量之间的复相关关系,得到如下表2.3的复相关系数表: 表2.3 解析:表2.3中有带“*”号的结果表明有关的两变量在0.01的显著性水平下显著相关,由上图可知,与的相关系数为0.9870,表示变量之间存在线性关系,其相关系数检验对应的概率P值为0.
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 基于 spss 多元 回归 分析 模型 选取 研究 毕业论文
链接地址:https://www.31ppt.com/p-4022376.html