返回顶部
首页 > 资讯 > 后端开发 > 其他教程 >R语言中的五种常用统计分析方法
  • 225
分享到

R语言中的五种常用统计分析方法

2024-04-02 19:04:59 225人浏览 泡泡鱼
摘要

1、分组分析aggregation 根据分组字段,将分析对象划分为不同的部分,以进行对比分析各组之间差异性的一种分析方法。 常用统计指标: 计数 length 求和 sum 平均值

1、分组分析aggregation

根据分组字段,将分析对象划分为不同的部分,以进行对比分析各组之间差异性的一种分析方法。

常用统计指标:

计数 length

求和 sum

平均值 mean

标准差 var

方差 sd

分组统计函数

aggregate(分组表达式,data=需要分组的数据框,function=统计函数)

参数说明

fORMula:分组表达式,格式:统计列~分组列1+分组列2+...

data=需要分组的数据框

function:统计函数


aggregate(name ~ class, data=data, FUN=length);
#求和
aggregate(score ~ class, data=data, FUN=sum);
#均值
aggregate(score ~ class, data=data, FUN=mean);
#方差
aggregate(score ~ class, data=data, FUN=var);
#标准差
aggregate(score ~ class, data=data, FUN=sd)

2、分布分析cut

根据分析目的,将数据(定量数据)进行等距或者不等距的分组,进行研究各组分布规律的一种分析方法。

分组函数


cut(data,breaks,labels,right)

参数说明

data=需要分组的一列数据

breaks=分组条件,如果是一个数字,那么将平均分组;如果是一个数组,那么将按照指定范围分组

labels:分组标签

right:指定范围是否右闭合,默认为右闭合,right参数为TRUE


用户明细 <- read.csv('data.csv', stringsAsFactors=FALSE)
head(用户明细)
 
breaks <- c(min(用户明细$年龄)-1, 20, 30, 40, max(用户明细$年龄)+1)
 
年龄分组 <- cut(用户明细$年龄, breaks = breaks)
用户明细[, '年龄分组1'] <- 年龄分组
 
年龄分组 <- cut(用户明细$年龄, breaks = breaks, right = FALSE)
用户明细[, '年龄分组2'] <- 年龄分组
 
labels <- c('20岁以及以下', '21岁到30岁', '31岁到40岁', '41岁以上');
年龄分组 <- cut(用户明细$年龄, breaks = breaks, labels = labels)
用户明细[, '年龄分组'] <- 年龄分组
 
head(用户明细)
 
aggregate(formula=用户ID ~ 年龄分组, data=用户明细, FUN=length)

3、交叉分析tapply(相当于excel里的数据透视表)

通常用于分析两个或两个以上,分组变量之间的关系,以交叉表形式进行变量间关系的对比分析;

交叉分析的原理就是从数据的不同维度,综合进行分组细分,以进一步了解数据的构成、分布特征。

交叉分析函数:

tapply(统计向量,list(数据透视表中的行,数据透视变中的列),FUN=统计函数)

返回值说明:

一个table类型的统计量

breaks <- c(min(用户明细$年龄)-1, 20, 30, 40, max(用户明细$年龄)+1)


labels <- c('20岁以及以下', '21岁到30岁', '31岁到40岁', '41岁以上');
年龄分组 <- cut(用户明细$年龄, breaks = breaks, labels = labels)
用户明细[, '年龄分组'] <- 年龄分组
 
head(用户明细)
 
tapply(用户明细$用户ID, list(用户明细$年龄分组, 用户明细$性别), FUN=length)

4、结构分析prop.table

是在分组的基础上,计算各组成部分所占的比重,进而分析总体内部特征的一种分析方法。

for example:资产占有率就是一个非常经典的运用

统计占比函数


prop.table(table,margin=NULL)

参数说明:

table,使用tapply函数统计得到的分组计数或求和结果

margin,占比统计方式,具体参数如下:

属性 注释

1 按行统计占比

2 按列统计占比

NULL 按整体统计占比


data <- read.csv('data.csv', stringsAsFactors=FALSE);

head(data)
 
t <- tapply(data$月消费.元., list(data$通信品牌), sum)
t
prop.table(t);
 
t <- tapply(data$月消费.元., list(data$通信品牌), mean)
t
prop.table(t);
 
t <- tapply(data$月消费.元., list(data$省份, data$通信品牌), sum)
t
prop.table(t, margin = 2)

5、相关分析prop.table

是研究现象之间是否存在某种依存关系,并对具体有依存关系的现象探讨其相关方向以及相关程度,是研究随机变量之间的相关关系的一种统计方法。

相关系数r 可以用来描述定量变量之间的关系

相关分析函数:

cor(向量1,向量2,...)返回值:table类型的统计量


data <- read.csv('data.csv', fileEncoding = "UTF-8");
 
cor(data[, 2:7])

补充:R中基本统计分析方法整理

面对一大堆的数据,往往会让人眼花缭乱。但是只要使用一些简单图形和运算,就可以了解数据更多的特征。R提供了很多关于数据描述的函数,通过这些函数可以对数据进行一个简单地初步分析。

获取描述性统计量的R函数

(1)常用统计函数(参数x为向量)

mean(x):平均值

median(x):中位数

sd(x):标准差

var(x):方差

sum(x):求和

min(x):最小值

max(x):最大值

range(x):值域

......等等

(2)summary()函数

提供最小值、下四分位数、中位数、平均值、上四分位数、最大值。

(3)apply()或sapply函数

计算参数指定的任意描述性统计量。

其中sapply()用法:sapply(x,FUNC,options) ,x是待处理的数据框,FUNC是用户指定的函数,如sum()、max()、mean()等等,指定了的options会传递给FUNC。

(4) Hmisc包中的describe()函数

返回变量和观测值的数目、缺失值和唯一值的数目、平均值、分位数、五个最大的值和五个最小的值。

(5)pastecs包中的stat.desc()函数

可以计算种类繁多的描述性统计量

(6)psych包也提供了一个describe()函数

它可以计算非缺失值的数量、平均数、标准差、中位数、截尾均值、绝对中位差、最小值、最大值、值域、偏度、峰度等。

以上为个人经验,希望能给大家一个参考,也希望大家多多支持编程网。如有错误或未考虑完全的地方,望不吝赐教。

--结束END--

本文标题: R语言中的五种常用统计分析方法

本文链接: https://lsjlt.com/news/124138.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com    QQ/279061341

猜你喜欢
  • R语言中的五种常用统计分析方法
    1、分组分析aggregation 根据分组字段,将分析对象划分为不同的部分,以进行对比分析各组之间差异性的一种分析方法。 常用统计指标: 计数 length 求和 sum 平均值 ...
    99+
    2024-04-02
  • R语言中有哪些统计分析方法
    这篇文章将为大家详细讲解有关R语言中有哪些统计分析方法,文章内容质量较高,因此小编分享给大家做个参考,希望大家阅读完这篇文章后对相关知识有一定的了解。什么是R语言R语言是用于统计分析、绘图的语言和操作环境,属于GNU系统的一个自由、免费、源...
    99+
    2023-06-14
  • 基于R语言中的各种更新方法分享
    宏包的更新 卸载package remove.packages("mypackage") 查看的version R.version 或者 getRversion() ...
    99+
    2024-04-02
  • R语言常用两种并行方法之parallel详解
    目录并行计算在模拟时什么地方可以用到并行?怎么在R中看我们可以使用并行?parallel(简单)由于最近在进行一些论文的模拟,所以尝试了两种并行的方法:parallel与snowfa...
    99+
    2024-04-02
  • R语言常用两种并行方法之snowfall详解
    上一篇博客(R中两种常用并行方法之parallel)中已经介绍了R中常见的一种并行包:parallel,其有着简单便捷等优势,其实缺点也是非常明显,就是很不稳定。很多时候我们将大量的...
    99+
    2024-04-02
  • R语言的Dataframe常用操作方法
    这篇文章主要讲解了“R语言的Dataframe常用操作方法”,文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习“R语言的Dataframe常用操作方法”吧!上节我们简单介绍了Dataframe的定义...
    99+
    2023-06-20
  • R语言统计结果输出至本地文件的几种方法示例
    1.sink() 在代码开始前加一行:sink(“output.txt”),就会自动把结果全部输出到工作文件夹下的output.txt文本文档。这时在R控制台的输出窗口中是看不到输出...
    99+
    2024-04-02
  • R语言中的MongoDB的示例分析
    今天就跟大家聊聊有关R语言中的MongoDB的示例分析,可能很多人都不太了解,为了让大家更加了解,小编给大家总结了以下内容,希望大家根据这篇文章可以有所收获。R利剑MongeDB,分为4个章节。MongoD...
    99+
    2024-04-02
  • r语言数据分析的实现方法是什么
    R语言是一种功能强大的编程语言和环境,特别适用于数据分析。以下是R语言实现数据分析的一般方法:1. 数据导入:使用R语言中的函数从各...
    99+
    2023-09-15
    r语言
  • R语言空间数据分析的方法是什么
    R语言可以使用许多方法来进行空间数据分析,包括但不限于: 空间数据可视化:R中提供了许多绘图包,如ggplot2、leaflet...
    99+
    2024-04-30
    R语言
  • R语言基础统计方法图文实例讲解
    tidyr > tdata <- data.frame(names=rownames(tdata),tdata)行名作为第一列 > gather(tdata...
    99+
    2024-04-02
  • 分享Go语言的常用的五大IDE
      Go是一种简单可靠的编程语言。其稳固的结构和强大的类,有助于它发展成为各种开发人员的稳定和流行的语言。在你的日常编程中,会用到哪些Go语言的IDE一起来看看Go的前5大IDE。  LiteIDE  LiteIDE是一个简单的开源IDE。...
    99+
    2023-06-02
  • R语言中Fisher判别的使用方法
    最近编写了Fisher判别的相关代码时,需要与已有软件比照结果以确定自己代码的正确性,于是找到了安装方便且免费的R。这里把R中进行Fisher判别的方法记录下来。 1. 判别分析与F...
    99+
    2024-04-02
  • mysql中insert语句的五种用法
    文章目录 前言一、values参数后单行插入二、values参数后多行插入三、搭配select插入数据四、复制旧表的信息到新表五、搭配set插入数据总结 前言 insert语句是标准sq...
    99+
    2023-09-02
    mysql 数据库 sql
  • R语言中Rcpp类型List的示例分析
    这篇文章主要为大家展示了“R语言中Rcpp类型List的示例分析”,内容简而易懂,条理清晰,希望能够帮助大家解决疑惑,下面让小编带领大家一起研究并学习一下“R语言中Rcpp类型List的示例分析”这篇文章吧。当我们想将 Rcpp 中的多种类...
    99+
    2023-06-25
  • R语言中向量加法和乘法运算的示例分析
    这篇文章给大家分享的是有关R语言中向量加法和乘法运算的示例分析的内容。小编觉得挺实用的,因此分享给大家做个参考,一起跟随小编过来看看吧。在R语言中,不同长度的向量也是可以相加和相乘的,乘法的规则和加法类似1,相同长度的向量相加>&nb...
    99+
    2023-06-14
  • r语言异常值处理的方法是什么
    在R语言中,可以使用以下方法来处理异常值:1. 箱线图(boxplot):使用箱线图可以直观地识别异常值。可以使用`boxplot(...
    99+
    2023-09-14
    r语言
  • R语言中data.frame的常用操作总结
    前言:近段时间学习R语言用到最多的数据格式就是data.frame,现对data.frame常用操作进行总结,其中函数大部分来自dplyr包,该包由Hadley Wickham所作,...
    99+
    2024-04-02
  • 如何分析Go语言中的方法
    如何分析Go语言中的方法,相信很多没有经验的人对此束手无策,为此本文总结了问题出现的原因和解决方法,通过这篇文章希望你能解决这个问题。概念在golang中的方法是作用在特定类型的变量上,因此自定义类型都是可...
    99+
    2024-04-02
  • 使用R语言与多元线性回归分析计算的示例
    这篇文章主要为大家展示了“使用R语言与多元线性回归分析计算的示例”,内容简而易懂,条理清晰,希望能够帮助大家解决疑惑,下面让小编带领大家一起研究并学习一下“使用R语言与多元线性回归分析计算的示例”这篇文章吧。计算实例例 6.9 某大型牙膏制...
    99+
    2023-06-20
软考高级职称资格查询
编程网,编程工程师的家园,是目前国内优秀的开源技术社区之一,形成了由开源软件库、代码分享、资讯、协作翻译、讨论区和博客等几大频道内容,为IT开发者提供了一个发现、使用、并交流开源技术的平台。
  • 官方手机版

  • 微信公众号

  • 商务合作