R_handbook_基本函数

1 导入数据

复制代码
# 导入数据
setwd("E:\\FOR_Study\\Daniel_File\\about_Study\\Junior\\Data_Science\\Data")
load("ch2_sample.RData")

# 文件名读入
data <- read.table("v6.csv", header = T, sep = ",")

2 数据离散化

复制代码
# 连续数据离散化
brks <-c (-1, -0.01, 2000, 6000, 10000, 20000, 50000, Inf)
labels <- c("Missing", "0-2000", "2000-6000", "6000-10000",
            "10000-20000", "20000-50000", "above 50000")
dpus$WAGP.fix <- cut(dpus$WAGP.fix, breaks=brks, labels, include.lowest=T)

x <- table(cut(HExer, c(-Inf, 7, 10, Inf)))

# 按条件筛选记录
data <- subset(data,with(data,(bmi>=10)&(bmi<=133)&(age>=18)&(age<=150)
                         &(glucose_max<=900)&(data$glucose_min<=900)
                         &(tempc_min>=30)&(ph_min>=6)))

3 数据集划分

复制代码
# 单次划分
set.seed(128767)
custdata_fix$gp <- runif(dim(custdata_fix)[1])
train_set <- subset(custdata_fix,custdata_fix$gp <= 0.9)
test_set <- subset(custdata_fix,custdata_fix$gp > 0.9)

4 常用函数

复制代码
# ROC评价指标
library('ROCR')
calcAUC <-function(predcol,outcol) {
  perf <-performance(prediction(predcol,outcol==pos),'auc')
  as.numeric(perf@y.values)
}

# 最大似然指标
loglikelihood<-function(y, py) {    
  pysmooth<-ifelse(py==0, 1e-12, ifelse(py==1, 1-1e-12, py))
  sum(y * log(pysmooth) + (1-y)*log(1 -pysmooth))   
}

# 常见指标封装
accuracyMeasures<-function(pred, truth, name="model",value) {   
  dev.norm<--2*loglikelihood(as.numeric(truth), pred)/length(pred)
  ctable<-table(truth==1,pred=(pred>value))
  accuracy <-sum(diag(ctable))/sum(ctable)
  precision <-ctable[2,2]/sum(ctable[,2])
  recall <-ctable[2,2]/sum(ctable[2,])
  f1 <-2*precision*recall/(precision+recall)
  data.frame(model=name, accuracy=accuracy,precision=precision,recall=recall, f1=f1, dev.norm)  
}

# roc曲线
library(ggplot2)
plotROC<-function(predcol,outcol) {
  perf<-performance(prediction(predcol,outcol==pos),'tpr','fpr')
  pf<-data.frame(
    FalsePositiveRate=perf@x.values[[1]],
    TruePositiveRate=perf@y.values[[1]])
  ggplot() + geom_line(data=pf,aes(x=FalsePositiveRate,y=TruePositiveRate)) +
    geom_line(aes(x=c(0,1),y=c(0,1)))
}

5 which函数

which能够帮助定位索引号,如返回当前列表中最大值对应的索引。

复制代码
country[which(prob_age2030_god == max(prob_age2030_god))] 

如找列名对应的索引

复制代码
which(names(data) == 'v225') 

6 group by函数

复制代码
planes <- group_by(data_select, Market)
Market_category <- summarise(planes,         
                              sum_sales = sum(Sales),
                              sum_quantity = sum(Quantity),
                              sum_profit = sum(Profit))     #求和
Market_category
相关推荐
Sylvia33.22 分钟前
LOL实时数据接入深度解析:从WebSocket到完整数据模型
java·网络·python·websocket·网络协议
梦想不只是梦与想23 分钟前
Web 服务器网关协议:ASGI 和 WSGI
服务器·python·fastapi
ai小陈3 小时前
PyTorch DataLoader数据加载性能排查:GPU利用率低的实操指南
人工智能·pytorch·python·深度学习·ai·gpu算力
2601_962299245 小时前
Azure python操作系统列表
python·操作系统·azure·虚拟机·存储配置文件
2601_962071576 小时前
【Java报错已解决】org.springframework.beans.factory.BeanCreationException
java·开发语言
学术 学术 Fun6 小时前
如何用 API 与 Webhook 批量把图表图片转换成 VSDX
python·自动化·api·visio
淡海水7 小时前
07-04-并发-ConcurrentBag-T-工作窃取WorkStealing算法
开发语言·算法·c#·bag·concurrent·workstealing
2601_962100547 小时前
python包和模块的内容整理
python·模块·导入·虚拟环境·
CS_Zero7 小时前
C语言sizeof是函数吗?
c语言·开发语言
二进制漫游记7 小时前
FastAPI项目集成 Qdrant向量数据库+阿里云Embedding完整实战(工具封装+业务调用)
数据库·python·阿里云·embedding