首页 > 其他分享 >【视频】R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险|数据分享|附代码数据

【视频】R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险|数据分享|附代码数据

时间:2024-05-11 22:52:28浏览次数:23  
标签:语言 逻辑 预测 回归 Logistic 数据 模型 决策树

原文链接:http://tecdat.cn/?p=22410 

最近我们被客户要求撰写关于逻辑回归的研究报告,包括一些图形和统计输出。

本文介绍了逻辑回归并在R语言中用逻辑回归(Logistic回归)模型分类预测病人冠心病风险数据

逻辑回归是机器学习借用的另一种统计分析方法。当我们的因变量是二分或二元时使用它。

它只是表示一个只有 2 个输出的变量,例如,预测抛硬币(正面/反面)的情况。结果是二进制的:如果硬币是正面,则为 1,如果硬币为反面,则为 0。这种回归技术类似于线性回归,可用于预测分类问题的概率。

图片

为什么我们使用逻辑回归而不是线性回归?

我们现在知道它仅在我们的因变量是二元的而在线性回归中该因变量是连续时使用。

现在,如果我们使用线性回归来找到旨在最小化预测值和实际值之间距离的最佳拟合线,这条线将是这样的:

这里的阈值为 0.5,这意味着如果 h(x) 的值大于 0.5,则我们预测为恶性肿瘤(1),如果小于 0.5,则我们预测为良性肿瘤(0)。

图片

这里一切似乎都很好,但现在让我们稍微改变一下,我们在数据集中添加一些异常值,现在这条最佳拟合线将移动到该点。像这样:

你看到这里有什么问题吗?蓝线代表新阈值,此处可能为 0.2。为了保持我们的预测正确,我们不得不降低我们的阈值。因此,我们可以说线性回归容易出现异常值。现在如果预测值大于 0.2,那么只有这个回归会给出正确的输出。

线性回归的另一个问题是预测值可能超出范围。我们知道概率可以在 0 和 1 之间,但是如果我们使用线性回归,这个概率可能会超过 1 或低于 0。

图片

Sigmoid函数

为此,我们最好有一个函数将任何实际值映射到 0 和 1 之间的区间内的值。您一定想知道逻辑回归如何将线性回归的输出压缩在 0 和 1 之间。

Sigmoid 函数是一种数学函数,用于将预测值映射到概率。该函数能够将任何实际值映射到 0 和 1 范围内的另一个值。 

规则是逻辑回归的值必须在 0 和 1 之间。由于它不能超过值 1 的限制,在图形上它会形成一条“S”形的曲线。这是识别 Sigmoid 函数或逻辑函数的简单方法。

关于逻辑回归,使用的概念是阈值。阈值有助于定义 0 或 1 的概率。例如,高于阈值的值趋于 1,低于阈值的值趋于 0。

这就是所谓的 sigmoid 函数,它是这样定义的:

最远离 0 的 x值 映射到接近 0 或接近 1 的 y值。x接近 0 的值  将是我们算法中概率的一个很好的近似值。然后我们可以选择一个阈值并将概率转换为 0 或 1 预测。

Sigmoid 是逻辑回归的激活函数。

图片

 

成本函数

成本函数是用于计算误差的数学公式,它是我们的预测值和实际值之间的差异。它只是衡量模型在估计 x 和 y 之间关系的能力方面的错误程度。当我们考虑成本函数时,首先想到的是经典的平方误差函数。 

m  - 示例数,

x(i)  - 第i个示例 的特征向量 ,

y(i)  - 第i个示例 的实际值 ,

θ   - 参数向量。 

 

图片

如果我们有一个线性激活函数h θ (x) 那就没问题了。但是使用我们的新 sigmoid 函数,我们没有平方误差的正二阶导数。这意味着它是非凸函数。我们不想陷入局部最优,因此我们定义了一个新的成本函数: 

这称为交叉熵成本。如果您仔细观察,您可能会注意到,当预测值接近实际值时,0 和 1 实际值的成本都将接近于零。

 

图片

让我们看看当 y=1 和 y=0 时成本函数的图形是什么

这里的蓝线代表1类(y=1),代价函数的右项会消失。现在,如果预测概率接近 1,那么我们的损失会更小,当概率接近 0 时,我们的损失函数会达到无穷大。

红线代表 0 类(y=0),左项将在我们的成本函数中消失,如果预测概率接近 0,那么我们的损失函数会更小,但如果我们的概率接近 1,那么我们的损失函数会达到无穷大。

此成本函数也称为对数损失。它还确保随着正确答案的概率最大化,错误答案的概率最小化。此成本函数的值越低,精度越高。

图片

如果我们结合这两个图,我们将得到一个只有 1 个局部最小值的凸图,现在在这里使用梯度下降很容易。

梯度下降优化

我们将尝试了解如何利用梯度下降来计算最小成本。

梯度下降以这样一种方式改变我们的权重值,它总是收敛到最小点,或者我们也可以说,它旨在找到最小化模型损失函数的最优权重。它是一种迭代方法,通过计算随机点的斜率然后沿相反方向移动来找到函数的最小值。

图片

R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险

本文的目的是完成一个逻辑回归分析。使你对分析步骤和思维过程有一个基本概念。

   
library(tidyverse)
library(broom)

这些数据来自一项正在进行的对镇居民的心血管研究  查看文末了解数据获取方式  。其目的是预测一个病人是否有未来10年的冠心病风险。该数据集包括以下内容。

  • 男性:0=女性;1=男性
  • 年龄。
  • 教育。1 = 高中以下;2 = 高中;3 = 大学或职业学校;4 = 大学以上
  • 当前是否吸烟。0=不吸烟;1=吸烟者
  • cigsPerDay: 每天抽的烟数量(估计平均)。
  • BPMeds: 0 = 不服用降压药;1 = 正在服用降压药
  • 中风。0 = 家族史中不存在中风;1 = 家族史中存在中风
  • 高血压。0 =高血压在家族史上不流行;1 =高血压在家族史上流行
  • 糖尿病:0 = 没有;1 = 有
  • totChol: 总胆固醇(mgdL)
  • sysBP: 收缩压(mmHg)
  • diaBP: 舒张压(mmHg)
  • BMI: 体重指数
  • 心率
  • 葡萄糖:总葡萄糖mgdL
  • TenYearCHD: 0 = 患者没有未来10年冠心病的风险; 1 = 患者有未来10年冠心病的风险

加载并准备数据

   
read_csv("fraingha") %>%
  drop_na() %>% #删除具有缺失值的观察值
  ageCent = age - mean(age), 
  totCholCent = totChol - mean(totChol),

拟合逻辑回归模型

   
glm(TenYearCHD ~ age +  Smoker +  CholCent, 
              data = data, family = binomial)

图片

预测

对于新病人

   
 data_frame(ageCent = (60 - 49.552), 
                 totCholCent = (263 - 236.848),

图片

预测对数几率

   
predict(risk_m, x0)

图片

预测概率

图片

根据这个概率,你是否认为这个病人在未来10年内有患冠心病的高风险?为什么?

   
risk

图片

混淆矩阵

   
risk_m %>%
  group_by(TenYearCHD, risk_predict) %>%
  kable(format="markdown")

图片

   
mutate( predict = if_else(.fitted > threshold, "1: Yes", "0: No"))

图片

有多大比例的观察结果被错误分类?
依靠混淆矩阵来评估模型的准确性有什么缺点?

ROC曲线

   
ggplot(risk_m_aug, 
  oc(n.cuts = 10, labelround = 3) + 
  geom_abline(intercept = 0) +

图片

   
auc(roc )$AUC

图片

一位医生计划使用你的模型的结果来帮助选择病人参加一个新的心脏病预防计划。她问你哪个阈值最适合为这个项目选择病人。根据ROC曲线,你会向医生推荐哪个阈值?为什么?


点击标题查阅往期内容

图片

R语言逻辑回归(Logistic Regression)、回归决策树、随机森林信用卡违约分析信贷数据集

图片

左右滑动查看更多

图片

01

图片

02

图片

03

图片

04

图片

假设

为什么我们不绘制原始残差?

   
ggplot(data = risk aes(x = .fitted, y = .resid)) +
  labs(x = "预测值", y = "原始残差")

图片

分级的残差图

   
 plot(x =  fitted, y =  resid,
                xlab = "预测概率", 
                main = "分级后的残值与预测值的对比",

图片

图片

图片

   
## # A tibble: 2 x 2
##   currentSmoker mean_resid
##   <fct>              <dbl>
## 1 0              -2.95e-14
## 2 1              -2.42e-14

检查假设:

  • 线性?- 随机性?- 独立性?

系数的推断

currentSmoker1的测试统计量是如何计算的?
在统计学上,totalCholCent是否是预测一个人患冠心病高风险的重要因素?
用检验统计量和P值来证明你的答案。
用置信区间说明你的答案。

偏离偏差检验

   
 glm(TenYearCHD ~ ageCent + currentSmoker + totChol, 
              data = heart_data, family = binomial)

图片

   
anova

图片

AIC

图片

根据偏离偏差检验,你会选择哪个模型?
基于AIC,你会选择哪个模型?

使用step逐步回归选择模型

   
step(full_model )

图片

图片

   
  kable(format = "markdown" )

图片

图片


图片

点击文末 “阅读原文”

获取全文完整资料。

本文选自《R语言逻辑回归(Logistic回归)模型分类预测病人冠心病风险》。

点击标题查阅往期内容

R语言逻辑回归Logistic回归分析预测股票涨跌
matlab用马尔可夫链蒙特卡罗 (MCMC) 的Logistic逻辑回归模型分析汽车实验数据
R语言逻辑回归、Naive Bayes贝叶斯、决策树、随机森林算法预测心脏病
R语言逻辑回归(Logistic Regression)、回归决策树、随机森林信用卡违约分析信贷数据集PYTHON用户流失数据挖掘:建立逻辑回归、XGBOOST、随机森林、决策树、支持向量机、朴素贝叶斯和KMEANS聚类用户画像
Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
PYTHON集成机器学习:用ADABOOST、决策树、逻辑回归集成模型分类和回归和网格搜索超参数优化
R语言集成模型:提升树boosting、随机森林、约束最小二乘法加权平均模型融合分析时间序列数据
Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
R语言用主成分PCA、 逻辑回归、决策树、随机森林分析心脏病数据并高维可视化
R语言基于树的方法:决策树,随机森林,Bagging,增强树
R语言用逻辑回归、决策树和随机森林对信贷数据集进行分类预测
spss modeler用决策树神经网络预测ST的股票
R语言中使用线性模型、回归决策树自动组合特征因子水平
R语言中自编基尼系数的CART回归决策树的实现
R语言用rle,svm和rpart决策树进行时间序列预测
python在Scikit-learn中用决策树和随机森林预测NBA获胜者
python中使用scikit-learn和pandas决策树进行iris鸢尾花数据分类建模和交叉验证
R语言里的非线性模型:多项式回归、局部样条、平滑样条、 广义相加模型GAM分析
R语言用标准最小二乘OLS,广义相加模型GAM ,样条函数进行逻辑回归LOGISTIC分类
R语言ISLR工资数据进行多项式回归和样条回归分析
R语言中的多项式回归、局部回归、核平滑和平滑样条回归模型
R语言用泊松Poisson回归、GAM样条曲线模型预测骑自行车者的数量
R语言分位数回归、GAM样条曲线、指数平滑和SARIMA对电力负荷时间序列预测R语言样条曲线、决策树、Adaboost、梯度提升(GBM)算法进行回归、分类和动态可视化
如何用R语言在机器学习中建立集成模型?
R语言ARMA-EGARCH模型、集成预测算法对SPX实际波动率进行预测在python 深度学习Keras中计算神经网络集成模型R语言ARIMA集成模型预测时间序列分析R语言基于Bagging分类的逻辑回归(Logistic Regression)、决策树、森林分析心脏病患者
R语言基于树的方法:决策树,随机森林,Bagging,增强树
R语言基于Bootstrap的线性回归预测置信区间估计方法
R语言使用bootstrap和增量法计算广义线性模型(GLM)预测置信区间
R语言样条曲线、决策树、Adaboost、梯度提升(GBM)算法进行回归、分类和动态可视化
Python对商店数据进行lstm和xgboost销售量时间序列建模预测分析
R语言随机森林RandomForest、逻辑回归Logisitc预测心脏病数据和可视化分析
R语言用主成分PCA、 逻辑回归、决策树、随机森林分析心脏病数据并高维可视化
Matlab建立SVM,KNN和朴素贝叶斯模型分类绘制ROC曲线
matlab使用分位数随机森林(QRF)回归树检测异常值

标签:语言,逻辑,预测,回归,Logistic,数据,模型,决策树
From: https://www.cnblogs.com/tecdat/p/18187317

相关文章

  • 数据结构学习笔记-递归求解森林高度
    森林的高度递归求解问题描述:设计算法求解森林的高度【算法设计思想】两个函数,一个用于计算单个二叉树的高度,另一个用于计算二叉树森林(即一组二叉树)的最大高度。下面是对两个函数的详细解释:1.treeHeight函数这个函数用于计算单个二叉树的高度。二叉树的高度定义为从根节点到......
  • 小小Redis数据类型,拿捏
    面试遇到过的Redis问题Redis的数据类型怎么利用Redis解决超卖问题1.什么是RedisRedis就是一个非关系型数据库(NoSQL),我们知道关系型数据库MySQL,在MySQL里我们对于数据的增删改查需要SQL语句(select*from...),麻不麻烦——麻烦,慢不慢——当然是慢的,因为数据是存在硬盘上的,......
  • SQL SERVER 数据库清空语句 忽略外键 触发器 等(转载)
    有时候我们想清空SQLServer中所有表的数据,但是由于有外键约束和触发器,有时候清表语句无法执行,下面的语句可以关掉和开启一个数据库中的所有外键约束和触发器,以便执行清表语句:USEClothesShopEXECUTEsp_MSForEachTable'ALTERTABLE?NOCHECKCONSTRAINTALL'EXECUTEsp_MS......
  • excel异步导出-通用-仅限单组数据导出
     支持单组数据(List<T>)异步导出,比如1000条数据,可以按100条数据一个sheet的形式,去异步写入10个sheet中,每个sheet有100条数据createPageExcel方法是通过HttpServletResponse直接响应给前端createPageExcelUrl是生成一个File,然后上传到OSS,获取到Url返回给前端,此方法中有redis和os......
  • 【YashanDB知识库】ycm托管数据库时,数据库非OM安装无法托管
    问题现象ps-ef|grepyas查看无yasom和yasagent进程,且在{数据库安装目录}/om/{数据库名称}的目录下没有conf、data、log等目录,确定数据库不是用yasboot安装,是用脚本安装的问题的风险及影响非yasboot安装,ycm无法完成托管,无法监控问题影响的版本不涉及ycm的版本问题问题发......
  • 通义灵码企业版正式发布,满足企业私域知识检索、数据合规、统一管理等需求
    5月9日阿里云AI峰会,阿里云智能集团首席技术官周靖人宣布,通义灵码企业版正式发布,满足企业用户的定制化需求,帮助企业提升研发效率。通义灵码是国内用户规模第一的智能编码助手,基于SOTA水准的通义千问代码模型Code-Qwen1.5研发,插件下载量已超350万。通义灵码熟练掌握J......
  • 通义灵码企业版正式发布,满足企业私域知识检索、数据合规、统一管理等需求
    5月9日阿里云AI峰会,阿里云智能集团首席技术官周靖人宣布,通义灵码企业版正式发布,满足企业用户的定制化需求,帮助企业提升研发效率。通义灵码是国内用户规模第一的智能编码助手,基于SOTA水准的通义千问代码模型Code-Qwen1.5研发,插件下载量已超350万。通义灵码熟练掌握J......
  • 基于PG开发数据库中出现PSQLException: 错误,无法确定参数$1的数据类型
    问题描述在开发接口适配瀚高数据库时,出现此错误:同样的xml文件在达梦、金仓、Mysql中使用模糊查询时未发现错误;...likeconcat('%',#{name},'%')后经排查与数据库连接中:jdbc:highgo://.../test?stringtype=unspecified存在联系。加入``是为了避免ERROR:columnisofty......
  • Agile PLM数据库表结构(Oracle)
    刚进公司,任务是接管PLM系统,但是还在给外包团队开发,没有代码。无妨先看业务和数据库,ok,业务看不懂,只能先看数据库,数据库没有数据字典,这个系统没有任何文档产出......练手时发现数据库类型是Oracle,面对百度不成问题,数据字典只能看前端然后去数据库里面一个个找着对应自己整理了,纯折磨......
  • 无线通信模块通过TCP/IP协议实现与PC端的数据传输
    在当今的信息时代,无线通信技术的发展日新月异,为我们的工作和生活带来了极大的便利。其中,无线通信模块通过TCP/IP协议向PC端传送数据已经成为了一种常见的通信方式。本文将详细介绍这一过程的主要步骤和涉及的关键技术,并以WIFI模块为例,探讨如何在QT平台下实现数据的无线传输。一、......