首页 > 编程语言 >算法金 | 统计学的回归和机器学习中的回归有什么差别?

算法金 | 统计学的回归和机器学习中的回归有什么差别?

时间:2024-06-22 22:46:03浏览次数:25  
标签:因变量 回归 统计学 算法 线性 数据 模型


大侠幸会,在下全网同名「算法金」 0 基础转 AI 上岸,多个算法赛 Top 「日更万日,让更多人享受智能乐趣」

统计学中的回归

  1. 目标:
  • 主要用于解释和推断自变量(independent variables)和因变量(dependent variables)之间的关系。
  • 强调模型的解释性,了解各个自变量对因变量的影响。
  • 假设:
  • 假设数据符合特定统计假设,如正态分布、独立性和同方差性。
  • 需要满足严格的模型假设。
  • 模型复杂性:
  • 通常使用简单模型,如线性回归。
  • 模型形式固定,主要是线性或加性模型。
  • 数据量:
  • 通常处理较小的数据集。
  • 评估方法:
  • 强调参数的显著性检验(significance tests)。
  • 使用 R 平方((R^2))和 P 值(P-value)等统计指标。

机器学习中的回归

  1. 目标:
  • 主要用于预测,关注模型的预测性能。
  • 更关注模型的泛化能力(generalization ability),即在新数据上的表现。
  • 假设:
  • 对数据分布和模型形式的假设较少。
  • 灵活性更大,不需要满足严格的统计假设。
  • 模型复杂性:
  • 使用复杂模型,如决策树回归(decision tree regression)、随机森林回归(random forest regression)、支持向量回归(support vector regression)和神经网络(neural networks)等。
  • 模型可以是非线性的,适应复杂数据模式。
  • 数据量:
  • 通常处理大规模的数据集。
  • 评估方法:
  • 使用交叉验证(cross-validation)等方法评估模型性能。
  • 强调预测误差,如均方误差(Mean Squared Error, MSE)和均绝对误差(Mean Absolute Error, MAE)。

总结

  • 统计学中的回归:用于解释和推断变量之间的关系,假设严格,模型简单,适用于小数据集。重点在于理解数据和变量关系,模型解释性强。
  • 机器学习中的回归:用于预测和优化,假设少,模型复杂,适用于大数据集。重点在于提高模型的预测性能,模型灵活性高。

图示解释

  1. 统计学中的线性回归:
  • 图示:数据点分布在图上,一条直线(回归线)穿过数据点,显示自变量与因变量之间的线性关系。
  • 解读:这条直线表示最小二乘法(Least Squares Method)拟合出的最佳线性关系,用于解释 (X) 和 (Y) 之间的关系。
  • 机器学习中的非线性回归:
  • 图示:数据点分布在图上,一条曲线穿过数据点,显示自变量与因变量之间的复杂非线性关系。
  • 解读:这条曲线可能是通过复杂模型(如决策树、神经网络)拟合出的,显示出自变量和因变量之间更复杂的模式和关系。

这两者的差别主要体现在模型的目标、假设、复杂性、数据量和评估方法上,各有其应用场景和优势。

统计学中的回归主要强调模型的解释性和简洁性,因此通常采用简单的线性模型。下面是一些具体原因:

假设和解释性

  1. 解释性:
  • 统计学中的回归模型强调解释变量对因变量的影响。
  • 线性回归模型的系数具有明确的解释意义,可以直接说明每个自变量对因变量的线性贡献。
  • 简洁性:
  • 线性模型较为简单,易于理解和解释。
  • 在变量关系相对简单的情况下,线性模型能有效地捕捉主要趋势。
  • 假设检验:
  • 统计学中的回归依赖于一定的假设,如正态分布、独立性和同方差性。
  • 这些假设在简单的线性模型中更容易满足和检验。

数据量和计算复杂度

  1. 数据量:
  • 统计学方法通常用于较小的数据集。
  • 简单模型在小数据集上表现更好,因为复杂模型容易过拟合。
  • 计算复杂度:
  • 线性回归计算简单,适用于快速分析和建模。
  • 非线性模型(如决策树)计算复杂度较高,训练和预测时间更长。

过拟合和泛化能力

  1. 过拟合:
  • 复杂模型(如右图的决策树回归)容易过拟合,即在训练数据上表现很好,但在新数据上表现不佳。
  • 线性模型的简单性有助于避免过拟合,提升模型的泛化能力。

应用场景

  1. 应用场景:
  • 统计学中的回归主要用于变量关系的探索和解释,如社会科学和经济学研究。
  • 在这些领域,理解变量间的关系和影响是主要目标,而不是追求复杂模型的预测性能。

图示解读

  1. 统计学中的线性回归(左图):
  • 适用于数据关系较简单、主要目标是解释和推断的场景。
  • 线性回归线展示了自变量和因变量之间的线性关系,便于解释。
  • 机器学习中的决策树回归(右图):
  • 适用于数据关系复杂、主要目标是预测和优化的场景。
  • 决策树回归曲线展示了自变量和因变量之间的复杂非线性关系,但解释性较差。

[ 抱个拳,总个结 ]

统计学中的回归更关注模型的简洁性和解释性,适用于变量关系较为简单、数据量较小的场景。因此,通常采用线性回归模型。而机器学习中的回归更多用于预测复杂关系,模型复杂性更高,适用于大数据集和需要高预测性能的应用。- 科研为国分忧,创新与民造福 -

日更时间紧任务急,难免有疏漏之处,还请大侠海涵 内容仅供学习交流之用,部分素材来自网络,侵联删

[ 算法金,碎碎念 ]

全网同名,日更万日,让更多人享受智能乐趣

如果觉得内容有价值,烦请大侠多多 分享、在看、点赞,助力算法金又猛又持久、很黄很 BL 的日更下去;

同时邀请大侠 关注、星标 算法金,围观日更万日,助你功力大增、笑傲江湖

标签:因变量,回归,统计学,算法,线性,数据,模型
From: https://www.cnblogs.com/suanfajin/p/18262815

相关文章

  • 基于鲸鱼优化的knn分类特征选择算法matlab仿真
    1.程序功能描述       基于鲸鱼优化的KNN分类特征选择算法。使用鲸鱼优化算法,选择最佳的特征,进行KNN分类,从而提高KNN分类的精度。 2.测试软件版本以及运行结果展示MATLAB2022a版本运行    3.核心程序  %---开始迭代-------------------------------......
  • x-s、x-t、x-s-common、x-b3-traceid 签名算法分析记录(2024/6/20)
    【作者主页】:小鱼神1024【擅长领域】:JS逆向、小程序逆向、AST还原、验证码突防、Python开发、浏览器插件开发、React前端开发、NestJS后端开发等等【学习交流】:知识星球:https://t.zsxq.com/gkn0r;vx:studypy1024本文章中所有内容仅供学习交流使用,不用于其他任何目的,不提......
  • AcWing算法基础课笔记——求组合数1
    求组合数Ⅰ10万组数据,1≤b≤a≤2000......
  • C++ STL容器操作:6种常用场景算法
    C++STL容器操作:6种常用场景算法    •   引言   •   概述   •   查找与计数   ▪   std::find   ▪   std::find_if   ▪   std::find_if_not   ▪   std::find_end   ▪   std::find_first_of......
  • C语言程序设计-2 程序的灵魂—算法
    【例2.1】求1×2×3×4×5。最原始方法:步骤1:先求1×2,得到结果2。步骤2:将步骤1得到的乘积2乘以3,得到结果6。步骤3:将6再乘以4,得24。步骤4:将24再乘以5,得120。这样的算法虽然正确,但太繁。改进的算法:S1:使t=1S2:使i=2S3:使t×i,乘积仍然......
  • 十大经典排序算法——插入排序与希尔排序(超详解)
    一、插入排序1.基本思想直接插入排序是一种简单的插入排序法,基本思想是:把待排序的记录按其数值的大小逐个插入到一个已经排好序的有序序列中,直到所有的记录插入完为止,得到一个新的有序序列。2.直接插入排序当插入第end+1 个元素时,前面的arr[0],arr[1],... ,arr[end]已经......
  • 【离散数学·算法】(复习)
    一、1.算法的属性:1.输入。2.输出。3.正确性。4.有穷性(有限步数)。5.有效性(有限时间内正确执行每个步骤)。6.泛化性。2.指定算法:可用语言or伪代码来描述二、三类问题1.搜索问题:(1)线性搜索:从头到尾一个一个检查。(2) 二分搜索:(假设排列是按递增顺序的)(找到:返回位置;......
  • 基于BP神经网络的64QAM解调算法matlab性能仿真
    1.算法运行效果图预览  2.算法运行软件版本MATLAB2022A 3.部分核心程序%第一部分:加载并可视化数据%loaddata.matreal1=[-7-7-7-7-7-7-7-7-5-5-5-5-5-5-5-5...-1-1-1-1-1-1-1-1-3-3-3-3-3-3-3-3...+7+7......
  • 【球类识别系统】图像识别Python+卷积神经网络算法+人工智能+深度学习+TensorFlow
    一、介绍球类识别系统,本系统使用Python作为主要编程语言,基于TensorFlow搭建ResNet50卷积神经网络算法模型,通过收集'美式足球','棒球','篮球','台球','保龄球','板球','足球','高尔夫球','曲棍球','冰球','橄榄球',&#......
  • 【球类识别系统】图像识别Python+卷积神经网络算法+人工智能+深度学习+TensorFlow
    一、介绍球类识别系统,本系统使用Python作为主要编程语言,基于TensorFlow搭建ResNet50卷积神经网络算法模型,通过收集‘美式足球’,‘棒球’,‘篮球’,‘台球’,‘保龄球’,‘板球’,‘足球’,‘高尔夫球’,‘曲棍球’,‘冰球’,‘橄榄球’,‘羽毛球’,‘乒乓球......