机器学习——多元梯度下降法

2023年6月15日上午4:59 • 人工智能 • 阅读 88

一、多维特征模型

目前为止，我们探讨了单变量/特征的回归模型（参考机器学习专栏中前面的文章），现在我们对房价模型增加更多的特征，例如房间数楼层等，构成一个含有多个变量的模型，模型中的特征为( x 1 , x 2 , . . . , x n ) \left( {x_{1}},{x_{2}},…,{x_{n}} \right)(x 1 ,x 2 ,…,x n )。

增添更多特征后，我们引入一系列新的注释：

n n n 代表特征的数量
x ( i ) {x^{\left( i \right)}}x (i )代表第i i i 个训练实例，是特征矩阵中的第i i i行，是一个向量（ vector）。
比方说，上图的
x ( 2 ) = [ 1416 3 2 40 ] {x}^{(2)}\text{=}\begin{bmatrix} 1416\\ 3\\ 2\\ 40 \end{bmatrix}x (2 )=⎣⎡1416 3 2 40 ⎦⎤，
x j ( i ) {x}{j}^{\left( i \right)}x j (i )代表特征矩阵中第i i i 行的第j j j 个特征，也就是第i i i 个训练实例的第j j j 个特征。
如上图的x 2 ( 2 ) = 3 , x 3 ( 2 ) = 2 x{2}^{\left( 2 \right)}=3,x_{3}^{\left( 2 \right)}=2 x 2 (2 )=3 ,x 3 (2 )=2，
支持多变量的假设h h h 表示为：h θ ( x ) = θ 0 + θ 1 x 1 + θ 2 x 2 + . . . + θ n x n h_{\theta}\left( x \right)={\theta_{0}}+{\theta_{1}}{x_{1}}+{\theta_{2}}{x_{2}}+…+{\theta_{n}}{x_{n}}h θ(x )=θ0 +θ1 x 1 +θ2 x 2 +…+θn x n ，
这个公式中有n + 1 n+1 n +1个参数和n n n个变量，为了使得公式能够简化一些，引入x 0 = 1 x_{0}=1 x 0 =1，则公式转化为：h θ ( x ) = θ 0 x 0 + θ 1 x 1 + θ 2 x 2 + . . . + θ n x n h_{\theta} \left( x \right)={\theta_{0}}{x_{0}}+{\theta_{1}}{x_{1}}+{\theta_{2}}{x_{2}}+…+{\theta_{n}}{x_{n}}h θ(x )=θ0 x 0 +θ1 x 1 +θ2 x 2 +…+θn x n

此时模型中的参数是一个n + 1 n+1 n +1维的向量，任何一个训练实例也都是n + 1 n+1 n +1维的向量，特征矩阵X X X的维度是 m ∗ ( n + 1 ) m*(n+1)m ∗(n +1 )。因此公式可以简化为：h θ ( x ) = θ T X h_{\theta} \left( x \right)={\theta^{T}}X h θ(x )=θT X，其中上标T T T代表矩阵转置。

; 二、多元梯度下降

与单变量线性回归类似，参考单变量梯度下降。在多变量线性回归中，我们也构建一个代价函数，则这个代价函数是所有建模误差的平方和，即：

我们的目标和单变量线性回归问题中一样，是要找出使得代价函数最小的一系列参数。多变量线性回归的批量梯度下降算法为：

即：

求导数后得到：

当n>=1时，

我们开始随机选择一系列的参数值，计算所有的预测结果后，再给所有的参数一个新的值，如此循环直到收敛。

; 三、特征放缩

在我们面对多维特征问题的时候，我们要保证这些特征都具有相近的尺度，这将帮助梯度下降算法更快地收敛。

以房价问题为例，假设我们使用两个特征，房屋的尺寸和房间的数量，尺寸的值为 0-2000平方英尺，而房间数量的值则是0-5，以两个参数分别为横纵坐标，绘制代价函数的等高线图能，看出图像会显得很扁，梯度下降算法需要非常多次的迭代才能收敛。

解决的方法是尝试将所有特征的尺度都尽量缩放到-1到1之间。如图：
机器学习——多元梯度下降法

最简单的方法是令：x n = x n − μ n s n {{x}{n}}=\frac{{{x}{n}}-{{\mu}{n}}}{{{s}{n}}}x n =s n x n −μn ，其中 μ n {\mu_{n}}μn 是平均值，s n {s_{n}}s n 是标准差。
s n {s_{n}}s n 简单表达就是特征的取值范围的大小，即最大值-最小值。

四、学习率

梯度下降算法收敛所需要的迭代次数根据模型的不同而不同，我们不能提前预知，我们可以绘制迭代次数和代价函数的图表来观测算法在何时趋于收敛。

在上图中，纵轴表示J 代价函数，横轴是执行梯度算法的迭代次数。通过这种曲线图可以来判断梯度下降算法是否已经收敛。
也有一些自动测试是否收敛的方法，例如将代价函数的变化值与某个阀值（例如0.001）进行比较，但通常看上面这样的图表更好。

上面这种图还可以告诉你算法有没有正常工作。

如果我们得到的曲线图中，代价函数J 随迭代步数的变化曲线是不断上升的，这就表明梯度算法没有正常工作，这通常意味着应该使用较小的学习率 α 。
机器学习——多元梯度下降法

如果代价函数J 随迭代步数的变化曲线是上升和下降不断交错的，这也意味着我们应该使用较小的学习率 α 。
综上，梯度下降算法的每次迭代受到学习率的影响，如果学习率a a a过小，则达到收敛所需的迭代次数会非常高；如果学习率a a a过大，每次迭代可能不会减小代价函数，可能会越过局部最小值导致无法收敛。

通常可以考虑尝试些学习率：
α = 0.01 ， 0.03 ， 0.1 ， 0.3 ， 1 ， 3 ， 10 \alpha=0.01，0.03，0.1，0.3，1，3，10 α=0.01 ，0.03 ，0.1 ，0.3 ，1 ，3 ，10

这篇文章是我学习吴恩达机器学习记录的一些笔记，有问题欢迎大家指出。

Original: https://blog.csdn.net/Luo_LA/article/details/127376182
Author: Luo_LA
Title: 机器学习——多元梯度下降法

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/613755/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

TensorFlow 删除 YAML 支持，建议 JSON 作为替补方案！

TensorFlow，作为一个主流的开源 Python 库，最初由 Google 开发用于机器学习领域，逐渐成为 GitHub 顶级开源 TOP 10 项目之一。近日，Googl…

人工智能 2023年5月26日
0095
基于OpenCV实现的多角度、多目标模板匹配项目实战案例

本案例采用NCC的匹配+金字塔(为了加速)思想，基于OpenCV实现的多角度、多目标模板匹配（不支持尺度不变）。若研究旋转+尺度不变性的匹配，请参考本人的OpenCV专栏内的《O…

人工智能 2023年6月18日
00126
Network）是如何实现的

问题描述本问题要解决的是关于网络（Network）是如何实现的。具体而言，我们将介绍网络的基本概念、算法原理和公式推导，并用Python代码示例展示如何实现一个网络。在代码示例中…

人工智能 2023年12月31日
0049
自注意力机制(Self-Attention)

目录一、注意力机制和自注意力机制的区别二、引入自注意力机制的目的三、Self-Attention详解 3.1 单个输出 3.2 矩阵形式四、Multi-head Self-…

人工智能 2023年6月16日
00180
【数学建模】二元非线性回归（华数杯比赛）（Matlab代码实现）

目录 1 概述 2 算例 2.1 算例 3 题目分析 4 Matlab代码实现 4.1 主函数 4.2 运行结果 5 全文求解结果及总结 1 概述本次算例和前次一样，前次是用了随…

人工智能 2023年6月17日
00116
切片逆回归原理(SIR)与Python实现

文章目录切片逆回归 * 简介一般模型具体步骤切片逆回归的Python实现切片逆回归简介切片逆回归(Slice Inverse Regression, SIR)是Li(…

人工智能 2023年6月17日
00185
鲁棒性的含义以及如何提高模型的鲁棒性

1、含义鲁棒是Robust的音译，也就是健壮和强壮的意思。它也是在异常和危险情况下系统生存的能力。比如说，计算机软件在输入错误、磁盘故障、网络过载或有意攻击情况下，能否不死机、不…

人工智能 2023年7月29日
0059
B. 知识图谱知识建模

抵扣说明： 1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。2.余额无法直接购买下载，可以购买VIP、C币套餐、付费专栏及课程。 Original: https:…

人工智能 2023年5月31日
00108
训练集和测试集 — 模型评估

模型评估训练集就是训练模型的样本，测试集就是在我们训练好一个模型后，需要去评价这个模型的好坏。最直接的方法就是拿着这个模型去做实际的判断。例如，垃圾邮件过滤，就看看能否把垃圾邮…

人工智能 2023年6月25日
00183
基于区块链辅助图像分类的集群学习

Federated Learning with Blockchain Assisted Image Classification for Clustered UAV Network…

人工智能 2023年7月1日
0078
语音合成（speech synthesis）方向十：GAN在声学模型干了什么？

声明：工作以来主要从事TTS工作，平时看些文章做些笔记。文章中难免存在错误的地方，还望大家海涵。平时搜集一些资料，方便查阅学习：TTS 论文列表 http://yqli.tech/…

人工智能 2023年5月25日
0087
TFRecord的Shuffle、划分和读取

对数据集的shuffle处理需要设置相应的buffer_size参数，相当于需要将相应数目的样本读入内存，且这部分内存会在训练过程中一直保持占用。完全的shuffle需要将整个数据…

人工智能 2023年6月4日
0096
【数据分析】认识Pandas：DataFrame和Series结构、属性

数据分析工具——Pandas 认识Pandas * Dataframe 结构 – DataFrame 构造方法 dtype参数 Series 结构 – Se…

人工智能 2023年7月6日
00135
Python图像处理，cv2模块，OpenCV实现边缘检测

前言利用Python实现OpenCV实现边缘检测。废话不多说。让我们愉快地开始吧~ 开发工具 Python版本： 3.6.4 相关模块： cv2模块； numpy模块；以及一…

人工智能 2023年6月22日
0086
双三次插值及Matlab实现

双三次插值及Matlab实现一、简单实例采用简单实例进行对双三次插值的介绍，由于双三次插值对于目标图像的某一像素进行估计时，所采用的像素信息为其周围16个像素点信息，因此不同于…

人工智能 2023年5月26日
00101
sklearn实现12种回归模型

import numpy as np import pandas as pd data = pd.read_excel(r"data.xlsx") data =…

人工智能 2023年6月16日
0096

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

机器学习——多元梯度下降法

一、多维特征模型

; 二、多元梯度下降

; 三、特征放缩

四、学习率

大家都在看