深度学习入门之SGD随机梯度下降法

Posted 2023-01-04 赵孝正

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了深度学习入门之SGD随机梯度下降法相关的知识，希望对你有一定的参考价值。

SGD

SGD为随机梯度下降法。用数学式可以将 SGD 写成如下的式（6.1）。

这里把需要更新的权重参数记为W，把损失函数关于W的梯度记为 ∂L/∂W 。 $η$ 表示学习率，实际上会取 0.01 或 0.001 这些事先决定好的值。式子中的←表示用右边的值更新左边的值。

如式（6.1）所示，SGD 是朝着梯度方向只前进一定距离的简单方法。现在，将 SGD 实现为一个 Python 类（为方便后面使用，将其实现为一个名为 SGD 的类）。

class SGD:
    def __init__(self, lr=0.01):
        self.lr = lr#学习率

    def update(self, params, grads):
        for key in params.keys():
            params[key] -= self.lr * grads[key]

进行初始化时的参数 lr 表示 learning rate（学习率）。这个学习率会保存为实例变量。此外，代码段中还定义了 update(params, grads) 方法，这个方法在 SGD 中会被反复调用。

参数 params 和 grads 是字典型变量，按 params[‘W1’] 、grads[‘W1’] 的形式，分别保存了权重参数和它们对应的梯度。

使用这个 SGD 类，可以按如下方式进行神经网络的参数的更新（下面的代码是不能实际运行的伪代码）。

network = TwoLayerNet(...)
optimizer = SGD()
for i in range(10000):#更新次数
    ...
    x_batch, t_batch = get_mini_batch(...) # mini-batch
    grads = network.gradient(x_batch, t_batch)
    params = network.params
    optimizer.update(params, grads)
    ...