[2022-12-17]神经网络与深度学习第5章 – 循环神经网络(part 1)

2023年7月30日下午1:55 • 人工智能 • 阅读 61

循环神经网络 part 1 – RNN记忆能力实验
*
写在开头
循环神经网络的记忆能力实验
–
写在最后

循环神经网络 part 1 – RNN记忆能力实验

写在开头

[2022-12-17]神经网络与深度学习第5章 - 循环神经网络(part 1)

在前面的作业中我们就已经提及，循环神经网络是带有记忆能力的一类神经网络结构，就像数字电路中的时序逻辑电路——它的输出不仅取决于输入的值、也取决于前面时刻所输入的值。神经元不但可以接收其他神经元的信息，也可以接受自身的信息，形成具有环路的网络结构。这样的记忆功能，更与生物学上的神经元贴近，也在很多情况下有着更为优越的性能。目前，循环神经网络已经被广泛应用在语音识别、语言模型以及自然语言生成等众多任务之上。本实验进行研究和测试的是简单循环神经网络。
维基百科介绍如下：

查了一下，FNN多指有门控状态的反馈神经网络，尽管其也有前馈神经网络的意思，但是不常用。

; 循环神经网络的记忆能力实验

简单循环网络在参数学习时存在长程依赖问题，很难建模长时间间隔（Long Range）的状态之间的依赖关系。为了测试简单循环网络的记忆能力，本节构建一个数字求和任务进行实验。
数字求和任务的输入是一串数字，前两个位置的数字为0-9，其余数字随机生成（主要为0），预测目标是输入序列中前两个数字的加和。如果序列长度越长，准确率越高，则说明网络的记忆能力越好。因此，我们可以构建不同长度的数据集，通过验证简单循环网络在不同长度的数据集上的表现，从而测试简单循环网络的长程依赖能力。数据集样例如下：

数据集构建

由于在本任务中，输入序列的前两位数字为 0 − 9，其组合数是固定的，所以可以穷举所有的前两位数字组合，并在后面默认用0填充到固定长度。但考虑到数据的多样性，这里对生成的数字序列中的零位置进行随机采样，并将其随机替换成0-9的数字以增加样本的数量。

数据集构建函数

我们可以通过设置kk的数值来指定一条样本随机生成的数字序列数量。当生成某个指定长度的数据集时，会同时生成训练集、验证集和测试集。当k=3时，生成训练集。当k=1时，生成验证集和测试集。代码实现如下：

import random
import numpy as np

random.seed(0)
np.random.seed(0)

def generate_data(length, k, save_path):
    if length < 3:
        raise ValueError("The length of data should be greater than 2.")
    if k == 0:
        raise ValueError("k should be greater than 0.")

    base_examples = []
    for n1 in range(0, 10):
        for n2 in range(0, 10):
            seq = [n1, n2] + [0] * (length - 2)
            label = n1 + n2
            base_examples.append((seq, label))

    examples = []

    for base_example in base_examples:
        for _ in range(k):

            idx = np.random.randint(2, length)
            val = np.random.randint(0, 10)

            seq = base_example[0].copy()
            label = base_example[1]
            seq[idx] = val
            examples.append((seq, label))

    with open(save_path, "w", encoding="utf-8") as f:
        for example in examples:

            seq = [str(e) for e in example[0]]
            label = str(example[1])
            line = " ".join(seq) + "\t" + label + "\n"
            f.write(line)

    print(f"generate data to: {save_path}.")

lengths = [5, 10, 15, 20, 25, 30, 35]
for length in lengths:

    save_path = f"datasets/{length}/train.txt"
    k = 3
    generate_data(length, k, save_path)

    save_path = f"datasets/{length}/eval.txt"
    k = 1
    generate_data(length, k, save_path)

    save_path = f"datasets/{length}/test.txt"
    k = 1
    generate_data(length, k, save_path)

可见运行效果如下：

数据集加载

数据集加载的代码如下：

import os

def load_data(data_path):

    train_examples = []
    train_path = os.path.join(data_path, "train.txt")
    with open(train_path, "r", encoding="utf-8") as f:
        for line in f.readlines():

            items = line.strip().split("\t")
            seq = [int(i) for i in items[0].split(" ")]
            label = int(items[1])
            train_examples.append((seq, label))

    eval_examples = []
    eval_path = os.path.join(data_path, "eval.txt")
    with open(eval_path, "r", encoding="utf-8") as f:
        for line in f.readlines():

            items = line.strip().split("\t")
            seq = [int(i) for i in items[0].split(" ")]
            label = int(items[1])
            eval_examples.append((seq, label))

    test_examples = []
    test_path = os.path.join(data_path, "test.txt")
    with open(test_path, "r", encoding="utf-8") as f:
        for line in f.readlines():

            items = line.strip().split("\t")
            seq = [int(i) for i in items[0].split(" ")]
            label = int(items[1])
            test_examples.append((seq, label))

    return train_examples, eval_examples, test_examples

length = 5

data_path = f"datasets/{length}"

train_examples, eval_examples, test_examples = load_data(data_path)
print("训练集数量：", len(train_examples))
print("验证集数量：", len(eval_examples))
print("测试集数量：", len(test_examples))

可以看到结果如下：

构建 Dataset类

为了方便数据集的加载和使用，我们继承torch的Dataset类进行数据集构建：

import torch
from torch.utils.data import Dataset

class DigitSumDataset(Dataset):
    def __init__(self, data):
        self.data = data

    def __getitem__(self, idx):
        example = self.data[idx]
        seq = torch.tensor(example[0], dtype=torch.int64)
        label = torch.tensor(example[1], dtype=torch.int64)
        return seq, label

    def __len__(self):
        return len(self.data)

模型构建

简单的循环神经网络模型结构如下图所示：

整个模型由以下几个部分组成：
（1）嵌入层：将输入的数字序列进行向量化，即将每个数字映射为向量；
（2） SRN 层：接收向量序列，更新循环单元，将最后时刻的隐状态作为整个序列的表示；
（3）输出层：一个线性层，输出分类的结果。

; 嵌入层

为了更好地表示数字，需要将数字映射为一个嵌入向量。嵌入向量中的每个维度均能用来刻画该数字本身的某种特性。由于向量能够表达该数字更多的信息，利用向量进行数字求和任务，可以使得模型具有更强的拟合能力。
首先我们构建一个嵌入矩阵E ∈ R 10 × M E\in \mathbb{R}^{10\times M}E ∈R 10 ×M，其中第i行对应数字i的嵌入向量，每个嵌入向量的维度是M。给定一个组数字序列S ∈ R B × L S\in \mathbb{R}^{B\times L}S ∈R B ×L，其中B为批大小，L为序列长度，可以通过查表将其映射为嵌入表示X ∈ R B × L × M X\in \mathbb{R}^{B\times L\times M}X ∈R B ×L ×M。

或者也可以将每个数字表示为10维的独热编码向量，使用矩阵运算得到嵌入表示为：
X = S ′ E X=S’E X =S ′E
其中S ′ ∈ R B × L × 10 S’\in \mathbb{R}^{B\times L \times 10}S ′∈R B ×L ×10。
由此可以得到嵌入层类的实现如下：

import torch.nn as nn

class Embedding(nn.Module):
    def __init__(self, num_embeddings, embedding_dim):
        super(Embedding, self).__init__()
        W_attr = torch.randn([num_embeddings, embedding_dim])
        W_attr = torch.nn.init.xavier_uniform_(torch.as_tensor(W_attr, dtype=torch.float32), gain=1.0)

        self.W = torch.nn.Parameter(W_attr)

    def forward(self, inputs):

        embs = self.W[inputs]
        return embs

emb_layer = Embedding(10, 5)
inputs = torch.tensor([0, 1, 2, 3])
emb_layer(inputs)

SRN层

该层有了嵌入层的铺垫，我们能够非常简单地得到模型的构建代码。

自己实现

import torch
import torch.nn as nn
import torch.nn.functional as F
torch.manual_seed(0)

class SRN(nn.Module):
    def __init__(self, input_size,  hidden_size, W_attr=None, U_attr=None, b_attr=None):
        super(SRN, self).__init__()

        self.input_size = input_size

        self.hidden_size = hidden_size
        W_attr = torch.randn([input_size, hidden_size])
        W_attr = torch.nn.init.xavier_uniform_(torch.as_tensor(W_attr, dtype=torch.float32), gain=1.0)
        U_attr = torch.randn([hidden_size, hidden_size])
        U_attr = torch.nn.init.xavier_uniform_(torch.as_tensor(U_attr, dtype=torch.float32), gain=1.0)
        b_attr = torch.randn([1, hidden_size])
        b_attr = torch.nn.init.xavier_uniform_(torch.as_tensor(b_attr, dtype=torch.float32), gain=1.0)

        self.W = torch.nn.Parameter(W_attr)

        self.U = torch.nn.Parameter(U_attr)

        self.b = torch.nn.Parameter(b_attr)

    def init_state(self, batch_size):
        hidden_state = torch.zeros([batch_size, self.hidden_size], dtype=torch.float32)
        return hidden_state

    def forward(self, inputs, hidden_state=None):

        batch_size, seq_len, input_size = inputs.shape

        if hidden_state is None:
            hidden_state = self.init_state(batch_size)

        for step in range(seq_len):

            step_input = inputs[:, step, :]

            hidden_state = F.tanh(torch.matmul(step_input, self.W) + torch.matmul(hidden_state, self.U) + self.b)
        return hidden_state

W_attr = torch.nn.Parameter(torch.tensor([[0.1, 0.2], [0.1,0.2]]))
U_attr = torch.nn.Parameter(torch.tensor([[0.0, 0.1], [0.1,0.0]]))
b_attr = torch.nn.Parameter(torch.tensor([[0.1, 0.1]]))

srn = SRN(2, 2, W_attr=W_attr, U_attr=U_attr, b_attr=b_attr)

inputs = torch.tensor([[[1, 0],[0, 2]]], dtype=torch.float32)
hidden_state = srn(inputs)
print("hidden_state", hidden_state)

结果如下：

torch框架实现

代码如下：

batch_size, seq_len, input_size = 8, 20, 32
inputs = torch.randn(size=[batch_size, seq_len, input_size])

hidden_size = 32
paddle_srn = nn.RNN(input_size, hidden_size)
self_srn = SRN(input_size, hidden_size)

self_hidden_state = self_srn(inputs)
paddle_outputs, paddle_hidden_state = paddle_srn(inputs)

print("self_srn hidden_state: ", self_hidden_state.shape)
print("torch_srn outpus:", paddle_outputs.shape)
print("torch_srn hidden_state:", paddle_hidden_state.shape)

结果如下：

比较

由于自己实现的SRN没有考虑多层的因素，所以比torch版本少了层次维度，因此其输出shape为[8, 32]。同时由于在以上代码使用pytorch内置API实例化SRN时，默认定义的是1层的单向SRN，因此其shape为[1, 8, 32]，同时隐状态向量为[8,20, 32]。
接下来是模型的精度对比，两个计算结果如下：

可见精度比较接近。
另外，由于底层是由C++构建，torch自带的算子必然比我们构建的要快上很多。

; 线性层

线性层比较简单，我们直接使用torch.nn.Linear算子即可。

模型汇总

模型总体代码如下：


class Model_RNN4SeqClass(nn.Module):
    def __init__(self, model, num_digits, input_size, hidden_size, num_classes):
        super(Model_RNN4SeqClass, self).__init__()

        self.rnn_model = model

        self.num_digits = num_digits

        self.input_size = input_size

        self.embedding = Embedding(num_digits, input_size)

        self.linear = nn.Linear(hidden_size, num_classes)

    def forward(self, inputs):

        inputs_emb = self.embedding(inputs)

        hidden_state = self.rnn_model(inputs_emb)

        logits = self.linear(hidden_state)
        return logits

srn = SRN(4, 5)

model = Model_RNN4SeqClass(srn, 10, 4, 5, 19)

inputs = torch.tensor([[1, 2, 3], [2, 3, 4]])

logits = model(inputs)
print(logits)

进行简单的模型计算得到最后一个位置的隐状态向量。这边测试结果如下：

模型训练

训练指定长度的数字预测模型

我们这边使用之前构造的Runner类能够很方便地进行模型训练和构造：

import os
import random
import torch
import numpy as np
from notawheel import Accuracy, RunnerV3

num_epochs = 500

lr = 0.001

num_digits = 10

input_size = 32

hidden_size = 32

num_classes = 19

batch_size = 8

save_dir = "./checkpoints"

def train(length):
    print(f"\n====> Training SRN with data of length {length}.")

    np.random.seed(0)
    random.seed(0)
    torch.manual_seed(0)

    data_path = f"datasets/{length}"
    train_examples, eval_examples, test_examples = load_data(data_path)
    train_set, eval_set, test_set = DigitSumDataset(train_examples), DigitSumDataset(eval_examples), DigitSumDataset(test_examples)
    train_loader = torch.utils.data.DataLoader(train_set, batch_size=batch_size)
    eval_loader = torch.utils.data.DataLoader(eval_set, batch_size=batch_size)
    test_loader = torch.utils.data.DataLoader(test_set, batch_size=batch_size)

    base_model = SRN(input_size, hidden_size)
    model = Model_RNN4SeqClass(base_model, num_digits, input_size, hidden_size, num_classes)

    optimizer = torch.optim.Adam(model.parameters(), lr)

    metric = Accuracy()

    loss_fn = nn.CrossEntropyLoss()

    runner = RunnerV3(model, optimizer, loss_fn, metric)

    model_save_path = os.path.join(save_dir, f"best_srn_model_{length}.pt")
    runner.train(train_loader, eval_loader, num_epochs=num_epochs, eval_steps=100, log_steps=100, save_path=model_save_path)

    return runner

部分运行结果如下，准确率在25%浮动：

模型训练时的损失如下：

模型评价

模型评价代码如下：

srn_eval_scores = []
srn_test_scores = []
for length in lengths:
    print(f"Evaluate SRN with data length {length}.")
    runner = srn_runners[length]

    model_path = os.path.join(save_dir, f"best_srn_model_{length}.pt")
    runner.load_model(model_path)

    data_path = f"./datasets/{length}"
    train_examples, eval_examples, test_examples = load_data(data_path)
    test_set = DigitSumDataset(test_examples)
    test_loader = DataLoader(test_set, batch_size=batch_size)

    score, _ = runner.evaluate(test_loader)
    srn_test_scores.append(score)
    srn_eval_scores.append(max(runner.eval_scores))

for length, eval_score, test_score in zip(lengths, srn_eval_scores, srn_test_scores):
    print(f"[SRN] length:{length}, eval_score: {eval_score}, test_score: {test_score: .5f}")

输出结果如下：

我们将准确率可视化，结果如下：

写在最后

通过本次实验，我们了解了简单的循环神经网络结构。通过实现SRN并进行实验，测试了循环神经网络的记忆能力。通过构建嵌入层、SRN等最终得到模型。尽管效果不是很好，但是基本的思路非常清晰。

Original: https://blog.csdn.net/LupnisJ/article/details/127930021
Author: 三工修
Title: [2022-12-17]神经网络与深度学习第5章 – 循环神经网络(part 1)

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/724172/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

基于Python实现的手写数字识别系统

资源下载地址：https://download.csdn.net/download/sheziqiong/85722434资源下载地址：https://download.csdn….

人工智能 2023年6月16日
0064
pandas concat “InvalidIndexError: Reindexing only valid with uniquely valued Index objects“

利用pandas的concat方法可以对多个DataFrame进行快捷的堆叠，非常方便，但是在使用concat会出现”pandas.errors.InvalidInde…

人工智能 2023年7月7日
00103
基于二值概率的朴素贝叶斯分类器在手写数字识别中的应用

基于二值概率的朴素贝叶斯分类器（最小错误率贝叶斯分类器）在手写数字识别中的应用 * – 一、 mnist数据集下载并保存至文件夹 – 二、算法原理 &#82…

人工智能 2023年7月1日
0082
神经网络——Python实现BP神经网络算法（理论+例子+程序）

采用BP算法的多层感知器是至今为止应用最广泛的神经网络，在多层感知器的应用中，以图3-15所示的单隐层网络的应用最为普遍。一般习惯将单隐层前馈网称为三层感知器，所谓三层包括了输入层…

人工智能 2023年7月3日
0078
python调用海康威视工业相机SDK实现图片采集

海康工业相机图像采集流程环境设置先安装MVS，下载地址海康机器人官网。条件：Python+海康官方的mvs文件下的development/samples下的python文件夹…

人工智能 2023年7月28日
0075
Yolov5更换backbone，与模型压缩（剪枝，量化，蒸馏）

~~~欢迎各位交流、star、fork、issues~~~ 项目介绍：本仓库是基于官方yolov5源码的基础上，进行的改进。目前支持更换yolov5的backbone主干网络为…

人工智能 2023年6月23日
0073
四.STM32F030C8T6 MCU开发之利用 TIM1+ADC1+DMA1 实现5路（3路外部电压模拟信号+内部2路信号）采集

四.STM32F030C8T6 MCU开发之利用 TIM1+ADC1+DMA1 实现5路（3路外部电压模拟信号+内部2路信号）采集文章目录四.STM32F030C8T6 MCU…

人工智能 2023年6月26日
00152
机器学习——PCA与LDA

机器学习——PCA与LDA PCA 推导一个PCA LDA LDA的中心思想是什么 LDA的优缺点 LDA的步骤推导LDA PCA和LDA有什么区别偏差与方差 SVD 伯努利分…

人工智能 2023年6月16日
0074
在树莓派3b使用Anaconda安装tensorflow：过程和遇见问题总结

树莓派ubuntu20.04（arrch64）的aarch64安装Tensorflow教程以下安装均在anaconda创建的虚拟环境中：注：安装树莓派20.04的conda请下…

人工智能 2023年5月23日
0093
自然语言处理（持续更新中…）

文章目录 * – @[TOC](文章目录)* 前言#* 一、文本表示* – 1.1词的独热表示 – 1.2词的分布式表示 – + 1…

人工智能 2023年5月28日
0093
用SVM分类模型处理iris数据集

文章目录 * – 一、实验简介: – 二、实验环境 – 三、第三方函数库 – + 1. Sklearn函数库（用于构建SVM模型和数…

人工智能 2023年7月3日
0092
论文阅读 Learning graph attention-aware knowledge graph embedding

Learning graph attention-aware knowledge graph embedding 学习图注意感知知识图嵌入发表于：Neurocomputing 4…

人工智能 2023年6月10日
0069
TensorFlow GPU最完整的安装方法

自己这几天更换电脑，再加上前次旧电脑学习，安装了好几次TensorFlow，每次都遇到了一些问题，经常缺一些文件，在网上下载文件还很慢，走了不少弯路，特将完整的安装方法记录如下，以…

人工智能 2023年5月23日
0092
AI 黑科技，老照片修复，模糊变高清

大家好最近闲逛，发现腾讯开源的老照片修复算法新出了V1.3的预训练模型，手痒试了一下。我拿”自己”的旧照片试了一下，先看效果 GFPGAN FPGAN算法由…

人工智能 2023年6月4日
00103
人工智能 | ShowMeAI资讯日报 #2022.06.15

ShowMeAI 日报系列全新升级！覆盖AI人工智能工具&框架 | 项目&代码 | 博文&分享 | 数据&资源 | 研究&论文等方向。点…

人工智能 2023年5月27日
00110
Proximal Policy Optimization(PPO)算法实现gym连续动作空间任务Pendulum-v0（pytorch）

目录 1.ppo算法概述 2.Pendulum-v0 3.代码实现 1.ppo算法概述 PG算法视频参考李宏毅强化学习课程：李宏毅深度强化学习(国语)课程(2018)_哔哩哔哩_…

人工智能 2023年7月21日
0086

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31