门控循环单元GRU

🕗 发布于 2024-11-08 01:37 gru 深度学习 人工智能

结构：

特点：

结构简单，参数较少

结构图：

对比LSTM：

1.LSTM有三个门，而GRU只有两个门

2.LSTM在左侧有两项输入，而GRU只有一项输入，将两项 $C_{t-1}$ 和 $H_{t-1}$ 合二为一合成一个部分 $H_{t-1}$

3.LSTM中的参数数量很多（ $W_{xi}$ 、 $W_{hi}$ 、 $W_{xf}$ 、 $W_{hf}$ 等9个），而GRU中的参数少得多（ $W_{z}$ 、 $W_{r}$ 等6个）

4.LSTM中的门为输入门、遗忘门、输出门，GRU的门为更新门和重置门

关注一个序列：

不是每个观察值都同等重要：

做RNN时，处理不了太长的序列，因为将整个序列信息放在隐藏状态里；当时间很长时，隐藏状态就累积了很多信息，对于前面很久前的信息并不容易将其抽取出来。

老鼠较为重要，第一次出现的猫也较为重要。

在现实生活中的NLP里，句子里可能只有一些关键字比较重要，关键句比较重要，其他的也不是很重要；类似于股票，重要的是几个点；电影里的几帧相类似，但在切换场景时，每次切换比较重要。

在RNN中无法实现特别关注某些区域，对RNN而言所有信息都为一个序列输入，门控神经网络通过一些额外的控制单元使得在构造隐藏状态时，可以选择的（重要的记住，不重要的忘记）浏览。

想只记住相关的观察需要：

能关注的机制（更新门）

能遗忘的机制（重置门）

门：

下图表示为一个层

$R^{t}$ ：重置；若为RNN，则等价于使用sigmoid做激活函数的隐藏状态的计算方法

$Z^{t}$ ：更新；对比 $R^{t}$ 也有自己的权重 $W$

门：与隐藏状态同样长度的一个向量，与RNN计算隐藏状态的方法类似

候选隐藏状态：

定义：

并不是真正的隐藏状态，而是候选的隐藏状态。

假设不看 $R_{t}$ ，类似于之前的RNN计算隐藏层

但现在加入了一个 $R_{t}$ ，用 $\bigodot$ 代表对元素进行乘法；因为 $R_{t}$ 和 $H_{t-1}$ 的长度相同，可以按元素做乘法且值域在（0，1）之间，假设 $R_{t}\bigodot H_{t-1}$ 中的元素更靠近“0”，那么运算后的结果更靠近“0”，等于把上一时刻的隐藏状态忘记；假设 $R_{t}\bigodot H_{t-1}$ 中的元素更靠近“1”，那么运算结果更靠近“1”，等价于RNN做运算的结果。

$R_{t}$ 可以根据前面的信息进行学习，决定信息可以丢弃或保留，是一个控制单元，被称为"门"。因为值域在（0，1），代表可以在（0，1）之间做比较软的控制。

隐状态：

$H_{t-1}$ ：上一次的隐藏状态

$\widetilde{H_{t}}$ ：候选项隐藏状态

$Z_{t}$ ：控制单元；若 $Z_{t}$ 为“1”， $H_{t}$ = $H_{t-1}$ ，不更新过去状态，将过去状态放入现在，忽略掉元素；当 $Z_{t}$ 为“0”，基本回到了RNN的情况，基本不看过去状态，而是看现在的状态。

总结：

引入了两个额外门，每个门可以学到的参数和之前的RNN一样多；两个门都为一个控制单元，控制（0，1）的输出值；Reset gate用来在更新新隐藏状态时，要用到多少过去隐藏状态的信息，在算新的隐藏状态时，需要用当前 $X_{t}$ 相关的多少信息；极端情况下， $\widetilde{H_{t}}$ 回到RNN的情况；

原文地址：https://blog.csdn.net/m0_61595251/article/details/143485509

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：基于Python爬虫与文本挖掘的网络舆情监控系统【附源码】
下一篇：在 Vue 中实现与优化轮询技术

「C/C++」C/C++ 之变量作用域详解
在C++编程中，变量作用域（Variable Scope）是一个非常重要的概念，它决定了变量在程序中的可见性和生命周期。本文将详细介绍C++中的变量作用域，包括全局作用域、局部作用域、块作用域和文件作
阅读更多2024-11-08
Pytorch学习--神经网络--现有网络模型的使用及修改
Pytorch学习--神经网络--现有网络模型的使用及修改
阅读更多2024-11-08
navicat pg库安装mysql fdw 外表扩展
在Windows上手动安装mysql_fdw（MySQL Foreign Data Wrapper）通常涉及一系列步骤，包括下载源码、编译、配置和测试。
阅读更多2024-11-08
笔记整理—linux驱动开发部分（9）framebuffer驱动框架
整理一下学习的内容，个人观点可能存在错误。本章介绍了什么是framebuffer驱动框架，依x210的显示器驱动来介绍相关框架的使用方法，并详细对probe函数进行分析。并介绍了一些相关使用到的技术，
阅读更多2024-11-08
AutoOps 使每个 Elasticsearch 部署都更易于管理
AutoOps for Elasticsearch 通过性能建议、资源利用率和成本洞察、实时问题检测和解决路径显著简化了集群管理。虽然 Elasticsearch 是一款功能强大且可扩展的搜索引擎，可
阅读更多2024-11-08
Elasticsearch可视化工具Elasticvue插件用法
Elasticsearch可视化工具Elasticvue插件用法
阅读更多2024-11-08
爬虫学习6
5. **解析：** JSONP不需要解析，因为它通过JavaScript执行回调函数来传递数据，而JSON需要在客户端使用JSON解析函数（如`JSON.parse()`）来解析成对象。3. **格
阅读更多2024-11-08
EL表达式和JSTL表达式（详解）
3. varStatus 属性：可选属性，用于指定一个变量名，该变量将保存当前迭代的状态信息，包括索引、计数等。它可以用于各种类型的值，包括字符串、集合、数组和对象等。可以是 List、Set、Map
阅读更多2024-11-08
[HarmonyOS]鸿蒙普通搜索（只是静态的待优化中，无接口无法获取数据）
// 创建一个搜索组件，设置占位符和初始值Search({ placeholder: '商品关键字...', value: $$this.keyword }) // 配置搜索图标，包括图标资源和颜色
阅读更多2024-11-08
django Forbidden (403)错误解决方法
在form表单中加{% csrf_token %}django提交请求时，报403错误；
阅读更多2024-11-08