深度学习笔记（9）——神经网络和反向传播

🕗 发布于 2024-12-30 23:43 深度学习 笔记神经网络 机器学习 人工智能

神经网络和反向传播

神经网络架构：

在这里插入图片描述
更多的神经元,更大的模型容量,使用更强的正则化进行约束。

神经网络的分层计算

$f=W_2max(0,W_1x+b_1)+b_2$ ,其中max函数体现了非线性,如果想要加深网络的层次,必须加上非线性函数。

$\frac{\partial f}{\partial x}=\frac{\partial f}{\partial y}\frac{\partial y}{\partial x}$ ,此处的 $\frac{\partial f}{\partial y}$ 是上游梯度, $\frac{\partial f}{\partial x}$ 是下游梯度, $\frac{\partial y}{\partial x}$ 是局部梯度。

Sigmoid函数: $\sigma=\frac{1}{1+e^{-x}}$ , $\sigma$ 在 $[0, 1]$ 之间, $\frac{\partial \sigma}{\partial x}=\sigma(1-\sigma)$ ,Sigmoid函数在 $x$ 很大或者很小的时候,梯度几乎为0,即梯度消失。
在这里插入图片描述

梯度流中的基本计算模式:

add gate:两个输入的梯度和上游梯度相等
在这里插入图片描述

mul gate:另外一个输入和上游梯度的乘积,例如两个输入为x=2,y=3,上游梯度为5,则x的梯度为 $3 * 5 = 15$ ,y的梯度为 $2 * 5 = 10$ 。
在这里插入图片描述

copy gate:两个输出,一个输入,输入的梯度等于两个上游梯度的和。
在这里插入图片描述

max gate:是两个输入中较大的那个的梯度
在这里插入图片描述

向量的反向传播

scalar to scalar: $x\in R,y\in R,\frac{\partial y}{\partial x}\in R$
vector to scalar: $x\in R^n,y\in R,\frac{\partial y}{\partial x}\in R^n,(\frac{\partial y}{\partial x})_n=\frac{\partial y}{\partial x_n}$
vector to vector: $x\in R^n,y\in R^m,\frac{\partial y}{\partial x}\in R^{n\times m},(\frac{\partial y}{\partial x})_{n,m}=\frac{\partial y_m}{\partial x_n}$
但是不管怎么变,Loss L依然是标量, $\frac{\partial L}{\partial x}$ 的形状总是与x相同

求向量的反向传播时,求得的雅可比矩阵总是稀疏的,非对角线元素总是0

max(x,a)的梯度:对于任何正数x,max(x,a)'=I(x>a),I(x>a)是示性函数

原文地址：https://blog.csdn.net/m0_74259787/article/details/144773753

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：【Spring MVC 异常处理机制】应对意外情况
下一篇：HTML CSS 简单动画

迅为瑞芯微RK3562开发板/核心板应用于人脸跟踪、身体跟踪、视频监控、自动语音识别(ASR)、图像分类驾驶员辅助系统(ADAS)、车牌识别、物体识别等
iTOP-3562开发板/核心板采用瑞芯微RK3562处理器，内部集成了四核A53+Mali G52架构，主频2GHZ，内置1TOPSNPU算力，RK809动态调频。支持几乎全格式的H.264解码，支
阅读更多2024-12-31
低精度只适用于未充分训练的LLM？腾讯提出LLM量化的scaling laws
尽管有一些研究声称原生的低比特LLM可以媲美fp16/bf16精度下的表现，但这些研究普遍都是在未充分语言模型上得到的结果从而推出的结论，研究人员认为在充分训练的情况下进行比较的话，低比特LLM也将很
阅读更多2024-12-31
医疗数仓配置Flume
Flume需要将Kafka中各topic的数据传输到HDFS，因此选用KafkaSource以及HDFSSink。对于安全性要求高的数据（不允许丢失）选用FileChannel，允许部分丢失的数据如日
阅读更多2024-12-31
Go中CAS算法
CAS算法常被用作乐观锁的实现方式，用于解决并发问题。例如，在计数器、缓存等场景中，可以使用CAS算法来确保数据的一致性和正确性。CAS操作会检查内存位置V的当前值是否与预期的旧值A相等。这一操作是原
阅读更多2024-12-31
Node.js 记账本项目总结
在使用Node.js结合Express框架构建记账本的过程中，遇到了一些常见的问题，这些问题主要集中在路径处理、包管理工具的选择、开发环境优化以及HTTP响应处理等方面。
阅读更多2024-12-31
Java 处理base64文件上传
在系统内有一个类似于公告的模块，如果里面添加的文章不是选择富文本上传图片的方式，而是选择复制别的文章直接粘贴到系统内的富文本，里面的图片就不会url，而是图片的base64格式，这样会导致数据库存储压
阅读更多2024-12-31
Tailwind CSS 实战：现代登录注册页面开发
基础结构搭建表单组件开发社交登录集成响应式适配深色模式支持动画效果表单验证性能优化可访问性增强通过合理使用 Tailwind CSS 的原子类，我们不仅实现了美观的界面，还确保了良好的用户体验和可维护
阅读更多2024-12-31
node.js下载、安装、设置国内镜像源（永久）（Windows11）
系统：Windows 11。
阅读更多2024-12-31
Slate文档编辑器-Decorator装饰器渲染调度
在这里我们主要讨论了slate中的decoration装饰器的实现，以及在实际使用中可能会遇到的问题，主要是在跨节点的情况下，我们需要将range拆分为多个range，然后分别进行处理，并且还分析了源
阅读更多2024-12-31
python去水印
请注意，这种方法仅适用于简单的水印去除，对于复杂的水印或嵌入到图像纹理中的水印，可能无法达到理想的效果。在实际应用中，还可以考虑使用深度学习的方法，如生成对抗网络（GAN）来去除水印，但需要大量的数据
阅读更多2024-12-31