大语言模型工作原理笔记

🕗 发布于 2024-11-09 08:11 语言模型笔记 人工智能

大语言模型工作原理笔记

一、词向量：表示语言的方式

大语言模型使用词向量来表示单词，每个词向量是由一串数字组成的列表，代表词空间中的一个点。
词空间中，含义相近的词位置更接近，例如"猫"的词向量会靠近"狗"、"小猫"等词向量。
词向量的好处:
- 可以进行数值运算，例如"最大" - “大” + “小” = “最小”。
- 能够捕捉词语之间的微妙关系，例如"瑞士人"与"瑞士"的关系类似于"柬埔寨人"与"柬埔寨"的关系。
- 可以根据上下文用不同的向量来表示同一个词，解决多义词问题，例如"银行"可以指金融机构或河岸。

二、Transformer：大语言模型的基石

Transformer是一种神经网络结构，由多个层组成，每层都接收一系列词向量作为输入，并添加信息以更好地预测下一个词。
Transformer 的两个核心处理过程：
- 注意力机制: 词汇会观察周围，寻找具有相关背景并彼此共享信息的词，并通过查询和关键项链的匹配来传递信息。
- 潜会层: 每个词会思考之前注意力步骤中收集到的信息，并尝试预测下一个词。
注意力机制:
- 可以将其视为单词之间的"撮合服务"，每个词会制作查询和关键项链来描述自己和寻找的词，并通过比较找到最佳匹配的词。
- 拥有注意力头，每个注意力头专注于不同的任务，例如匹配代词和名词、解析多义词等。
潜会层:
- 可以访问注意力头提供的上下文信息，并通过模式匹配来预测下一个词。
- 早期层倾向于匹配特定单词，后期层则匹配更广泛类别的短语。
- 可以通过向量运算进行推理，例如将国家转化为首都。
注意力机制和潜会层的分工：注意力机制从提示中检索信息，而潜会层让语言模型记住未在提示中出现的信息。

三、训练：让模型学习语言

大语言模型通过预测文本段落中的下一个词来学习，不需要人工标记数据。
训练过程：
1. 前向传播: 输入文本，检查模型预测的下一个词是否正确。
2. 反向传播: 根据预测结果调整模型的权重参数，使模型做出更好的预测。
训练需要大量的数据和计算资源，例如 GPT-3 在 5000 亿个单词的语料库上进行训练，需要运行数月才能完成。

四、模型规模与能力：越大越好

研究表明，模型规模越大，在语言任务上的表现越好。
模型规模的增大带来了更强的推理能力，例如 GPT-3 在心智理论任务上的表现接近人类儿童。

五、结论

大语言模型通过学习大量文本数据，能够以惊人的准确度预测下一个词，并展现出一定的推理能力。虽然其内部工作机制尚未被完全理解，但其强大的能力和潜力已不容忽视。

原文地址：https://blog.csdn.net/qq_30621637/article/details/143632945

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：python构建一个带有服务器的双向视频通话Demo
下一篇：深度学习——优化算法、激活函数、归一化、正则化

手机ip地址异常怎么解决
在现代社会中，手机已成为我们日常生活中不可或缺的一部分，无论是工作、学习还是娱乐，都离不开网络的支持。然而，有时我们会遇到手机IP地址异常的问题，这不仅会影响我们的网络体验，还可能带来安全隐患。本文将
阅读更多2024-11-17
Windows 小记 5 -- 判断账户是否是管理员账户
域用户（针对间接或者嵌套用户组，最佳的获取方式是通过令牌SID，如果用户账户已经登陆，则可以通过进程句柄获取令牌，否则，则需要通过凭据登陆获取令牌）此外需要注意，当账户没有启用时，可能是无法创建和登陆
阅读更多2024-11-17
Python 小高考篇（5）自定义函数
通过def关键词，可以自定义一个函数，之后再在代码内调用它。第一行代表定义一个函数，函数名字叫hello；第2行到第3行代表该函数需要执行的东西，第4行代表执行该函数。lambda是一种很简洁（偷懒）
阅读更多2024-11-17
MySQL慢日志
日志顾名思义就是查询慢的sql语句可以记录到一个日志文件里，至于有多慢才会被记录，默认是10秒，但也可以通过系统配置来更改，慢日志在做系统优化时是一个非常好用的工具。上面的操作只是对本次MySQL服务
阅读更多2024-11-17
凹凸/高度贴图、法线贴图、视差贴图、置换贴图异同
因为NormalMap只是改变的表面上的光照结果，并没有改变表面上的形状，不能实现自身内部的遮挡，因此不能表现平面上凹凸起伏比较大的场合。根据经验，这个凸起会很轻易的挡住我们的视线，让我们看不见那支牙
阅读更多2024-11-17
PMBOK® 第六版控制进度
制定了明确的计划后，对计划的控制尤为重要。例如，经常提到的“累积效应”，如果某个阶段的评分仅为0.9分，那么五个得分为0.9分的阶段，最终结果可能只是一个0.5分。
阅读更多2024-11-17
网络通信NetClient实现
上一集我们就完成了数据中心类的内容，那么我们开始需要进行网络的通信，我们这一集就要封装一个类来帮我们实现网络上的通信。
阅读更多2024-11-17
frp内网穿透介绍安装教程
内网穿透（Port Forwarding）是将公网上的IP地址映射到内部网络中的一台计算机的某个端口上，以便外部网络可以访问该计算机中运行的应用程序。内网穿透技术可以通过一些开源工具来实现，其中比较常
阅读更多2024-11-17
【网络】子网掩码
前面我们已经学习了网络的基础知识，对网络的基本框架已有认识，算是初步认识到网络了，如果上期我们的学习网络是步入基础知识，那么这次学习的板块就是基础知识的实践，我们今天的板块是学习网络重要之一，学习完这
阅读更多2024-11-17
网络物理隔离应用
其实公安的摄像头视频好几个王都有，视频量最大的在公安视频专网里面，还有一些就是社会资源的摄像头，比如一些酒店、网吧，他会有视频监控，这些视频监控，是要求你要把它导入到公安视频专网里面，视频专网跟互联网
阅读更多2024-11-17

大语言模型工作原理笔记

大语言模型工作原理笔记

一、词向量：表示语言的方式

二、Transformer：大语言模型的基石

三、训练：让模型学习语言

四、模型规模与能力：越大越好

五、结论

相关文章