o1的风又吹到多模态，直接吹翻了GPT-4o-mini

🕗 发布于 2024-11-21 18:54 人工智能 算法 大数据

开源LLaVA-o1：一个设计用于进行自主多阶段推理的新型VLM。与思维链提示不同，LLaVA-o1独立地参与到总结、视觉解释、逻辑推理和结论生成的顺序阶段。

LLaVA-o1超过了一些更大甚至是闭源模型的性能，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。

基础模型与LLaVA-o1的比较。基础模型Llama-3.2-11B-Vision-Instruct在推理过程中有明显的缺陷，整个推理过程中出现了几个错误。相比之下，LLaVA-o1首先概述问题，从图像中解释相关信息，然后进行逐步推理过程，并最终得出一个有充分支持的结论。

LLaVA-o1如何炼成

LLaVA-o1模型的结构化推理框架，专门的数据集和训练方法，以及推理时的阶段性束搜索策略，来提高模型在复杂任务中的推理能力和扩展性。

结构化推理阶段：
- 总结阶段（Summary Stage）：LLaVA-o1在这一阶段提供对问题的高层次总结，概述它打算解决的问题的主要方面。
- 图像描述阶段（Caption Stage）：如果存在图像，LLaVA-o1提供与问题相关的图像元素的简洁概述，帮助理解多模态输入。
- 推理阶段（Reasoning Stage）：在初始总结的基础上，LLaVA-o1进行结构化、逻辑推理，得出初步答案。
- 结论阶段（Conclusion Stage）：在最后阶段，LLaVA-o1根据前面的推理综合答案。结论阶段的输出是直接提供给用户的响应，而前三个阶段是内部的“隐藏阶段”，代表LLaVA-o1的推理过程。
- 四对特殊标签：<SUMMARY></SUMMARY>、<CAPTION></CAPTION>、<REASONING></REASONING>和<CONCLUSION></CONCLUSION>
数据准备和模型训练：
- 由于现有的视觉问题回答（VQA）数据集缺乏训练LLaVA-o1所需的详细推理过程，研究者们编译了一个新的数据集LLaVA-o1-100k，整合了多个广泛使用的VQA数据集的样本。
- 使用GPT-4o生成包括总结、图像描述、推理和结论的详细推理过程，并将这些编译成LLaVA-o1-100k数据集。
- 选择了Llama-3.2-11B-Vision-Instruct模型作为基础模型，并使用LLaVA-o1-100k数据集进行全参数微调。

有效的推理时扩展使用阶段性束搜索：
- 训练完成后的目标是在推理期间进一步增强模型的推理能力。LLaVA-o1的输出设计为结构化，提供了理想的粒度，用于推理时扩展。
- 采用阶段性束搜索方法，该方法在每个推理阶段生成多个候选结果，并选择最佳结果以继续生成过程。
- 通过在每个阶段进行有效的验证，这种方法验证了结构化输出在提高推理时扩展中的有效性。

推理方法的示意图。最佳选择法（Best-of-N search）生成N个完整的响应，并从中选择最好的一个；句子级束搜索（Sentence-level Beam Search）为每个句子生成多个候选项并选择最好的一个。相比之下，LLaVA-o1的阶段性束搜索（Stage-level Beam Search）为每个推理阶段（例如，总结、标题、推理和结论）生成候选项，并在每个阶段选择最佳选项。最佳选择法在粗略层面上操作，而句子级束搜索过于细致，而LLaVA-o1的方法实现了最佳平衡并取得了最佳性能。

有无阶段性束搜索的LLaVA-o1性能比较。LLaVA-o1的阶段性束搜索在模型推理过程中有效地选择了更好的推理。

实验数据

LLaVA-o1在多模态推理基准测试中相较于其基础模型Llama-3.2-11B-Vision-Instruct实现了8.9%的性能提升。
LLaVA-o1在各种基准测试中不仅超越了基础模型，还超过了一些更大甚至是闭源模型，例如Gemini-1.5-pro、GPT-4o-mini和Llama-3.2-90B-Vision-Instruct。
结构化标签（structured tags）对于模型性能至关重要。去除这些标签后，模型性能显著下降，说明这些标签有助于推理过程并提高了模型性能。

https://arxiv.org/pdf/2411.10440LLaVA-o1: Let Vision Language Models Reason Step-by-Stephttps://github.com/PKU-YuanGroup/LLaVA-o1

来源 | PaperAgent

原文地址：https://blog.csdn.net/AIBigModel/article/details/143906010

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：短视频矩阵系统：智能批量剪辑、账号管理新纪元！
下一篇：实现两个表格的数据传递（类似于穿梭框）

【Git】工作区、暂存区和版本库
暂存区是一个临时存储区域，它包含了即将被提交到版本库中的文件快照，在提交之前，可以选择性地将工作区中的修改添加到暂存区。这个命令也是极具危险性的，因为不但会清除工作区中未提交的改动，也会清除暂存区中未
阅读更多2024-11-21
白嫖网络建设与运维文档，视频，加入知识星球和博客地址
免费白嫖文档地址链接点击即可跳转（csdn）]22年国赛解析设备文档。
阅读更多2024-11-21
在Spark Streaming中简单实现实时用户画像系统
详细介绍如何在Spark Streaming中实现实时用户画像系统。
阅读更多2024-11-21
ssm148基于Spring MVC框架的在线电影评价系统设计与实现+jsp(论文+源码)_kaic
它将程序数据通过使用不同的数据表格进行保存，在增加了程序数据的存储速度的时候，也提高了数据库的灵活性。当前需要开发的程序软件是根据当下的用户需求进行设计开发的，但是随着时间的推移，社会大环境的改变，开
阅读更多2024-11-21
【运维项目经历|048】Terraform 云基础设施自动化部署项目
项目背景随着公司业务快速发展，运维团队需要快速响应业务需求，高效、准确地部署和管理大量云服务器、网络资源和存储设备等。然而，传统的手动配置方式不仅耗时耗力，还容易出错，难以满足业务的快速迭代需求。因此
阅读更多2024-11-21
SIP协议学习总结
SIP（Session Initiation Protocol）会话初始协议，“是一个应用层的信令控制协议。用于创建、修改和释放一个或多个参与者的会话。这些会话可以是Internet多媒体会议、IP
阅读更多2024-11-21
Linux相关概念和易错知识点（21）（软硬链接、动静态库）
理解两者的差异，搞清楚为什么要这么做很重要。
阅读更多2024-11-21
详解SpringCloud集成Camunda7.19实现工作流审批(一)
详细分享工作中从0到1使用camunda工作流引擎的经验
阅读更多2024-11-21
Springboot + vue 健身房管理系统项目部署
许多人在拿到 Spring Boot 项目的源码后，不知道如何运行。我以 Spring Boot + Vue 健身房管理系统的部署为例，详细介绍一下部署流程。大多数 Spring Boot 项目都
阅读更多2024-11-21
CTR之行为序列建模用户兴趣：Temporal Interest Network（WWW‘2024）
用户的行为可以反应出其对候选item的兴趣，归因于它们的语义或者时序相关性。然而，这些文献尚未结合起来去分析这两种相关性，即语义-时序相关性。论文通过实验来衡量这种相关性，并观察到了直接而健硕的模型，
阅读更多2024-11-21

o1的风又吹到多模态，直接吹翻了GPT-4o-mini

LLaVA-o1如何炼成

实验数据

相关文章