【深度学习】大模型卷到机器人上了

1年前作者：人工智能大讲堂分类：Toy博客阅读(8)违法举报

这篇具有很好参考价值的文章主要介绍了【深度学习】大模型卷到机器人上了。希望对大家有所帮助。如果存在错误或未考虑完全的地方，请大家不吝赐教，您也可以点击"举报违法"按钮提交疑问。

当一项变革性技术出现后，以此为基础的技术就会像雨后春笋般蔓延。

就像Transformer出现后，以此为基础的大语言模型ChatGPT，视觉基础模型Segment Anything相继横空出世，并展现出强大的涌现能力。生成式AI可谓百花齐鸣，争相绽放。

继纯语言，纯视觉大模型后，多模态大模型也粉墨登场，最近Google DeepMind重磅推出Robotic Transformer 2（RT2），也被称为视觉-语言-行动模型（Vision-Language-Action）。用一句话概括：RT2可以将机器人对世界的观察（图片）以及用户的指令（文本）转换成机器人的控制指令（文本）。

论文地址：
https://robotics-transformer2.github.io/assets/rt2.pdf
官方文档：
https://robotics-transformer2.github.io
https://www.deepmind.com/blog/rt-2-new-model-translates-vision-and-language-into-action

【深度学习】大模型卷到机器人上了,深度学习,深度学习,机器人,人工智能

【深度学习】大模型卷到机器人上了,深度学习,深度学习,机器人,人工智能

整体流程图

整体流程如上图所示，机器人接受人类的语音指令，将其转换为文本，同时利用自身的摄像头对现实场景进行拍照，将文本和图片同时输入到RT2中，模型输出机器人控制指令文本，最后将指令文本解码成机器人能识别的指令格式下达给机器人控制器。

【深度学习】大模型卷到机器人上了,深度学习,深度学习,机器人,人工智能

机器人指令文本格式

机器人对人类下达的文本指令（pick robot）原本一无所知，但通过RT2将人类指令文本（pick robot）和机器人指令文本（A:=132 114 128 5 25 156）映射到了同一个向量空间，通过大量数据训练后，那么两者就具有相同的语义了。

纯语言模型和纯视觉模型的输入大多是单模态的，也就是只有文本或者图片，而RT2的输入既有文本也有图片，这种能够处理多模态信息的模型被称为视觉语言模型，目前有两种主流方法。

一种方法是CLIP，它的思路很简单，就是将图片和文本分别编码到同一个共享空间，在这个空间中，“a cat”和一只猫的图片余弦相似度最大。

另一种方法是具有{vision, text} → {text} 映射形式的模型，类似于视觉问答，这种方法也是本文RT2所采用的方法。

采用这种方法的另一个好处是不需要从零开始训练模型，目前已经有在大量网络数据上进行训练的视觉语言预训练模型，例如，PaLI-X PaLM-E，但只有网络通用数据无法直接应用于机器人领域，所以需要在预训练模型的基础上继续用专门的机器人训练数据进行微调，其整体训练过程如下。

【深度学习】大模型卷到机器人上了,深度学习,深度学习,机器人,人工智能

训练过程

为了适应机器人场景，需要将用户文本指令进行简单的装饰后再送入网络进行训练，例如，用户的指令是：pick the football，装饰后的文本就是What robot should do to pick the football? 最后与图片一起送入网络。

【深度学习】大模型卷到机器人上了,深度学习,深度学习,机器人,人工智能文章来源地址https://www.toymoban.com/news/detail-732570.html

到了这里，关于【深度学习】大模型卷到机器人上了的文章就介绍完了。如果您还想了解更多内容，请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章，希望大家以后多多支持TOY模板网！

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：如若内容造成侵权/违法违规/事实不符，请点击违法举报进行投诉反馈，一经查实，立即删除！

分享到：

领支付宝红包赞助服务器费用

基于TF-IDF+Tensorflow+pyQT+孪生神经网络的智能聊天机器人（深度学习）含全部工程源码及模型+训练数据集
本项目利用TF-IDF（Term Frequency-Inverse Document Frequency 词频-逆文档频率）检索模型和CNN（卷积神经网络）精排模型构建了一个聊天机器人，旨在实现一个能够进行日常对话和情感陪伴的聊天机器人。首先，我们使用TF-IDF技术构建了一个检索模型。TF-IDF可以衡量一个词语在文档中
2024年02月12日
浏览(38)
基于TF-IDF+Tensorflow+PyQt+孪生神经网络的智能聊天机器人（深度学习）含全部Python工程源码及模型+训练数据集
本项目利用TF-IDF（Term Frequency-Inverse Document Frequency 词频-逆文档频率）检索模型和CNN（卷积神经网络）精排模型构建了一个聊天机器人，旨在实现一个能够进行日常对话和情感陪伴的聊天机器人。首先，我们使用TF-IDF技术构建了一个检索模型。TF-IDF可以衡量一个词语在文档中
2024年02月13日
浏览(35)
第九课：机器学习与人工智能、计算机视觉、自然语言处理 NLP及机器人
各位小伙伴想要博客相关资料的话关注公众号：chuanyeTry即可领取相关资料！以区分飞蛾为例：标记数据如下。虚线为决策边界如下。右下角表为混淆矩阵。本质上是用任意线段来切分决策空间，不一定是直线。不用统计学的算法。模拟人类学习的过程，将数据进行加权求
2024年02月03日
浏览(14)
AI人工智能（调包侠）速成之路十五（中国象棋AI网络机器人：AI模型部署）
神经网络模型动态加解密的技术这个以后再写吧书接上文： AI人工智能（调包侠）速成之路十四（中国象棋AI网络机器人：AI技术综合应用实现）神经网络模型的存储格式我们训练的神经网络就是一堆模拟神经元的参数集合，给（他/她/它）一个输入信息就会得到
2024年01月23日
浏览(9)
深度强化学习：教会机器人做出复杂决策
2023年09月12日
浏览(10)
竞赛项目深度学习的智能中文对话问答机器人
🔥 优质竞赛项目系列，今天要分享的是基于深度学习的中文对话问答机器人该项目较为新颖，适合作为竞赛课题方向，学长非常推荐！ 🧿 更多资料, 项目分享： https://gitee.com/dancheng-senior/postgraduate 整个项目分为数据清洗和建立模型两个部分。（1）主要定义了seq2seq这样
2024年02月13日
浏览(11)
机器学习-搭建轻量级机器人模型
在自己的机器上部署一个机器人简直太酷啦，因为模型数据缘故，可能有时候回复会有一点点怪，不过不影响我们探索机器模型的学习，搭建安装完毕，大家就可自行学习源码啦。这是启动后台的图片。需要安装环境：python3.7 、Transformers==4.2.0、pytorch==1.7.0、nginx（映射网页
2024年02月11日
浏览(9)
仿真机器人-深度学习CV和激光雷达感知(项目2)day03【机器人简介与ROS基础】
💫你好，我是辰chen，本文旨在准备考研复试或就业 💫本文内容是我为复试准备的第二个项目 💫欢迎大家的关注，我的博客主要关注于考研408以及AIoT的内容 🌟 预置知识：基本Python语法，基本linux命令行使用以下的几个专栏是本人比较满意的专栏 (大部分专栏仍在持续更新
2024年01月19日
浏览(8)
竞赛选题题目：基于深度学习的中文对话问答机器人
🔥 优质竞赛项目系列，今天要分享的是基于深度学习的中文对话问答机器人该项目较为新颖，适合作为竞赛课题方向，学长非常推荐！ 🧿 更多资料, 项目分享： https://gitee.com/dancheng-senior/postgraduate 整个项目分为数据清洗和建立模型两个部分。（1）主要定义了seq2seq这样
2024年02月04日
浏览(16)
机器人动力学与控制学习笔记（十七）——基于名义模型的机器人滑模控制
滑模运动包括趋近运动和滑模运动两个过程。系统从任意初始状态趋向切换面，直到到达切换面的运动称为趋近运动，即趋近运动为的过程。根据滑模变结构原理，滑模可达性条件仅保证由状态空间任意位置运动点在有限时间内到达切换面的要求，而对于趋近运动的
2024年02月12日
浏览(6)