发布时间:2023-11-06
点击次数: 北京大学董豪团队具身导航最新成果来了:
无需额外建图和训练,只需说出导航指令,如:
Walk forward across the room and walk through the panty followed by
the kitchen. Stand at the end of the kitchen
我们就能控制机器人灵活移动。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
在此,机器人靠的是主动与大模型构成的“专家团队”沟通完成指令分析、视觉感知、完成估计和决策测试等一系列视觉语言导航关键任务。

目前项目主页和论文都已上线,代码即将推出:

视觉语言导航涉及到一系列子任务,包括指令分析,视觉感知,完成估计和决策测试。
这些关键任务需要不同领域知识,它们环环相扣决定机器人的导航能力。
受到现实中专家讨论行为的启发,北大董豪团队提出DiscussN*导航系统。
作者首先以提示方式赋予LLM(大语言模型)和MLM(多模态大模型)专家角色和特定任务,激活它们的领域知识和能力,由此构建具备不同特长的视觉导航专家团队。

然后,作者设计了讨论问题语料库和讨论机制,遵循该机制,由LLM驱动的导航机器人可以主动发起一系列与视觉导航专家的讨论。

在每一步移动前,导航机器人都会与专家讨论来理解人类指令中要求的动作和提及的物体标志。
进而依据这些物体标志的类型有倾向性地对周围环境进行感知,指令完成情况估计,由此做出初步的移动决策。

在决策过程中,导航机器人会根据Chain-of-Thought(思维链)同时生成N个独立的预测结果,当这些预测结果之间不一致时,机器人会向决策测试专家求助,筛选出最终的移动决策。
从这个过程我们可以看到,相比传统方法需要进行额外的预训练,这个方法通过与大模型专家交互指导机器人根据人类指令移动,直接解决了机器人导航训练数据稀缺的问题。
更进一步,正是由于这个特点,它也实现了零样本能力,只要遵循以上讨论流程,就能follow多样的导航指令。
Voicepods
Voicepods是一个在线文本转语音平台,允许用户在30秒内将任何书面文本转换为音频文件。
142
查看详情
以下是DiscussN*在经典的视觉语言导航数据集Room2Room上的表现。

可以看到,它显著高于所有零样本方法,甚至超过两个经过训练的方法。
作者进一步在Turtlebot4移动机器人上开展真实室内场景导航实验。
凭借专家角色扮演和讨论激发出的大模型强大的语言和视觉泛化能力,DiscussN*在真实世界的表现明显优于之前最优的零样本方法和经过预训练微调的方法, 展现出良好的sim-to-real迁移能力。

通过实验,作者进一步发现,DiscussN*产生了4个强大的能力:
1、识别开放世界物体,比如“白色桌子上的机械手臂”,“椅子上的泰迪熊”。
2、识别细粒度的导航标志物体,比如“厨房柜台上的植物”,“桌上的纸箱”。
3、纠正其它专家在讨论中回复的错误信息,比如标志提取专家在从导航动作序列提取导航标志前会检查并纠正被错误分解的动作序列。
4、排除不一致的移动决策,比如决策测试专家们可以根据当前环境信息从DiscussN*预测的多个不一致的移动决策中选择最合理的一个作为最终移动决定。
通讯作者董豪在之前的报告中提出,深入探索如何有效利用*数据和大模型从海量数据中学习到的先验知识是未来具身智能研究的发展方向。
目前受限于数据规模和探索真实环境的高昂成本,具身智能研究仍将重点关注*平台实验和*数据训练。
近期大模型的进展为具身智能提供新方向,合理发掘和利用大模型中存在的语言常识和物理世界先验将推动具身智能发展。

论文地址: https://arxiv.org/abs/2309.11382
以上就是北大具身智能新成果:无需训练,听指令就能灵活走位的详细内容,更多请关注其它相关文章!
# 怎么处理
# 做推广网站联系火8星
# 广州建设网站是什么
# 栾城网站建设
# seo学习课程费用
# 重庆关键词排名哪个好用
# 浏阳pc网站建设
# 优化关键词排名网络
# 店铺推广软文营销策略
# 高邮网站推广优化
# 精酿啤酒推广营销方案
# 工作流程
# 机器人
# 如何用
# 工作效率
# 一幅
# 可以看到
# 官网
# 北大
# 就能
# 关键词
# follow
# 视觉
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
AI 程序 Text With Jesus 在海外迅速受到关注:与耶稣和撒旦进行对话
小米9号员工李明宣布创业:打造首款安卓桌面机器人
IBM CEO克里希纳:人工智能潜在创新无法被监管
网易云音乐和小冰推出AI歌手音乐创作软件,首发内置12名AI歌手
中国气象局预测:到 2030 年,中国人工智能气象应用将达到国际领先水平
普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!
借助ChatGPT快速上手ElasticSearch dsl
生成式人工智能来了,如何保护未成年人? | 社会科学报
日媒:AI高效解析纳斯卡地画
AI 大模型重塑软件开发,有哪些落地前景和痛点?| ArchSummit
新华社联合北大发布AI大模型评测:安全可靠成重点,360智脑表现优异
2025年的网络分区:人工智能和自动化如何改变事物
云深处科技绝影 Lite3 与 X20 四足机器人亮相
如何对员工进行再培训以充分利用供应链管理中的人工智能创新
联合国秘书长称支持建立全球人工智能监管机构
OpenAI宣布在伦敦设立海外分部,要招揽“世界级人才”
Transformer六周年:当年连NeurIPS Oral都没拿到,8位作者已创办数家AI独角兽
天翼云在国际AI顶会大模型挑战赛中获得冠军
参议院司法听证会:AI 不易管控,有可能被恶意分子利用来研发生化武器
OpenAI更新GPT-4等模型,新增API函数调用,价格最高降75%
Meta发布音频AI模型,仅需2秒片段模拟真人语音
外科医生的智能助手,“机器人手术”得到补充商业医保覆盖
对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人
学生作文评分的新趋势:教师与AI的合作模式
生成式人工智能如何改变云安全的游戏规则
华为云天筹AI求解器荣获世界人工智能大会最高奖
海南省公安机关警用无人机培训班结业并举行警航比武演练
AI新视野,增长新势能,伙伴云受邀出席笔记侠创业讲真话AI峰会
马斯克讽刺人工智能炒作:什么“机器学习”,其实就是统计
大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升
探索人工智能在物联网领域的影响与改变
美图秀秀“AI 扩图”功能上线,可根据图像生成更大画幅
世界人工智能大会|“AI领航,共筑未来”高端保险论坛成功举办
微软在 Build 大会上宣布的新 Microsoft Store AI Hub 现已开始推出
联想举办2025创新开放日,展出260余项算力及AI产品技术
普林斯顿大学推出 Infinigen AI 模型,生成真实自然环境 3D 场景
马克龙密会AI专家,法国加入全球人工智能竞赛
人工智能驱动艺术,打开达利的超现实想象
微软必应聊天现已在Chrome和Safari浏览器上可用,但仍有许多限制存在
Unity发布Sentis和Muse AI工具,助力创作游戏和3D内容
创作音乐/音频的Meta开源AI工具AudioCraft,让用户通过文本提示实现
AI技术改变*,新骗局来袭,*成功率接近100%
网易易盾 AI Lab 论文入选 ICASSP 2025!黑科技让语音识别越“听”越准
世界人工智能大会机器人同台炫技!梳理A股相关业务营收占比超50%的个股名单
张勇对话多位诺奖得主 人工智能将无处不在
GPT-4最全攻略来袭!OpenAI官方发布,六个月攒下来的使用经验都在里面了
OpenAI大神Karpathy最新分享:为什么OpenAI内部对AI Agents最感兴趣
笔神作文声讨学而思AI大模型 称用“爬虫”技术盗取数据
Moka AI产品后观察:HR SaaS迈进AGI时代
关于开展“与AI共创未来”——2025年全国青少年人工智能创新实践活动的通知