400 128 6709

行业新闻

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

发布时间:2025-01-08点击次数:

「(公众号:)」在刚刚结束的堪称「ai 界春晚」的世界人工智能大会(waic 2025)上,「中国版gpt-4o」亮相,它是来自商汤科技发布的“日日新5o”——国内首个「流式交互」多模态大模型。

在商汤的演示下,日日新5o拥有像人一样的实时视觉能力,可以跟人进行流畅的视频交互——能听、能说、能看、无延时,它可以通过摄像头+语音实现和用户的实时交互,并获知用户所在的真实场景下的各种状态信息,打破了与AI交互的次元壁,实现了与AI的“视频通话”,已经具备真人聊天般的交互体验。

两个月前OpenAI推出了GPT-4o,以突破性的智能交互能力,彻底颠覆了我们对AI语音助手的认知,颠覆了过去的人机交互,给业界带来又一次震撼。

震撼之外,中国大模型界对GPT-4o的认知似乎并不如GPT-4那么统一,有人认为「在实现AGI的路上,GPT-4o并不重要」、有人评价「在技术突破上,GPT-4o没那么惊艳」;有人认为GPT-4o的发布是 AI 2.0 时代的标志*件,会催生全新的应用平台和商业模式。

带来的共识是,多模态可能引领新的交互模式和产品创新,多模态大模型开始成为国内大模型竞争的下一个焦点。

然而,在国内GPT-4o似乎并未成为引领多模态竞争的产品形态时,两个月后商汤率先推出了「中国版GPT-4o」日日新5o大模型,商汤用行动力证明了对GPT-4o的判断。

正如商汤 CEO徐立在WAIC 2025上所讲的:「行业要变化,交互模式一定是先行的」,解释了商汤为什么要做「中国版GPT-4o」,首创流式交互大模型。

1 大模型可以是每个人的贴身AI全能助手

如果你拥有一个能看(现实世界)、能听(读懂指令)、能说(回答问题)的贴身 AI 助手,将会是一种什么体验?

这位贴身助手,拥有丰富的多领域知识,包括生活、学习、工作各方面的知识,关键还能看懂现实世界——摄像头就是它获取现实世界影像的眼睛,而视觉触及到的信息,它能立马进行分析、总结,通过实时对话,像面对面聊天一样,立即告诉你问题的答案,没有延迟和拒绝。

早上起来,准备出门,你想知道现在外面的天气应该做哪些准备,日日新5o可以准确地描述出外面的天气状况,并给出外出准备的建议:

走到一处很美的地方,你想拍照,但是不知道用什么姿势拍出来好看,日日新5o开始充当一个摄影助手,它会指导你如何根据当前景色摆姿势动作、注意光线等等技巧:

晚饭是一顿烧烤,大家一起搭起炭火炉、燃起炭火准备烧烤,日日新5o能准确地知道视频里的人们正在干嘛,而且还能告诉详细的户外烧烤注意事项:

你想知道每种食材分别要如何烧烤才好吃,此时日日新5o化身为一名拥有多年烹饪经验的烧烤大师,它能分辨出每种食材、要如何烤:

回到酒店,你看到一袋咖啡,询问日日新5o后它能识别出这是咖啡粉而不是速溶咖啡,并告诉你咖啡粉对应的冲泡步骤,宛如一个咖啡师:

日日新5o不仅拥有大量、多领域的生活方面的知识,在日常生活场景中分别充当了发型助手、摄影师、烧烤大师、咖啡师……在职场工作环境中,也是一把好手,比如能迅速地总结出这本书该页讲了什么知识。比人的反应、分析、总结速度快多了:

面对一张手写的字条或诗句,它也能立马回答出它的意思和出处:

还能根据前三个字,准确预测出整个成语是什么:

从以上可以看到,日日新5o具备非常丰富的多领域知识,相比其他AI助手,它能看、能听、能读,首创的实时流式交互方式,使其具备真人般的交流对话;能精准地分析、辨别、总结出所「看到」的环境信息,在我们的生活、学习、工作中可以扮演多种助手角色,完全可以充当一款 AI 全能助手。

2 重塑交互的意义

日日新5o能作为一款表现出色的 AI 全能助手,除了展示出了它对标GPT-4o的各种能力:能看到那个现实世界,包括人、物、文字等符号;能听懂用户的话语,并根据其中的指令对现实世界进行识别,再反馈给用户;能看书识字,概括总结所讲的内容……

Tunee AI Tunee AI

新一代AI音乐智能体

Tunee AI 1104 查看详情 Tunee AI

最大的变革就是交互模式的变化:国内首个流式交互多模态大模型。商汤将流式交互融入到大模型中,给用户带来真人般的交流体验,让日日新5o系统更像人。

我们知道,在人工智能发展中,ChatGPT之所一炮而红,便是因为它开始展露出人类所具备的自主学习、分析、总结能力以及逻辑能力,而让大模型像人一样交流,正如引言所说,交互模式先行似乎并不是业界共识。

而商汤的日日新5o的发布,正是符合商汤对AI 2.0时代的判断,正如CEO徐立所说:行业要变化,交互模式一定是先行的。

在徐立看来,变化是指能定义AI 2.0时代的「超级时刻」,正如iPhone时刻定义了移动互联网的变化。而超级时刻需要一个超级应用,即便是像ChatGPT、Sora都还没有到超级时刻,是因为它们没有真正走进到一个行业的垂直应用中、引起广泛变化。

走向应用,商汤认为需要有几个核心的重点突破:

第一个就是实时的交互性能带来流畅的用户体验,这是推动超级时刻以及应用爆发的一个核心。

第二是构建高阶思维逻辑的合成数据,来提升模型的智力。

最后,不管是文本、图像、视频,如果对它没有可控性,那么它们作为一个工具,本身带来的效能提升就非常有限。

大模型本质上是做记忆的事情,记住世界的知识,就能回答的更准确,在徐立看来,它仅有的一点智力来自于对知识背后的高阶的思维逻辑的记忆,所以,在垂直行业里面怎么构造高阶思维逻辑的合成数据,往往是制胜的关键,并且是差异化的关键,也是中国人工智能之路的关键。

商汤最新发布的日日新5.5基座模型,便用了大量的合成、高阶思维链的数据,把模型能力平均提升了30%。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

商汤CEO徐立认为,如果要推动人工智能超级时刻的到来,需要大模型可以展现出卓越的深度思考的能力。那么合成的人工数据,特别是高阶思维的数据往往是非常重要的。所以越是有应用的场景,才能形成更好的高质量的数据的一些核心。

过去垂直领域是依赖人去构建更加高级的思维链数据,但是商汤认为,往前一步,不应该依赖人,而是应该通过跟真实世界的交互形成执行数据,去做推理。

因此,基于基座模型日日新5.5,商汤研发了日日新5o流式交互多模态大模型,在摄像头不停地移动过程中、跟真实世界互动获取更多新的信息,去进行推理、再得出反馈。

日日新5o的各种功能离不开基座模型日日新5.5的支撑。今年4月发布的日日新5.0是国内首个对标GPT-4 Turbo的大模型,经过两个多月技术迭代,日日新5.5实现了多项功能升级,在数学推理、英文能力、指令跟随等能力上明显增强,交互效果和多项核心指标可比肩GPT-4o。

徐立认为,如果能把这种流式交互多模态大模型置入眼镜、手机、电脑等端侧设备,可能会推动一些应用的爆发。

商汤大模型的「5o」交互,普通人如何和 AI 过一天?

以上就是商汤大模型的「5o」交互,普通人如何和 AI 过一天?的详细内容,更多请关注其它相关文章!


# iphone  # 电脑  # 多模  # 流式  # sora  # chatgpt  # 为什么  # ai  # 番禺seo网络营销推广报价  # 浉河区生产企业推广营销  # 荆州电商网站推广公司  # 平面构图网站推广方案  # 菏泽阅读推广人招聘网站  # 360黑帽seo  # 优惠券推广网站源码  # 辽宁小企业网站建设公司  # 沈阳互联网推广招聘网站  # seo的几大优化技巧  # 这是  # 能看  # 中文网  # 你想  # 中国  # 还能  # 基座  # 高阶 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 无人机自主巡检为高海拔输电线路运维添“新彩”  腾讯企点客服接待与营销分析能力升级!企业操作更高效、人机交互更智能  国家发改委组织工业机器人产业高质量发展现场会  DeepMind推惊世排序算法,C++库忙更新!  探展WAIC |万向区块链杜宇:不存在单一技术的iPhone时刻,Web3.0核心将基于AI+区块链+物联网  关于开展“与AI共创未来”——2025年全国青少年人工智能创新实践活动的通知  再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手  谷歌推出 AI 反洗钱工具,可将金融机构内部风险预警准确率提高2至4倍  聚焦人工智能大模型、AIGC 徐汇十余场重磅论坛等你来  华为云发布华为云盘古模型3.0和升腾AI云服务,亮点亮相2025华为开发者大会  人工智能自己玩自己  周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇  利用AI技术更好地发展农村电商  百度文心一言App上架苹果商店,人工智能创作引发热议  微软向美国政府提供GPT大模型,如何保证安全性?  AYANEO AIR 1S 掌机 7 月 9 日发布:R7 7840U + OLED 屏  争鸣:OpenAI奥特曼、Hinton、杨立昆的AI观点到底有何不同?  当孔子遇见AI|尼山的“数字”  阿里云连续两年进入Gartner云AI开发者“挑战者象限”  今年,全球客服中心支出将增长 16.2%,迎接对话式 AI 的浪潮,根据 Gartner 报告  前特斯拉总监、OpenAI大牛Karpathy:我被自动驾驶分了心,AI智能体才是未来!  调查显示:实际上没有那么多人在用 ChatGPT  人形机器人概念集体爆发,能买吗?  Win11 AI 助手 Windows Copilot 被吐槽:套皮的 Edge 浏览器  华为云天筹AI求解器荣获世界人工智能大会最高奖  机器人加速!稀土永磁也被带火,持续性如何?  AI 模型 Stable Diffusion 升级:正常生成五指、图像更逼真  AI数字人业务频频获点赞,谦寻积极引领示范作用  “具身智能”引爆机器人产业,看绝影Lite3/X20四足机器人有何特别之处?  DreamAvatar数字人在哪里下载  自动驾驶汽车避障、路径规划和控制技术详解  IBM CEO克里希纳:人工智能潜在创新无法被监管  抛媚眼给瞎子看?微软、谷歌的AI广告被广告主抵制  参考封面|人工智能“淘金热”  普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!  传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台  印象笔记开放旗下“印象 AI”,可一键生成思维导图、写文章等  苹果推出全新沉浸式 AR 体验应用“Deep Field”  本届人工智能大会上的这个“镇馆之宝”,来自长宁企业西井科技!  2025年贵州省青少年机器人竞赛在安举行  阿里云推出通义万相AI绘画大模型  12页线性代数笔记登GitHub热榜,还获得了Gilbert Strang大神亲笔题词  图像生成过程中遭「截胡」:稳定扩散的失败案例受四大因素影响  基于预训练模型的金融事件分析及应用  深度学习模型综述:用于3D MRI和CT扫描的应用  阿里云全面支持Llama2训练部署,助力企业快速构建自有大型模型  OpenAI首席执行官引用《道德经》 呼吁就AI安全问题合作  优傲机器人的人机协作技术 助力中小企发展  优化J*a与MySQL合作:分享批处理操作的技巧  英特尔张宇:边缘计算在整个AI生态系统中扮演重要角色 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司