微软公布多模态模型MM-Navigator,基于GPT-4V研发-aigc导航|ai导航

据 Arxiv 页面显示,微软近日联手加州大学等高校,共同发布一款多模态大模型产品 MM-Navigator。

MM-Navigator基于 GPT-4V打造,可用于零镜头智能手机 GUI 导航任务。通过使用 MM-Navigator,智能手机屏幕可以像人类用户一样进行交互,并确定后续行动以完成给定的指示。

研究发现,多模态大模型在零镜头 GUI 导航方面表现出色,尤其是 GPT-4V,它具有先进的屏幕解释、行动推理和精确行动定位能力。

ai工具箱
ai导航
免费aigc导航
aigc工具
免费ai工具

相关新闻

联系我们

联系我们

微信747975991

在线咨询:点击这里给我发消息

邮件:1500158347@qq.com

工作时间:周一至周六,8:30-20:30,可以随时留言

扫码加微信
扫码加微信
返回顶部