阿里云发布多模态交互开发套件,让硬件能听、会看、会交互

电商派
2026-01-08 11:15

1月8日,在阿里云通义智能硬件展上,阿里云发布多模态交互开发套件,该套件集成了千问、万相、百聆三款通义基础大模型,并预置十多款生活休闲、工作效率等领域的Agent和MCP工具,不仅能听、会看,还能思考并且与物理世界交互,可应用于AI眼镜、学习机、陪伴玩具、智能机器人等硬件设备。

watermark,image_d2F0ZXJtYXJrLnBuZz94LW9zcy1wcm9jZXNzPWltYWdlL3Jlc2l6ZSxQXzEy,g_south,t_55,x_1,y_20

随着多模态大模型的发展,大模型已开始具备理解、感知以及和物理世界交互的能力,越来越多的硬件和终端设备厂商开始通过接入大模型来提升交互体验。然而,仅靠基础大模型仍无法同时满足硬件设备对低成本、低时延、功能丰富和高质量效果的需求。 

阿里云多模态交互开发套件为硬件企业和解决方案商提供了低开发门槛、响应速度快、场景丰富的平台。在芯片层面,该套件适配了30多款主流ARM、RISC-V和MIPS架构终端芯片平台,满足市面上绝大多数硬件设备的快速接入需求。未来,通义大模型还将与玄铁RISC-V实现软硬全链路的协同优化,实现通义大模型家族在RISC-V架构上的极致高效部署和推理性能。

在模型优化层面,除通义模型家族外,阿里云还针对大量多模态交互场景进行分析,推出适合AI硬件交互的专有模型,全面支持全双工语音、视频、图文等交互方式,端到端语音交互时延低至1秒,视频交互时延低至1.5秒。

此外,该套件预置十多款MCP工具和Agent,覆盖生活、工作、娱乐、教育等多个场景,例如,基于预置的出行规划Agent,用户可直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。该套件还接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的MCP和Agent模板,还能通过 A2A协议兼容三方Agent,极大程度地扩展了应用的能力边界,帮助企业灵活搭建业务场景。

watermark,image_d2F0ZXJtYXJrLnBuZz94LW9zcy1wcm9jZXNzPWltYWdlL3Jlc2l6ZSxQXzEy,g_south,t_55,x_1,y_20

现场,阿里云还展示了面向智能穿戴设备、陪伴机器人、具身智能等领域的解决方案。例如,在AI眼镜领域,基于千问VL、百聆CosyVoice等模型,阿里云打造了感知层、规划层、执行层以及长期记忆的完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘录、录音转写功能,有效解决交互不自然、回答准确率低的难题。面向家庭陪伴机器人场景,基于千问模型和多模态交互套件,阿里云推出的解决方案不仅可实时监测异常状况,并及时告警信息推送,用户还能基于关键词查找、定位视频,与机器人进行对话交互和控制设备等。

根据国际权威市场研究机构Gartner发布的GenAI(生成式AI)技术创新指南系列报告,阿里云在GenAI云基础设施、GenAI工程、GenAI模型以及AI知识管理应用四大维度均位于新兴领导者象限,为入选全部四项新兴领导者象限的唯一亚太厂商,并比肩谷歌、OpenAI。

1、该内容为作者独立观点,不代表电商派观点或立场,文章为作者本人上传,版权归原作者所有,未经允许不得转载。
2、电商号平台仅提供信息存储服务,如发现文章、图片等侵权行为,侵权责任由作者本人承担。
3、如对本稿件有异议或投诉,请联系:info@dsb.cn
相关阅读
通义万相基于阿里通义模型能力打造,用户可以在通义万相中输入提示词,以输出相应图像。
众安发现,阿里通义千问在大部分中文的金融类场景里,准确性方面已经能够超越GPT-3.5,且性能远优于GPT-4。
4月18日消息,新东方已接入阿里通义模型,大幅提升在线学习效率。新东方相关负责人表示,通义模型“上岗”后,学员满意度提升3%。
5月11日消息,小米旗下的人工智能助手“小爱同学”与阿里通义模型展开合作,强化其在图片生成、图片理解等方面的多模态AI生成能力,并在小米汽车、手机等多类设备落地。以最新推出的小米汽车SU7为例,车上的“小爱同学”可遵从乘客的自然语言指令,在车载中控屏画出“小猫爬上窗台”等画面,增加亲子互动和乘车乐趣。通过优化算法、蒸馏模型模型在确保图片质量的前提下可做到5秒出图,将出图时间缩短一半。
6月21日消息,从阿里上海AI峰会上获悉,携程已接入阿里通义千问模型,支持其全球业务发展。此外,哈啰集团已与阿里达成深度合作,全方位接入阿里通义模型
5月9日消息,阿里公布了一组最新数据,通义模型通过阿里服务企业超9万,通义开源模型累计下载量突破700万。此外,通义落地应用进程加速,现已进入PC、手机、汽车、航空等领域。小米旗下的人工智能助手“小爱同学”已与阿里通义模型达成合作。微博、完美世界游戏等企业也宣布接入通义模型
基于阿里通义模型和百炼平台,长安汽车正在结合汽车通用文本语料和业务语料,以座舱交互为应用核心,研发汽车垂域模型
4月24日消息,基于阿里通义模型和百炼平台,长安汽车正在结合汽车通用文本语料和业务语料,以座舱交互为应用核心,研发汽车垂域模型,为用户提供更优质的产品体验。据介绍,这款创新型交互应用或将在2024年搭载于长安即将上市的启源E07上。该车将采用最新的SDA平台架构,是长安推出的“全球首款量产可变新汽车”。此外,在研发场景,长安汽车已使用通义灵码帮助研发部门程序员提升开发效率。
微博、众安保险、完美世界游戏等企业也宣布接入通义模型,将模型应用于社交媒体、保险、游戏等领域。
首个基于阿里通义模型打造的AI助理“小西”已在西部机场集团正式上线。