智东西 7小时前
全SOTA!不止纯文本,阿里多模态站上全球第一梯队
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 李水青

编辑 | 漠影

智东西 8 月 21 日报道,过去一个月,阿里巴巴模型发布全面提速,大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。

有业内人士评价,多模态下一代智能的范式。阿里在多模态上的布局节奏,远比市场感知的要快。

模型密集迭代的另一面,是模型能力开始与云基础设施的增长形成更紧密的联动。2027 财年第一季度(对应 2026 年 4 月 1 日 -6 月 30 日),阿里云外部商业化收入增速提升至45%,创下 22 个季度新高。AI 云及算力服务收入484.37 亿元,经调整 EBITA 达到56.28 亿元,同比暴增133%。AI 相关产品收入123.76 亿元,连续第 12 个季度保持三位数同比增长。

在 AI 进入价值兑现期的当下,多模态也正在从模型榜单上的 " 能力补齐 ",走向更广泛的产业场景,成为观察阿里 AI 进展的一条重要暗线。

一、阿里 AI 不只有语言模型,多模态全面开花

刚刚过去的一个月,阿里在模型发布上按下了加速键。

大语言模型方面,8 月发布的 Qwen3.8-Max 总参数达到 2.4 万亿,在当时编程竞技场 CodeArena 排名全球第三,在 Artificial Analysis Agentic 榜单登顶全球第一。Qwen3.8-27B 开源仅两天,下载量就突破 100 万次。截至 8 月,阿里累计开源模型超过 460 个,Qwen 系列全球下载总量突破 30 亿次。

芯片厂商和推理框架也在快速跟进。平头哥、英伟达、AMD、沐曦、联发科、摩尔线程等国内外芯片厂商 Day0 适配 Qwen3.8,vLLM、SGlang、Ollama 等开源社区第一时间优化推理框架。Qwen 已经成为全球 AI 产业链的基础件之一。

但把时间线拉长到整个季度,会发现更密集的变化其实发生在多模态。

6 月 22 日,视频生成模型 HappyHorse 1.1 发布,重点升级动态表现力、主体一致性、指令遵循、视觉质感和音频能力。

7 月 21 日,Qwen-Image-3.0 发布。它支持最长 4.5k Token 输入,可生成包含公式、几何图形、逻辑推导的知识图解和复杂 UI,同时支持 12 种语言、20 多款字体原生渲染。8 月 5 日,该模型登上 Arena.ai 文生图榜单国内第一。

语音方向同样连续更新。7 月,阿里连续发布实时语音识别模型 Fun-ASR-Realtime、实时语音交互对话模型 Qwen-Audio-3.0-Realtime,以及语音识别模型 Qwen-Audio-3.0-ASR-Flash。Qwen-Audio-3.0 系列的 ASR、TTS、Realtime 三类模型在 Artificial Analysis 今年 7 月的相应语音榜单中均拿下全球第一。

8 月 6 日,Wan3.0 公测,单次视频生成时长达到 30 秒,并首次在文本、图片、音频、视频之外支持 doc、xls、ppt、pdf、md 等文档输入。8 月 17 日,AI 音乐模型 HappyShrimp 上线,可以完成从作词、作曲、编曲到演唱的端到端整曲生成。

甚至在更前沿的世界模型方向,阿里也已经推出 HappyOyster 1.0,能够根据一句话或一张图生成可互动、可探索、可实时改变的数字世界。

语言、图像、语音、视频、音乐、世界模型,一张覆盖越来越完整的模型版图已经浮现。

模型能力的扩张,也正在体现在收入端。财报电话会上,阿里透露,本季度,阿里 AI 相关产品 ARR 突破 495 亿元,包括 MaaS 在内的模型与应用服务收入(ARR)突破 160 亿元人民币。

至少从财报看,模型已经从技术投入逐渐变成一项规模化收入来源。

二、从榜单到场景,多模态开始走进产业一线

大语言模型的商业化路径正在变得清晰。

Anthropic 靠 Coding 能力打开高价值企业市场,Cowork 进一步把模型带入真实工作流。Qwen3.8 在编程和专业办公能力上的大幅提升,正是沿着这条被验证的路径推进,从而获得市场的初步认可。

但市场可能忽略了一点,多模态也已经跨过模型炫技阶段,开始进入一线商业化场景。

语音模型正在重新成为 AI 时代的人机交互入口。Qwen-Audio 正进入会议纪要、智能客服、车载助手、智能硬件、教育等高频场景。相比单纯聊天,这些场景拥有更明确的调用频次、付费主体和 ROI。Fun-ASR-Realtime 支持 16 种方言和 30 种语言,首字延迟在百毫秒级别,已经具备大规模商用条件。

图像和视频模型更贴近内容生产产业链。Qwen-Image-3.0 已将复杂 UI 设计、多语言海报制作、知识图解等商业素材作为重点能力,支持 12 国语言和 20 多款字体原生渲染。Wan 3.0 覆盖广告创意、影视制作、短视频生成、电商素材生产等环节。HappyShrimp 则把生成式 AI 版图进一步推向音乐创作市场。

科技媒体 Semafor 报道,Pinterest 的 AI 购物助手和聊天机器人采用了阿里 Qwen 大模型。Pinterest CEO 在财报会上表示,使用开源模型的成本不到 Anthropic、OpenAI 等同类闭源模型的 8%。他直言,任何不用开源模型的 CEO,几乎都在浪费股东的大量资金。

AI 对阿里核心业务的反哺也在加速。千问 App 深度集成淘宝天猫、淘宝闪购等生态,上线以来已有 2.5 亿用户通过其智能体功能实现 AI 驱动的购物体验。AI 正在从技术能力转化为真实的商业场景。

三、能力越补越齐,阿里多模态的价值开始显现

AI 真正进入产业后,客户需求天然就是多模态的。

布局多模态模型,有望帮助阿里覆盖更多需求,消耗更多云资源,带动更多配套服务。

首先,多一个模态,对应的往往就是一类新的需求和一批新的客户。比如,一家汽车公司既需要语言模型理解指令,也需要实时语音完成交互;影视、游戏、广告行业的需求则天然横跨文字、图片、声音和视频。

其次,多模态任务还会产生更重的计算需求。高清图片、长视频、实时语音等业务,对 GPU、存储和网络的要求都会随之提高。阿里财报也提到,AI 应用的部署、访问和持续运行,正在直接带动计算、存储、网络等通用云资源需求增长。

此外,当一个客户同时使用文本、图像、视频和语音模型后,需求链条还会继续延伸到数据处理、模型微调、数据库、对象存储、安全等环节。原本的一次模型调用,可能变成一整条 AI 生产链,也有望进一步提升客户黏性和综合客单价。

而支撑这套模型体系持续向前的,是阿里近几年不断加厚的全栈 AI 底座。

在组织层面,今年 3 月,阿里成立 Alibaba Token Hub 事业群,由吴泳铭直接负责,以 " 创造 Token、输送 Token、应用 Token" 为核心目标重新整合 AI 业务。

芯片层面,阿里自研真武 AI 芯片已经通过阿里云服务进入 20 多个行业、超过 650 家外部客户,覆盖训练、微调和推理等 AI 工作负载。吴泳铭在财报会议中提及,阿里正在数据中心大规模部署自研倚天 / 真武体系芯片,并希望逐步替换外购商业芯片,以提高 AI 云毛利率。

基础设施层面,阿里云持续扩张全球 AI 数据中心布局,扩建完成后将覆盖 30 个地域、104 个可用区。其新一代 CUBE 5.0 架构已将大型 AIDC 数据中心交付周期压缩至 100 天,建设成本较上一代降低约 10%,今年还计划将模块化数据中心全球产能提升两倍以上。

结语:AI 进入兑现期,多模态价值正在被重新认识

过去两年,Qwen 的纯文本语言模型几乎是外界观察阿里 AI 的第一窗口。但这其实只是冰山一角。在大众视线之外,阿里的多模态模型(图像、语音、视频、音乐等)正在密集迭代。阿里的 AI 版图,早已从单一的语言模型,扩展为更完整的多模态智能体系。

随着 AI 从聊天走向内容生产、办公、电商和真实世界交互,多模态的重要性还会继续上升。对阿里而言,这既是一场模型能力的补齐,也是一条正在进入产业深水区的新主线。被低估的多模态,正在走到台前。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 ai 开源 芯片 智东西
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论