微软 MAI 系列模型发布:自研不蒸馏,图像生成省 84% 算力

10 阅读3分钟

微软又搞事情了。昨天深夜,他们一口气发布了两款自研AI模型——一个专门画画,一个专门聊天,而且已经悄悄在Bing、PowerPoint这些产品里跑起来了。

说实话,这波操作挺有意思的。

图片

先说个背景。大家都知道,微软这几年跟OpenAI走得特别近,从ChatGPT到GPT-4,几乎所有AI能力都靠OpenAI的模型撑着。但这次不一样——微软推出的 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,是自家团队从零开始训练的,没偷懒用第三方模型做蒸馏。

这是什么意思?就是说微软不想把所有鸡蛋放一个篮子里了。自己动手,丰衣足食。

画画的那个:比GPT-Image-2省84%算力

MAI-Image-2.5-Pro,定位是最强图像生成模型。从名字就能看出来,这是MAI系列的第2.5代Pro版,不是小打小闹的迭代。

官方说这玩意儿在文字渲染方面做了专门优化——就是生成图片里带文字的时候,不会出现缺胳膊少腿的尴尬。这个痛点用过AI绘图的人都懂。

价格也放出来了:文本输入每百万Token 5美元,图片输出每百万Token 106美元。换算下来大概700多块人民币。听着贵,但在企业级市场其实不算离谱。

关键是成本对比——微软说在PowerPoint里用这个模型做图片编辑,比直接上GPT-Image-2能节省最高84%的GPU成本。这数字一摆,预算部门看了都得笑出声。

图片

语音那个:速度快了两倍,成本降了三成

另一个模型 MAI-Voice-2-Flash,顾名思义,主打一个快。

相比上一代MAI-Voice-2,速度翻倍,成本降了32%。每处理100万个字符收15美元,大概是101块人民币。

这玩意儿已经被用在了什么场景?说几个名字你就懂了:T-Mobile的客服、EasyJet的订票热线。做企业级语音助手的,可以关注一下。

微软自己透露,这模型已经集成到Azure Voice Live服务里了,开发者可以直接拿它搭语音到语音的智能体。

已经落地了,不是画饼

最让我觉得这波靠谱的是——不是PPT发布

Bing Image Creator 已经全面切换到了微软自研模型,现在你去生成图片,背后大概率就是MAI-Image-2.5在跑。PowerPoint里的AI修图功能也换上了自家的引擎。

OneDrive更是直接上数据说话:换了模型之后,图片编辑保存成功率涨了26%,延迟降了25%,效率翻了2.5倍。

语音侧,Dynamics 365 Contact Center已经接入MAI-Voice-2-Flash,还拿下了T-Mobile、EasyJet这样的客户。你说这是不是真落地?

还有个隐藏亮点:医疗转录

微软顺带提了一嘴 MAI-Transcribe-1.5,这个模型目前用在Dragon Copilot医疗语音方案上。17万医护人员在用,上季度处理了2800万次问诊记录。支持58种语言,错误率砍了一半。

讲道理,这个数据量一看就不是实验室里跑出来的,是实打实在一线实战。

我的看法

坦白说,微软这步棋走得挺聪明。一方面减少对OpenAI的依赖,另一方面用自研模型把成本打下来——企业级客户最在意的就两件事:能不能用和贵不贵。既要又要,微软偏偏做到了。

而且你看他们的思路:不是先搞个超级大模型出来秀肌肉,而是针对具体场景做专用模型。画图的管画图,语音的管语音,医疗的管医疗。这种"分而治之"的做法,反而更容易落地。

这大概就是大厂做AI的正确姿势——不炫技,只解决问题。

你觉得微软这次能靠自研模型追上OpenAI吗?欢迎在评论区聊聊。

数据来源:微软官方公告、IT之家