扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

股市情报:上述文章报告出品方/作者:新智元;仅供参考,投资者应独立决策并承担投资风险。

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

时间:2026-09-03 19:12
上述文章报告出品方/作者:新智元;仅供参考,投资者应独立决策并承担投资风险。

  新智元报道  


太卷了。


九月才过去3天,就已经有五个前沿模型发布了!


Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。


就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。


小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!



Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。


他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。



Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。


跑分显示,这次 Muse Spark 1.3 的提升更大。


它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。




在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。



亚历山大王嘲讽谷歌
「吸别家模型尾气」


最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。


Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。


在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。


Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分



不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。


在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。


在Terminal-Bench 2.1它拿下88.8 分。


在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。



在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。



在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。


在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。



而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。


面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」


谷歌真是虎落平阳。



有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」



Less is More:1美元跑2小时的性能怪兽


跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。


Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。


正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。 



它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。


针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。



它变得更聪明利落,代码风格更干净,废话更少。


而这种减法带来的直接后果,就是成本的断崖式下跌。


下面就是一个非常震撼的真实实测案例。


开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。



他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。


这两个模型都运行了大约 2 个小时,结果惊人。


Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。


而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!



这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」


在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。



在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)



Codedamn创始人、开发者Mehul Mohan直呼:


Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。


在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。


作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。


甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。


它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。



Alexandr Wang的狂飙,小扎的终极野心


Muse Spark 1.3 的横空出世,离不开其背后的操盘手。


今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。


短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。


如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。


他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。


也就是说,Meta看下一个ASI风口——「智能体工程」。


Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。



要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。


1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。


当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。


2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。


Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。


它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。


为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。




狂欢背后:我们被「刷榜」骗了吗?


不过,Muse Spark 1.3也同样受到了质疑。


知名 AI 机构 BridgeMind发了一段引人深思的话:


Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。


Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。


因为,这个月的AI发布如出一辙,分数飙升,真实世界的体验却毫无长进。


这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。



这段话,精准地击中了当前大模型行业的痛点。


有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:


Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。




现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。


DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。


而Muse Spark 1.3 也露出了马脚。


在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。


比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。


这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。



大模型的下半场,到底比什么?


今天  Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。


首先,基座模型的「参数红利」正在见顶。


单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。


未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。


另外,「智能体工程」才是胜负手。


大模型之争,已经从「谁更会说话」转向「谁更能干活」。


未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。 

像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。

股票复盘网
当前版本:V3.0