扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 独家|大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员

股市情报:上述文章报告出品方/作者:AI前线;仅供参考,投资者应独立决策并承担投资风险。

独家|大模型没有秘笈:腾讯混元4背后站着GLM-5核心研究员

时间:2026-08-31 19:51
上述文章报告出品方/作者:AI前线;仅供参考,投资者应独立决策并承担投资风险。

“做大模型其实并没有什么秘密。”

两个月前,从 OpenAI 空降腾讯的姚顺雨,在谈及大模型竞争时这样说道。当时很少有人真正在意这个论断。毕竟,此话由一位顶级研究员口中说出,未免有凡尔赛之嫌。
但只要看清他接手的战局,就知道此话未必是谦辞。
过去半年,智谱、月之暗面、DeepSeek、千问……群狼环伺,开源旗舰的更新周期被压到几个月,甚至数周;而腾讯,急缺一款能在行业里站稳脚跟的旗舰模型。
这位不到30岁的空降少帅,接手的从来都不是一摊慢工出细活的研究课题,而是一场容不得半点迟疑的前线救火。他要做的,是在最短时间内重组团队、更新血液,拿出一个稳站第一梯队的答案。
上周,混元交出了这份答卷。
这是混元大语言与多模态两大部门合并重组后的首次大考,混元4(Hy4 preview)各项指标直逼第一梯队,参数规模770B,支持百万上下文,距离上一代大版本发布不到四个月。
细品这份 README,你会猛然回过味来:姚顺雨说的是大实话。
从官方坦诚架构设计“受到DeepSeek和GLM启发”,到注意力模块借鉴DeepSeek的DSA与智谱的IndexCache机制,再到GLM-5的核心研究员数月前出现在混元论文作者栏……
原来大模型所谓的“独门秘笈”,早已被顶尖人才的高速流动、极度透明的开源机制迅速瓦解。

一套熟悉的骨架

要看清混元4的底牌,最直接的方法,是翻开它的底层配置文件(Config)。

当模型参数来到 700B (7000亿)这一中大规模档位,各家模型厂面对的其实是同一道算力极限题。在混元4交卷之前,国内在这个体量上真正跑通万卡训练、并立住口碑的,是智谱在今年2月发布的 GLM-5(744B)。
相隔半年,同处 700B 的量级,把两代旗舰的底层骨架并排摊开,重合之处一目了然:
这里的前四项基本决定了一款Transformer主干网络的深度、宽度和注意力并行结构;后四项则进一步还原了模型的稀疏注意力内部,涉及Query如何压缩、负责筛选Token的索引器开多少个头,以及每次最终保留多少Token。
当模型主干与稀疏注意力内部同时对齐,可以看出,同一个量级的大模型工程最优解,正在收敛。
隐藏维度6144、78层、64个注意力头——这是智谱用真金白银砸出来的‘700B最优解’,而开源,让它成了全行业公认的共识底座。对于急需突围的混元来说,没有理由绕开它重新踩一遍坑。

技术沿路迁移


具体到架构,Hy4架构最核心的注意力模块,主干来自DeepSeek的稀疏注意力机制,同时叠加了智谱团队最新验证的跨层索引复用。最后,连同GLM-5核心贡献者白雨石一起,移植到了腾讯混元。

先从源头DeepSeek说起。

2025年9月,DeepSeek在V3.2-Exp中首次公开DeepSeek稀疏注意力(DeepSeek Sparse Attention,DSA),名字里的"D",毫不掩饰地标注着它的原创归属。

它针对的是超长上下文越来越昂贵的注意力计算:先增加一个轻量级索引器,从漫长上下文里筛出真正值得关注的Top-K Token,再进行核心注意力计算,避免每一次都遍历全部历史信息。

两个月后,DSA进入V3.2正式版,并被DeepSeek列为当代模型的核心技术突破之一。长文本的行业基准,就此改写。

很快,接力棒到了智谱手里。

今年2月,744B参数的GLM-5直接采用了DSA。但真正把这套稀疏注意力做到超大规模后,智谱团队很快发现另一个隐藏的成本黑洞:注意力虽然稀疏了,负责筛选Top-K Token的索引器却仍然要在不同网络层反复运行,无疑是巨大的浪费。

一个月后,IndexCache给出了解法。

智谱AI联合清华团队发表研究称,相邻Transformer层最终筛出的Top-K Token高度重合。既然上一层刚算过,下一层何必重新找一遍?于是,IndexCache让大量网络层直接复用已有索引结果。

这个四两拨千斤的改动,最高可以砍掉75%的索引器计算量。更关键的是,它没有停留在小模型实验,而是在744B的GLM-5上完成了生产级验证:削减50%索引器计算后,端到端仍取得约1.2倍提速。

从中不难看出,在开源生态下,大模型技术的迁徙周期已被压缩到以月计。

2025年9月,DeepSeek将DSA推向开源;次年2月,智谱将其部署进GLM-5;到了3月,智谱继续将其向前推演,迭代出IndexCache;2026年8月,这套组合拳已经赫然出现在770B的混元4身上。

不到一年时间,一项针对算力瓶颈的底层创新,就完成了从概念提出、工程降本到全行业旗舰标配的完整闭环。

论文背后的人

技术接力只是故事的一半。另一半,藏在论文的作者栏里。

在大模型这场智力密集的角逐中,任何一项能改变行业走向的底层优化,背后都站着极其稀缺的顶尖大脑。

混元能在四个月里把长文本架构拉满(从295B的Hy3到770B的Hy4),靠的不只是公开的论文,更是那个亲手把积木严丝合缝嵌进混元底座的研究员。

白雨石,清华姚班2022届本科毕业生,随后留清华计算机系读博,师从清华大学人工智能研究院知识智能中心主任李涓子;在此期间,他先后赴斯坦福、哈佛做访问研究,并参与了唐杰、刘知远、Jure Leskovec、Ariel Procaccia等知名学者的研究项目。

在入职腾讯之前,白雨石是智谱GLM-5这条架构线上的关键人物。

今年2月GLM-5发布时,白雨石在个人主页上介绍:“GLM-5新模型架构(DSA)、架构改进以及强化学习适配的负责人”。GLM-5 的技术论文里也能看到他的署名。

一个月后,他又以第一作者身份发布IndexCache,把GLM-5刚刚采用的全新DSA继续往前推进。不过,他当时在智谱的身份还是实习生。

有意思的是,腾讯和他的交集,其实开始得更早。

今年1月,白雨石入选首届腾讯青云奖学金(Tencent Project Up Scholarship)——这是腾讯面向AI前沿在校硕博设立的顶尖人才项目,全国仅15人,每人20万元现金加30万元云算力,并明确提供进入腾讯实习、就业的通道。而为他颁奖的,正是刚接掌腾讯AI体系不久的“姚班”师兄,姚顺雨。

再往后,时间线突然加速。

7月3日,腾讯混元发布HiLS-Attention,一篇研究“无限上下文”的新型稀疏注意力论文。作者名单里,已经出现了Yushi Bai;论文归属机构包括Tencent HY Team。

一个多月后,Hy4发布。白雨石的个人简介同步更新:“Prev @Zai_org,currently scaling at @TencentHunyuan.”

如果说,论文完成了显性技术的公开,那么跳槽的天才们,则推进了隐性工程经验的物理迁徙。

大模型没有独家秘笈

今天,任何能够被论文、代码和实验数据完整表达出来的技术优势,独占期都在急剧缩短。

DeepSeek的DSA 发布即成为行业标准模块,智谱的IndexCache 不到五个月也被旗舰模型验证。更有意思的是,连一篇实验论证的知乎热帖,也在半年后并入了大厂的Model Card。

在残差侧优化上,Hy4并没有沿用DeepSeek复杂的mHC(流形约束超连接),而是选择了更简单的恒等超连接(identity Hyper-Connections,iHC)。而这项技术的参考链接,甚至都不能称之为正式研究,而是一篇在社交平台公开讨论的知乎热帖。

从顶会论文,到开源代码,再到社区讨论……前沿架构的传播路径已经彻底扁平化。

据笔者了解,那位质疑 mHC、提出iHC方案的作者“涮月亮的谪仙人”(微软亚洲研究院研究员谢天),近期也从微软加入了阿里千问。

顶尖人才的高速流动,正在迅速填平领先大模型的护城河。

股票复盘网
当前版本:V3.0