
“做大模型其实并没有什么秘密。”

一套熟悉的骨架
要看清混元4的底牌,最直接的方法,是翻开它的底层配置文件(Config)。

技术沿路迁移
具体到架构,Hy4架构最核心的注意力模块,主干来自DeepSeek的稀疏注意力机制,同时叠加了智谱团队最新验证的跨层索引复用。最后,连同GLM-5核心贡献者白雨石一起,移植到了腾讯混元。
先从源头DeepSeek说起。
2025年9月,DeepSeek在V3.2-Exp中首次公开DeepSeek稀疏注意力(DeepSeek Sparse Attention,DSA),名字里的"D",毫不掩饰地标注着它的原创归属。
它针对的是超长上下文越来越昂贵的注意力计算:先增加一个轻量级索引器,从漫长上下文里筛出真正值得关注的Top-K Token,再进行核心注意力计算,避免每一次都遍历全部历史信息。
两个月后,DSA进入V3.2正式版,并被DeepSeek列为当代模型的核心技术突破之一。长文本的行业基准,就此改写。
很快,接力棒到了智谱手里。
今年2月,744B参数的GLM-5直接采用了DSA。但真正把这套稀疏注意力做到超大规模后,智谱团队很快发现另一个隐藏的成本黑洞:注意力虽然稀疏了,负责筛选Top-K Token的索引器却仍然要在不同网络层反复运行,无疑是巨大的浪费。
一个月后,IndexCache给出了解法。

智谱AI联合清华团队发表研究称,相邻Transformer层最终筛出的Top-K Token高度重合。既然上一层刚算过,下一层何必重新找一遍?于是,IndexCache让大量网络层直接复用已有索引结果。
这个四两拨千斤的改动,最高可以砍掉75%的索引器计算量。更关键的是,它没有停留在小模型实验,而是在744B的GLM-5上完成了生产级验证:削减50%索引器计算后,端到端仍取得约1.2倍提速。
从中不难看出,在开源生态下,大模型技术的迁徙周期已被压缩到以月计。
2025年9月,DeepSeek将DSA推向开源;次年2月,智谱将其部署进GLM-5;到了3月,智谱继续将其向前推演,迭代出IndexCache;2026年8月,这套组合拳已经赫然出现在770B的混元4身上。
不到一年时间,一项针对算力瓶颈的底层创新,就完成了从概念提出、工程降本到全行业旗舰标配的完整闭环。
论文背后的人
技术接力只是故事的一半。另一半,藏在论文的作者栏里。
在大模型这场智力密集的角逐中,任何一项能改变行业走向的底层优化,背后都站着极其稀缺的顶尖大脑。
混元能在四个月里把长文本架构拉满(从295B的Hy3到770B的Hy4),靠的不只是公开的论文,更是那个亲手把积木严丝合缝嵌进混元底座的研究员。
白雨石,清华姚班2022届本科毕业生,随后留清华计算机系读博,师从清华大学人工智能研究院知识智能中心主任李涓子;在此期间,他先后赴斯坦福、哈佛做访问研究,并参与了唐杰、刘知远、Jure Leskovec、Ariel Procaccia等知名学者的研究项目。
在入职腾讯之前,白雨石是智谱GLM-5这条架构线上的关键人物。

今年2月GLM-5发布时,白雨石在个人主页上介绍:“GLM-5新模型架构(DSA)、架构改进以及强化学习适配的负责人”。GLM-5 的技术论文里也能看到他的署名。

一个月后,他又以第一作者身份发布IndexCache,把GLM-5刚刚采用的全新DSA继续往前推进。不过,他当时在智谱的身份还是实习生。
有意思的是,腾讯和他的交集,其实开始得更早。

今年1月,白雨石入选首届腾讯青云奖学金(Tencent Project Up Scholarship)——这是腾讯面向AI前沿在校硕博设立的顶尖人才项目,全国仅15人,每人20万元现金加30万元云算力,并明确提供进入腾讯实习、就业的通道。而为他颁奖的,正是刚接掌腾讯AI体系不久的“姚班”师兄,姚顺雨。
再往后,时间线突然加速。
7月3日,腾讯混元发布HiLS-Attention,一篇研究“无限上下文”的新型稀疏注意力论文。作者名单里,已经出现了Yushi Bai;论文归属机构包括Tencent HY Team。

一个多月后,Hy4发布。白雨石的个人简介同步更新:“Prev @Zai_org,currently scaling at @TencentHunyuan.”
如果说,论文完成了显性技术的公开,那么跳槽的天才们,则推进了隐性工程经验的物理迁徙。
大模型没有独家秘笈
今天,任何能够被论文、代码和实验数据完整表达出来的技术优势,独占期都在急剧缩短。
DeepSeek的DSA 发布即成为行业标准模块,智谱的IndexCache 不到五个月也被旗舰模型验证。更有意思的是,连一篇实验论证的知乎热帖,也在半年后并入了大厂的Model Card。
在残差侧优化上,Hy4并没有沿用DeepSeek复杂的mHC(流形约束超连接),而是选择了更简单的恒等超连接(identity Hyper-Connections,iHC)。而这项技术的参考链接,甚至都不能称之为正式研究,而是一篇在社交平台公开讨论的知乎热帖。
从顶会论文,到开源代码,再到社区讨论……前沿架构的传播路径已经彻底扁平化。
据笔者了解,那位质疑 mHC、提出iHC方案的作者“涮月亮的谪仙人”(微软亚洲研究院研究员谢天),近期也从微软加入了阿里千问。
顶尖人才的高速流动,正在迅速填平领先大模型的护城河。


VIP复盘网