扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 中信建投 | 模型Scaling持续,AI自我改进加速

股市情报:上述文章报告出品方/作者:中信建投证券研究;仅供参考,投资者应独立决策并承担投资风险。

中信建投 | 模型Scaling持续,AI自我改进加速

时间:2026-08-10 07:19
上述文章报告出品方/作者:中信建投证券研究;仅供参考,投资者应独立决策并承担投资风险。

前沿模型Scaling进入多路径并行阶段。Anthropic Mythos 5、Fable 5被行业估算为8万亿和5万亿参数,Kimi K3总参数达到2.8万亿,字节据报正在预训练最高10万亿参数模型;Post-training进一步延伸至百万Token Agent轨迹、数千次工具调用和持续数小时的复杂任务。7月8日发布的RSI综述覆盖1250篇论文,其中74%发表于2026年,AI研发自动化明显提速。我们认为,模型竞争正由单一参数扩张转向预训练、强化学习、推理时计算、RSI及长期Agent能力协同演进,算力需求将由训练扩展至推理和Agent执行,继续看好大厂Capex生态、国产芯片与超节点、算力服务、Pre-AI、B端AI应用和本地推理

海外头部模型率先突破数万亿参数,Pre-training Scaling仍然持续。6月9日,Anthropic发布Claude Fable 5和Mythos 5;《金融时报》8月7日报道援引行业估算称,Mythos 5约为8万亿参数、Fable 5约为5万亿参数,海外前沿模型的参数规模已进入5万亿以上区间。头部模型Pre-training规模继续扩大,验证了行业领导者此前对Scaling路径的判断。其中,Anthropic CEO Dario Amodei在2月13日访谈中表示,扩大预训练和强化学习规模仍能持续带来能力提升;Google DeepMind CEO Demis Hassabis则在2月20日访谈中同样指出,Pre-training、Post-training和Thinking范式仍有较大提升空间。前沿模型竞争虽然已向强化学习、推理时计算和Agent系统延伸,但更大规模的底座模型仍是提升能力上限的重要基础。
国内前沿模型加速跟进,模型参数由万亿级向多万亿及10万亿级演进。4月24日,DeepSeek发布V4-Pro,总参数达到1.6万亿、单Token激活490亿参数;7月16日,月之暗面发布Kimi K3,总参数达到2.8万亿、激活参数为1040亿,成为首个接近3万亿参数的开放权重模型;7月19日,阿里发布2.4万亿参数的Qwen3.8-Max-Preview;美团近期发布的LongCat-2.0同样达到1.6万亿总参数、约480亿激活参数,并使用超过35万亿Token完成预训练。《金融时报》8月7日报道,字节跳动正在预训练最高10万亿参数的新模型,规模约为Kimi K3的3倍。国内模型厂商已完成万亿级跃迁,下一轮预训练规模上限继续提升,模型规模扩张将与稀疏架构、训练稳定性及软硬件协同优化同步推进。

RL路线持续深化,Post-training Scaling由可验证推理向长程Agent和真实工作流扩展。2024年,OpenAI o系列模型推动长思维链和推理时计算进入主流产品,DeepSeek-R1则于2025年进一步验证了大规模强化学习对多步推理能力的提升,此后RL逐步成为前沿模型后训练的标准环节。OpenAI Post-Training Frontiers联席负责人Yann Dubois在5月21日访谈中表示,强化学习正由数学、编程等易验证任务向法律、医疗、金融及复杂真实工作流延伸,当前瓶颈主要在于高成本采样、长轨迹训练和奖励归因,Post-training Scaling仍处于早期阶段。

近期模型迭代进一步验证RL训练任务和轨迹长度仍在持续扩展。

月之暗面:7月27日发布的Kimi K3在长程Coding、通用Agent、通用推理及知识任务上分别开展强化学习,并设置多档推理强度,训练环境覆盖可验证搜索与专业知识工作、软件工程和内核优化、视觉闭环工具调用、持续型助理工作流、网页开发及自主执行任务,单条任务可包含数百至数千次工具调用,累计上下文达到数百万Token。系统侧,Kimi K3通过分段Rollout、外部KV Cache保留、动态限流及可恢复的MicroVM沙箱,持续保存模型与外部环境状态,支持百万Token级Agentic RL;不同领域和推理强度形成的策略再通过多教师在线蒸馏整合至统一模型。

xAI:7月16日发布的Grok 4.5则将RL覆盖至数十万项任务,重点训练多步骤软件工程及其他技术工作,并结合自动评分和模型评分构造奖励;其异步训练系统支持Agent轨迹持续运行数小时,同时在数万张GPU上并行更新模型,整体训练使用数万张NVIDIA GB300。上述进展表明,Post-training Scaling已由增加数学和Coding训练题数量,进一步扩展至更长任务轨迹、更多工具调用和多档推理强度,对GPU算力、KV Cache、沙箱环境、存储及任务调度系统的需求仍将持续增长。

RSI推动模型由研发工具向研发主体演进,核心在于形成能够持续积累的自我改进闭环。递归自我改进(RSI)是指AI参与下一代AI系统的研发,并使本轮改进形成的能力反过来提升下一轮研发效率,形成“更强模型—更高研发效率—更强模型”的循环。完整的RSI不仅要求模型编写训练代码,还需要自主发现能力短板、提出研究假设、设计和执行实验、修改模型或训练算法、评价实验结果,并将有效改进纳入后续模型。目前产业进展主要集中于人类设定目标和评价标准、模型承担代码编写与实验执行的自动化AI研发,距离自主确定研究方向并修改评价体系的完全闭环仍有差距。

头部实验室加快推进AI研发自动化,RSI的早期形态已在代码、实验和安全训练环节落地。

OpenAI:7月9日披露,过去六个月内部用于Coding推理的研究算力增长100倍,Agentic Token使用量增长约22倍,GPT-5.6已被用于故障诊断、系统优化和实验执行;7月15日发布的GPT-Red进一步通过攻击模型与防御模型的自博弈训练,自动发现Prompt Injection漏洞,并将生成的攻击样本用于GPT-5.6训练,使其在最难直接提示词注入测试中的失败次数较四个月前最优生产模型下降约六倍。

Anthropic:6月4日披露,截至5月Claude已生成公司合并代码的80%以上,单名工程师日均合并代码量约为2024年的八倍;在训练代码优化测试中,模型实现的运行速度提升由2025年5月Claude Opus 4的约3倍,提高至2026年4月Claude Mythos Preview的约52倍。

Google:此前通过AlphaEvolve将Gemini、自动评价器和进化搜索结合,使其发现的矩阵乘法算法将Gemini关键计算内核提速23%、整体训练时间缩短1%;2026年5月,AlphaEvolve已由试点工具升级为Google核心基础设施,并用于下一代TPU设计和缓存策略优化。6月12日,Google DeepMind进一步将递归改进列为AGI迈向ASI的四条潜在路径之一。

RSI研究快速升温,可验证反馈仍是自我改进能否持续的核心约束。7月8日发布的RSI综述(《Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops》)覆盖2024—2026年1250篇论文,其中74%发表于2026年,并按照模型改进对象和自动闭环程度,将现有研究划分为输出优化、训练策略改进、评价器改进和自动化研究等方向。论文显示,当前多数成果仍属于有明确目标和外部评价标准的有限自我改进:代码执行、数学证明和规则检查能够提供可靠反馈,而在开放式研究中,模型自评容易形成自我确认、能力坍缩和多样性下降,研究选题及评价标准仍主要由人类决定。7月30日发布的Frontis-MA1进一步将机器学习工程作为可执行的AI4AI环境,模型通过Draft、Improve、Debug和Crossover四类操作持续生成、测试和迭代程序;在固定OpenMLE-Evo框架下,35B模型的MLE-Bench Lite Medal Average由基础模型的39.39%提升至60.61%。前沿研究正在从一次性自我反思转向由执行反馈驱动、能够跨轮次积累的研发循环,但现阶段突破仍主要集中于结果可验证的任务。

除Pre-training、Post-training和RSI外,持续学习、长期记忆和世界模型等细分技术也在同步演进,为模型从单次任务工具向长期自主Agent发展提供支撑。

1)持续学习:解决模型在吸收新知识、新任务和新反馈时如何保留原有能力的问题,核心难点是平衡能力更新与灾难性遗忘。8月6日发布的《Continual Learning in Transition》将持续学习由参数更新扩展至模型全生命周期,覆盖持续预训练、Post-training、推理时适应以及外部记忆、技能库和Agent框架更新,能力迭代正由单纯修改权重走向系统级持续演进。7月26日发布的Latent-LoRA通过为不同任务配置独立低秩适配器,并利用冻结模型的Embedding实现无梯度任务路由,在两个包含15项连续任务的基准上,平均性能较此前最优方法提高1.7-3.6pct,其中Long Sequence基准的遗忘率降至1%以下,验证了参数隔离与动态路由对持续学习的有效性。

2)长期记忆:提升模型跨任务积累和调用信息的能力,是Agent保持长期一致性和个性化服务的基础。长上下文主要扩大单次任务的信息容量,长期记忆则要求模型判断哪些信息值得保存、何时更新或删除,并在后续任务中准确调用。ACL 2026收录的AgeMem将存储、检索、更新、总结和遗忘设计为模型自主选择的工具动作,并通过三阶段强化学习统一管理长短期记忆;在ALFWorld、SciWorld、PDDL、BabyAI和HotpotQA五项长程任务上,基于Qwen3-4B的平均得分达到54.31%,较表现最好的外部记忆基线提高8.57pct,其中强化学习本身贡献8.72pct增益,表明记忆技术正由被动信息存储升级为可训练的主动生命周期管理。

3)世界模型:通过学习环境状态变化和行动后果,使Agent能够在真实执行前模拟不同动作对应的未来结果。世界模型技术形态正由视频生成进一步延伸至动作条件预测、想象式规划、合成训练数据和闭环策略评价。7月31日发布的BWM将世界模型作为机器人训练的数据引擎和策略评估器,在实物机器人任务中,加入BWM生成轨迹后策略平均成功率达到71.00%,高于表现最好的对比世界模拟器53.33%的水平;其虚拟评估结果与真实硬件结果的相关系数达到0.908,显示世界模型已开始具备预测真实行动结果、筛选策略及提前识别风险的能力。

总结:前沿模型能力提升已进入多路径并行阶段,Pre-training Scaling并未结束,海外头部模型率先进入多万亿参数区间,国内Kimi K3、Qwen3.8等模型快速跟进,字节跳动最高10万亿参数模型亦在预训练。Post-training Scaling正由数学、Coding等可验证任务拓展至百万Token长轨迹、数千次工具调用和持续数小时的Agent工作流,带动GPU、KV Cache、存储、沙箱及任务调度需求上升。RSI推动模型由研发工具向研发主体演进,OpenAI、Anthropic和Google已将AI用于代码生成、实验优化和基础设施设计,但可靠评价仍是闭环自我改进的主要约束。持续学习、长期记忆和世界模型同步迭代,共同支撑模型向长期自主Agent演进。

(1)宏观经济下行风险:计算机行业下游涉及千行百业,宏观经济下行压力下,行业IT支出不及预期将直接影响计算机行业需求;(2)应收账款坏账风险:计算机多数公司业务以项目制签单为主,需要通过验收后能够收到回款,下游客户付款周期拉长可能导致应收账款坏账增加,并可能进一步导致资产减值损失;(3)行业竞争加剧:计算机行业需求较为确定,但供给端竞争加剧或将导致行业格局发生变化;(4)国际环境变化影响(目前美国持续加息,影响科技行业估值,同时市场对于海外衰退预期加强,对于海外收入占比较高公司可能形成影响,此外美国不断对中国科技施压)

股票复盘网
当前版本:V3.0