扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 月之暗面发布 Kimi K3 技术报告并开源权重:2.8T MoE,长程编程与智能体接近闭源前沿

股市情报:上述文章报告出品方 / 作者:Hyman的杂货铺;仅供参考,投资者应独立决策并承担投资风险。

月之暗面发布 Kimi K3 技术报告并开源权重:2.8T MoE,长程编程与智能体接近闭源前沿

时间:2026-07-28 11:35
上述文章报告出品方 / 作者:Hyman的杂货铺;仅供参考,投资者应独立决策并承担投资风险。


一句话讲清楚
 月之暗面发布 Kimi K3 技术报告并开源完整权重:总参约 2.8T 、每次激活约 104B 的原生多模态 MoE ,百万上下文;相对 K2 约 2.5 倍缩放效率,长程编程与智能体多项基准接近最强闭源。

  • 报告标题:Kimi K3: Open Frontier Intelligence

  • 报告链接:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

  • Github 链接:https://github.com/MoonshotAI/Kimi-K3

  • 模型权重:https://huggingface.co/moonshotai/Kimi-K3

这次真正新增的是两件事:完整技术报告公开,以及按 Kimi K3 License 放出可下载的全量权重。下面按报告本身的因果链来读:问题是什么、结构怎么改、训练与后训练怎么把能力「训出来」、基础设施如何托住 2.8T 与 1M 上下文、证据落在哪、边界又在哪。

能下载、又敢拿去改真实代码仓库的开源权重,过去常常在长程编程或工具链上先掉一截。 K3 把三件事捆在一起测:在大型仓库里连续多轮修改代码、跨多种工具做知识工作,以及「写代码、看截图或画面、再继续改」。规格一次性拉满: 2.8T 总参数、约 104B 激活参数、原生视觉、 1M 上下文。

报告定位仍然克制。整体落后于 Claude Fable 5 与 GPT-5.6 Sol ,但稳定压过 Claude Opus 4.8 、 GPT-5.5 与 GLM-5.2 ,并在若干编程与浏览任务上排到第一或第二。更该盯的是「哪一类任务已经可贴顶、哪一类还明显欠账」;总参数只是入场券,分任务账本才决定要不要下场。

Figure 1 :主结果墙。蓝色为 Kimi K3 。编程侧优先看 ProgramBench 、 SWE-Marathon ;智能体侧看 BrowseComp 、 AutomationBench 。

相对 K2 :同一隐藏宽度,换了一套「可训、可扩、可服务」的骨架

隐藏维度仍是 7168 ,词汇表仍是 160K 。拉开差距的是:层数 61→93 ,总参 1.04T→2.78T ,激活参数 32.6B→104.2B ;路由专家 384→896 ,每 token 激活 8→16 ;共享专家 1→2 ;训练上下文 128K→1M 。注意力从纯 MLA 换成混合 KDA–MLA ( 69 层 KDA   24 层带门控的 MLA ),激活函数换成 SiTU-GLU ,并新增约 401M 的 MoonViT-V2 。

Table 1 : K2 与 K3 架构对照。优先读激活参数、专家数、注意力组成、上下文四行。

差距主要来自可训、可扩、可服务的骨架重标定。缩放律曲线给出一个可比较的总账:同等验证损失下, K3 相对 K2 大约 2.5× 的整体缩放效率,也就是达到相近效果大约少花 2.5 倍算力量级。它来自架构、数据与训练配方一起重标定;单改某一层解释不了这条曲线。

Figure 7 :横轴 FLOPs 、纵轴验证损失。同损失水平下, K3 相对 K2 左移约 2.5 倍。

读法可以更狠一点:开源侧真正稀缺的,往往是「下一单位算力买到多少能力」。 2.5× 意味着同样预算下,你更有机会把长程能力训到可部署;模型看起来很大、训练却训不稳推不动,那种账最亏。

骨干怎么搭:序列、通道、深度三条混合轴

整网粗看成三件事: token 沿序列怎么混合、专家通道怎么混合、层与层之间怎么传递;输入侧再挂原生视觉。图 2 是后文所有模块的挂靠点。

Figure 2 :右列端到端栈;左上 Stable LatentMoE ;左下 KDA 。块内常见模式是三段 KDA MoE ,再接一段 Gated MLA MoE 。

KDA :百万上下文先要过「数值   算子」这一关

Kimi Delta Attention ( KDA )用固定大小的递推状态传递长序列信息,计算和缓存成本更接近线性。相对 softmax 注意力「 KV 随长度膨胀」,这是 1M 上下文能站住的结构前提。

相对早期 Kimi Linear , K3 收紧了两处。第一处是给逐步 log-衰减设下限。以前衰减可以变得极小,分块计算时 reciprocal 放大容易超出半精度范围。 K3 改成:

每步保留因子  因此有下界(), 16 token 小块内累积衰减落在 BF16 可表示范围。图 3 把后果画得很直白:对角小块不再需要单独的 position-pair 路径,整块因果计算都能走稠密 Tensor Core 。少了这条,长序列训练会先被半精度数值打穿;表达力再强也排不上号。

Figure 3 :(a) 下界衰减;(b) 对角块从专用计算并入 Tensor Core 。这是算法改动直接改写硬件路径的例子。

第二处是输出门改成输入相关的满秩投影,对递推结果做通道级开关。周期性插入的 Gated MLA ( Multi-head Latent Attention )继续压缩 KV :先缓存低维潜向量,需要时再上投影,做全局内容交互。这些 MLA 层采用 NoPE (不单独加位置编码),位置感主要由中间的 KDA 提供;扩到 1M 时就不必再调 RoPE 基频。

可以记成一句话:长文里先用省算力的递推注意力「滚着走」,隔一段再用能全局对上看的注意力「翻一遍」。分工清楚,扩窗也更干净。

AttnRes :深度方向也做一次「选择性读取」

普通残差像只把「上一层的汇总」往下传,网络一深,早期细节容易被挤掉。 Attention Residuals ( AttnRes )让每一层还能按权重回看更早几层的输出。

全量回看的内存随层数线性涨()。 K3 用 Block AttnRes :把层划成约 8 个块,块内先加总,块间再做注意力,开销降到跟块数相关()。大约 12 层一块,再加 embedding 源,共约 9 份可回看的表示。对 93 层的 K3 ,这是效果、流水线通信量与推理合并成本之间的折中;后文基础设施还会专门给 Block AttnRes 做 checkpoint 与增量通信,说明它不是「加一层好看」。

Stable LatentMoE :把「更稀」训稳,才敢开到 16/896

路由专家扩到 896 、每 token 激活 16 ,稀疏度约 56 。若每个专家仍吃满宽 ,通信和权重流量会按激活数线性涨。 LatentMoE 的解法是:共享专家走全宽;被选中的路由专家先压到较窄的中间宽度  再算,算完再放大回去。这是用「潜空间宽度」换「专家池规模」。

极端稀疏会放大两类失败:路由支路接近连续四次矩阵乘,内部激活易爆;近千专家的请求也容易挤到少数「热门」专家上。 Stable LatentMoE 用三件事对症。

Normalized LatentMoE :路由结果汇总后、放大前加 RMSNorm ,降低尺度抖动。 SiTU-GLU :对 SwiGLU 两侧做平滑上限,限制大幅值乘积。 Quantile Balancing ( QB ):按「该有多少活」对应的分数线去调专家偏好,用直方图近似全局分位数。

Figure 4 : GLU / SwiGLU / SiTU-GLU 。红线 SiTU-GLU 在大正值侧有界,服务低精度时更稳。

SiTU-GLU 写成( 为 sigmoid ):

K3 取 。靠近原点时行为接近常用的 SwiGLU ;大正值被两侧平滑上限住。上线用 MXFP4/MXFP8 时,少出现某个专家激活突然炸数值、整步训练或推理直接 NaN 这类事故。

Figure 5 : QB 示意。左图 Top-k 挤热门专家;中图按分位数调偏好;右图负载拉平。推理时 bias 冻结。

QB 相对固定步长 sign 更新的关键差别是:它直接对准「目标负载对应的分位数」,省掉在慢与抖之间手调 γ 的折中。 896 专家规模下,这几乎是训练吞吐能否「专家并行拉满」的前提;后文 MoonEP 追求每卡精确相同 token 数,也默认路由侧先别把负载打崩。

MoonViT-V2 :从零训,是为了联合优化站得住

K3 把文本、图像、视频放进同一上下文、同一骨干,没有后置模态对齐阶段。模型改完界面后能直接看截图或画面,再继续改。这对 Web/游戏/CAD 类任务属于能力前提:没有「写完就能看、看完继续改」,后面的视觉在环训练无从落地。

相对 K2.5 ,一个明确转向是: MoonViT-V2 (约 0.4B 、 27 层)完全用 next-token prediction 从零训练,跳过 SigLIP 等对比学习权重初始化。图 6 给出的证据很具体: SigLIP 初始化的 MoonViT-3D 梯度范数更高、尖峰更频;从零训的 V2 更稳,且视觉评测不落后。结构上仍经轻量 MLP 投进语言模型,图像与视频共享参数,时空注意力分解,并用 2×2 pixel-shuffle 把视觉 token 压到约 1/4 ,以支撑最高约 3584×3584 的输入落在 1M 上下文预算里。

Figure 6 :视觉塔梯度范数。从零训的 MoonViT-V2 全程更低、尖峰更少。

矩阵参数继续用 Muon ;对注意力投影再做成 Per-Head Muon :按头切分动量块再做正交化,避免少数头主导更新方向。细节小,但和「更深、更稀、更长」是同一类问题:训练动力学要先稳住,规模才谈得上。

预训练:联合多模态,并把 1M 当成可训课程

预训练覆盖 Web 、代码、数学、知识四类文本,外加大规模视觉语料。知识与数学沿用 K2 式改写;视觉侧额外放大「代码与渲染成对」的数据( SVG 、 3D 、网页、游戏、 CAD )。这对后面「写界面再看画面」很关键:训练分布里本来就有代码和渲染结果同流出现的样本。

语言与视觉从第一步就做联合 next-token prediction ,跳过「先纯文本、再外挂视觉塔」的两段式。优化器是 Per-Head Muon   K2 的 weight clipping , MoE 负载用 QB ,余弦学习率( 1% warmup ), weight decay 0.1 。上下文课程大致是:预训练内 8K→64K ,训练收尾阶段再 256K→1M 。位置信息主要来自 KDA 的门控与衰减,扩窗时不做 RoPE 重标定。

真正决定 1M 有没有用的,是数据构造:长文档/视频会专门清洗与上采样,并合成必须跨整段 1M 才能解的拼接任务。只有长度、没有跨段依赖,注意力会塌成局部模式,百万上下文只剩营销数字。

后训练:九个教师先把长程能力拉开,再蒸馏回一个可上线模型

后训练是三段: SFT 冷启动;按领域、按推理强度做强化学习;再用 Multi-Teacher On-Policy Distillation ( MOPD )把多个专长老师蒸馏回一个可上线的学生模型。

SFT 扩充复杂智能体轨迹,用 XTML (可扩展 token 标记语言)聊天模板序列化;并从 SFT 起做量化感知训练(专家权重 MXFP4 、激活 MXFP8 ),让后训练全程与上线精度对齐。这很关键:稀疏大 MoE 如果训推精度不一致,长程轨迹上的误差会沿工具步放大。

RL 在三个宽域各训专家,再与 low / high / max 三种推理强度交叉,得到 9 个教师:通用、通用智能体、 Coding Agent 。图 8 的信息密度很高:随着 RL FLOPs 增加,多类任务分数上升,平均工具调用步数也拉长。分数抬升往往伴随着「多走几步、把事做完」。

Figure 8 :分数与平均助手步数随 RL FLOPs 变化。能力提升与更长交互轨迹同向。

实现上有几处决定了长程任务能不能训得动。部分 rollout :长任务跑到一定进度就开优化,剩下的下一轮接着跑,靠沙箱把状态存住,避免被最慢的那几条轨迹拖死整轮。对不可验证的通用任务,用另一个会按规矩打分的模型两两比较,并强制裁判走「读结果、写评分细则、打分、记分板」协议,再加长度惩罚。推理强度用每题 token 预算课程:先训较大  的 max ,再退火得到 high/low 。

MOPD 可以想成「九个专科老师轮流带同一个学生」:抽到某域、某推理强度,就让对应老师和学生看着同一段已写好的前文,比下一步更该说哪个词;差得大就给有上限的逐步奖励,最终把九份专长压回一个能上线的模型。部署侧还把预训练的多 token 预测层微调成 EAGLE-3 风格草稿模型,并用接受率相关的 LK 损失,目标是草稿更常被采纳。

任务从哪来:长程能力很大一块是「环境工程」

长程智能体 RL 的上限,很大一块卡在任务本身:要可验证、够多样,还不能过拟合某一套运行框架。

统一白盒环境把工具接口、系统提示、上下文管理、 skill 、记忆、子智能体等拆成可配置模块,训练时动态组合,刻意覆盖 Kimi Code 、 Claude Code 、 Codex 等多种 harness (具体用哪套编程/智能体运行框架和工具协议)。

知识图谱引导的任务合成则用自扩展层级图采样概念,检索公开材料,再按类型合成题目。

Figure 9 :知识图谱引导的任务合成。粗粒度域到细概念,取样关键词后检索材料再合成任务。

配套环境还包括:带 Python 沙箱的多步视觉推理;覆盖 CUDA/Triton 等栈的 kernel 优化(正确性,加上相对专家实现与硬件上限的性能奖励,并持续加防刷分规则); Gmail/Notion 等模拟应用上的多日个人助理任务;以及黑盒系统复刻等 Autonomous Execution Tasks 。

图 10 是 AET 的一张完成度曲线:智能体通过 oracle 查询,把隐藏的「相机维修管理系统」复刻成 Web 应用。横轴是规范化工具调用进度,纵轴是验证器评估的完成度。 Kimi K3 的曲线面积到 1.000 ,明显高过 Opus 4.8 、 GPT-5.5 ,也大幅高过 K2.6 。它衡量的是「能把多步假设—行动—反馈循环走完」这类长程执行,单点刷分解释不了这条曲线。

Figure 10 :黑盒系统复刻任务的完成度曲线。 Kimi K3 面积 1.000 ,相对 K2.6 的 0.560 跳变很大。

后训练章节写得越细,越说明团队判断:长程能力主要靠环境与可验证反馈堆出来;参数再大,没有可训任务也抬不起曲线。

基础设施: 2.8T 与 1M 不是「模型写完再补工程」

报告后半把三类系统挑战捆在一起:混合 KDA 、近 3T 级稀疏多模态训练/推理、百万 token 智能体负载。这是算法—系统共设计,附录补丁解释不了这套吞吐。

对 KDA ,训练/prefill 用 FlashKDA 做块内并行与跨块状态传播重叠;跨设备则用 KDA Context Parallelism ( KCP )。普通线性注意力可以把各段从零状态算的贡献直接加总; KDA 有 token 相关的矩阵  作用在入状态上,段效果依赖进入该段的状态,因此要把每段拆成「本段自己长出来的状态」和「入状态乘上一路转移矩阵后的贡献」,再用前缀扫描拼回。否则多卡切开的 1M 序列对不齐,线性注意力的省算优势就兑不现。通信侧是固定大小 all-gather ,计算随序列线性扩展。

预训练侧,图 11 展示了流水线不同阶段里计算、通信与 offload 的重叠。 MoonEP 追求每卡精确接收  个 token 的完美均衡,并证明每卡至多放  个冗余专家( 为专家总数、 为并行卡数)就能保证总有可行均衡方案;动态冗余专家在线规划,避免「预设 cap 导致无可行解就停训」。激活用统一存储抽象做量化/重算/远端 offload ; Block AttnRes 用边界层生成块表示并 checkpoint ,使反向保存量回到标准残差量级;视觉编码器则把大图/长视频的计算塞进流水线气泡。

Figure 11 :不同 PP 阶段中计算、通信与 offload 的重叠调度。 3T 级训练的吞吐很大一块来自这里。

1M 智能体 RL 侧,外部 KV 池把可复用前缀写回 CPU DRAM , KDA 状态与 MLA KV 生命周期对齐;训练状态迭代后可卸到 NVMe ,给 rollout 腾内存。沙箱 AgentENV 用 microVM 提高隔离与保真,并支持 pause/resume 、 fork 、增量 checkpoint (报告写到 checkpoint/resume 延迟可到约 133ms/49ms )。训练与评测期间共创建约 5122 万个 sandbox 、覆盖约 150 万镜像。这些数字提醒:开源权重只是起点,复现长程曲线还要复现一整套执行环境。

推理侧,图 12 解决混合注意力前缀缓存的粒度冲突。物理块可粗到 6144 token ,但哈希匹配若也绑在物理块上,短请求几乎无法复用。 K3 把哈希粒度解耦到例如 512 token 的细块, KDA checkpoint 只在稀疏的哈希边界落盘。命中时恢复该边界的 KDA 状态,并对部分填充的 MLA 块做写时复制,从边界继续 prefill ,前面不再重算。

Figure 12 :物理大块内的细粒度前缀哈希。示例命中 B=2560 ,复用前缀而不重算 [0,B)。

解码时还要处理推测解码: KDA 状态原地更新,拒绝草稿后不能简单回滚。做法是缓存草稿的投影输入、片上重放已接受前缀,再写回验证与 bonus token 的状态,避免为每个草稿位置存整份状态。这些细节决定「百万上下文   投机解码」能不能在生产流量里稳定吃到吞吐。

评测:公开表、内部表、第三方表一起看

主表( Table 2 )对照 Claude Fable 5 、 GPT-5.6 Sol 、 Claude Opus 4.8 、 GPT-5.5 、 GLM-5.2 。报告注明 Fable 5 结果含潜在 fallback , GPT-5.6 Sol 含潜在 cyberguards ; Kimi K3 默认 reasoning effort = max 、 temperature = 1.0 。读表时先记住脚注:两边的「最强闭源」并不总是同一约束下的干净单次得分。

Table 2 :公开主结果。粗体最优、下划线次优;部分格子为「无工具 / 有工具」双分。

可以按四条线读,并各自带走一个结论。

推理与知识。 GPQA Diamond 93.5 ,与顶尖并列或接近; AA-LCR 74.7 为表内最好。但 HLE-Full 43.5/56.0 、 CritPt 23.4 ,明显落后 Fable 5 与 GPT-5.6 Sol 。若关心「能不能当科研助手抠难题」,这才是报告自己标出的缺口;若关心写代码、浏览、改界面,后面三条线更有参考价值。

编程。 ProgramBench 77.8 、 SWE-Marathon 42.0 为最好,更贴近程序综合与长程工程耐力; Terminal-Bench 2.1 88.3 贴近 GPT-5.6 Sol 的 88.8 ; DeepSWE 67.5 、 FrontierSWE 81.2 处在前列,但未全面压过闭源第一名。

智能体。 BrowseComp 91.2 、 DeepSearchQA 95.0 、 MCPMark-Verified 94.5 、 AutomationBench 30.8 等多项最好或第二; GDPval-AA v2 Elo 1686 ,仍低于 Fable 5 的 1747 与 GPT-5.6 Sol 的 1736 。知识工作总榜还没翻盘,但单项工具链已经经常进前二。

视觉。 OmniDocBench 91.1 、 Video-MME 90.0 、 MMVU 82.1 等最好;带工具的 CharXiv 、 Math-Vision 、 ZeroBench 多处第二,紧贴 Fable 5 。原生视觉路线至少在文档、视频与多模态理解上站住了脚。

内部表( Table 3 )补公开榜覆盖不足的「体验向」能力: Coding Experience 、 Deep Research 、 Swarm 、 CLIF 、 Online Experience 等。 Kimi K3 在 Deep Research Bench ( 90.0 )、 Swarm Bench ( 76.3 )、 CLIF ( 52.4 )等项领先或贴顶; Kimi Code Bench 2.0 仍略低于 Fable 5 。脚注里多家闭源有 refusal/fallback ,读数时要连着看。

Table 3 :内部基准。更贴近真实编程体验、深度研究、多智能体编排与在线助手形态。

Table 4 是 Webdev 盲评:同一 Claude Code harness 下, Kimi K3 对 Opus 4.8 总体 Win–Lose 为  31.0%,其中 3D/WebGL/Shader 达  59.1%。这与「原生视觉   代码—渲染成对数据   视觉在环 RL 」的叙事一致:优势集中在强视觉保真与交互体验的开发任务上。

Table 4 : Kimi Webdev Bench 盲评。总体  31.0%, 3D/WebGL/Shader  59.1%。

第三方表( Table 5 ,截至报告所引 2026-07-23 )给出外部交叉验证: Artificial Analysis Intelligence Index 第 4/580 , Vals Index 第 2/39 , WebDev Arena Elo 第 1/99 ( 1678 )。综合指数仍略低于 Fable 5 / GPT-5.6 Sol ,但 Web 开发赛道已经冲到榜首,与 Table 4 同向。

Table 5 :第三方头条评测。 WebDev Arena 第 1 ;综合指数仍处第一梯队但未压过双顶尖。

成本效率图( Figure 13 )把分数和每任务推理成本画在一起。对准备自建服务的人,这张图比单点 SOTA 更有用:在若干内部与公开任务上, Kimi K3 落在分数靠前、成本可控的区域。开源权重的意义,最终要落到「单位美元能买到多少可用长程能力」。

Figure 13 :分数相对每任务推理成本。看是否落在高分且成本不过分的一侧。

案例:从「会写代码」到「会抠硬件上限」

报告用两个 GPU 相关案例说明长程 Coding Agent 在干什么。

Figure 14 是 AttnRes 相关 kernel 优化轨迹:模型在正确性约束下持续改写实现、追性能。看的是优化路径是否稳定前进;单次提交碰运气解释不了整条轨迹。

Figure 14 : AttnRes 相关 GPU kernel 优化案例。关注优化轨迹是否持续逼近目标性能。

Figure 15 是 MiniTriton 编译器开发案例:在 CUDA-core 与 tensor-core 两条 roofline 上看实现落点。任务要求模型同时处理正确性、性能与编译器工程约束,和 SWE-Marathon 、 kernel RL 任务同一条能力轴。

Figure 15 : MiniTriton 案例。(a)(b) 分别为 CUDA-core 与 tensor-core roofline 上的实现落点。

把案例和主表放在一起读: SWE-Marathon 42.0 领先,和报告里的 kernel/编译器长程任务环境对得上;榜上耐力分,很大一块是这类可验证长轨迹堆出来的。

权重怎么用:模板与思考历史决定你能不能复现表上行为

Figure 16 给出聊天模板结构:全局 option 消息在前,输入消息在后,并区分思考与可见回复等字段。 K3 在保留思考历史模式下训练;多轮与工具调用必须把上一轮完整助手消息(含 reasoning_content 与 tool_calls)原样回传。漏掉思考字段,等于把模型从「带着中间状态继续」拽回「只看最终回复」,长程工具链会明显变脆。

Figure 16 :聊天模板结构。多轮必须回传完整助手消息,含思考与工具调用字段。

权重按 Kimi K3 License 全量开放;推理侧报告推荐 vLLM 、 SGLang 、 TokenSpeed 。模型始终开启 thinking ,用 reasoning_effort 在 low/high/max 间切换。专家权重经 MXFP4 量化感知训练,部署时按报告的精度约定走,才更接近评测设定。

边界与判断

报告写明的边界需要原样保留。整体能力仍落后 Fable 5 与 GPT-5.6 Sol ;研究级基准( HLE 、 CritPt )差距可见。评测配置敏感:选用哪套 harness 、是否启用 1M 全窗与上下文压缩、 Fable 的 fallback 比例,都会左右名次。 SWE-Marathon 等分支相对官方最终版有硬件与镜像重标定,读数时要连脚注一起看。

如果只用一句话收束这次开源: Kimi K3 证明开源侧可以把「混合线性注意力   极端稀疏 MoE   原生多模态   百万上下文   长程 RL 环境」捆成一套可下载配方,并在编程与工具智能体上逼近双顶尖;它还没有在研究级难题上翻盘,也还没有把知识工作总榜压过最强闭源。

对读者更有用的分层是:若你的场景是长程改仓、工具调用、 Web/3D 与看图再改,技术报告给出的证据已经足够把 K3 列为当前开源默认候选之一,下一步该盯的是本地复现成本与 harness 对齐;若你的场景是研究级难题求解,报告自己已经把缺口标出来了,不必被主结果墙带偏。

真正要验证的,是社区在真实仓库、真实工具链和真实成本约束下,能否把表上的长程分数复现成可维护的工程产出。权重开放把这件事从「只能看榜」推进到了「可以动手复现」。若你要验证,优先对齐同一 harness 、打开思考历史回传,再谈能不能摸到表上的长程分数

股票复盘网
当前版本:V3.0