GPT-5.6降价推动大模型竞争由能力排名进一步转向“同等智能成本”。OpenAI于7月30日将Terra和Luna价格分别下调20%和80%;次日发布的DeepSeek V4 Flash 0731在Artificial Analysis Intelligence Index达到50分,仅比Luna低1分,混合价格和平均任务成本分别约0.06美元/百万Token和0.03美元,较Luna分别低约65%和57%。我们认为,Kimi K3以57分代表当前国产开放权重模型的强能力上限,DS V4 Flash则刷新50分能力区间的成本底线,中国模型已形成“强能力 高性价比”两条竞争路线,有望带动下游应用的起量。建议关注AI应用和国产模型两条投资主线。
同等智能成本成为模型竞争的新衡量维度
智能定价需要从Token、任务到成功结果分三层衡量。1)Token层比较单位预算可购买的调用量及对应能力,反映基础性价比。2)任务层将实际Token消耗、推理轮次和重试次数纳入Cost per Task,衡量完成一项任务的真实成本。3)结果层先判断模型能否跨过能力门槛,再比较达标模型的单位成功成本及失败损失。我们认为,模型竞争的核心并非单一Token低价,而是在既定能力要求下,以更低成本获得可用且稳定的智能。
降价有望释放应用数量与单任务需求
Token降价不仅能够扩大调用规模,也会推动应用采用更复杂的Agent架构,从而提升单项任务的计算强度。据《The Economics of Digital Intelligence Capital》,当API价格一次性下降50%时,Token需求价格弹性约为1.42,推理深度、记忆容量和工具集成分别增加45%、38%和25%,总Token消耗呈非线性增长,行业Token收入亦有所提升,即“结构性杰文斯悖论”。我们认为,成本下降有望同时释放任务数量与单任务Token消耗,推动客服、办公、Coding和数据分析等场景加快Agent化。
国产模型形成强能力与高性价比两条路线
Kimi K3 Max在AA指数达到57分,仅比GPT-5.6 Sol低2分,混合价格和平均任务成本分别低约47%和54%;DeepSeek V4 Flash 0731以50分接近Luna的51分,混合价格和平均任务成本分别低约65%和57%,同时开放权重、支持私有化部署。我们认为,国产模型在前沿能力和低成本推理两端均已形成代表性产品,开放权重、国产算力适配和本地化交付进一步增强其产业竞争力。
投资结论
建议关注两条投资主线:1)AI应用。模型调用成本下降有望提升Agent执行次数、用户使用频率及应用厂商毛利空间。2)国产模型。能力提升与推理降本有望共同推动企业端落地,开放权重和本地化服务进一步强化差异化竞争。
风险提示:模型调用需求增长不及预期;AI应用商业化进展不及预期;模型能力迭代不及预期;第三方评测口径及数据变化风险。未上市及未覆盖公司仅作为产业链观察,不构成投资建议。
正文
GPT-5.6降价,模型竞争转向“同等智能成本”
GPT-5.6以三层级定价矩阵覆盖不同任务需求,并通过差异化调价强化各型号定位。据OpenAI模型文档,Sol面向复杂推理、Coding和Agent任务,Terra强调能力、速度与成本之间的平衡,Luna则主要服务于高并发及价格敏感型场景。据OpenAI API Changelog信息,GPT-5.6系列于2026年7月9日发布,并于7月30日对Terra和Luna实施价格调整。具体来看,Sol价格保持不变,继续承接前沿能力及较高任务成功率对应的溢价;Terra价格下调20%,主要面向生产环境中的主流调用需求;Luna价格下调80%,通过较低调用成本扩大高并发任务覆盖及开发者使用规模。由此,OpenAI在同一模型家族内兼顾旗舰能力变现、主流需求承接与经济型模型放量。
发布三周后重新定价,显示本次调整具有较强的市场策略属性。短期内,硬件更新及推理系统优化较难单独解释Luna价格下调80%的变化幅度,早期需求反馈、不同模型间的流量分配,以及来自谷歌和中国模型厂商的竞争,均可能影响本次定价决策。从产品分工看,Luna主要承担扩大调用量、提升高并发场景渗透率及巩固开发者入口的功能;Sol继续作为能力标杆和利润锚点,维持前沿模型的定价基础;Terra则位于两者之间,承接对能力、速度和成本均有要求的生产级需求。我们认为,三级分层与差异化定价有助于OpenAI覆盖不同客户预算和任务复杂度,并提升模型家族内部的需求匹配效率。

Luna整体的低成本主要来自单Token价格下调,而非Token效率改善。据Artificial Analysis数据,完成整套Intelligence Index评测时,Luna Max产生约130M输出Token,较Sol Max高86%;Terra Max产生约96M输出Token,较Sol Max高37%,表明经济型型号并未通过压缩输出Token规模降低成本。尽管Luna多生成86%的输出Token,其完成整套指数评测的客户账单仅为Sol的5.5%,主因Token定价更低。对于Coding Agent等场景,任务成功率、重试次数及工具调用或会进一步影响总成本,较低价格只有在模型跨过任务门槛后,才能转化为实际的经济性。

OpenAI的模型Token价格经历过先降后升
OpenAI模型定价已由持续降价转向前沿提价与同代分层。据OpenAI公开价格,GPT‑4至GPT‑5期间,输入价格由30美元/百万Token降至1.25美元/百万Token,输出价格由60美元/百万Token降至10美元/百万Token;GPT-5.2发布后,前沿模型价格重新上行,GPT-5.6进一步形成Sol、Terra和Luna三档价格体系。该变化表明,单一Token价格曲线已难以完整反映能力升级与成熟能力下沉并行的行业趋势。
2025年下半年以来的价格上行主要集中于前沿模型。深度推理、Coding、Agent及专业任务需要投入更多测试时计算,同时能够覆盖过去难以完成的高价值场景,因此旗舰模型重新获得能力溢价。据OpenAI公开价格,GPT-5至GPT-5.5期间,输入价格扩大至4倍,输出价格扩大至3倍,反映厂商开始围绕能力边界和任务价值重新定价。
前沿能力提价并未改变固定能力成本持续下降的趋势。据OpenAI EU Economic Blueprint数据,达到给定AI能力水平的使用成本约每12个月降至原来的1/10,并称2023年初GPT‑4至2024年中GPT‑4o的单位Token成本压缩至原来的约1/150。该口径衡量固定能力水平,即过去由旗舰模型完成的任务,后续可由体量更小、价格更低的模型承接。我们认为,Sol反映前沿能力的市场价格,Terra和Luna则体现成熟能力商品化及成本下沉的速度。

全球竞争由能力竞赛转向“同等智能成本”竞赛
DeepSeek V4 Flash重新刷新了50分能力区间的价格底线。据DeepSeek官网和Artificial Analysis数据,V4 Flash 0731在模型架构和参数规模不变的情况下,仅通过后训练将AA智能指数由40分提高至50分,说明中国模型在算法架构和单位智能成本控制竞争中处于全球前沿。
中国模型已经形成K3比能力、V4 Flash比成本的双线竞争格局。据Artificial Analysis数据,Kimi K3 Max的智能指数为57分,仅比GPT-5.6 Sol低2分,混合价格和平均任务成本分别为2.31美元/百万Token和0.86美元,较Sol分别低约47%和54%;V4 Flash的智能指数为50分,仅比Luna低1分,混合价格和平均任务成本分别较Luna低约65%和57%。前者代表当前国产开放权重模型的能力上限,后者代表接近同等能力下的成本优势。
开放权重使国产模型的能力与成本优势具备进一步释放空间。Kimi K3与DeepSeek V4 Flash均开放模型权重,企业可根据业务需求进行私有化部署、量化和硬件适配,并降低对单一API供应商的依赖。V4 Flash拥有284B总参数、每Token仅激活13B参数,支持1M上下文;其较低激活规模为低成本部署提供计算基础。我们认为,国产模型的竞争力已经由单一API价格扩展至能力、成本、部署方式和产业生态的综合优势。

降价能否转化为收入增长,取决于调用量的价格弹性
降价后的收入平衡点取决于调用量能否按反比例增长。按Token收入不变测算,Terra价格下降20%后,调用量增长25%即可保持收入稳定;Luna价格下降80%后,调用量需扩大至原来的5倍,即增长400%。该测算仅反映价格与调用量之间的静态关系,未考虑模型组合、单位推理成本、客户结构和增量需求等因素。
Luna的调价幅度反映OpenAI对需求扩张具有较高预期。Agent、Coding、客服和研究任务通常包含多轮上下文、推理Token、工具调用及并行执行,价格下降有助于释放此前受成本约束的使用量,并提升单个客户在OpenAI平台内的工作流渗透。若开发者将更多批量任务迁移至Luna,调用规模可能通过新增场景与使用频率共同增长。
模型降价仍可能推动推理算力需求增长。单Token价格下降有助于拓展使用场景,Agent任务还会增加推理长度、执行轮次及并行任务数量。据Artificial Analysis数据,Luna Max在完整评测中产生的Token高于Sol Max,说明经济型模型并不天然对应更低总Token消耗。我们认为,只要调用量增幅高于单次任务算力消耗的下降幅度,降价仍将对推理算力需求形成正向拉动。

Token降价不仅扩大应用调用规模,也会提升单项任务的计算强度,从而推动总需求非线性增长。据《The Economics of Digital Intelligence Capital》论文,在校准后的Agent-Based Model中,当API价格一次性下降50%时,Token需求价格弹性约为1.42,同时推理深度增加45%、记忆容量增加38%、工具集成增加25%,总Token消耗随之加快增长,行业Token收入亦有所提升。论文将该现象概括为“结构性杰文斯悖论”,即单位智能成本下降后,企业将采用更复杂的Agent架构,Token需求同时受到任务数量扩张与单任务消耗提升的推动。
Terra降价后实现收入增长所需的需求增量相对可控。按照小幅变化近似,20%的价格下降对应约28.4%的需求增长,略高于维持收入所需的25%;若假设1.42的需求价格弹性在该区间内保持不变,调用量可增长约37.3%,对应Token收入增长约9.8%。因此,相关测算支持Terra通过适度降价扩大调用规模,并带动收入增长的可能性。
Luna维持收入所需的需求释放幅度明显更高。其价格下调80%后,调用量需增至原来的5倍,才能维持Token收入不变,已超出小幅弹性近似的适用范围。若假设1.42的弹性在整个价格区间内保持不变,调用量可增至约9.83倍(按照《The Economics of Digital Intelligence Capital》论文恒定弹性需求函数计算得到),对应Token收入增长约96.6%;我们认为,该结果仅属于敏感性情景,Luna能否实现相应需求增长,仍取决于低价能否推动大规模Agent工作流落地、新增客户进入及竞争对手份额迁移。

Token的智能如何更好的被定价
Token的智能衡量应由Token单价延伸至单项任务成本及单位成功结果成本。仅比较输入与输出Token价格,容易忽略三项关键变量:1)不同模型完成同一任务所需的Token数量存在差异。2)较低的任务成功率会增加重试次数,并进一步推高失败成本。3)Agent任务通常涉及多轮上下文、缓存读取、工具调用及并行执行,实际资源消耗高于单轮问答。我们认为,智能价格更关注达到可比能力水平所需的实际推理成本,而非单一Token账单。

方式#1:Token购买力与智能购买力
“一美元能买多少智能”可以从Token购买力与智能购买力两个维度衡量。我们定义:Token购买力等于1美元除以混合价格,用于表示单位预算可购买的百万混合Token数量,主要反映模型调用规模;智能购买力指标等于AA智能指数除以混合价格,用于观察单位预算对应的模型能力与Token规模组合,主要反映能力与价格的相对关系。需要注意的是,两项指标均属于价格与能力的比较工具,不能直接代表模型的任务完成质量。
V4 Flash在单位预算对应的模型能力与调用规模方面超过Luna。据Artificial Analysis公开价格,1美元可购买约16.67百万V4 Flash混合Token,对应智能购买力指标为833.3,约为Sol的61.4倍、Luna的2.78倍;Luna的对应指标为300.0。V4 Flash的AA智能指数为50分,仅比Luna低1分,因此该差异主要来自其0.06美元/百万Token的混合价格。需要注意的是,智能购买力属于能力与价格的相对比较工具,不能直接代表不同任务中的实际完成质量。

方式#2:平均任务成本才是定价关键
智能购买力代理指标仅适用于能力与价格的相对比较,不能视为可线性累加的智能总量。AA Intelligence Index属于综合基准得分,60分并不代表30分的两倍能力;同时,不同模型完成同一任务所需的Token数量、推理轮次及重试次数也存在差异。因此,Token购买力与智能购买力主要用于回答“同一预算可调用多少Token,以及这些Token对应何种能力水平的模型”,任务层经济性仍需结合实际Token消耗、任务成功率及失败成本进行综合判断。
平均任务成本可进一步衡量模型完成典型任务的实际经济性。据Artificial Analysis方法,Cost per Task汇总Intelligence Index各项评测中的输入、缓存、推理及输出Token,并计算单项任务的加权平均成本。我们统计了全球典型模型,API服务商优先采用原厂口径,如未披露原厂任务成本,则采用其他供应商的实测值。

V4 Flash在接近Luna能力水平的同时,将平均任务成本进一步降至约0.03美元。据Artificial Analysis数据,V4 Flash的AA智能指数为50分,仅比Luna低1分,平均任务成本约0.03美元,较Luna的0.07美元低约57%。V4 Flash完成整套指数评测产生约210M输出Token,较Luna的130M高约62%,其任务成本优势主要来自更低的单Token价格。V4 Flash同时开放权重,进一步增加了企业私有化部署和持续优化推理成本的空间。
国产模型已经同时进入高能力前沿与单位任务成本经济性前沿。Kimi K3 Max以57分智能指数接近Sol的59分,平均任务成本约0.86美元,较Sol的1.86美元低约54%。我们认为,K3证明国产开放权重模型能够接近全球前沿能力,V4 Flash则证明中国模型仍能在相近能力下建立更低的任务成本优势。
方式#3:先考虑任务阈值,再考虑性价比
高难任务的模型比较应优先关注是否能成功完成任务,而非平均任务成本。对于常规任务,多款模型均可能提供合格结果,经济型模型通常具备成本优势;但在网络攻防、前沿数学、超长上下文及模型自我改进等场景中,任务成功率将成为关键约束。据OpenAI评测数据,Sol与Luna在上述高难任务中的表现差距显著扩大,说明综合指数接近并不意味着模型在复杂场景下具备相近的任务可用性。因此,平均任务成本更适合衡量常规任务经济性,对高难任务仍需结合成功率及能力门槛进行判断。
Luna在多项高难任务中的表现明显弱于Sol,反映两者在前沿能力上的差距远大于综合指数差异。据OpenAI数据,在ExploitBench、KernelGen 1P和MRCR v2 8-needle评测中,Sol得分分别为73.5%、61.1%和91.5%,Luna分别为33.2%、22.4%和41.3%,Sol约为Luna的2.21倍、2.73倍和2.22倍。据ARC Prize数据,Sol在ARC-AGI-3官方半私有集得分7.78%,Luna仅为0.18%,Sol约为Luna的43.2倍,Luna在该任务上接近失效。上述结果表明,Luna虽具备较低调用成本,但在网络攻防、基础设施优化、超长上下文及交互式推理等高难场景中的可用性仍受到明显限制。

模型应先设定任务成功率门槛,再在达标模型中比较成本。当Luna满足业务要求时,其较低价格具备更强经济性;当任务要求超长上下文成功率达到70%、KernelGen达到50%或FrontierMath Tier 4达到75%时,Luna将退出候选范围,企业需要升级至Terra或Sol。此时,旗舰模型较高价格所购买的是任务可行性与更高成功率,而非常规任务中的额外Token数量。

单次调用价格较高,并不必然对应更高的成功任务总成本。单位成功任务成本可表示为“单次任务成本÷任务成功率”;若进一步考虑失败损失,模型预期价值可表示为“成功率×任务价值-单次成本-失败率×失败损失”。任务价值越高、失败代价越大,成功率差异越可能覆盖旗舰模型的价格溢价。
在ARC-AGI-3等高难任务中,较高调用价格可能对应更低的单位成功任务成本。以Artificial Analysis当前平均任务成本作为单次尝试成本代理,Claude Opus 5 High单次成本约为Luna的17.6倍,但成功率约为Luna的168倍,对应单位成功任务成本约4.08美元;Sol单次成本约为Luna的26.6倍,成功率约为Luna的43倍,对应单位成功任务成本约23.91美元,仍低于Luna的38.89美元。低于1%的成功率通常难以通过机械重试形成稳定供给,因此Luna的555.6次和Terra的125次更接近“能力尚未跨过门槛”,不宜理解为增加调用次数即可获得稳定成功。
ARC-AGI-3现阶段尚不足以支持国产与海外模型的全面同口径比较。截至2026年7月31日,据ARC Prize公开状态,Kimi K3仍处于测试阶段,DeepSeek V4 Flash、GLM-5.2、Qwen3.7 Max、DeepSeek V4 Pro和MiniMax M3暂无公开验证结果。在已完成验证的模型中,Claude Opus 5和Sol的成功率处于较高水平,Grok、Terra和Luna仍低于1%。我们认为,现阶段该评测主要用于识别已测试海外闭源模型内部的能力差异,暂不足以形成完整的中外模型排名。后续中国模型有望持续通过算法和Infra优化,实现对头部闭源模型的逼近。

低价模型的实现路径
因素#1:MoE架构或降低激活参数
MoE架构通过稀疏激活降低单Token计算量,或为低价模型提供了重要基础。传统稠密模型在每次推理时需要调用大部分参数,MoE模型仅激活与当前任务相关的部分专家参数,从而降低单Token计算负担。据Artificial Analysis数据,V4 Flash拥有284B总参数、每Token仅激活13B参数,激活比例约4.58%;其AA智能指数达到50分,混合价格约0.06美元/百万Token,完整指数评测成本约72.02美元。尽管完整评测产生约210M输出Token,其完成指数评测成本仍明显低于Luna,说明较低激活规模为低成本部署提供计算基础,较低Token定价则将成本优势传导至客户账单。

因素#2:模型厂商的推理效率优化
模型厂商的推理系统优化是推动API价格下降的重要因素。同一模型在不同API供应商之间具有基本一致的模型权重,但单位Token价格、输出速度和任务成本仍可能存在明显差异,说明服务价格不仅取决于模型本身,也受到量化精度、硬件配置、批处理规模、并行策略、任务调度及基础设施运营效率影响。通过提升推理吞吐、降低单位计算资源消耗,供应商能够在不改变模型能力的情况下压低服务成本,并为Token降价提供空间。
开源模型在不同API供应商之间的价格、任务成本与推理速度差异较为显著。据Artificial Analysis数据,GLM-5.2 Max跨供应商混合价格相差5.1倍、任务成本相差4.4倍、输出速度相差10.7倍;MiniMax M3的任务成本和输出速度分别相差4.1倍和9.1倍。同一模型跨供应商出现数倍价格与成本差异,仍表明推理系统及部署工程优化能够显著降低单位服务成本,是推动Token价格下降的重要因素。

因素#3:缓存命中可降低重复上下文的边际成本
缓存机制能够显著降低重复上下文调用的边际成本。据OpenAI API Pricing,GPT-5.6三个档位的缓存读取价格均为新增输入价格的10%,缓存写入价格均为新增输入价格的1.25倍。对于需要反复调用相同系统提示、历史对话或长上下文的任务,较高缓存命中率可减少重复输入对应的计费成本,从而改善模型在持续运行场景下的经济性。
缓存命中率提升能够同步降低不同档位模型的稳态调用成本。通常复杂任务的输入Token远大于输出Token,我们假设固定输出Token占比为10%,其余90%为输入Token,并分别假设缓存读取Token占总Token量的0%、50%和70%;测算不含首次缓存写入,适用于缓存已建立并被重复使用的稳态场景。测算结果显示,当缓存命中率达到70%时,Sol、Terra和Luna的混合价格均可下降约42%。我们认为,缓存是降低大模型重复调用成本的重要工具,尤其适用于Agent、多轮对话及长上下文等高频复用场景。

产业影响:应用需求加速释放,国产模型迎来多维竞争机会
AI应用是模型降价的直接受益环节。客服、搜索、营销生成、Coding Agent、办公助手和数据分析均需要持续调用模型,模型降价能够降低单次推理和多轮Agent执行成本,并为提高使用频率、增加Agent执行次数及优化应用公司毛利率和付费转化提供空间。
降价带来Token使用量提升,K3与V4 Flash进一步强化国产模型的产业竞争力。GPT-5.6降价说明低成本推理已成为全球模型竞争方向,V4 Flash随后以更低混合价格和任务成本进入50分能力区间,进一步证明中国厂商仍具备单位智能成本优势。K3则以57分智能指数接近海外旗舰,表明国产开放权重模型也已进入高能力区间。未来,国内厂商可依托真实任务能力、开放权重、私有化部署、国产算力适配、中文场景优化及企业服务持续形成差异化优势。我们认为,国产模型已经从单一价格竞争扩展至强能力与高性价比并行。
风险提示
模型调用需求增长不及预期。模型降价可能无法带动调用量同比例增长,进而影响模型厂商收入及盈利改善。
AI应用商业化进展不及预期。推理成本下降向付费用户、收入和利润的传导可能慢于预期。
模型能力迭代不及预期。可能限制复杂任务、Agent及企业级场景的需求释放。
第三方评测口径及数据变化风险。第三方评测口径、模型版本和API价格可能持续调整,不同模型的测试条件及推理配置也存在差异,相关比较结果可能发生变化


VIP复盘网