扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 Token消耗减少75%,千问办公创造了新的“省钱模式”

股市情报:上述文章报告出品方/作者:AI前线;仅供参考,投资者应独立决策并承担投资风险。

Token消耗减少75%,千问办公创造了新的“省钱模式”

时间:2026-08-28 16:03
上述文章报告出品方/作者:AI前线;仅供参考,投资者应独立决策并承担投资风险。

在功能逐渐趋同、越来越难以拉开代差的当下,办公 Agent 的竞争正在卷向模型与 Agent 架构的深度协同。

8 月 26 日晚,阿里千问大模型团队发布 Qwen3.8-Flash,并同步开源(开放权重的模型版本为 Qwen3.8-Flash-Next)。这是一个 多模态 MoE 模型,主模型参数量为 125B,额外加入 51B N-gram Embedding,每个 Token 只激活 6B 参数。 该模型拥有极致性价比,输入每百万 Tokens 仅需 0.8 元,输出每百万 Tokens 2.7 元。

几乎是同一时间,Qwen3.8-Flash 首发上线千问办公全新的标准模式,其单任务生成速度提升约 100%,Token 消耗平均减少 75%,同时还保证了任务质量,Agent 使用成本大幅降低 

image

对办公 Agent 来说,比单纯拉低使用成本更有意义的是,千问大模型与千问办公团队实现模型和 Agent 双向协同,打破了成本、性能和速度的不可能三角,用户使用标准模式就可以覆盖约 95% 的日常任务。如果这个数字成立,过去那种精打细算、舍不得把 Agent 用在小事上的使用方式,或许真的可以成为历史。

价格已经足够低,能力到底有没有跟上?是否真的跨过 Agent“斩杀线”?我们实际跑了几轮任务,给千问办公来了场突击小考。

 95% 的办公任务,

不需要最贵的 AI?

先从职场人最熟悉的周报开始。一周的工作散落在会议纪要、聊天记录、待办列表和各种临时笔记里,把这些零散材料一股脑丢给千问办公,让它别写流水账,自己找重点,整理成一份领导能直接看的周报。看看它怎么说:

周报.png

它没有机械地按照原始材料的顺序重新排列,而是把重复出现的项目进展做了合并,也区分出了本周主要成果、风险与需协调事项、下周工作重点。并且千问办公还能连接外部应用、日历和服务,连上钉钉后,精简版周报可以直接发到钉钉消息里,从整理材料到交付,中间不需要再复制粘贴一次。

连接器.png
钉钉发送.png

除了标准办公任务,一些临时冒出来的奇思妙想,也可以直接丢给它。

比如,我提了一个需求:需要一个网站自动抓取各个天气网站未来一周内的天气情况,综合分析,并根据温度、舒适度、雨雪等分析推荐出今日通勤的服装和注意事项。

这个需求如果自己动手,至少要先找天气数据接口,再处理城市定位、页面结构和穿衣规则。千问办公很快给出方案,调用公开天气 API,完成页面和规则逻辑,最后交付了一个可以直接打开的网页。

通勤天气助手.jpeg

经常用 Agent 的人都知道,最纠结的不是某个任务要不要交给它跑,而是到底该选哪一档。

像千问办公这类 Agent,通常都会给用户提供几个不同能力档位。比如 Manus 有 1.6 Lite、1.6 和 1.6 Max;ChatGPT 也提供 Instant、Medium、High、Extra High、Pro 等不同推理档位;还有一些 Agent 把选择权交给用户,放上一堆模型让用户自己选;千问办公过去的模型供给也分为经济、基础、高级三种模式,这次更新之后,直接收拢为标准和高级两档。

选择看起来很多,但真碰上稍微复杂一点的任务,用户大都本能地往高级模式上选。毕竟已经花时间上传了一堆文件、写了一长串提示词,谁都不想最后只拿到一个 60 分的结果。与其返工重来,不如一开始就把最好的模型用上。

这也是标准模式真正需要回答的问题:便宜归便宜,到底够不够用?

我们又拿同一个任务分别跑了标准模式和高级模式。这一次,我们丢给千问办公一份工作报告,让它把原本的文字材料做成一个带留言框的网页。最终两个版本的完成度比较接近。高级模式在部分细节处理和页面呈现上更完整一些,但标准模式已经能把需求理解、内容组织、页面生成和基础交互完整跑下来。

标准模式:

工作报告 - 标准模式.png

高级模式:

工作报告 - 高级模式.png

差距更明显的地方,是积分。

标准模式执行过程中,单次积分消耗大多还停留在零点几;切到高级模式后,同类任务的积分消耗很快进入两位数。如果每天都把整理材料、做网页、处理文件这类任务交给 Agent,差距会迅速累积起来。

积分消耗对比.png

这也是标准模式更有意思的地方。它未必要在每一道题上都超过高级模式。只要那些每天都会发生、结果达到可用线就够的工作能够稳定完成,用户就少了一个每次都往高级模式上点的理由。从精打细算地用,到想到什么就随手丢进去,差的其实就是这一步。

标准模式为什么能便宜这么多,还够用?这笔账,要从模型内外两头算。

  模型和 Agent 协同:

两“王炸”双向优化

千问办公这轮变化,实际上发生在两个层面:模型内,首发 Qwen3.8-Flash 继续提高单位计算量能够换来的能力;模型外,通过 Agent Harness、上下文管理和工具调用,把这些能力更高效地用起来。

先看模型内。

Qwen3.8-Flash 最核心的变化,是在尽量少增加计算开销的前提下,把模型容量和实际能力继续往上推。

它采用 MoE 架构,主模型参数量达到 125B,但每个 Token 只激活 6B 参数,同时额外加入 51B N-gram Embedding。总参数量很大,真正参与单次计算的部分却很小。这也是它所谓“高智能密度”的来源之一:模型可以保留千亿级参数带来的容量,又不需要每生成一个 Token,都让全部参数参与计算。

这种效率提升,来自 Qwen3.8-Flash 对 Attention、Residual、Embedding 和 Optimization 四个部分的系统升级。其中,给笔者带来最大惊喜的是 Attention 层面的变化。

办公 Agent 天生是长上下文大户,任务跑得越久,需要处理的 Token 越多,传统 Full Attention 的计算和 KV Cache 访存成本也会随之上涨。

Qwen3.8-Flash 延续了 Qwen3.5 的架构设计,采用 GDN   Attention 的 Hybrid 架构:每四层中三层使用 GDN,将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。此外,Qwen3.8-Flash 还引入了 Qwen Sparse Attention(QSA),通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文。可以理解成,GDN 负责把大量历史信息压缩记住,真正需要找细节时,QSA 先做一轮粗筛,从长上下文里找到最相关的区域,不用每次都把全部内容重新过一遍。

image

根据官方披露的数据,在 1M Token 上下文下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段最高分别实现 7.6 倍和 4.9 倍加速;在 Prefix Cache 命中率 90% 的测试条件下,Qwen3.8-Flash 的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。

image

Residual、Embedding 和 Optimization 也分别从信息传递、模型容量和训练效率上继续压缩成本:

  • Residual: 引入 Gated Residual(GR),把原本单一的 Residual Stream 扩展为 4 条分支,再通过动态 Gate 控制不同信息的读取和写入。相当于给模型内部的信息传递多开了好几条路,重要信息一路保留下来,减少信息损耗。

  • Embedding: 引入 N-gram Embedding,利用当前 Token 和前序局部上下文进行查表,在增加很少计算量的情况下扩展模型容量。相关 Embedding Table 还可以放在 Host Memory,通过异步 Prefetch 与模型计算并行。相当于给模型额外挂了一个记忆库,能记住更多东西,但不用每次推理都付出相应规模的 GPU 计算成本。

  • Optimization: 采用 Muon Optimizer,重新划分 Muon 与 AdamW 负责的参数类型,同时针对新架构重新拟合 Scaling Law,让同样的算力能更快、更稳定地把模型训到目标效果。

这四项改动,让 Qwen3.8-Flash 能够在尽量少动用计算资源的前提下,把模型能力维持在一个足够高的水平。模型价格能继续往下走,首先有赖于这种底层效率的提升。

但对办公 Agent 来说,模型本身只解决了一半问题,模型外的能力同样重要。

过去做 Agent,常见路线是先找一个足够强的通用模型,再在外面接规划、工具、Memory、Sandbox 和一套 Agent Loop。模型团队负责把能力做强,Agent 团队负责想办法驾驭它。

两边如果长期各自优化,很快就会暴露问题。典型的就是工具调用。模型不熟悉工具的能力边界,可能本来一次调用就能解决的问题,先选错工具,再换一个重试。每多走一步,背后都是新的模型调用和 Token 消耗。

另一个重灾区是上下文。Agent 跑得越久,对话历史、检索结果等信息就堆得越多。如果 Harness 缺乏有效的压缩和筛选机制,就只能不断把越来越长的上下文重新塞给模型。模型每一轮都在重复阅读大量已经处理过的信息,速度越来越慢,成本也跟着往上涨。

这也是为什么,业内越来越多团队开始把模型和 Agent 放到一起优化。

比如 OpenAI 的 GPT-5-Codex,就是专门针对 Agentic Software Engineering 训练,甚至还调整了 Codex Agent 的 Prompt、工具定义和 Agent loop,让 Harness 更适配模型。官方的表述是:GPT-5-Codex was trained for Codex,同时 Agent implementation 也经过专门调优。

阿里在 Qoder 上也走过类似路线。今年 2 月,Qoder 发布定制模型 Qwen-Coder-Qoder,基于 Qwen-Coder,通过大规模强化学习针对 Qoder 的 Agent 架构、工具和真实 Coding 场景进行适配。

到了千问办公,这套模型与 Agent 协同优化的方法,开始从 Coding 进一步扩展到办公场景。这也是为什么,这次千问办公首发 Qwen3.8-Flash 值得拿出来讨论。千问大模型团队和千问办公没有各自做完自己的部分再拼起来,而是在训练、推理、工具调用和 Harness 层面一起调:模型为真实办公任务适配,Agent 也围绕模型的行为方式重新设计执行路径。

准确来说,办公专属版本 Qwen3.8-Flash 就是千问大模型团队与千问办公团队联合推出的,在多步规划、工具选择、上下文压缩等场景上做专项训练,同时结合推理优化和定制 Harness 提升整体吞吐效率。

这些工程优化最终都会落到 Token 账单上。数据显示,在真实办公场景测试中,千问办公标准模式的单任务生成速度提升约 100%,Token 消耗平均减少 75%。

一边降低每一个 Token 的价格,一边减少完成同一项工作需要多少 Token。Agent 与模型的双向优化,试图真正打破性能、成本和速度的“不可能三角”。过去逼疯无数打工人的“Token 焦虑”,或许真能翻篇了。

 逼疯打工人的“Token 焦虑”,

可以休矣

Token 焦虑,已经不分国界,也不太分职级。甭管是在硅谷还是国内,也不论高管还是普通打工人,都开始围着 Token 算账。区别是,有人焦虑自己用得太少,有人焦虑自己根本不够用。

在硅谷,这种焦虑甚至已经演变成一种新的生产力竞赛,甚至还出现了一个很硅谷的词:Tokenmaxxing,想方设法把 Token 用到极致。

Meta 此前把这件事推到了一个相当夸张的程度。今年 4 月,The Information 报道,Meta 员工自发做了一个名为 Claudeonomics 的内部排行榜,追踪超过 8.5 万名员工的 Token 使用情况。榜单显示,排名最高的一名员工个人消耗量达到 2810 亿 Token。这是什么概念?如果粗略按一页 PPT 从资料整理到生成消耗 1 万 Token 计算,2810 亿 Token 足够生成约 2810 万页 PPT。如果按照 Claude Opus 4.6 输入、输出价格的简单平均值粗略估算,2810 亿 Token 对应的价格超过 400 万美元,约合人民币 3000 万元。

企业高管也在推波助澜。英伟达 CEO 黄仁勋今年在 All-In Podcast 谈到,公司应该给工程师足够多的 AI Token。如果一个年薪 50 万美元的工程师一年只花掉很少的 AI 计算预算,他反而会担心;他给出的理想量级甚至接近每年 25 万美元。特斯拉和 OpenAI 的前顶级 AI 科学家、现任 AI 教育初创公司负责人 Andrej Karpathy 的说法更接近一种新式焦虑。他在播客里提到,如果订阅额度到月底还剩很多,他会觉得自己没有充分利用能够获得的 Token 吞吐。

硅谷工程师焦虑 Token 用得不够多,普通人焦虑的是,Token 到底会花掉多少真金白银。

和传统 SaaS 相比,Agent 的账单很难在使用之前算得明白。所以,一个有点无奈又好笑的现象是,为了节省 Token,一些工作不舍得交给 Agent 跑。

这次千问办公更新里,输入每百万 Tokens 0.8 元、输出每百万 Tokens 2.7 元、缓存命中每百万 Tokens 0.1 元,这些数字都很抢眼。但还有两个数字也值得关注:95% 和 75%。按照千问办公给出的数据,95% 的日常任务可以交给标准模式完成;在真实办公场景测试中,标准模式平均 Token 消耗减少 75%。

一个降低单价,一个减少用量。有声音评价千问办公重新定义 Agent 的“斩杀线”,原因也在于此。并且这条“斩杀线”,实际上不是一次模型降价就能划出来的。

8 月 3 日开启公测的千问办公,整合了此前 QoderWork、MuleRun 和悟空的能力,把桌面 Agent、云端 Agent 和企业协同放进同一套产品。随后开放的 MyContext,又开始把 IM、文档、日历、会议等分散的工作数据加工成 Agent 可以持续使用的上下文。模型、Harness、Context,再到办公应用,阿里的企业 Agent 路线逐渐拼出了一条完整链路。

这次模型和 Agent 实现深度协同优化,进一步打出了 Agent 同质化竞争的差异化优势。

过去两年,大模型行业花了大量精力证明 AI 到底能完成多难的任务。Agent 真正走进办公室以后,问题开始变得更现实:它能不能便宜到让人舍得天天用?毕竟,真正决定办公 Agent 能否成为日常工具的,可能不只是它能做多少高难度任务,而是面对那些每天都会发生的小事,用户还需不需要在按下执行之前,先算一遍 Token。

股票复盘网
当前版本:V3.0