研发团队用AI写代码时,最怕长任务跑到一半卡住;客服系统在高并发下,毫秒级的延迟都会被用户感知;运营部门调用智能体时,任何一次调用失败都可能打断整条任务链……
当企业把大模型真正用进业务之后,企业对Token服务的要求,已经从“能用”升级为“要稳、要快、要可靠”。
也正因此,Token服务的标准正在被重新定义。
今日,中国信通院公布第三批“词元(Token)服务能力攀登计划”结果。网宿科技凭借边缘AI网关在模型服务性能、稳定性及Token输出效率方面的综合表现,达到企业级 Token服务性能攀登基线,入选第三批“Token服务能力攀登计划”,跻身高质量Token服务梯队。

三项核心指标,定义企业级Token服务基准
Token调用量正以前所未有的速度增长。中国日均Token调用量已从2024年年初的 1000亿次/天,飙升到今年6月初的近175万亿次/天。
当调用规模高频化,行业迫切需要一套统一、客观的性能标准,来衡量不同Token服务对企业级业务的实际支撑能力。
在此背景下,中国信通院启动“词元(Token)服务能力攀登计划”,围绕Token服务工程化落地中的性能、稳定性与成本等关键问题,通过“大模型Token服务性能监测平台”开展测试,并按季度动态更新行业统一的性能基准。
企业级通用场景性能攀登主要考察三项核心指标:
每秒输出Token数(TPS)≥55个/秒
首Token时延(TTFT)≤0.9秒
调用成功率≥99.9%
TPS直接反映文本生成效率和模型计算吞吐能力,对于长文本、代码生成、报告撰写等任务,TPS往往决定任务完成时间。
TTFT是从用户请求发起到首个Token返回的端到端耗时,包含排队、网络、Prefill计算等全环节,决定用户主观感受到的“反应速度”。在对话、代码生成、Agent工具调用等场景中,TTFT过高不仅会打断交互节奏,还可能让用户误以为服务无响应。
调用成功率则关系到在大量、持续的API请求下,任务能否持续、稳定地运行。

放到企业真实业务场景中,单次调用性能上的差异,会在长期、高频运行中不断累积,最终影响整体业务效率、资源消耗与服务稳定性。
因此,这三项指标共同构成了企业级Token服务的基础能力门槛。
网宿实测:全面超越基线
作为国内率先推出Token服务平台的厂商之一,网宿边缘AI网关聚合了200+主流模型能力,覆盖文本、代码、视频、图像、语音等丰富模型类型,企业通过统一接口即可完成模型调用。
近年来,网宿持续升级在多模型接入、智能调度、精细化运营和生产级保障等方面的能力,为办公辅助、软件编程、广告设计、电商营销、游戏创作等场景的AI应用落地提供支撑。
在信通院实测中,网宿三项核心指标全部优于基线:
TPS:较基线要求高出95%
首Token时延(TTFT):较极限要求优化65%
调用成功率:100%
这一表现背后,一方面得益于网宿覆盖全球的3000+节点资源和边缘基础设施能力,能够显著降低模型调用时延,并提高稳定性,另一方面,网宿依托自有GPU算力,对模型进行深度定向调优,在更低算力成本下实现更快推理、更高精度,为企业提供更具竞争力的AI引擎。
此次入选信通院第三批“Token服务能力攀登计划”,不仅是对网宿Token服务性能与工程化能力的权威验证,也为企业评估和选择Token服务提供了客观参考。
面向未来,网宿科技将持续完善AI Token服务体系,致力于让企业能够更简单、更稳定、更高效地调用大模型能力,推动AI应用加速走向规模化落地。


VIP复盘网