
新智元报道
新智元报道

就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。
事情是这样的。
9月1日,Hugging Face上线了两个开源端侧模型:星火X2.5-4B和1.7B。
本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两圈的对手,狠狠地秀了一把肌肉。

比如考验多轮工具调用的τ³-bench,拿了30.4分。这测的是极限定力,几十步操作连轴转,中间只要错一步,整个任务直接拉胯。
测试MCP协议的MCP-Atlas,拿下54.6分。把它丢进真实的API环境里,它给接口填的参数严丝合缝,一点报错的空子都不钻。
自主上网搜信息的BrowseComp,跑到40.9分。哪怕网页里一堆弹窗和垃圾代码,它照样能像活人一样,把有效数据生抠出来。
至于专考「听人话」的IFBench,更是飙到了75.0分。面对那种字数超长、格式层层叠加的变态指令,它硬是做到了一丝不差。
在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。
1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。
光看数字没意思,我们第一时间把它下下来跑了跑。
装进本地环境后,直接下指令:写一个霓虹烟花的HTML页面。代码出得极其利落,一口气吐完,中间不带卡壳的。
跑出来的效果确实惊艳。
鼠标点哪儿哪儿炸,一簇七十多颗粒子四散开来,同一朵烟花颜色高度统一,粉的、青的、橘的随机切换——烟花的物理动态和氛围感,一下就出来了。
值得一提的是,这两款模型从头到尾都基于全国产算力平台完成训练,部署端更是打通了英伟达、华为、海光及后摩等主流硬件平台。
做这件事的,是科大讯飞全资子公司「词元星火」。

过去这两年,大模型的故事几乎全发生在云端。参数越堆越庞大,离真实用户却越来越远。想用?必须先联网,还得把数据乖乖交出去。
可现实中偏偏有一大批机器「碰不到云」。比如内网里的办公电脑、工厂车间里的终端设备。
这些无网场景当然也有人试过水,办法无非两种。
要么,硬往本地塞几十、上百B的开源大模型,结果对硬件要求极高,部署折腾半天,跑起来还像看幻灯片; 要么,退而求其次用个小尺寸模型。
可过去的小模型,能力大多停留在「陪聊」和「文字续写」。你把一叠报表扔给它说「帮我整理一下」,它大概率会一本正经地给你回复一段「整理建议」。
端侧模型的尴尬一直卡在这儿。它只会动嘴,动不了手。
而用户的诉求其实特别朴素:几十页的操作手册能不能一次性读完?一个需要多步操作的复杂任务能不能直接帮我干完?
星火X2.5这两个模型,冲的就是这件事。
要干脏活累活,第一步是得先「挤得进」那台机器。
在BF16精度下,4B模型的权重只占8个多G,1.7B模型只要3个多G。如果做一下4bit量化,体积还能再砍一半。
尺寸压到这份上,它的使用场景就非常清晰了。
把4B模型直接放进笔记本和工作站,哪怕是塞进一套正在运行的老旧业务系统里也毫无压力;
1.7B模型则专攻汽车座舱、智能家居等,一台普通手机就能轻松带飞。

「应当」被改成了「可以」。就这两个字的差别,强制义务瞬间变成了任意条款。人类审阅时,眼睛一扫极容易滑过去。
「知识产权」条款整段消失。B版合同里关于衍生成果归属的那段根本不存在,它是顺着条款编号递进的逻辑硬揪出来的。找一个「不存在」的东西,远比找一个「被修改」的东西要难得多。
违约金条款,它竟然连着看了。 乙方违约金从万分之五降到了万分之三,甲方却没动,两条原本对等的条款现在不对等了。这种相隔好几行的内容,必须具备全局记忆力才能比对得出来。
除此之外,它还严谨地逐条列出了A版原文、B版原文、对我方的影响以及风险等级,最后按高、中、低风险分档汇总,并附上了五条应对建议。这套东西拿到手,基本上可以直接转发给法务,连返工都省了。
审完文本合同,紧接着是更硬核的数据处理。
我们丢给它一张未经处理的原始表格。结果它自己写了段Python代码,自己跑通,自己生成了分析报告。
从理解需求、写脚本、执行到检查结果,全程零插手。它不是在给你提供「建议」,而是真刀真枪地自己动手,把文件盘了出来。
抓异常的眼光,更是极其毒辣。
单笔超5000审批上限的4条、字段缺失的3条、有拆单嫌疑的11条,被它揪得一清二楚。
连带周末报销、负数金额、小数位异常、工号姓名不匹配、甚至日期格式混乱这种恶心人的暗病,全被它挨个高亮标出。
最关键的是,交付的报告格式严丝合缝,打开就能直接用,彻底免去了人工二次排版的折磨。
对于财务、审计、法务这些天天跟敏感数据死磕的岗位来说,这才是决定AI到底「能不能用」的绝对分水岭。
而且别忘了,这一切全部是在一台断网的笔记本上完成的,合同数据连一个字节都没有离开过这台机器。

为了让端侧小身板爆发出这种越级的智能体能力,词元星火在底层和后训练阶段,砸出了两套绝活。
第一招:混合注意力机制,把显存抠到极致。
要干复杂的活,首先得「看得全」。
星火X2.5不仅原生支持最长100万Token的上下文,还在底层架构上动了刀,极其聪明地把注意力层一分为二。
一层负责通读全文建立宏观联系,另一层则死抠眼前的局部细节。
这样既能看得足够远,又不需要在每一层都把算力拉满。
而省下来的,全是端侧最宝贵的显存。同样跑满100万Token,它占用的显存只有传统全局注意力模型的四分之一。
端侧模型记性差、长文本前言不搭后语的老毛病,就这么被治好了。
第二招:多教师在线策略蒸馏(MOPD),不教答案只教「走法」。
看全了之后,还得「会干活」。
为了把复杂的动作逻辑塞进4B的参数里,研发团队打出了一套叫MOPD的组合拳。
首先,用高质量数据打底,再按编程、推理、工具调用分科开小灶,练出一批在垂直领域登峰造极的「单科专家」大模型。
接下来就是核心环节——用这些老师傅去带徒弟。
传统蒸馏往往是老师给出标准答案,小模型照着死记硬背。但小身板的脑容量摆在这,硬知识装不下就是装不下。
而MOPD玩的,是更硬核的「在线策略」。
简单来说就是,小模型先自己上手去盘这道题,老师傅则在旁边全程督战,一步步纠正路线。读需求、挑工具、填参数、查报错,失败了换条路再来。
相比于硬塞知识的老路,它能把「遇到问题怎么解」这套动作机制,直接传给小模型。

跑分和性能只是第一关。真正决定AI能不能大规模落地的,是它能不能顺畅地活在真实的行业设备里。
按照国资委79号文给出的时间表,到2027年底前后,央企国企必须完成信息化系统的信创替代——芯片、操作系统、中间件、基础软件,要求100%替换。
这背后是一个巨大的市场。
据券商测算,政企信创的市场空间动辄在数千亿乃至万亿级别。单单是党政口径,2025到2027年间的PC替换需求就在千万台量级。
而2026和2027,就是集中交付的关键节点。
再加上今年8月施行的《网络数据安全风险评估办法》明确规定,采用AI大模型等新技术必须纳入动态安全评估。于是,「这份数据要不要发给云端大模型处理」已经不是成本问题,而是合规红线问题。
这些机器嗷嗷待哺的,正是一个能在国产芯片上跑、不需要联网、尺寸又足够小能塞进存量硬件里的模型。
星火X2.5的出现,几乎是严丝合缝地对上了这个缺口:
算力自主:国产算力上训出来,国产硬件上跑得动。
兼容性强:框架侧兼容vLLM、SGLang、llama.cpp,放在Ollama和LM Studio里几分钟就能跑起来。
极致开源:权重采用Apache-2.0协议,不仅免费商用,微调后也无需开源。想做垂直场景的,拿LLaMA-Factory跑自己的数据就行。
目前,模型的权重、代码仓库和部署文档都已经毫无保留地在Hugging Face、ModelScope和GitHub上开放,API也同步上线了MaaS平台,限时免费。
Hugging Face地址:
https://huggingface.co/collections/XHToken/spark-x25
Github地址:
https://github.com/XHToken/Spark-X2.5
ModelScope地址:
https://www.modelscope.cn/collections/XHToken/Spark-X25
MaaS平台接入:
https://maas.xfyun.cn/modelSquare
在国内,「AI落地」往往被看作一个纯粹的应用题,大家都在卷谁的助手更好用,谁的Agent更花哨。
但那千万台在物理上隔绝的机器,面对的却是一道严酷的生存题。
它们连不上云,它们必须先拥有一个「装得进去、且真能干活」的引擎,然后才有资格谈好不好用。
而这道题也不止摆在办公电脑面前。路上跑的车机、客厅里的音箱、产线上的机器人,处境是一样的。网络时断时续,算力就那么点,活还得当场干完。
它们要的不是一个琴棋书画样样精通的全才。把手头那份操作手册读完,把那张表理顺,把那条指令一次执行对,就够了。
过去我们在评测时总爱问,这个模型有多聪明?但从现在开始,整个行业更该问的是,这个模型,能适配多少台设备?
最后,再来一个彩蛋。
9月7日,科大讯飞还将正式发布全新一代旗舰通用大模型——星火X2.5。届时,其代码与智能体等核心能力,将迎来又一次全面进化。
编辑:所罗门 摩西


VIP复盘网