扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 沐曦股份携手众智FlagOS完成Qwen3.8-Flash-Next Day 0适配

股市情报:上述文章报告出品方/作者:沐曦股份MetaX;仅供参考,投资者应独立决策并承担投资风险。

沐曦股份携手众智FlagOS完成Qwen3.8-Flash-Next Day 0适配

时间:2026-08-27 15:29
上述文章报告出品方/作者:沐曦股份MetaX;仅供参考,投资者应独立决策并承担投资风险。

阿里千问开源多模态 MoE 模型 Qwen3.8-Flash-Next沐曦股份与众智FlagOS合作,率先完成曦云C系列GPU对该模型的Day 0 适配,实现基于曦云C系列GPU硬件环境下的推理部署验证。



Qwen3.8-Flash-Next从注意力、残差、Embedding、优化器四个方面做了系统性升级,在提升模型能力的同时进一步优化计算效率、模型容量与训练稳定性:


注意力:GDN   QSA 混合架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA)用压缩后的轻量索引器在 micro-block 粒度上挑选重要上下文,大幅降低长序列的注意力开销

残差:Gated Residual(GR)把残差流加宽为4条分支,由动态门控控制读写,增强跨层信息流动与训练稳定性

Embedding:N-gram Embedding 用局部上下文查表来扩展模型容量,额外计算量很小;查表参数可放到 Host Memory,通过异步预取与模型计算重叠

优化器:使用 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的参数分工、融合参数拆分三方面做了改进,并针对新架构重新拟合 Scaling Law

Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。且原生支持 262,144 tokens 上下文,可通过 YaRN 扩展至 1,000,000 tokens。

MXMACA软件栈是沐曦GPU从“可用” 进阶为 “好用、易用”的核心基石。作为连接硬件算力与上层应用生态的核心枢纽,MXMACA软件栈全链路覆盖底层驱动、用户态接口、MXCC编译器、算子深度适配及主流训练/推理框架对接。目前,MXMACA软件栈已实现对主流AI生态的广泛覆盖:兼容支持40余种AI框架、1000多款模型,适配超6000个开源项目测试,全量支持PyTorch 2.8的2410个GPU算子。


自2025年12月以来,沐曦股份已完成33个主流顶尖模型Day 0适配,涵盖阿里千问、智谱AI、MiniMax、DeepSeek、阶跃星辰、腾讯混元等头部厂商,适配品类囊括通用语言、多模态、OCR等,适配速度、数量、生态广度均位居行业前列。


目前,FlagOS已经完成针对Qwen3.8-Flash-Next开源模型的精度对齐与部署验证,开发者可直接获取开箱即用方案。未来,沐曦股份将持续推进GPU硬件与全栈软件技术的迭代升级,深化与FlagOS等人工智能企业的生态协作,以Day 0适配为标准,持续完善“国产芯片-国产大模型-产业落地”的完整技术链条。共同打造从底层算力到上层应用的无缝衔接生态,为人工智能技术在各行各业的规模化落地提供坚实支撑。

开发者速用指南

FlagOS 为 Qwen3.8-Flash-Next 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。在 FlagOS 推理插件的支持下,曦云C系列GPU已完成 Qwen3.8-Flash-Next 的推理部署及评测验证。


使用源码安装部署,可参考以下官方文档:


1

vLLM-plugin-FL

GitHubhttps://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md


GitCodehttps://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.md

2

SGLang-plugin-FL

GitHubhttps://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md


GitCodehttps://gitcode.com/flagos-ai/sglang-plugin-FL/blob/main/README.md

FlagOS 安装部署


快速安装(以 vLLM 为例)

Shell

# 1. 安装 vLLM

git clone https://github.com/vllm-project/vllm.git

cd vllm

git checkout v0.24.0

VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation  --no-deps .


# 2. 安装 vllm-plugin-FL

git clone https://github.com/flagos-ai/vllm-plugin-FL

cd vllm-plugin-FL

git checkout v0.3.0-dev

pip install --no-build-isolation -e .


# 3. 安装 FlagGems 算子库

git clone https://github.com/flagos-ai/FlagGems

cd FlagGems && git checkout v5.3.0

pip install --no-build-isolation -e .


# 4. (可选) 安装 FlagTree 跨芯编译器


# 5. (可选) 安装 FlagCX 跨芯通信库

# 详见 https://github.com/flagos-ai/FlagCX



运行推理(沐曦平台 BF16 版本为例)

Pythonfrom vllm import LLM, SamplingParamsprompts = ["请介绍下阿里巴巴最新开源模型Qwen3.8-Flash-Next "]sampling_params = SamplingParams(max_tokens=10, temperature=0.0)llm = LLM(    model="FlagRelease/Qwen3.8-Flash-Next-BF16-metax-FlagOS",     max_num_batched_tokens=8192,    max_num_seqs=32,    tensor_parallel_size=16)outputs = llm.generate(prompts, sampling_params)for output in outputs:    print(f"Prompt: {output.prompt!r}")    print(f"Generated: {output.outputs[0].text!r}")

模型镜像下载

FlagReleasehttps://modelscope.cn/models/FlagRelease/Qwen3.8-Flash-Next-BF16-metax-FlagOS


HuggingFace

https://huggingface.co/FlagRelease/Qwen3.8-Flash-Next-BF16-metax-FlagOS

股票复盘网
当前版本:V3.0