通義千問發佈Qwen3.8-Flash-Next,提前劇透Qwen4架構阿里通義千問團隊近日開源全新多模態MoE模型Qwen3.8-Flash-Next,作爲Qwen4架構早期預覽版。該模型採用高度稀疏的混合專家設計,總參數1250億,另搭配510億參數N-gram嵌入表和40億參數多token預測模塊,以極低計算開銷實現越級性能表現。4 天前15.8K
千問開源Qwen3.8-Flash-Next架構,輕量化多模態大模型實現效能突破阿里千問發佈多模態MoE模型Qwen3.8-Flash,並開源下一代架構Qwen3.8-Flash-Next(Qwen4雛形)。模型總參數125B,搭載51B N-gram Embedding,每token僅激活6B;原生支持26萬token,可擴展至100萬。訓練成本爲前代1/9,API定價輸入每百萬Tokens 1元、輸出3元。4 天前17.4K