千问开源Qwen3.8-Flash-Next架构,轻量化多模态大模型实现效能突破阿里千问发布多模态MoE模型Qwen3.8-Flash,并开源下一代架构Qwen3.8-Flash-Next(Qwen4雏形)。模型总参数125B,搭载51B N-gram Embedding,每token仅激活6B;原生支持26万token,可扩展至100万。训练成本为前代1/9,API定价输入每百万Tokens 1元、输出3元。4 天前17.4K
LFM2.5 DSpark草稿模型发布,推理速度最高飙升3. 18 倍Liquid AI 与 Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型检查点,覆盖 1.2B、2.6B、8B-A1B 三款模型。其采用全新投机解码路径,不改变输出质量,大幅提升推理吞吐量。实测 GPU 端最高提速 3.18 倍,端侧设备也有明显加速。08-2124.6K