通义千问发布 Qwen3.8-Flash ,作为Qwen4架构的早期预览版本,并同步开源模型权重。这款模型在架构上做了大胆取舍,总参数规模达到125B,外加51B的N-gram嵌入,但每个token仅激活6B参数,属于典型的稀疏激活设计。 训练成本是最大亮点 。官方数据显示,Qwen3.8-Flash的训练成本仅为Qwen3.7-Plus的 1/9 ,这意味着在同等算力预算下,可以训练出更大规模的模型,或者用更少的资源完成同等规模的训练任务。 性能方面,模型在 SWE-bench Pro 基准上拿到 62.5分 ,直接反超Claude Opus 4.6 Max的53.4分,领先幅度超过9个百分点。这一成绩在代码生成与软件工程任务中相当能打。 开源权重意味着开发者可以自行部署和微调,不必依赖闭源API。对于关注推理成本和本地化部署的团队来说,6B激活参数带来的推理效率提升,可能比基准分数更有吸引力。 特别
Copyright © 今年会(中国)官方网站 版权所有 网站地图
留言框-