Qwen4的技术路线终于正式公开了。
Qwen3.8-Flash-Next虽然名字还是3.8,但官方已经明确:这就是Qwen4架构预览。
125B参数只激活6B,还专门重新设计Attention,核心目标就是降低长上下文和Agent成本。
我觉得下一代大模型竞争已经变了:
不是参数越大越好,而是谁能用更少算力,完成更多真实工作。
Qwen4的技术路线终于正式公开了。
Qwen3.8-Flash-Next虽然名字还是3.8,但官方已经明确:这就是Qwen4架构预览。
125B参数只激活6B,还专门重新设计Attention,核心目标就是降低长上下文和Agent成本。
我觉得下一代大模型竞争已经变了:
不是参数越大越好,而是谁能用更少算力,完成更多真实工作。