昊梵体育网

【8.4科技头条|阿里千问3.8-Max重磅发布:2.4万亿参数对标Claude

【8.4科技头条|阿里千问3.8-Max重磅发布:2.4万亿参数对标Claude Fable 5,国产旗舰首度开源,长程自动编程16天从空文件夹到生产交付】

8月3日,阿里巴巴千问团队正式发布Qwen3.8-Max——千问家族迄今规模最大、能力最强的模型:总参数量2.4万亿,激活参数95B,上下文窗口100万tokens。最炸裂的不是参数规模,而是这是千问首次将Max级别模型开源,权重将于下周在Hugging Face和ModelScope同步发布,同期开源的还有Qwen3.8-27B。

🎯 核心定位:与Claude Fable 5相当,部分基准超越千问团队在官方技术博客中明确:Qwen3.8-Max在编程智能体和通用智能体多项指标上与Anthropic Fable 5表现相当,部分指标超越。几个关键基准的真实对照:PaperBench(论文能力):Qwen3.8-Max 93.0,Fable 5为88.8,GPT-5.6 Sol为90.5——千问反超。OSWorld-Verified(电脑操作):Qwen3.8-Max 86.1,超过Fable 5的85.0,位居参评模型首位。IFBench(指令遵循):Qwen3.8-Max 82.8,Fable 5仅63.5,GPT-5.6 Sol为72.7——千问大幅领先。CoWorkBench(通用协作):Qwen3.8-Max 74.8,Fable 5为75.9,差距极小。ParametricCAD Bench:Qwen3.8-Max 91.5,超过Fable 5的87.5。WideSearch:Qwen3.8-Max 81.9,与Fable 5的81.2基本持平。第三方权威榜单Arena同步放榜:Text Arena以1496分位列实验室榜第二;CodeArena WebDev榜单以1668分位列实验室榜第三;Vision Arena以1305分位列第二,仅落后于Claude Fable 5。

💡 需要客观指出的是:Qwen3.8-Max并未在所有测试中全面领先。在TerminalBench 2.1中其86.6分略低于GPT-5.6 Sol的88.8分;SWE-bench Pro中67.7分落后于Fable 5的80.0分;长视频基准VideoMME v2的68.3分也低于GPT-5.6 Sol。准确的说法是"第一梯队相当、多项逼近或超越",而非"全面碾压"。

🚀 真正的杀手锏:长程自动编程,16天从空文件夹到生产交付这次发布最大的看点不在跑分,而在模型能否脱离人工持续陪伴,自己把一个跨度数小时、数天甚至数周的真实任务做完。官方给出的三个真实案例堪称震撼:案例一:十天级自动编程。模型从零创建oh-my-cli项目,自主运行约16天,累计完成265次commits、127个PR、151个issues。它将用户反馈、社区实践与自测结果统一纳入工程循环,实现需求自动领取、代码生成、测试验证的完整闭环。

案例二:复现并超越论文。模型独立工作约125小时,写下约7600行代码,执行超过1100步操作,跑了33轮GPU训练,完整复现了论文《Unified Data Selection for LLM Reasoning》的六项主要结论。随后进入"自进化"阶段,提出并测试18种改进方案,最终在AIME24上比论文原方法再提升2.7分。

案例三:24小时击败87%人类队伍。参加WWW2025多模态对话意图识别挑战赛,在526支人类队伍中,经45次提交迭代,准确率从0.60升至0.853,击败458支队伍。

💼 办公与长程任务:数百职业场景的生产级验证在企业合规律师场景,模型单次通读数百份文档,标出1284条相关条款,一小时完成——同等工作通常需要法务团队约一周。在芯片设计优化任务中,模型在无参考设计、无人工干预下,历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计从8298门优化至678门;芯片面积从106×106 µm²收缩至46×46 µm²,整体缩减81%。

在E-Commerce Bench(365天电商经营模拟)中,以¥416,252(4.16倍回报)胜出,超过第二名GLM 5.2达38%,较上一代千问3.7-Max提升152%。

💰 定价:海外仅为Opus 5的40%与24%千问AI平台8月3日同步首发API:国内:每百万tokens输入12元、输出36元,隐式缓存命中1.5元海外:每百万tokens输入2美元、输出6美元,隐式缓存命中0.25美元阿里云方面明确表示,海外定价下输入成本约为Opus 5的40%,输出成本约为其24%——相近智能、更高性价比。

接口同时支持OpenAI兼容协议和Anthropic兼容协议,可直接与Claude Code、Codex、Qoder CLI、千问Code、OpenClaw等主流开发工具集成;支持reasoning_effort参数调节推理深度(xhigh/medium/low)。

🔥 为什么这件事对A股科技线意义重大?发布当日,阿里巴巴港股股价上涨7.26%,市值达2.41万亿港元;阿里巴巴美股涨逾4%。市场用脚投票的逻辑非常清晰:第一,国产旗舰大模型首次开源Max级权重。这意味着下周起,全球开发者可在Hugging Face和ModelScope获取Qwen3.8-Max与Qwen3.8-27B权重。前者用于研究前沿能力上限,后者更适合本地部署与二次开发。阿里在旗舰模型上形成了"API商用 + 权重开源"的双轨策略。

第二,AI Agent从"玩具"走向"生产工具"。16天自主编程、500轮芯片设计优化、365天电商模拟——这些案例证明大模型已经能端到端交付复杂任务。对A股而言,AI应用、AI Agent、企业级AI服务、算力基础设施都将迎来重估催化。

第三,性价比策略加速Token变现。阿里云最新财季收入同比增长38%,AI相关产品收入连续第11个季度三位数增长,占外部云收入比重已达30%。低价API + 开源权重,本质是用价格杠杆撬动开发者基本盘,加速Token商业化闭环。

第四,对标Fable 5的国产突破提振产业链信心。在Claude Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro等一线旗舰阵营中,国产模型首次在多项核心基准与之并肩甚至反超,对国产AI算力、大模型应用、AI芯片适配等产业链是实质性利好。

🎯 后市观察千问3.8-Max的发布,标志着国产大模型正式迈入"超大规模MoE + 长程智能体 + 开源权重"的新阶段。接下来重点跟踪三个方向:一是下周Hugging Face和ModelScope权重开源后的开发者生态反响,这决定Qwen3.8-Max能否真正形成与Fable 5抗衡的开源阵营;

二是阿里"千问办公"(QwenWork)产品的公测进展,整合QoderWork、MuleRun和悟空三款Agent产品,由钉钉新任CEO陈宇森负责,是企业级AI应用落地的关键观察点;

三是A股AI Agent及应用端能否承接这一催化,尤其是与阿里生态深度绑定的AI应用场景。

⚠️ 以上为科技产业动态梳理,不构成投资建议。大模型跑分与真实业务落地之间存在鸿沟,Qwen3.8-Max在SWE-bench Pro、TerminalBench等工程基准上仍落后Fable 5,投资者需理性看待"国产对标"叙事,重点关注相关公司真实的订单兑现与商业化进度。

千问3.8Max 阿里大模型国产开源模型Claude Fable5 AI Agent 8月4日财经