阿里发布Qwen3.8旗舰大模型:2.4万亿参数,长程自动编程重构Agent工作范式

8月3日,阿里巴巴抛出一枚重磅棋子:新一代基座大模型Qwen3.8正式发布,总参数量达到2.4万亿,激活参数95B。这不仅是千问家族尺寸最大、性能最强的旗舰,更在当天放榜的权威三方评测Arena中,整体性能仅次于Anthropic的Claude系列,稳居全球大模型第一梯队。
架构升级:稀疏MoE与混合注意力的联合优化
Qwen3.8-Max基于Qwen 3.5架构打造,通过稀疏MoE(混合专家)架构与混合注意力机制的联合优化,首次将千问总参数量拓展至2.4T,同时把激活参数压到95B。这种设计带来的直接收益是更高的推理效率与更快的推理速度——参数规模暴涨,单位任务成本却没有同步失控。
在指令遵循IFBench评测中,Qwen3.8拿到82.8分;科学推理GPQA Diamond取得92.6分;视觉推理BabyVision无工具条件下拿到82.0分,超出部分主流模型近两倍;在评估智能体电脑操作能力的OSWorld-Verified评测中,则以86.1分位居主流模型首位。这些数字背后,是模型从"会答题"到"能干活"的能力迁移。
长程自动编程:从写函数到交付项目
编程(Coding)是前沿大模型的核心战场,Qwen3.8在这一维度实现了质变。在权威CodeArena榜中,它位居全球第四。更硬核的案例来自真实工程:模型在无人工干预的情况下独立运行16天,完成了名为"oh-my-cli"的自进化智能体框架,产出265次代码提交,并已在GitHub完全开源。
两年前的前沿模型还只能写好函数、补全代码;如今Qwen3.8能从一个空文件夹出发,自主完成一个十数天的真实项目交付。这意味着大模型的能力边界,已经从"辅助人类完成单点任务"扩展到了"独立交付端到端的长周期项目"。在科研场景中,它连续自主工作约125小时,成功复现AI Reasoning相关论文并进行了四轮自我进化探索,使AIME24基准得分再提升2.7分。
视觉理解与多模态Agent的边界突破
除了文本与推理,Qwen3.8把视觉理解的极限也推高了。模型能读懂200页的财报PDF、看懂超100小时的长视频,并将"看到"的信息反馈到工作全流程。在VisionArena榜单中,Qwen3.8-Max排名全球第二。
更值得关注的是,在千问团队自研的"应用复刻"基准RecreationBench中,模型没有源代码、也无法联网,只通过交互与反馈去理解一个应用,却能从零复刻出整个应用。这表明它已展现出前沿水准的混合多模态智能体能力,通过"迭代编程—交互反馈"的循环,把视觉编程推向新高度。
价格与开源:把性价比做成武器
在商业落地上,阿里把性价比摆到了台前。Qwen3.8的API已上线千问AI平台,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元;国际价格仅为Opus5的40%与24%。同时,Qwen3.8-Max预计下周开源,并同步开源Qwen3.8-27B——这是Qwen-Max级别模型首次面向社会开放开源权重。
消息公布当天,港股阿里巴巴(9988.HK)早盘股价一度涨近6%。开源证券指出,Kimi K3、DeepSeek V4与Qwen3.8的接连突破,标志着中国AI产业进入新阶段,有力证明了开源模型的天花板同样很高,其国际竞争力持续提升。
结语:Agent时代的生产力重构
Qwen3.8的意义,不止于一款更强的模型。它用265次提交、125小时连续工作、4.16倍回报的电商经营模拟成绩,向行业展示了一个清晰趋势——大模型正在从"对话工具"进化为"可委托任务的同事"。当模型能独立跑完一个长周期项目,围绕它的产品形态、组织流程乃至商业估值逻辑,都将随之重写。
网友留言(0 条)