发展趋势量子位5/10

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

By 梦瑶

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
图源:量子位

AI 摘要

编程、专业工作、长程任务、多模态分析统统梭哈

原文正文

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

编程、专业工作、长程任务、多模态分析统统梭哈

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg)

说时迟那时快,友友们,这不就来了嘛!!!

就在刚刚,阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。

用四个字概括就是:「能打」「便宜」。

总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。

就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型:

△Text Arena文本能力榜单,包含数学、代码、创业写作等领域

在编程表现上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不简单???

△编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等

性能能打是一方面,关键是吧,人家连价格也一块打了下来——

国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。

性价比高,能力还强,那还了得?

瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈!

看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞!

还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》!

哦对了,还有一堆网友们,已经针对模型「超能打」的表现开始聊得火热朝天了!

下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊)

下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变——

毕竟又贵又闭源,门槛确实摆在那儿……

还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥!

真·有口皆碑了也是。

既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打!

编程、专业工作、长程任务、多模态分析统统梭哈!

说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是——

确实夯,也确实能打……

而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。

在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部——

贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快!

- 编程能力:能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。

- 长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。

- 专业工作:能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。

- 多模态智能体:几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。

我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!!

Vibe一下,编程能力大考验

既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的「编程本事」。

好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。

阅读原文
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude · AI Daily