刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
编程、专业工作、长程任务、多模态分析统统梭哈
梦瑶 发自 凹非寺
量子位 | 公众号 QbitAI
不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg)
说时迟那时快,友友们,这不就来了嘛!!!
就在刚刚,阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。
用四个字概括就是:「能打」「便宜」。
总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。
就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型:

△Text Arena文本能力榜单,包含数学、代码、创业写作等领域
在编程表现上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不简单???

△编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等
性能能打是一方面,关键是吧,人家连价格也一块打了下来——
国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。
性价比高,能力还强,那还了得?
瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈!
看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞!

还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》!

哦对了,还有一堆网友们,已经针对模型「超能打」的表现开始聊得火热朝天了!
下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊)

下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变——
毕竟又贵又闭源,门槛确实摆在那儿……

还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥!

真·有口皆碑了也是。
既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打!
编程、专业工作、长程任务、多模态分析统统梭哈!
说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是——
确实夯,也确实能打……
而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。
在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部——

贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快!
- 编程能力:能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。
- 长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。
- 专业工作:能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。
- 多模态智能体:几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。
我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!!

Vibe一下,编程能力大考验
既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的「编程本事」。
好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。
这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中)
不过,光用一句提示词搭个网页,多少有点太简单了,于是乎——
我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需求,让它「从零」开发一个可运行的AI资讯网页。
在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难!!!

大概过了5分钟。
我的这位产品经理Qwen3.8-Max,就直接给我端上来了一份接近正式产品交付水准的全链路解决成果——

整个交付过程页面我从头拉到尾,说实话,确实有点让我震惊。
需求拆解、技术选型、项目结构、功能实现,该有的环节一个没落,完全是一套真实项目从开发到交付的完整流程。
然后,我再定眼一看,发现Qwen3.8-Max还专门整理了一份「问题与解决记录」,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。
而作为提出需求的那个人,我真的全程一次手都没插,甚至直到看见这份记录,我才知道中间居然还冒出过这么多麻烦???
不是我说,这模型是真·有问题自己解决啊,Qwen3.8-Max:事情交给我您放心哈~

此外,在检查模型作业的过程中,我又发现了点我属实没料到的东西……
Qwen3.8-Max在交付前,还给整个项目来了一轮正儿八经的「功能验收」????
从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍。
甚至,连数据量、分类覆盖范围、搜索清空后的页面恢复,它都一项项列进了验收清单,最后统一打上「通过」。
别说,整个从零搭建项目的全过程真有点真实工程内味儿了,be like:

真的就几分钟。
我写下的一整页产品需求,就这么被Qwen3.8-Max直接交付成了一个能跑的项目。
我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。
页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题,
原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。

我只想说,Qwen3.8-Max,你这是真·端到端啊……
长长长长文本分析也来探一探
能搞定编程项目的全流程交付,确实不亿般。
But,在日常学习工作场景中,我们很多时候未必有那么多需要Coding的场合。
很多时候真正想让我们口吐芬芳的,反倒是一些《蛮基础》的工作场景,就比如啊——长文本分析。(doge)
估计有友友该说了,这有啥难的啊,直接喂给AI资料,然后坐享其成得了呗~
单纯的文本分析当然不难,but,让AI对几十页复杂文档进行「交叉分析」那事情就不一样了。
之前我就喂给过GPT一份包含几十页的技术文档,让AI总结内容还行,但涉及跨章节、细节对比的事儿就宕机了…

于是灵机一动的我,这回也给Qwen3.8-Max上点难度。
这次我喂给它的是AI大神卡帕西参与撰写的一篇几十页的论文,正文、图表、附录一个不少。

这篇论文复盘了2010—2014年ImageNet大赛,讲清楚AI看图能力是怎么一步步逼近人类的,以及这背后数据、算法和评测规则各自起了多大的作用。而我向AI发起的问题是:
论文拿ILSVRC和PASCAL VOC这两套“AI看图考卷”做了比较,结合正文、表3和附录B的图16来看,哪套题更难?为什么看平均值和看困难类别,会得到不同答案?
这个题难就难在,AI光搜关键词还真答不了,因为答案散落在正文、表格、图表和附录里,AI得把几组数据全部对上,并且进行交叉分析得出结论才行。
大概33秒的时间,Qwen3.8-Max就直接给了我一个明确答案——
只看整体平均值,PASCAL VOC似乎更难;但看可比类别和ILSVRC的困难子集,ILSVRC在很多方面并不比 PASCAL VOC简单,甚至更难。

为了确认这份回答是否准确,我又对照原文的表3、图16和附录B逐一定位,发现这AI确实说的是「对的」——
比如在原论文中,图16上排比较全部1000个ILSVRC类别,下排则筛出随机定位成功率最低的200个类别。
可以看到,进入困难子集后,ILSVRC在多项定位难度指标上确实已经接近或超过PASCAL,AI说的完全正确,哪怕是在几十页文档资料里对跨章节内容进行图标图片和文字的联合分析,也没难倒这个AI:

此外,Qwen3.8-Max为了告诉我它为什么得出这样的结论,还给我生成了一篇超有理有据的「分析报告」。
从物体大小、位置变化、定位难度、画面杂乱度几个维度对ILSVRC和PASCAL VOC两套考卷进行了分析。
哦对了,它还把原文中的表格直接1:1单拎出来作为证据,定位找得那叫个《稳准狠》……
我只能说,还在苦啃论文、资料文档的友友们,这下我们的好日子可能真的要来了。。。
多模态内容理解任务也安排上
上面两轮实测,说到底,考察的主要还是Qwen3.8-Max对文本的分析、理解和执行能力。
但我们的日常学习工作里,还有一块更难啃、也非常刚需的硬骨头场景:多模态内容分析。
对AI来说理解某一个画面或者总结一个视频内容确实不是难事儿。
真正麻烦的是,当素材被拉长到几十分钟甚至几小时,它还能不能理清其中的人物、事件和观点关系,并根据一个具体问题,精准定位到原片段。
于是这次,我直接把手头一个亟待处理的「实录烂摊子」交给了Qwen3.8-Max——
一期接近70分钟的视频播客,在播客里山姆·奥特曼从AI创业一路聊到OpenAI战略和未来社会,话题多、跨度大,想从头捋清楚并定位原片段,少说也得折腾半天。

△播客来源:「Relentless」Youtube账号
对此,我交代给Qwen3.8-Max的任务,也可以说非常复杂艰巨——
请为这期播客生成一份完整的主题时间轴,并按「话题观点」定位原始片段。
对于AI来说,这不仅要求它能准确识别人物、事件与观点之间的关联关系,还要能重建整期播客的叙事结构,并把每个观点精准映射回原始片段。
大概也就两三分钟,Qwen3.8-Max就给我吐出来了一份按照核心观点划分的播客内容。
更贴心的是,每个话题都采用「先总结、再展开」的结构,前面提炼核心观点,后面逐段捋清具体内容,还一一标出了对应的时间戳。
对我来说最大的好处嘛,那就是看到哪段感兴趣,直接点进原视频精准空降就行,简直不要太太太太方便!!!
好用是真的,用得起也是真的
哪怕AI Coding发展到今天,海外主流模型三天两头迭代得飞起。
我们依旧不得不承认一个事实:落到用户的实际体验里,似乎始终很难真正做到「既要、又要、还要」。
换句话说,模型能力、场景覆盖和价格,这三件事儿似乎总不能同时兼得。
Coding能力很能打,到了其他场景里,交付效果却未必同样稳定;就算效果足够好,价格也经常让人望而却步,各种Plan和Token费用,长期用下来确实烧不起。
但这次实测完Qwen3.8-Max,我可能得重新下一个结论,那就是全球头部模型——也是能用得爽,还用得起的。
每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入和输出价格真的只有Opus 5的40%和24%。
这意味着,大家不用承担高昂的Token费用,也能获得高性能模型带来的完整体验。
而在真实场景中,Qwen3.8-Max所完成的工作,也早已超出「生成」这一步。
它真的可以从零开始,帮我推进一项完整工程,再把过程中冒出来的实际问题一个个解决掉,最终把能运行、能检查的成果交到我手里。

△AI生成
这种兼顾,放眼整个模型圈里都算得上稀缺。
而Qwen之所以敢把能力、场景和价格一起next level,实际上背后靠的也远不止一款Max模型。
从2023年开源至今,阿里已经累计开源400多个模型,衍生模型已经超过20万个,累计下载量突破10亿次,一路下来,Qwen也成为了全球规模最大、覆盖最全的开源大模型家族。
更值得注意的是,Qwen这条更新进度条,过去一年几乎就没停过。
从Qwen3到Qwen3.5,再到如今的Qwen3.8,几乎每一次迭代,都对应着一批新场景真正变得可用——从基础推理,延伸到编程、专业工作、多模态理解、长程Agent,再到这次的端到端交付。
这种日拱一卒的节奏,放眼全球也没几家跟得上。
于是,我们或许真的可以下一个结论。
那就是真正「好用」的模型,未必一定昂贵;真正「便宜」的模型,也未必需要在能力上做取舍。
而Qwen3.8-Max,恰好把这两件事放在了一起。
对了。
目前,Qwen3.8的API已上线千问AI平台,还接入了阿里今日同步推出的Agent产品「千问办公」,感兴趣的朋友不妨直接上手试试~
相关链接:
[1]千问AI平台:https://www.qianwenai.com/
[2]QwenStudio平台:https://chat.qwen.ai/
[3]千问办公平台:https://qwenwork.cn/
- Anthropic模型,也失控了。。。2026-08-01
- 刚刚,即梦 Seedance 2.5来了!我狂测测测测……2026-07-31
- Kimi K3上线48小时:模型爆火,GPU爆肝,会员停售2026-07-20
- IDC报告:中国AI Coding市占率阿里Qoder断层第一,超过二三四五名总和2026-07-17



