成绩单好看,口碑跟不上跑分?
(资料图片仅供参考)
AIX财经(AIXcaijing)原创
作者 | 雷晶
编辑 | 金玙璠
8月3日,预热两周后,阿里正式发布Qwen3.8-Max。模型参数规模达到2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研和长周期任务能力。按照官方说法,它不仅可以回答问题,还能调用工具、修改代码,并端到端完成复杂任务。
开发者可通过千问AI平台获得Qwen3.8-Max的API服务,每百万Token输入12元、输出36元,在国产头部模型中处于中间价位。阿里还计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。这也意味着,千问一边用Max级别模型冲击能力上限,一边继续通过开源模型扩大开发者生态。
7月19日预览版上线时,千问称该模型正以“天”为单位持续进化,并对标Anthropic最强旗舰模型Fable 5,宣称它“可能是除了Fable 5以外最强大的模型”。口号不小,实际成色如何?先看它和Fable 5的基准测试成绩对比。
我们挑了两类项目:一类是Qwen3.8-Max反超Fable 5的,一类是差距仍然明显的。可以看出,Qwen3.8-Max确实在科研编程、Agent和办公任务中取得明显进步,部分项目超过海外旗舰模型,但在真实软件工程和复杂环境操作中仍有差距。
预览版发布后的两周里,不少开发者参与测试,千问团队也在根据反馈持续调整模型。如今正式版上线,千问会给国产模型的竞争带来变数吗?
01.最新模型,强在哪儿、差在哪儿?
先看跑分成绩。
在官方发布的基准测试中,千问将Fable 5、Opus 4.8和GPT-5.6 Sol等海外旗舰模型作为对比对象。从结果来看,Qwen3.8-Max相较前代提升明显,但还没有做到全面领先。
进步最突出的是科研编程和Agent任务。PaperBench要求模型理解论文、搭建实验并复现结果,Qwen3.8-Max从上一代的64.8分升至93分;在Agents’ Last Exam测试中,其任务通过率也从11.8%升至27%。两项成绩同时提高,一定程度上反映出它在代码生成、工具调用、连续执行和反馈修正方面的进步。
但在真实软件工程测试中,Qwen3.8-Max还没有追上最强模型。在SWE-bench Pro测试中,Qwen3.8-Max得到67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。这类测试要求模型进入已有代码仓库,完成跨文件修改,并避免引入新问题。Qwen3.8-Max更会解决复杂任务了,但在真实项目中的全局理解和修改稳定性仍是短板。
再来看一下第三方榜单成绩。这里我们选择了Arena榜单来进行解读,Arena主要依靠用户盲选投票,更接近模型最终交付给用户的实际体验。其中,Vision Arena主要反映图像理解和视觉问答体验,Text Arena考察通用文本、指令执行和表达质量,Code Arena则更关注模型生成网页的视觉效果、交互和完成度。
Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首均相差13分。文本榜单分差相对集中,Qwen3.8-Max虽然排名第五,但仍处于头部区间。在前端代码榜单中,它排名第四,比榜首的Opus 5-Max低37分。官方编程基准成绩较好,与Arena未能登顶并不矛盾,前者主要反映解题和工程任务能力,后者更侧重生成结果的视觉效果、交互完成度和用户偏好。
图源 / 千问官网
不过,比单项成绩更值得关注的是长周期任务。
随着头部模型在单次问答、知识推理和代码生成上的差距越来越小,竞争的重点变成了模型能不能把一项工作持续做完。
大模型从业者王楠将长周期任务的难点概括为远距离规划、状态追踪和错误恢复。每一步操作都会改变环境,一次错误的后果可能在数步之后才显现。模型不仅要记得最终目标,还要判断任务进行到了哪里、前一步是否正确,以及失败后应该从哪里重新开始。
他介绍,目前行业主要通过任务规划、结构化记忆、多Agent协作等方式解决这些问题。简单来说,就是给模型增加任务管理、质量检查和回滚机制,让长周期任务不再只依赖模型自身,而是由模型和外部工程系统共同完成。
千问给出的案例是,Qwen3.8-Max连续运行约16天,从零构建了一个名为oh-my-cli的开源项目。用户反馈、社区实践和模型自测结果先被整理为Issue(任务单),再由Agent领取;代码完成后运行构建、单元测试和端到端测试,验证失败则退回修改。在这套循环中,issue负责记录任务状态,自动测试提供外部反馈,退回修改则对应错误恢复。
这说明千问展示的不只是模型能够连续生成代码的能力,更是它能否借助工程系统持续接收任务、验证结果并修正错误的能力。
不过,连续运行16天仍不能直接证明长周期能力已经成熟。王楠表示,真正需要验证的是模型能否长期保持目标一致,能否及时发现错误,以及出错后能否恢复。落到实际使用中,还要考察最终功能是否可用、重复执行是否稳定、中途需要多少次人工接管,以及完成任务所需的Token和算力成本。
综合来看,Qwen3.8-Max已经进入头部模型的竞争范围,在办公、多模态理解、搜索和部分编程任务提升明显;短板则主要集中在真实代码仓库、复杂工具调用和动态环境中的连续操作。
长周期任务可能是Qwen3.8-Max的亮点,但目前最有代表性的证据仍来自官方搭建的项目,它能否在不同任务中以较少的人工介入稳定交付,还需要开发者社区进一步验证。
02.跑分和口碑的落差
千问系列模型一直不缺少好成绩。5月20日,阿里发布的Qwen3.7-Max曾位列Code Arena第四名,是当时国产模型的第一;在Text Arena也一度排名第六。
但在实际使用中,Qwen3.7-Max的口碑并不一致。开发者艾林认为,Qwen3.7-Max对项目的理解比较清晰,在问题分析和输出逻辑上略胜一筹。但在处理复杂代码时,前期看起来进展顺利,检查结果时却会发现漏洞,反而增加了工作量。
当时,围绕Qwen3.7-Max的评价主要集中在,它擅长阅读代码、分析问题和提出方案,进入执行阶段后却可能扩大修改范围、改动无关配置,或者没有严格遵守需求。
新一代的模型Qwen3.8-Max在上代模型的基础上进行了提升,艾林测试后认为,Qwen3.8-Max在任务拆解、Agent调用、需求理解和UI设计方面均有明显提升,不过与Fable系列仍有距离。
独立开发者李默也感受到编程和复杂任务能力的进步,认为Qwen3.8-Max已经摸到了第一梯队的门槛。但在生成交互网站时,模型没有完整实现核心拖动功能,还把HTML标签直接显示在页面上。“Qwen3.8-Max有点懒”,需要把要求拆得非常具体,才能执行到位。
相比Qwen3.7-Max,Qwen3.8-Max更会拆解任务,也更容易做出接近成品的页面,但没有完全解决稳定性和交付意识的问题。
个体体验有落差,那放到国产模型的竞争里看,千问排在什么水平?
一个细节值得注意:上一代发布时,千问的对标名单里还有智谱、月之暗面、深度求索等国内厂商;这一次,对标对象只剩OpenAI和Anthropic的旗舰模型。这并不意味着它已经甩开国产对手,随着Kimi K3和DeepSeek V4的发布,国内竞争只会更激烈。
所以,我们也将Qwen3.8-Max与国内近期发布的新模型Kimi K3以及DeepSeek V4 Flash做一组对比。两款模型的参照意义不同:Kimi K3是同期发布的同级旗舰,用来回答“千问掉队了吗”;DeepSeek V4的Pro版尚未发布,目前只有轻量化的V4 Flash有公开成绩,它要回答的是,Qwen3.8-Max比一台便宜得多的轻量模型强多少,多花的钱值不值。
先看和Kimi K3的对比。从双方均公布成绩的基准测试来看,Qwen3.8-Max只在工作流智能体任务上超过Kimi K3,其余项目多数落后。差距较小的主要是终端操作和科学推理,说明两者的基础能力处于相近区间。差距较大的则是深度软件工程和前沿工程任务,反映Qwen3.8-Max在复杂代码仓库中的持续执行能力仍有不足。
再看和DeepSeek V4 Flash的对比。Qwen3.8-Max在所有可比项目中均占优势,覆盖编程、自动化和工具调用,考虑到双方量级不同,这个结果在预期之内。更值得注意的是差距的幅度:V4 Flash以更小的规模、更低的调用成本,取得了“够用”的成绩。这场对比真正的信息量不在输赢,而在价格。如果轻量模型的能力已经够用,中间价位的旗舰就要证明,多出来的能力值这个差价。
从基准成绩来看,真正说明问题的是与Kimi K3的对比:Qwen3.8-Max多数项目落后,但差距有限,算不上掉队;与DeepSeek V4 Flash的对比则更多反映定位差异,它有更高的能力上限,但上限能不能变成用户愿意付的钱,还要看实际交付。
开发者的实际感受与跑分互相印证。李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,尤其是编程和智能体协作方面;但代码能力弱于GLM 5.2和Kimi K3,还不能稳定排进第一梯队前列。千问计划开放27B模型权重,可能成为它在中小型开源模型市场上的另一项优势。
国内外开发者的关注点也不太一样。海外社交平台的讨论更多集中在前端能力、审美提升,以及与海外头部模型的差距缩小;国内开发者则更务实,分数涨了多少没那么重要,值不值得换掉手里正在用的模型,才是他们关心的问题。
因此,如果第一梯队指模型的能力上限,Qwen3.8-Max已经接近。如果还要求交付质量稳定、成本有优势,并能成为开发者的默认选择,它目前更像第一梯队候选。
03.国产模型集体崛起,阿里还有竞争力吗?
再把视角放到Qwen3.8-Max背后的阿里,它面对的竞争已经比过去更复杂。
过去,一项架构创新、更长的上下文或更低的API价格,都可能成为模型的突出卖点。现在,这些能力正在快速普及,MoE架构、百万Token上下文、智能体编程、多模态和开放权重,几乎成为国产头部模型的共同发展方向,不再是千问独有的优势。
对手的动作也越来越快。Kimi K3在复杂软件工程和长周期任务中表现突出,部分成绩已经超过海外闭源模型;DeepSeek V4继续以低价和推理效率吸引开发者;GLM 5.2则凭借编程能力获得不少海外开发者认可,有人将其视为接近Claude头部模型的国产替代方案。
技术路线逐渐趋同,单个模型很难建立长期壁垒。今天领先的跑分,可能在下一轮更新后就被反超。竞争变成了谁能持续推出更强的模型,同时把推理成本降下来,让更多用户愿意长期使用。
竞争最终都会落到价格上,API定价正好能看清四家的不同策略。
从价格梯度来看,Kimi K3走高价旗舰路线,DeepSeek V4-Pro继续用低价争夺调用量,Qwen3.8-Max与GLM 5.2则处在两者之间。不过,千问的输入、输出价格均高于智谱,因此它在中间档位中也不占价格优势。
对于编程和Agent任务,Token单价只是成本的一部分。模型要反复读取上下文、调用工具、生成代码并根据执行结果继续修改,任务成功率、重试次数和人工接管成本,往往比单次调用价格更影响总账。
低价模型如果频繁理解错需求,节省的调用费用可能会被检查和返工成本抵消;价格较高的模型如果能一次完成任务,综合成本反而可能更低。这也解释了为什么阿里不采取激进降价策略,Qwen3.8-Max需要证明的,是完成同一项任务时能否带来更低的综合成本。
从这个角度看,Qwen3.8-Max的价格并不算贵,但优势也不稳固。它比Kimi K3便宜,却在部分复杂编程任务上落后;它的能力高于DeepSeek V4 Flash,价格差距又远大于能力差距。千问需要依靠稳定性和实际交付质量,守住中间位置。
阿里更难被复制的优势是模型之外的完整生态。
在模型层面,阿里已经覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸到世界模型和具身智能。企业不必为文字、图片、语音和视频任务分别寻找供应商,可以在同一套平台中组合不同模型。
在产品层面,阿里还有云计算、模型开发平台、钉钉、淘宝以及大量企业客户。模型可以被直接接入办公、电商、客服、营销和软件开发场景。发布当天,阿里旗下企业级Agent产品“千问办公”同步开启公测,模型能力正被直接装进办公场景。阿里披露,Qwen在国内企业级大模型调用市场排名第一,阿里云也位居国内AI云市场第一。
这对B端客户尤其重要。企业采购的不只是一项模型能力,还包括算力、数据存储、权限管理、安全合规、部署运维和服务保障。阿里能够把这些环节打包提供,把模型能力变成一套可以直接采购和部署的服务。对于已经使用阿里云或钉钉的企业,接入千问的迁移成本也更低。
不过,生态不能替代模型能力。企业越来越倾向于在同一套系统中调用多个模型,哪个效果更好、价格更低,就把任务分配给哪个。平台越开放,模型被替换也越容易。如果千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。
所以,阿里的竞争力依然存在,但壁垒已经不再是某一款Qwen模型。模型能力决定它能否拿到入场券,价格决定开发者是否愿意尝试,云服务和企业生态则决定客户会不会长期留下。
对阿里而言,挑战是持续留在第一梯队,并把模型、算力和应用生态转化为稳定的商业交付。
*题图由AI生成。应受访者要求,王楠、李默为化名。
营业执照公示信息