究竟还有没有便宜又好用的模型?就在刚刚,阿里巴巴突袭发布了新一代基座大模型 Qwen3.8-Max。用四个字概括就是「能打」、「便宜」。总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接跃升了一个档次。

在今天最新放榜的权威第三方榜单 Arena 中,Qwen3.8-Max 一路冲到全球大模型第一梯队,表现直逼 Anthropic 的 Claude 系列。在编程表现上,甚至超过了 Claude Opus 5 和 Fable 5 的 High 版本,确实表现不俗。能打是一方面,关键是价格也打下来了——国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,输入与输出的国际价格仅为 Opus 5 的 40% 与 24%,确实便宜大碗。

性价比高,能力还强,自然备受关注。此前抢先体验的网友已经交上了第一批实测反馈。有老哥用 Qwen3.8-Max 复刻了一版《愤怒的小鸟》,直言价格合适,一周使用下来额度消耗不到九成。也有网友只用一条提示词,就搭出了一个完整、可交互的开发者作品集。大家针对模型的表现聊得火热,有人迫不及待想用起来,甚至调侃祝 A 社、O 社 IPO 好运,也有人对 OpenAI 和 Anthropic 的闭源策略表示质疑,认为 Qwen3.8-Max 已经把 5.6-Sol 给 KO 了。

既然 Qwen3.8-Max 来了,我们也直接实测一波,看看模型到底能不能打。

01 编程与专业工作:端到端交付

说实话,阿里 Qwen 前几代模型我几乎是发一个测一个,感受最深的就是确实能打。而这次到了 Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。在具体评测表现中,Qwen3.8-Max 在科研复现、多模态理解、长视频和电脑操作多项测试中超越了 GPT-5.6、Opus 4.8 与 Fable 5,在编程、终端 Agent 和专业工作也稳居行业头部。

具体亮点包括:编程能力能端到端自主交付,理解需求、搭建工程、运行实验、检查结果全流程覆盖,官方披露的一个极端案例是,它能从空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目;长线程任务具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标;专业工作能一次交付需要返修 3 到 5 轮的 APP 原型,也能在一小时内处理数百份法律文档;多模态智能体能消化几百页的复杂材料和上百小时的视频内容,还能整理成直接可用的成果。

02 编程能力大考验

既然 Qwen3.8-Max 如此擅长 AI Coding,那我们直接考察一下这模型的「编程本事」。好巧不巧的是,最近我正愁每周例会上该怎么把这一周的 AI 热点捋清楚,做成一份能给领导交差的分享。于是,我索性把这事儿交给 Qwen3.8-Max。不过,光用一句提示词搭个网页多少有点太简单了,于是我化身产品经理,喂给了 Qwen3.8-Max 整整一大页产品需求,让它「从零」开发一个可运行的 AI 资讯网页。

在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难。大概过了 5 分钟,我的这位产品经理 Qwen3.8-Max 就直接给我端上来了一份接近正式产品交付水准的全链路解决成果。整个交付过程从需求拆解、技术选型、项目结构到功能实现,完全是一套真实项目从开发到交付的完整流程。

我发现 Qwen3.8-Max 还专门整理了一份「问题与解决记录」,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。作为提出需求的那个人,我全程一次手都没插,甚至直到看见这份记录,才知道中间居然还冒出过这么多麻烦。Qwen3.8-Max 在交付前,还给整个项目来了一轮正儿八经的「功能验收」,从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍,甚至连数据量、分类覆盖范围、搜索清空后的页面恢复都列进了验收清单。

我忐忑地打开代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题。原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。我只能说,Qwen3.8-Max,你这是真·端到端啊。

03 长文本分析探一探

在编程项目上能全流程交付确实不简单,但在日常学习工作场景中,很多时候真正想让我们头疼的,反倒是一些基础的工作场景,比如长文本分析。单纯的文本分析当然不难,但让 AI 对几十页复杂文档进行「交叉分析」那事情就不一样了。之前我就喂给过 GPT 一份包含几十页的技术文档,让 AI 总结内容还行,但涉及跨章节、细节对比的事儿就宕机了。

于是这次,我也给 Qwen3.8-Max 上点难度。我喂给它的是一篇关于 ImageNet 的几十页论文,正文、图表、附录一个不少。这篇论文复盘了 2010—2014 年 ImageNet 大赛,讲清楚 AI 看图能力是怎么一步步逼近人类的,以及这背后数据、算法和评测规则各自起了多大的作用。而我向 AI 发起的问题是:论文拿 ILSVRC 和 PASCAL VOC 这两套「AI 看图考卷」做了比较,结合正文、表 3 和附录 B 的图 16 来看,哪套题更难?为什么看平均值和看困难类别,会得到不同答案?这个题难就难在,AI 光搜关键词还真答不了,因为答案散落在正文、表格、图表和附录里,AI 得把几组数据全部对上,并且进行交叉分析得出结论才行。

大概 33 秒的时间,Qwen3.8-Max 就直接给了我一个明确答案——只看整体平均值,PASCAL VOC 似乎更难;但看可比类别和 ILSVRC 的困难子集,ILSVRC 在很多方面并不比 PASCAL VOC 简单,甚至更难。为了确认这份回答是否准确,我又对照原文的表 3、图 16 和附录 B 逐一定位,发现这 AI 确实说的是「对的」。Qwen3.8-Max 为了告诉我它为什么得出这样的结论,还给我生成了一篇超有理有据的「分析报告」,从物体大小、位置变化、定位难度、画面杂乱度几个维度对两套考卷进行了分析,甚至把原文中的表格直接 1:1 单拎出来作为证据,定位找得那叫一个稳准狠。

04 多模态内容理解任务

上面两轮实测,考察的主要还是 Qwen3.8-Max 对文本的分析、理解和执行能力。但我们的日常学习工作里,还有一块更难啃、也非常刚需的硬骨头场景:多模态内容分析。对 AI 来说理解某一个画面或者总结一个视频内容确实不是难事儿,真正麻烦的是,当素材被拉长到几十分钟甚至几小时,它还能不能理清其中的人物、事件和观点关系,并根据一个具体问题,精准定位到原片段。

于是这次,我直接把手头一个亟待处理的「实录烂摊子」交给了 Qwen3.8-Max——一期接近 70 分钟的视频播客,在播客里山姆·奥特曼从 AI 创业一路聊到 OpenAI 战略和未来社会,话题多、跨度大,想从头捋清楚并定位原片段,少说也得折腾半天。对此,我交代给 Qwen3.8-Max 的任务,也可以说非常复杂艰巨——请为这期播客生成一份完整的主题时间轴,并按「话题观点」定位原始片段。

大概也就两三分钟,Qwen3.8-Max 就给我吐出来了一份按照核心观点划分的播客内容。更贴心的是,每个话题都采用「先总结、再展开」的结构,前面提炼核心观点,后面逐段捋清具体内容,还一一标出了对应的时间戳。对我来说最大的好处嘛,那就是看到哪段感兴趣,直接点进原视频精准空降就行,简直不要太太太太方便。

好用是真的,用得起也是真的

哪怕 AI Coding 发发展到今天,海外主流模型三天两头迭代得飞起。我们依旧不得不承认一个事实,落到用户的实际体验里,似乎始终很难真正做到「既要、又要、还要」。换句话说,模型能力、场景覆盖和价格,这三件事儿似乎总不能同时兼得。Coding 能力很能打,到了其他场景里,交付效果却未必同样稳定;就算效果足够好,价格也经常让人望而却步,各种 Plan 和 Token 费用,长期用下来确实烧不起。

但这次实测完 Qwen3.8-Max,我可能得重新下一个结论,那就是全球头部模型——也是能用得爽,还用得起的。每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,输入和输出价格真的只有 Opus 5 的 40% 和 24%。这意味着,大家不用承担高昂的 Token 费用,也能获得高性能模型带来的完整体验。而在真实场景中,Qwen3.8-Max 所完成的工作,也早已超出「生成」这一步。它真的可以从零开始,帮我推进一项完整工程,再把过程中冒出来的实际问题一个个解决掉,最终把能运行、能检查的成果交到我手里。这种兼顾,放眼整个模型圈里都算得上稀缺。

Qwen 之所以敢把能力、场景和价格一起提升,实际上背后靠的也远不止一款 Max 模型。从 2023 年开源至今,阿里已经累计开源 400 多个模型,衍生模型已经超过 20 万个,累计下载量突破 10 亿次,一路下来,Qwen 也成为了全球规模最大、覆盖最全的开源大模型家族。更值得注意的是,Qwen 这条更新进度条,过去一年几乎就没停过。从 Qwen3 到 Qwen3.5,再到如今的 Qwen3.8,几乎每一次迭代,都对应着一批新场景真正变得可用——从基础推理,延伸到编程、专业工作、多模态理解、长程 Agent,再到这次的端到端交付。这种日拱一卒的节奏,放眼全球也没几家跟得上。

于是,我们或许真的可以下一个结论。那就是真正「好用」的模型,未必一定昂贵;真正「便宜」的模型,也未必需要在能力上做取舍。而 Qwen3.8-Max,恰好把这两件事放在了一起。

对了,目前,Qwen3.8 的 API 已上线千问 AI 平台,还接入了阿里今日同步推出的 Agent 产品「千问办公」,感兴趣的朋友不妨直接上手试试。

最新快讯

2026年08月03日

20:32
当整个AI行业都在为“得大模型者得天下”而狂热时,一家AI应用层的公司给出了完全相反的答案。 6月18日,演语科技(Evoken)对外宣布完成近3亿美元B+轮融资,投后估值超过20亿美元,成为中国AI应用层迄今为止最大的单轮融资之一。 乍一看这家公司或许会陌生,但其旗下产品LiblibAI,以及Liblib这个名字则为外界熟知。此次融资...
20:32
序/TrueView 技术叙事是AI创业的第一针强心剂,但资本的潮水退去后,所有估值神话最终都要落回商业账本之上。 商业规律从不会因概念火热而网开一面,融资只是购买时间,上市只是更换赛场,真正的考验永远在于,一家AI公司,到底能不能创造可持续的商业价值。 本文将重点分析 1、六家公司为何三年间走出了截然不同的发展路径? 2、...
20:32
8月3日,阿里巴巴Qwen 3.8-Max版正式版发布,官方信息显示,这一版本总参数2.4T、激活参数95B。8月3日收盘,阿里巴巴港股(89988.HK)股价上涨6.75%。 在7月31日,DeepSeek发布了公司V4 Flash正式版,Artificial Analysis表示,这一版本被认为是目前单任务成本(而非单Token成...
20:32
6月中旬,IT桔子写了一份报告,盘点了国内做世界模型的创业公司,受到了市场很多关注。 在 这 个报告被传播的过程中,每一天我们都在发现新的世界模型公司创立、融资。  正如我在那份报告的结尾所说「世界模型,才刚出发,一起走着瞧吧」 现在,鉴于大家关注度这么高,我们就再做一次盘点—— 2026年已过去七个月,中国AI...
20:32
算力的重要性,再度得以凸显。 近段时间,GLM 5.2、Kimi K3.0上新叠加DeepSeek投资人会议纪要外泄,将算力紧张的现实摆上了桌面。 这意味着,国产大模型要再进一步,必须迈过算力门槛。 围绕算力的争议一度平息,为何当下再掀波澜?国产算力走到哪一步了?超节点会成为破局的关键抓手吗? 算力门槛无法绕过 曾几何时,堆...
20:32
本周末,OpenAI 的新一代模型引发了数学界的巨大震动。这家公司公布了一份令人咋舌的成绩单,其内部代号为“Astra”的模型,在高维几何、编码理论、群论、算术电路复杂性、量子复杂性、格密码学和极值组合等十项前沿领域取得了突破性进展。这些成果中,有的问题已沉寂十年甚至数十年未获核心突破,有的则悬而未决长达数十年。具体而言,模型成功构造了非Sofic群、推翻了...
20:17
鼓狮财经8月3日电,昇辉科技(300423.SZ)发布公告,宣布调整对赫普能源的收购策略。公司原计划通过发行股份购买赫普能源85%股权并配套募资,现决定终止该方案,改为以现金方式收购赫普能源36%至45%的股权。 在具体执行上,昇辉科技已与赫普能源5名原股东签署了《支付现金购买资产之框架协议》。但需注意,具体的交易方案、定价等核心条款仍需以正式签署的协议为准...
20:17
鼓狮财经8月3日电,苑东生物发布公告称,公司及全资子公司参加第12批全国药品集中采购,盐酸尼卡地平注射液和比索洛尔氨氯地平片拟成功中选。预计上述产品2025年销售收入约为8789.44万元,占公司总营收的6.60%。此次采购周期将持续至2029年12月31日,并计划于2026年第四季度正式执行。
20:17
鼓狮财经8月3日讯,博腾股份发布公告称,其控股子公司苏州博腾生物制药有限公司近期获批江苏省药品监督管理局核发的《药品生产许可证》,有效期至2031年7月26日。该资质的取得,标志着苏州博腾已具备承接细胞与基因治疗产品商业化受托生产的合规能力,将有力促进公司细胞与基因治疗CDMO业务的发展。公司同时表示,此次获证预计不会对公司2026年度的业绩表现产生重大影响...
20:00
智元机器人高管变动:罗剑岚职位疑似调整 智元机器人内部高层发生变动。据量子位最新消息,智元机器人官网合伙人团队名单已出现变更,原首席科学家罗剑岚的名字不再在列。 回溯至2023年9月,智元首次对外披露合伙人团队名单时,罗剑岚与邓泰华、彭志辉、姚卯青等人一同入选,彼时其职务为合伙人、高级副总裁兼首席科学家。 此前,社交媒体上已流传着罗剑岚可能离职的猜测。如今,...