究竟还有没有便宜又好用的模型?就在刚刚,阿里巴巴突袭发布了新一代基座大模型 Qwen3.8-Max。用四个字概括就是「能打」、「便宜」。总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接跃升了一个档次。

在今天最新放榜的权威第三方榜单 Arena 中,Qwen3.8-Max 一路冲到全球大模型第一梯队,表现直逼 Anthropic 的 Claude 系列。在编程表现上,甚至超过了 Claude Opus 5 和 Fable 5 的 High 版本,确实表现不俗。能打是一方面,关键是价格也打下来了——国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,输入与输出的国际价格仅为 Opus 5 的 40% 与 24%,确实便宜大碗。

性价比高,能力还强,自然备受关注。此前抢先体验的网友已经交上了第一批实测反馈。有老哥用 Qwen3.8-Max 复刻了一版《愤怒的小鸟》,直言价格合适,一周使用下来额度消耗不到九成。也有网友只用一条提示词,就搭出了一个完整、可交互的开发者作品集。大家针对模型的表现聊得火热,有人迫不及待想用起来,甚至调侃祝 A 社、O 社 IPO 好运,也有人对 OpenAI 和 Anthropic 的闭源策略表示质疑,认为 Qwen3.8-Max 已经把 5.6-Sol 给 KO 了。

既然 Qwen3.8-Max 来了,我们也直接实测一波,看看模型到底能不能打。

01 编程与专业工作:端到端交付

说实话,阿里 Qwen 前几代模型我几乎是发一个测一个,感受最深的就是确实能打。而这次到了 Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。在具体评测表现中,Qwen3.8-Max 在科研复现、多模态理解、长视频和电脑操作多项测试中超越了 GPT-5.6、Opus 4.8 与 Fable 5,在编程、终端 Agent 和专业工作也稳居行业头部。

具体亮点包括:编程能力能端到端自主交付,理解需求、搭建工程、运行实验、检查结果全流程覆盖,官方披露的一个极端案例是,它能从空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目;长线程任务具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标;专业工作能一次交付需要返修 3 到 5 轮的 APP 原型,也能在一小时内处理数百份法律文档;多模态智能体能消化几百页的复杂材料和上百小时的视频内容,还能整理成直接可用的成果。

02 编程能力大考验

既然 Qwen3.8-Max 如此擅长 AI Coding,那我们直接考察一下这模型的「编程本事」。好巧不巧的是,最近我正愁每周例会上该怎么把这一周的 AI 热点捋清楚,做成一份能给领导交差的分享。于是,我索性把这事儿交给 Qwen3.8-Max。不过,光用一句提示词搭个网页多少有点太简单了,于是我化身产品经理,喂给了 Qwen3.8-Max 整整一大页产品需求,让它「从零」开发一个可运行的 AI 资讯网页。

在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难。大概过了 5 分钟,我的这位产品经理 Qwen3.8-Max 就直接给我端上来了一份接近正式产品交付水准的全链路解决成果。整个交付过程从需求拆解、技术选型、项目结构到功能实现,完全是一套真实项目从开发到交付的完整流程。

我发现 Qwen3.8-Max 还专门整理了一份「问题与解决记录」,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。作为提出需求的那个人,我全程一次手都没插,甚至直到看见这份记录,才知道中间居然还冒出过这么多麻烦。Qwen3.8-Max 在交付前,还给整个项目来了一轮正儿八经的「功能验收」,从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍,甚至连数据量、分类覆盖范围、搜索清空后的页面恢复都列进了验收清单。

我忐忑地打开代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题。原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。我只能说,Qwen3.8-Max,你这是真·端到端啊。

03 长文本分析探一探

在编程项目上能全流程交付确实不简单,但在日常学习工作场景中,很多时候真正想让我们头疼的,反倒是一些基础的工作场景,比如长文本分析。单纯的文本分析当然不难,但让 AI 对几十页复杂文档进行「交叉分析」那事情就不一样了。之前我就喂给过 GPT 一份包含几十页的技术文档,让 AI 总结内容还行,但涉及跨章节、细节对比的事儿就宕机了。

于是这次,我也给 Qwen3.8-Max 上点难度。我喂给它的是一篇关于 ImageNet 的几十页论文,正文、图表、附录一个不少。这篇论文复盘了 2010—2014 年 ImageNet 大赛,讲清楚 AI 看图能力是怎么一步步逼近人类的,以及这背后数据、算法和评测规则各自起了多大的作用。而我向 AI 发起的问题是:论文拿 ILSVRC 和 PASCAL VOC 这两套「AI 看图考卷」做了比较,结合正文、表 3 和附录 B 的图 16 来看,哪套题更难?为什么看平均值和看困难类别,会得到不同答案?这个题难就难在,AI 光搜关键词还真答不了,因为答案散落在正文、表格、图表和附录里,AI 得把几组数据全部对上,并且进行交叉分析得出结论才行。

大概 33 秒的时间,Qwen3.8-Max 就直接给了我一个明确答案——只看整体平均值,PASCAL VOC 似乎更难;但看可比类别和 ILSVRC 的困难子集,ILSVRC 在很多方面并不比 PASCAL VOC 简单,甚至更难。为了确认这份回答是否准确,我又对照原文的表 3、图 16 和附录 B 逐一定位,发现这 AI 确实说的是「对的」。Qwen3.8-Max 为了告诉我它为什么得出这样的结论,还给我生成了一篇超有理有据的「分析报告」,从物体大小、位置变化、定位难度、画面杂乱度几个维度对两套考卷进行了分析,甚至把原文中的表格直接 1:1 单拎出来作为证据,定位找得那叫一个稳准狠。

04 多模态内容理解任务

上面两轮实测,考察的主要还是 Qwen3.8-Max 对文本的分析、理解和执行能力。但我们的日常学习工作里,还有一块更难啃、也非常刚需的硬骨头场景:多模态内容分析。对 AI 来说理解某一个画面或者总结一个视频内容确实不是难事儿,真正麻烦的是,当素材被拉长到几十分钟甚至几小时,它还能不能理清其中的人物、事件和观点关系,并根据一个具体问题,精准定位到原片段。

于是这次,我直接把手头一个亟待处理的「实录烂摊子」交给了 Qwen3.8-Max——一期接近 70 分钟的视频播客,在播客里山姆·奥特曼从 AI 创业一路聊到 OpenAI 战略和未来社会,话题多、跨度大,想从头捋清楚并定位原片段,少说也得折腾半天。对此,我交代给 Qwen3.8-Max 的任务,也可以说非常复杂艰巨——请为这期播客生成一份完整的主题时间轴,并按「话题观点」定位原始片段。

大概也就两三分钟,Qwen3.8-Max 就给我吐出来了一份按照核心观点划分的播客内容。更贴心的是,每个话题都采用「先总结、再展开」的结构,前面提炼核心观点,后面逐段捋清具体内容,还一一标出了对应的时间戳。对我来说最大的好处嘛,那就是看到哪段感兴趣,直接点进原视频精准空降就行,简直不要太太太太方便。

好用是真的,用得起也是真的

哪怕 AI Coding 发发展到今天,海外主流模型三天两头迭代得飞起。我们依旧不得不承认一个事实,落到用户的实际体验里,似乎始终很难真正做到「既要、又要、还要」。换句话说,模型能力、场景覆盖和价格,这三件事儿似乎总不能同时兼得。Coding 能力很能打,到了其他场景里,交付效果却未必同样稳定;就算效果足够好,价格也经常让人望而却步,各种 Plan 和 Token 费用,长期用下来确实烧不起。

但这次实测完 Qwen3.8-Max,我可能得重新下一个结论,那就是全球头部模型——也是能用得爽,还用得起的。每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元,输入和输出价格真的只有 Opus 5 的 40% 和 24%。这意味着,大家不用承担高昂的 Token 费用,也能获得高性能模型带来的完整体验。而在真实场景中,Qwen3.8-Max 所完成的工作,也早已超出「生成」这一步。它真的可以从零开始,帮我推进一项完整工程,再把过程中冒出来的实际问题一个个解决掉,最终把能运行、能检查的成果交到我手里。这种兼顾,放眼整个模型圈里都算得上稀缺。

Qwen 之所以敢把能力、场景和价格一起提升,实际上背后靠的也远不止一款 Max 模型。从 2023 年开源至今,阿里已经累计开源 400 多个模型,衍生模型已经超过 20 万个,累计下载量突破 10 亿次,一路下来,Qwen 也成为了全球规模最大、覆盖最全的开源大模型家族。更值得注意的是,Qwen 这条更新进度条,过去一年几乎就没停过。从 Qwen3 到 Qwen3.5,再到如今的 Qwen3.8,几乎每一次迭代,都对应着一批新场景真正变得可用——从基础推理,延伸到编程、专业工作、多模态理解、长程 Agent,再到这次的端到端交付。这种日拱一卒的节奏,放眼全球也没几家跟得上。

于是,我们或许真的可以下一个结论。那就是真正「好用」的模型,未必一定昂贵;真正「便宜」的模型,也未必需要在能力上做取舍。而 Qwen3.8-Max,恰好把这两件事放在了一起。

对了,目前,Qwen3.8 的 API 已上线千问 AI 平台,还接入了阿里今日同步推出的 Agent 产品「千问办公」,感兴趣的朋友不妨直接上手试试。

最新快讯

2026年08月03日

19:27
令人始料未及的是,7月份,港股竟成为全球主要市场中表现最亮眼的存在。恒生指数单月涨幅达13.13%,若从6月底的低点计算,三大指数累计反弹约15%,大幅领先于其他主要市场。更值得称道的是,互联网、医药、有色、金融、消费等几大核心板块同步回升,且领涨的多数是行业内的核心巨头。从6月的低点至今,阿里涨了40%、美团涨超45%,京东涨超35%,小米涨超30%,比亚...
19:13
鼓狮财经8月3日消息,长飞光纤(601869.SH)发布公告称,公司子公司长飞资本将出资1.7亿元,参与设立规模为5亿元的长飞江城智能创业投资基金。该基金将重点布局人工智能、高端制造、半导体与集成电路等战略新兴产业。
19:13
据鼓狮财经8月3日报道,恒银科技(603106.SH)发布异动公告,称公司目前生产经营一切正常,近期经营状况及内外部经营环境均未发生重大变化。 公司核心业务聚焦于金融智能终端设备的研发与制造,主要面向银行等客户提供包括现金类、非现金类及支付安全类在内的综合解决方案。具体产品涵盖自动柜员机(ATM)、存取款一体机(CRS)、大额高速存取款一体机(TCR)以及智...
19:13
据鼓狮财经8月3日报道,歌华有线(600037.SH)发布公告称,公司将以自有资金2亿元作为有限合伙人,认购杭州君联良道股权投资合伙企业份额,占比4.16%。该基金由君联资本管理,主要投资于先进制造、科技服务及医疗健康等领域。鉴于本次投资不构成关联交易,无需提交董事会或股东大会审议。
19:13
鼓狮财经8月3日消息,以色列总理府发言人多龙·施皮尔曼2日表示,以方对美国提出的巴勒斯坦伊斯兰抵抗运动(哈马斯)解除武装方案表达了“严重关切”。他强调,在哈马斯完全解除武装之前,以色列不会撤出加沙地带。此外,2日以色列对加沙地带进行了连续第二天的空袭,已造成至少18名巴勒斯坦人死亡。
19:13
鼓狮财经8月3日消息,罗马尼亚海军部队当天在多瑙河巴拉水道实施了可控爆破作业,目的是将水流导向切尔纳沃德核电站附近,从而抬升当地水位。此前,受多瑙河水位跌至历史低点影响,该核电站的两座反应堆分别于7月28日和30日停运,这是两座反应堆首次因水位过低而同时停机。受此影响,罗马尼亚宣布全境进入为期一个月的紧急状态,该状态将持续覆盖整个8月。
19:02
据智元创新官网最新披露,其合伙人团队阵容已正式揭晓。该团队汇聚了来自华为、谷歌、腾讯、大疆、寒武纪等顶尖科技企业的资深精英,横跨AI研发、产品工程、全球商业化及政企关系等核心领域,构建了“AI科技+商业化”的双轮驱动模式。 在核心创始团队方面,创始人、董事长兼CEO邓泰华曾担任华为副总裁及无线、计算产品线总裁,主导了鲲鹏与昇腾AI计算生态的建设,拥有深厚的I...
18:54
2026年8月1日,OpenAI抛出了一枚重磅消息。其内部代号Astra的下一代主力模型,在数学与理论计算机科学领域取得了十项重大突破。这些成果覆盖高维几何、编码理论、群论、算子代数、量子复杂度、格密码学和极值组合学等多个方向。每道题都是开放超过十年、核心进展长期停滞的硬骨头。消息一出,数学圈的反应不是欢呼,而是长时间的沉默和反复核对。原因很简单:这一次,A...
18:54
Genspark 最成功的 Agent,或许就是 Genspark 自己。它只需执行一项长程任务:让世界相信它从来只是一家来自 Palo Alto 的美国 AI 公司。 2026年7月24日,英伟达联合创始人与 CEO 黄仁勋(Jensen Huang)破天荒地在社交媒体开通了账号,发布的第一条推文即震撼了整个人工智能界。 ...
18:54
今年夏天,具身智能赛道迎来历史性时刻,宇树科技科创板IPO审核生效,并于8月5日开始询价,10日开始申购。从3月份正式提交IPO申请到注册生效,宇树全程仅用时104天,创下科创板预先审阅机制落地以来最快审核纪录。这家成立于2016年的公司,以约420亿元的发行估值,即将成为“A股人形机器人第一股”。 然而,资本市场的另一侧,硬科技股“上市即...
18:54
2026年春天,一位传统制造业的老板找到我。他苦笑着说:“周围所有人都在聊AI,ChatGPT、DeepSeek、Agent、大模型……我花了几十万买了个‘AI解决方案’,结果发现就是套了个对话壳子。我连AI到底是个什么都还没搞明白,钱就花出去了。” 我觉得他真正需要的不是某个具体的“AI解决方案”,而是对AI的系统认知——知道AI是什么、能做什么、不能做什...
18:53
8月3日,南下资金净买入港股总额达到110.31亿港元。具体资金流向方面,净买入盈富基金47.5亿港元、阿里巴巴41.69亿港元、腾讯24.32亿港元、美团5.8亿港元、南方恒生科技3.17亿港元、小米集团2.93亿港元;净卖出中芯国际10.64亿港元、华虹宏力4.2亿港元、建滔积层板3.1亿港元、智谱1.73亿港元、兆易创新1.73亿港元。 持仓趋势方面,...