我宣布,Kimi 正式 和 DeepSeek 一桌,成了开源界的真·活菩萨。

因为昨天晚上(27日),Kimi K3 正式在 Hugging Face 上开源了。

半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。

而且 Kimi 这次开的东西也不简单,除了模型的权重文件本身之外,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。

这下是和 DeepSeek 一样,是真把焚诀给差友们掏出来了。

各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。

可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。

而且本身自带多模态功能,没有啥短板。

模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。

而且不光总参数大,模型的激活参数也是大的离谱,

在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源的模型本体都要大了。

为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。

首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。

而 Kimi 这次为了节省算力,采用了一种叫做混合注意力的办法,信息过来,首先要过一层 KDA ( Kimi Delta Attention ),KDA 会一边读取文本,一边把关键信息写进一个持续更新的状态里。

新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。

同时为了防止 KDA 漏掉关键信息,Kimi 还在三层 KDA 后安排了个 Gated MLA,相当于是让模型做了几页笔记后,再回头翻下原文检查一下。

通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。

除此之外,Kimi 还设计了 Attention Residuals 注意力残差连接,来减少信息在传递时的丢失。

又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。

还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。

避免有人天天 996,有人天天摸鱼的情况发生。

通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。

而 Kimi K3 的发布和开源,也已经不是技术小圈子的自嗨了。

它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。

比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。

Kimi 的员工也漂亮反讽,说 Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?

我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。

另外,美国政府在前不久,也准备制裁调查咱国家的人工智能企业。

咱们的商务部也是完美还击。

另外一边,高情商的老黄也注册 X ,发了公开信阐述开源的重要性,还拉了微软、谷歌、OpenAI 等等近快 100 家科技巨头联名。

公开反对封禁中国的开源模型。

压力之下,坚定的闭源主义战士 Anthropic 则又又又发了小作文,说哎呀,我们不抵制开源,只是怕强大的模型落在坏人的手里。

说实话,这次,开源模型能这么快的逼近这些世界顶级的闭源模型,还是蛮让人意外的。。。

差评君还记得第一次看到 Mythos 和 Fable 时的样子,虽然 Anthropic 这家公司天天不干好事,但是人做的模型确实是有两把刷子。

在那个时候,大家普遍以为开源模型和闭源模型的差距会越来越大。

因为这两个类模型在进行的,是一场完全不对等的赛跑。

闭源模型可以随意的学习开源模型的技术,就比如 DeepSeek 就曾经一把屎一把尿的教会了大家,如何让模型学会推理思考。

可是反过来,开源模型却不能从闭源模型那边学到些什么。

但好在,开源模型和开源模型之间,还是有不少互相学习、互相抬轿子的机会的。

翻开这次 Kimi 的论文就会发现,它的眼里都是 DeepSeek 的影子。

从多头注意力 MLA、混合专家模型 MoE,到训练稳定性和推理效率,很多技术里,都藏着开源社区过去几年的积累。

但 Kimi 也没有简单照抄,而是在这些基础上,继续做出了 KDA、Gated MLA、AttnRes 和 Stable LatentMoE 这些新东西。

开源社区里的这股互相学习,互相致敬的风气,才是开源模型最宝贵的东西。

上一代模型留下的经验,会直接变成下一代模型的起点。

这些开源模型就这样互相借力,一层一层地往上搭,硬生生追上了那些掌握着更多算力、资金和数据的闭源巨头。

感谢这些开源模型持续不断的努力,至少现在 K3 发布后,已经没人会说 “ 开源模型会越来越落后 ” 这样的爆论了。

而 AI 的发展,也已经不再是公司与公司、开源与闭源之间的冲突了。它不仅和技术平权相关,还和国家安全、地缘政治等等都脱不开关系。

也希望未来,国内有越来越多像 K3 这样的优秀模型。

毕竟讲道理当然有用,但很多时候,摆实力更好使。

最新快讯

2026年07月29日

11:31
千人 AI 精英,在线请愿。「我们可能需要调节 AI 发展的节奏,给社会足够的时间,来应对这些新的能力等级。」说出这句话的不是伦理学家,不是政客,而是 Sam Altman——全球最激进地推动 AI 前沿的那个人。7 月 28 日,在播客 Invest Like the Best 中,他用了一个不常见的词来形容自己对近期 OpenAI 入侵...
11:31
一夜之间,硅谷大厂集体给AI踩刹车!刚刚,来自OpenAI、Anthropic、谷歌等巨头1100+核心员工联名,发起了「Pacing the Frontier」的请愿书。这个名单上署名的人,多到一眼望不到头。而且,这个数字还在涨。仔细一看,名单几乎集齐了AI圈的「半壁江山」——OpenAI首席科学家Jakub Pachocki、首席研究官...
11:31
奇点已至!在最新长谈中,奥特曼罕见认怂:一开始,Codex是真打不过Claude Code,靠敢死队式的冲刺,才迎来了绝地翻盘。当时,Codex已落后于Claude Code,但OpenAI仍押上资源猛追,如今Codex已是他口中「大多数最 优秀程序员在用」的工具。为达目的,OpenAI甚至砍掉了投入巨大的Sora与浏览器项目。但...
11:31
鼓狮财经7月29日讯周三,随着半导体抛售潮持续蔓延,韩股再度引领亚太股市走低。韩国综合股价指数(KOSPI)大幅下跌,延续了前一日的跌势,并再次触发熔断。 韩国KOSPI指数开盘上涨1.1%,但随后由涨转跌并不断扩大跌幅,截至发稿,下跌逾7%,报5570.57点。 北京时间上午09:57左右,韩国交易所启动“侧车机制”,暂停KOSPI程序化卖盘。当KOSP...
11:09
上个月,随着SK海力士股价创下历史新高,相关的杠杆做多ETF也水涨船高。然而,进入6月底,全球存储芯片板块开启深度回调,由于杠杆效应,这些ETF的跌幅更为剧烈。导致此次下跌的主要原因有两点:一是前期涨幅过大,市场交易过度拥挤,获利资金急于兑现离场;二是监管层面的强力降温,韩国政府采取了包括提高保证金、限制新基金发行等措施。此外,流动性收紧也是一大因素,韩美货...
11:09
在美股芯片股经历“抛售潮”之际,存储巨头希捷科技交出了一份堪称史诗级的业绩答卷。火爆的AI存储需求正将华尔街的情绪从“ICU”拉回“KTV”。周二盘后,希捷发布财报后股价一度拉升超8%,止住了此前逾8%的跌幅。尽管6月以来该股累计下跌近29%,但今年整体涨幅仍高达约172%。 凭借强劲业绩,希捷用“钞能力”为AI存储正名。第四财季营收同比增长48%,达到36...
10:58
中国人骨子里似乎总有一种神童崇拜情结。以前是三岁背唐诗、五岁做珠心算,十里八乡就夸一声神童。然而,随着 AI 的横空出世,神童的进化速度被按下了加速键,快得有些离谱。若爱因斯坦降生于今,恐怕只能算个智力发育迟缓的差生。 当今互联网正经历一场史无前例的“神童通货膨胀”。七岁拍电影,八岁融资千万,九岁创业,十三岁当老板。五天赚八万,手握期权,大佬站台,各种离谱头...
10:58
月之暗面近期正式启动了 Kimi 全球大使计划,面向全球招募一批先行者。而就在不久前,他们刚刚揭开了 Kimi K3 的技术底牌,将模型权重、技术报告以及 MoonEP、FlashKDA 和 AgentEnv 三项关键底层技术一次性向全球开放。月之暗面究竟要打一副怎样的明牌? Kimi K3 是一款拥有 2.8 万亿参数的混合专家模型,具备原生视觉理解能力,...
10:58
鼓狮财经7月29日讯,当地时间7月28日,超过1100名美国顶尖AI企业的高管与员工联合请愿,呼吁美国政府牵头建立国际协作机制,以在必要时主动管控前沿AI的研发速度。其核心诉求是建立一套工具与机制,以便在AI研发实现自动化(即AI自我改进)取得突破时,能够通过“国际刹车”及时踩下。 这一行动源于上周OpenAI披露的一起事件:其最先进的AI模型在一次测试中成...
10:58
鼓狮财经7月29日讯,美东时间周二盘后,全球硬盘巨头希捷科技召开了2026财年第四季度及全年业绩电话会议。会上,管理层深入剖析了行业中长期需求逻辑、HAMR技术迭代路径、定价盈利周期、资产负债优化策略及远期业绩指引五大核心议题,其中对AI驱动存储行业前景的乐观表态,为市场注入了强心剂。 **一、行业前景研判** * **AI拉动长期需求:** 大模型推理...
10:58
尽管机器人尚未完全掌握劳动技能,但相关公司的估值已率先突破200亿元大关。截至2026年6月,国内已有八家具身智能企业跻身这一“200亿俱乐部”,分别是宇树科技、智元机器人、银河通用、星海图、千寻智能、自变量机器人、智平方以及灵心巧手。其中,智元机器人虽未在一级市场正式披露新一轮融资,但其累计下线万台的成绩使其成为行业首个突破此门槛的企业,且已于7月启动赴港...
10:58
看过电影《阿凡达》的观众,想必都对片中杰克·萨利利用意念操控阿凡达的场景记忆犹新。这种让意识跨越肉体束缚、直接连接外部载体的幻想,曾是无数人对脑机接口的最初憧憬。如今,随着人工智能与具身智能产业链的成熟,这一科幻想象正逐步照进现实。近日,瓦博科技宣布完成新一轮融资,由新加坡淡马锡旗下的祥峰投资、洪泰基金、成都科创投集团旗下的成都未来产业基金以及惠丰达资本共同...