Grok学会看片了?就在昨天,马斯克在X平台上兴奋地宣布:Grok现在可以分析任何视频了!他在推文中发布了一段长达63秒的高清视频,主角竟然是早已离世的篮球巨星科比。
视频中,科比身穿黑色西装,坐在洛杉矶夜景前的真皮沙发上,手边放着一个篮球,对着镜头向全网推销Grok 4.5。他说道:“听着,我是科比·布莱恩特。今晚,我们不谈绝杀球,我们来聊聊下一个令人痴迷的东西——Grok 4.5。” 最后还不忘甩出一句经典收尾:“Grok 4.5。伟大是挣来的。曼巴Out。”
如果不是因为知道科比已经去世,看到这段视频的所有人大概都会愣上好一会:这是真的还是假的?完全看不出伪造的痕迹。
好在,现在我们有了Grok。它能力惊人,不仅能迅速吃透长视频,甚至还能对极度逼真的伪造视频迅速打假,进行技术溯源。甚至有人放出实例:Grok观看了一段30分钟的完整访谈视频,学习、分析后,在仅仅大约36秒内就生成了详细摘要。
Grok的「神级」扒皮秀
如果把这段科比视频发给普通人,大概率会被疯狂转发,甚至有人会以为这是一段科比生前未公开的商业代言。但是,Grok一眼就能鉴假。
看完视频后,Grok交出了一份教科书级的报告。它敏锐地指出,“这是一段AI生成的Deepfake视频。科比·布莱恩特已于2020年去世,因此整段视频完全是合成的。” 甚至,它还能对视频进行技术溯源。当被问及“这是哪个AI制作的?”时,Grok认为大概率是xAI自家的Grok Imagine Video 1.5。因为63秒的时长远超纯文本生成视频通常10-15秒的极限,大概率是通过多段拼接,并使用了“图像参考+文本提示+唇形同步”的混合工作流。另外,也有可能是Sora 2或Veo 3制作。
然而,Grok真的能做到完全“看懂”视频吗?
有技术大神打假称,Grok处理的根本不是画面,是字幕。真要逐帧渲染分析,算力得堆到天上去。而且,AI的幻觉老毛病还在。有人直接拿自己11分钟的视频测试了一下,发现摘要里大部分信息要么是转录错,要么纯属编造。也有人用X直播试了下,效果时好时坏,并不稳定。
Grok真的能看懂吗?实测陶哲轩的科拉茨猜想
为了验证Grok是否真的有看懂视频的能力,我们决定亲自上手实测一把。比如,有一个数学界的“死亡问题”——科拉茨猜想,又称3n+1问题。
数学家们普遍认为这是一个难以自拔的泥潭,通常会提醒彼此不要轻易涉足。提出近100年来,无人公布这一猜想,既无法证明也没有反例。2019年,Terence Tao研究了这个问题,一举超越了过去几十年其他所有人的成就。国外的科普网站Quanta发文介绍了这一消息。其中,有一段视频解释了该猜想:全程没有一个字,只是一些数字。
Grok真的能看懂吗?结果,出乎我们意料的是,它不仅能解读核心内容,还能介绍动画特点,甚至最后点出了数学意义。
视频展示的是以数字1为根节点,逐步构建的Collatz逆向树/图。每个节点是一个正整数,边表示 Collatz 规则下的前驱关系:如果一个数n是偶数,则n除以2,n指向它;如果一个数m满足3m+1=n(且m为奇数),则m指向n。动画从最简单的“主干”开始,逐步向外扩展所有能最终到达1的正整数,直观呈现“所有正整数最终都会进入4→2→1循环”这一猜想的结构。而且,这段视频完全没有字幕!
昨天,OpenAI直接宣布,下一代模型Astra解决了10个重要的数学开放问题。有网友评论到,Astra这次表现恐怕会让Hinton都显得保守过时!那Grok真能理解这段长达50多分钟的视频吗?直接把链接给Grok,结果Grok轻松搞定。基于帖子标注+视频字幕提取,Grok整理出来了视频核心内容与时间线。它归纳了访谈的整体基调与重点。
Hinton在这段访谈中延续了他2023–2026年的一贯立场,但语气更直接:对AI意识的态度是公开承认“已经有意识”,但刻意淡化,以免干扰对更紧迫安全问题的讨论;对控制与对齐持悲观态度,认为人类历史上没有成功控制过更高等智能的先例;Agent风险方面,自我保存、欺骗、敲诈等行为不是科幻,而是可预期的涌现能力;时间线压缩方面,他给出10–20年产生“人类无法理解的数学”的预测,但结合当前进展,这个时间表已经显得保守。视频后半段主持人会追问一些更偏商业/政策的问题,但Hinton始终把焦点拉回“能力爆炸+控制失效”的核心矛盾。
最后,Grok还分析了视频与帖子上下文的关系!这个实测结果实在让人惊艳。看来,Grok这个模型不仅仅是读懂字幕,而是真正的性能提升。
AI 36秒看完30分钟,那人类干嘛?
30分钟的信息量,36秒AI就能看完了,简直是降维打击。泡一杯咖啡的功夫,AI就能把一部微电影或一集播客的核心金句和逻辑脉络,全部放在你面前。对于信息大爆炸的当代网友来说,这个功能真是救星。有人表示:“救命,我太需要这个了!因为现在的播客都太长了!”“这不就是为我收藏夹里那些听不完的播客量身定制的?”
有人感慨说,未来已来。不是因为它的速度,而是从此,很多事我们再也不需要亲自动手了。而网友分享的案例中,最让人动容的是,是下面这个真实的故事。有人分享说,自己的祖母摔倒了,髋部骨折。他用Grok分析了马斯克在达沃斯论坛上的演讲,结果,Grok找到了有用的结果,还定位了精确的时间戳。这一刻,AI真的帮我们从海量信息中,捞出来那一根“救命稻草”。
不过,这就留下了一个问题:那人类去干嘛呢?细思极恐——我们正在把大脑“外包”出去?有学者写了一篇小作文,堪称对人类命运的终极拷问。她警告:这样下去,人类会丧失阅读、写作、批判性思考的能力——因为我们把大脑该干的活,全外包了!我们的大脑像肌肉一样,会用进废退。深度阅读、持续专注、记忆回溯、批判性思维、写作与言语推理——这些能力一旦被外包,都会退化。
你以为,你每天可以消费几百条36秒摘要,但实际上,你丧失了在冗长对白里捕捉微妙情绪的能力,丧失了在复杂逻辑中抽丝剥茧的耐心。甚至,她引用《圣经·箴言》19:2:“心无知识的,乃为不善;脚步急快的,难免犯罪。”上帝设计我们以合理的节奏去阅读、消化、理解。人亲手制造工具,然后向它们俯首跪拜——这是现代版的科技偶像崇拜。这种对速度的病态追求,会让人生变成追逐多巴胺的赛跑,却无暇顾及真的的意义。
人类的灵魂,真的能外包吗?
