面对AI视频在网络上泛滥的乱象,英伟达CEO黄仁勋终于坐不住了。近日,英伟达宣布推出Synthetic Video Detector NIM,这套工具号称能逐帧分析视频,通过识别生成模型留下的统计特征和频域痕迹,精准甄别哪些内容是AI生成的,准确率最高可达92%。
随着生成式AI技术的普及,制作虚假视频的门槛日益降低。例如前阵子网上流传的一个视频:一只猫碰碎了花瓶后迅速溜走,旁边的狗子愣在原地疯狂挥爪解释,表情仿佛在说“不是我”。如果这视频确实是AI生成的,那确实挺搞笑的。
以前判断假视频,还能靠嘴型对不上、手指数量不对等明显破绽。但现在视频生成模型进化神速,很多生成内容已经看不出明显的漏洞,难怪家里的长辈容易上当。既然普通人难以辨别,检测工具就派上用场了。
英伟达加入了“用AI检测AI视频”的大军。简单来说,Synthetic Video Detector NIM是英伟达NIM标准下打包的一套AI视频检测服务。它主要面向本地部署,目前用户想要在线使用需通过媒体测试申请,本地部署则需要Linux系统和兼容NVENC/NVDEC视频编解码的硬件,普通用户想用上门槛颇高。
根据官方介绍,视频上传后,SVD NIM会将H.264编码的MP4拆成画面帧,交由DINOv2和DINOv3组成的视觉模型分析,并给每一帧打分汇总。它不关注穿模、手指数量等传统破绽,而是识别生成和去噪过程中留下的底层统计特征、频率异常及像素规律。即便视频被压缩或重新编码,识别概率依然较高。
从官方演示案例看,一段本身没有明显崩坏、运镜却过于平滑的视频,SVD NIM给出了高达99%的综合得分。这表明在Seedance和Kling等模型面前,肉眼确实很难分辨。英伟达声称准备了超过4000个视频的内部测试集,SVD NIM检测成功率高达85.64%,未压缩视频准确率更是达到92%。不过,这高准确率基于严格的阈值采样,在真实环境中可能产生大量误判,更适合作为视频网站的初筛工具。
英伟达的SVD NIM离普通用户较远,国内其实也有类似工具。例如腾讯朱雀AI检测助手和反诈中心App里的“AI内容鉴定”,均支持文字、图片和视频检测。为了测试效果,我准备了一组混合素材,包括主流模型生成的图片、手机实拍照片、精心挑选的AI视频以及真实Vlog。
测试第一轮是AI视频。一段由Seedance制作的视频,画质模糊、镜头微晃、角色神态自然,很有老电影感。腾讯朱雀直接“翻车”,误判为真图。相比之下,借来的SVD NIM账号给出了93%的AI合成得分。反诈中心则因服务器问题半小时未能上传成功。
第二轮是真实视频。选了一个光线质感极佳、过渡顺滑的Vlog视频,真假难辨。腾讯朱雀再次误判为AI,SVD NIM给出了34%的综合得分,表示证据不足。反诈中心依然无法上传。
图片测试中,两张经过处理抹除水印的AI图片(豆包、Image2)与真实照片混在一起。朱雀这次将真实照片误判为AI,而反诈中心则成功识别出AI图片。不过,两款应用的免费次数都不多,且反诈中心服务器常处于爆满状态。
经过实测,我对AI检测工具的信心只能说“聊胜于无”。视频方面,英伟达表现尚可,腾讯朱雀则完全不可靠;图片方面,腾讯朱雀经常出现真图当假图的情况,反诈中心虽然算法准确但服务体验不佳。既然机器自己都拿不准,普通人更别急着拿检测截图去断案了。
相比于事后检测,生成时直接留下水印和来源记录显然更靠谱。谷歌的SynthID和Adobe推动的C2PA都在尝试记录生成过程。国内网信办也已要求AI内容添加标识,腾讯、阿里和字节也在跟进。但目前这套体系尚未打通:开源模型生成的无水印内容、转发中丢失的元数据,以及各平台间的互认壁垒,都是阻碍。在这些问题解决前,普通人只能多长个心眼。
