有没有人和我一样,每天都会对着AI生成的萌宠视频傻笑?谁说观众不喜欢看AI内容?这技术简直太棒了!今天,各位有福了,生数科技发布了Vidu S2模型。它不仅能让你和虚拟数字形象实时互动,还能在视频播放过程中,现场换装、换人、换背景、换画风。

无论是想给屏幕里的小奶狗男友换套西装,还是想让二次元小偶像一秒切换到赛博朋克风,甚至想把老板变成一只“尖叫鸡”,它都能丝滑搞定。数字人这边也开始接“新活儿”了:跳舞、转身,动动嘴就能安排;聊到一半再递张参考图,还能让它换上同款衣服、拿起指定物品。你负责出主意,它负责加戏。这哪里是AI视频生成模型,这分明是“换装游戏的导演剪辑版”啊!

这项神奇的能力来自生数科技最新发布的Vidu S2。它不仅让数字人更加能说会动,也能像P图一样P视频,边播边改。要知道,就在短短两个月前,上个版本的Vidu S1才刚让大家见识了什么叫“数字人成精”。数字人从依赖“音频驱动口型+预设动作库”的传统模式,进化到能通过语音控制数字人的行为,还能实现无限时长连续互动。Vidu S1一经推出,便被网友玩出了花。有的把自己猫的照片喂给模型,让它开口讲话;有的把Coding界面传给模型,让它扮演“程序员鼓励师”小姐姐;还有的让自己去世的亲人“复活”,互相倾诉思念……

这次Vidu S2带来了全方位升级,一口气放出三个大招:

S2-Editing:正在输入的视频,可以实时换装、换角色、换背景、换风格。这是本次最值得先上手的升级,堪称视频版“Photoshop”。

S2-Avatar:实时互动角色升级到720P,还能接住中途递来的物品参考图,按指令拿起、展示,完成更丰富的肢体表演。

实时空间视频探索:进一步把生成或编辑的视频转换成左右眼画面,送进VR头显,探索与角色更有纵深感的互动。

而且Vidu S2发布当天就全量开放,不搞内测、不限名额,这波操作属实是把“技术自信”写在脸上了。

实测模型,这AI是不是偷偷学了魔术?老规矩,先来测试一波这次更新的Vidu S2。Vidu S2包含两个细分模型:Vidu S2-Avatar(实时交互模型)和Vidu S2-Editing(实时视频编辑模型)。

先看Vidu S2-Avatar,除了能在互动过程中接收新的参考图,它执行动作指令的能力也升级了。把上一代请出来,同屏比一比就知道了。同样让数字人跳舞、转圈和跺脚,左边的S1没能完成要求,右边的S2则跟着指令动起来了。以前S1主要是聊天互动,现在S2将大幅度的身体动作也安排上。“嘴上答应”和“身体力行”的区别,这下终于有画面了。不仅动作更听指挥,画面也更清楚了。Vidu S2-Avatar将实时输出分辨率从上一代的540p提升到了720p,数字角色面部和衣服上的细节等变得更加丰富。

接下来,轮到参考图发挥作用。你可以在互动过程中随时递给数字人一张新图片,让它拿起图里的物品、换上指定的衣服,或者进入新的场景。既能听指令做动作,又能照着参考图调整内容,这位数字搭档能接的“活儿”,明显更多了。

再来看看Vidu S2-Editing,它带来的实时视频编辑能力,是这次最大的更新之一。画面对准一位正在接受采访的女士,秒切不同款式的服装,它们都非常合体,好像本来就穿在她身上似的。人物动作连贯,脸部一致性很好,服装随着动作产生的形变也非常真实。尤其是最后一套驼色大衣,袖口半遮住了女士佩戴的首饰,处理得非常真实。非要挑刺的话,第二套衣服在呈现色块时仍有一点涂抹感;人物佩戴帽子时,头发仍然有一点穿模。不仅能换装,还可以更换背景。看看这个视频,小姐姐在各个场景丝滑地跳着女团舞,我感觉自己在看一个制作精良的MV。不换背景只换人?听说《牛来2》要来了?在办公室的我变成了牛来跟大伙say hi……嚯!我感觉自己好像加班加出幻觉了。最离谱的是,我变成的这些奇怪东西居然完美融入了办公室环境,透视、遮挡都挑不出毛病。建议各位打工人收藏此功能,开会时把自己替换成财神爷,说不定老板看你都顺眼了。

再来看看视频风格转换的表现。小哥哥切换不同的风格,视频全程的画面一致性以及风格的迁移能力表现得相当不错!小小总结一下,Vidu S2-Editing,对正在进行的画面提供四类实时编辑能力:实时人物换装、实时更换背景、实时更换主体角色、实时风格渲染。这意味着,直播间的视觉效果、虚拟角色的演出、创意视频的玩法,都有了更多临场发挥的空间。

69天完成版本更迭。Vidu S2只用了69天就完成了一次大版本跃迁,视频模型赛道现在真的是卷麻了!两个月前,Vidu S1的亮相同样惊艳。有必要来回顾一下这位“前辈”。Vidu S1、Vidu S2的全链路研发均由清华大学朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。之前绝大多数数字人,都是“音频驱动口型+预设动作库”的传统模式,本质上跟一个会动的PPT没太大区别。而Vidu S让AI视频从“离线生成”跨越到“实时交互”。只需要上传一张照片,模型就能生成一个可以和你实时互动的AI角色。这里要划个重点:实时交互视频,和传统视频生成模型走的是不同的路。实时交互视频的每一帧,都是根据用户输入现场算出来的。这意味着模型的生成速度必须跑赢播放速度,不然用户看到的就是PPT式的卡顿。这可不是简单地“把生成速度拉高”就完事了,而是要重塑整条生成链路。团队用SageAttention等技术给计算提速,再通过多GPU协同调度减少模块间的等待,让显卡少闲着、整条生成链路跑得更顺。

到了S2,这种交互又向前迈了一步:画面从540p提升到720p,数字人能执行更复杂的动作,还能在互动中接收新的参考图;新增的Editing模型,则把换装、换人、换背景和换画风带进了实时视频流。此外,还有一件事值得单独唠唠。最近“实时空间视频”成为了视频模型行业的竞争前沿,业内有公司刚开始布局,而生数已经把空间视频做成了可体验的产品。所谓的空间视频,是一种能够呈现三维立体深度和沉浸感的立体视频格式。它基于人类的双目立体视觉原理,利用两个不同视角同时录制影像,记录下景物的立体深度信息。空间视频需要在支持空间计算的设备上观看,比如Apple Vision Pro,在普通设备上它只是普通的二维视频。如今,基于Vidu S2-Avatar,用户可以实时生成空间视频;基于Vidu S2-Editing,用户还能实时编辑空间视频。你可以把一段普通视频实时转成空间视频,还能将你通过头显摄像头看到的真实物理世界,当成“画布”来创作。也就是说,Vidu S2不光能让AI角色在屏幕里跟你互动,还打算让它们“走出屏幕”。当然,团队也坦诚地表示:头显对分辨率和延迟的要求极其苛刻,画面糊了会晕,延迟高了转头和画面会“打架”,这块还在持续优化中。未来,团队计划从固定视角扩展到全景空间视频,让你转头就能自由探索AI生成的场景。

技术揭秘:如何做到“边播边改”?看完这些让人惊艳的视频效果,问题来了:Vidu S2到底是怎么做到的?在数据处理方面,为了让数字人表现出更丰富的动作与表情,团队补充了舞蹈、二维动画和三维动画等训练素材,并对符合条件的视频进行背景稳定处理,在保留大幅动作的同时,减少镜头运动带来的干扰。标注方式也围绕连续互动重新设计:按照事件发生的顺序,记录动作何时开始、带来什么变化,以及结束后人物处于什么状态。片段描述根据事件边界划分,训练时,每个时间片段都有对应的条件。这让“抬手、拿起杯子、端着杯子继续说话”中的动作衔接与状态变化,都有了更清晰的学习依据。

流式训练一直是一个难点,因为这个过程像一场接力:下一段画面接着上一段往前走,前面的一点偏差,也可能被一路传下去。Vidu S2选择先通过Hybrid Forcing学会逐段生成,然后让模型练习接住自己产生的偏差。为此,Vidu S2引入Self-Replay Forcing:先让模型连续生成一段视频,再给生成结果分块加噪,进行一次可训练的因果回放。这次“复盘”把前后片段连起来训练,让后续片段的训练反馈也能影响较早片段的表示,帮助模型学会:即使前面出现偏差,后面也能尽量接得稳、接得顺。

接着是画质和实时性的问题。Vidu S2采用了Backbone-Refiner两阶段架构。Backbone先在低分辨率下生成画面的主体结构、运动和语义内容,确定“画面里有什么、正在做什么”;Refiner再负责生成细节,把画面做得更清楚。可以把它理解成两位画师配合:一位负责打底稿、抓动作,另一位负责精修。关键是,两位不用排队等着干活。通过异步流水线,细节重建与后续内容生成可以并行推进,这让模型在720P输出下仍然不掉帧。

而换装、换背景能做到“边播边改”,靠的是“时间戳对齐”。用户中途发来一张衣服图片,模型需要知道的不只是“换成什么”,还有“从什么时候开始换”。Vidu S2通过重新设计位置编码,将参考图的注入位置与时间戳对齐,让模型知道新条件应该从哪个时间点开始生效。因此,新参考图中的内容可以根据指令进入后续画面,并保持运动与光照的连续性,实现生成条件的平滑过渡。

模型光会换装还不够,还得学会看场合换。于是Vidu S2请来一位盯着现场的“执行导演”:VLM Agent。实时互动时,用户可能接连提出要求。模型在执行下一步之前得先搞清楚:画面里现在有什么?人物正在做什么?上一条指令执行完了吗?VLM Agent是基于视觉语言模型的智能体,会持续解析已经生成的画面,跟踪这些状态,再据此规划后续生成,并在合适的时机调整生成条件,让互动更好地结合画面状态与用户意图。

最后是强化学习。Vidu S2在双向与流式两个阶段都加入了偏好与奖励优化,让模型生成的内容更符合人的期待。双向阶段采用DPO,改善画质、表情、动作自然度和音画同步,为后续流式训练提供更强的教师模型。流式阶段则采用Streaming NFT,直接优化承担持续生成任务的因果模型。模型先生成自己的视频轨迹,再沿用SRF的回放思路进行奖励优化,让训练贴近实际运行时的状态,进一步提升画面质量、动作可控性和指令遵循。

从Vidu S1的语音互动,到Vidu S2更清晰的画面、更准确的动作响应、随时加入参考图和实时编辑视频,再到空间视频体验,人与AI的交互正在变得更加自然、丰富。一个虚拟数字人能理解你此刻在做什么,并且立刻跟着指令行动,这事放在两年前听着还挺科幻。现在Vidu S2把它做成了直播间里随手一点的功能,仔细想想也真是奇妙。

最新快讯

2026年09月16日

19:03
9月16日,南下资金净买入港股20.99亿港元。其中,净买入智谱31.22亿、中芯国际6亿、MINIMAX 4.99亿、建滔积层板3.75亿、腾讯3.49亿;净卖出盈富基金6.04亿、长飞光纤光缆3.9亿、金斯瑞生物科技3.02亿、剑桥科技2.31亿。据统计,南下资金已连续4日净买入智谱,共计54.9818亿港元。北水关注个股智谱:智谱9月16日表示,公司刚...
19:03
近期,中国科技股终于迎来了一波久违的反弹。科创50指数在上周五一度跌破关键年线,最低触及1516点,这是自2024年9月30日以来的首次跌破。相比7月初2255点的历史高点,指数回撤幅度已达31%。然而,跌破年线后市场迅速企稳,午后上演深V反转,成功收复失地。周一指数虽震荡微跌,但守住了前期低点;周二试探上攻至1578点后虽有回落,但收盘仍收涨1.55%。今...
19:03
本文作者 | 远舟数据支持 | 鼓狮大数据(www.gushiio.com)执业编号 | A20260413000375本周一开始,亚太市场经历了一场过山车行情。受AI巨头呼吁"放缓研发"的消息冲击,AI相关板块集体承压。主要股指在情绪化宣泄之后有企稳迹象,展现一定的韧性,但剧烈的走势本身,印证了当前AI科技板块的高波动特征。与此同时,宏观环境同样...
19:02
在某电商平台上,搭载豆包手机助手的第二代努比亚 NaviX Ultra 目前预约量已达38.7万台。考虑到努比亚并非智能手机出货量前五的品牌,这一数据确实令人瞩目。得益于第一代产品的铺垫,市场对第二代产品的关注度自然更高。 早在2023年下半年,华为、小米、vivo、荣耀等厂商便宣称推出端侧大模型,2024年“AI手机”概念迅速升温,OPPO甚至在内部分析中...
18:58
据巴勒斯坦方面9月16日消息,加沙地带加沙城一座在战火中受损严重的居民楼于当天发生倒塌。此次事故已造成至少20人死亡、25人受伤,另有约100人下落不明。 当地消息人士称,倒塌建筑位于加沙城西南部,事发时间为16日凌晨2时15分许。尽管该建筑已被判定为危楼,但仍有6户家庭居住其中,且周边还设有数个难民帐篷。事故发生时,大多数居民正在熟睡,导致现场情况十分危急...
18:58
鼓狮财经9月16日讯,俄罗斯总统新闻秘书佩斯科夫今日回应了日本使馆关于恢复本国公民前往南千岛群岛(日方称“北方四岛”)探亲及安葬亲属免签制度的请求。佩斯科夫指出,日本对俄奉行极不友好的立场,并参与了所有针对俄罗斯的制裁,已被俄方列为不友好国家。因此,在当前形势下,指望在免签等问题上相互放宽是不现实的。此外,佩斯科夫强调,缩减双边关系并非俄方意愿。(来源:CC...
18:58
鼓狮财经9月16日讯,据美国方面15日披露的消息,美国前国务卿布林肯在接受采访时指出,美国在中东的盟友对美国保障其安全的能力已感到失望。布林肯分析认为,伊朗持续袭击美国在中东的军事基地,向盟友传递了一个警示信号:一旦自身面临危机,未必能指望美国的援助。受此影响,该地区国家目前都在积极寻求与伊朗展开对话。
18:22
鼓狮财经9月16日讯,国晟科技(603778.SH)发布公告称,公司及其子公司在连续12个月内累计新增诉讼及仲裁金额为5226.65万元,占公司最近一期经审计净资产的16.81%。 具体来看,其中有一起涉案金额为1030万元的民间借贷纠纷,另一起涉案金额为2800万元的服务合同纠纷,这两起均为单笔600万元以上的案件。目前,部分案件尚处于未开庭状态,因此这些...
18:22
鼓狮财经9月16日电,德尔未来(002631.SZ)发布股票交易异常波动公告。公告指出,公司股价于9月15日及16日连续两个交易日收盘涨幅偏离值累计超过20%,属于股票交易异常波动。 针对市场关注,公司就石墨烯相关业务情况进行了澄清。目前,该业务主要涵盖石墨烯制备设备、应用产品销售及检测服务。根据公司《2026年半年度报告》,2026年上半年,公司石墨烯检测...
18:22
据鼓狮财经9月16日报道,艾德生物发布公告,宣布公司多位高管将增持公司股份。具体增持计划如下:董事兼总经理罗捷敏拟增持金额在500万元至1000万元之间;董事、高级副总经理阮力拟增持300万元至600万元;财务总监兼董事会秘书陈英拟增持400万元至800万元;副总经理郑惠彬和王弘宇则分别计划增持300万元至600万元。