生数科技近日正式发布 Vidu S2 模型,并实现了当天的全量开放在线体验。本次发布包含两款核心模型:一是专注于持续交互数字角色生成的 S2-Avatar,二是针对输入视频流进行实时编辑的 S2-Editing。其中,S2-Avatar 将实时输出分辨率提升至 720P,并支持用户在互动过程中随时上传参考图,使角色能够持续响应新的指令与视觉信息;S2-Editing 则能对持续输入的视频流进行实时风格、服装、人物及背景的修改。
除了实时互动与编辑,Vidu S2 还将技术探索延伸至了“空间视频”领域。与此同时,“实时空间视频”正成为视频模型行业的新热点。9 月 7 日,彭博社援引知情人士消息透露,字节跳动正在研发一款基于 Seedance 的实时空间视频生成模型,该模型由张一鸣亲自督导,计划应用于直播、短剧、游戏及 Pico 等 VR 场景,旨在探索交互式虚拟世界。目前,该模型的发布时间尚未最终敲定。
Vidu S2 在此方向上也展示了领先的技术探索:它能将实时生成或编辑的视频转换为左右眼视频格式,供 VR 头显观看。例如,基于 S2-Avatar 生成的角色,不仅可与你持续对话互动,还能以空间视频形式呈现在头显中;而利用 S2-Editing,现实世界的实时视频流也能被即时修改,随后转换为空间视频进行沉浸式观看。这标志着视频模型正从“生成静态片段”向“操控持续视频流乃至沉浸式空间体验”演进。从实时生成到实时编辑,再到空间视频,这无疑是 Vidu S2 相较上一代产品在能力边界上的显著拓展。
Vidu S2 的全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛主导。与部分实时交互模型初期采用限量预览或申请制不同,Vidu S2 选择了发布即全量开放的策略。用户可直接通过官方链接体验模型,亲身感受其对新指令、新参考图以及持续视频输入的实时响应能力。
根据生数科技公布的技术报告显示,S2-Avatar 在实时数字角色生成基准 StreamAV-Bench 的九项指标中均取得了最优成绩;S2-Editing 在多项视频编辑基准测试中,也超越了报告中对比的离线与流式模型。用户可立即体验:https://vidu.com/vidu-stream;API 平台:http://platform.vidu.com/vidu-stream/doc;技术报告:https://arxiv.org/pdf/2609.11638
