2026年9月8日,智象未来旗下内容创作智能体vivago R1正式面向全球上线,国内版本「够搭」同步完成全新升级。早在今年7月的WAIC 2026上,R1便以全球首个无限时长内容创作智能体的身份惊艳亮相。如今,R1正式向全球用户敞开大门。其核心突破在于实现了从“生成片段”到“完全交付作品”的范式跃迁。依托智象“基础模型+智能体”的双轮驱动战略,创作者仅需通过自然语言对话,即可完成从创意表达到高质量成片交付的全流程。R1的上线,标志着AI视频创作迈入“单反级交付时代”,让每一位普通创作者都能独立产出专业团队级别的品质大片。
**一、从Sora的15秒到R1的五分钟**
Sora曾以15秒视频震撼世界,成为AI视频生成的重要转折点。然而,15至30秒的片段式生成至今仍是行业主流。R1的突破在于,能够一次性稳定输出长达5分钟的高质量视频,并支持无限次多轮延长。长视频创作的难点不仅在于拉长时长,更在于确保故事在多镜头、多角色、多场景间的连贯性。R1通过Agent系统对长任务进行规划与调度:主Agent负责拆解创意,子Agent协同完成脚本、分镜、角色、场景与音效,确保多段落中角色形象、场景风格和叙事节奏保持一致。依托智象自研的HD-AgentOS全流程调度与治理能力,R1的内容有效可用成功率提升至85%,显著降低了“抽卡”概率。此外,R1优化了跨镜头角色一致性和场景过渡的自然度,弱化了AI视频常见的“塑料感”和“瞬移感”,实现了更自然的运镜衔接与音画对齐,使长视频更接近实拍质感。
**二、Chat-First(对话优先):让创作回归表达本质**
好的创作工具应顺应人的表达本能。对于视频创作而言,起点不应是画布、节点或参数,而应是创作者想要表达的内容。因此,R1选择了“对话优先”路线。对话是人类最自然的表达方式,也是AI最友好的创作入口。当前AI视频工具主要分为两类:一类是画布式、节点式工作流,自由度高但门槛高;另一类则是R1的对话式路线,用户只需用自然语言描述需求,R1即可自动生成并支持在对话中持续调整。这种体验背后遵循“做后”与“做厚”两大原则。“做后”是指将专业创作者的判断、审美和经验编码进Agent编排能力;“做厚”则是构建SkillHub,将抽象的AI能力转译为广告、角色视频、故事短片等具体场景,让用户更容易理解如何开始。在完整流程中,用户只需表达目标,Agent负责拆解执行,SkillHub作为翻译层自动匹配并编排所需Skill组合,将用户意图转化为可执行任务序列。R1的对话式创作并非消灭复杂,而是将复杂隐藏在简单背后,让创作从“灵感闪现”到“进入执行”缩短至只需一句话。
**三、原生全模态基础架构,推动AI创作走向项目制**
视频生成的另一大挑战在于一致性:同一个角色、同一种声音,如何在数十个镜头、多次生成中始终如一。智象未来的解法是“基础模型与智能体系统双轮驱动”。一方面,智象自研的原生全模态世界模型技术,为R1提供多模态理解与生成基础能力。它能将文本、图片、视频、参考资产、文档及历史创作结果纳入同一语境,让Agent理解“任务全貌”。另一方面,智能体系统负责将模型能力组织为可持续的创作流程,在脚本、分镜、角色、场景、镜头和音效间进行规划调度,确保复杂叙事中的角色、声音和风格前后一致。这使得创作不再是孤立的一次性生成,而是围绕同一项目的持续推进。用户可以“说不清的直接给”,R1则在统一上下文中理解、组织并迭代。同时,R1推出资产库功能,沉淀用户认可的内容以供复用,让一次创作成为下一次创作的素材基础。基础模型决定能力上限,智能体系统则负责将能力转化为稳定、可控、可复用的作品交付。
**四、全球创作者用作品说话:R1让表达成为生产力**
在当天举办的vivago R1「够搭」沉浸式工作坊上,来自全球不同领域的创作者通过线上线下方式分享了使用心得及作品。近期引发热议的AI版《西游记》便是一例,一位创作者利用R1生成了近5分钟的同题材作品,从角色造型、场景氛围到东方奇幻质感,展现了R1对经典文本的视觉转译能力。在真人质感还原上,R1同样表现出色。一位创作者分享了体育老师周岚的励志短片,影片细腻还原了奔跑时肌肉的震颤、汗水的光泽以及脚步压过塑胶跑道的颗粒质感,生动呈现了人物从迟疑到重新出发的过程。另一位AI创作者则展示了红色折叠手机广告案例,R1根据提示词理解产品、人物与场景关系,生成了多视图、女设计师造型、工作室及户外生活场景等视觉资产,串联起从创作、出行到回归设计的日常灵感流动。多位海外创作者也通过连线表示:“视频创作的终点,就是一次表达。”这印证了许多R1用户的感受:当复杂流程被隐藏在对话之后,创作者得以专注于表达本身。
**五、开创视频Agent新标准:CHATS™**
R1的实践表明,当产品进入专业场景,行业需要的不再是零散的能力清单,而是一套可衡量、可依赖的交付标准。智象提炼出面向视频Agent的评估框架——CHATS™,用于衡量其是否具备真正的作品交付能力:
* **C(Consistency)一致性**:角色、场景、风格在多镜头中保持稳定。
* **H(Human Intent)意图理解**:准确理解用户创意,并在多轮对话中持续推进。
* **A(Audio & Visual)视听完整度**:不仅生成画面,还能组织声音、节奏与整体视听体验。
* **T(Timeline & Tale)时间线与叙事**:让故事在多个镜头、多个段落中持续成立。
* **S(Stability)稳定交付**:降低反复生成和返工成本,提高内容可用率。
这五个维度并非实验室的理想指标,而是R1在真实创作内测场景中经反复验证的能力边界。智象希望通过构建用户视角的标准,推动AI Agent产品的更好发展。2024年5月,vivago.ai上线,成为全球首批公开可用的AI视频生成产品;今年5月,vivago.ai登顶Product Hunt日榜第一;今天,全球用户突破7000万。两年时间,智象从“第一个可用”走到“第一个单反级交付”。这就是vivago R1中“R”的含义:一面是Reasoning,用深度推理将灵感转化为作品;另一面是Rock,致敬“The Show Must Go On”的创作精神——无论如何,创作终将继续。在AI视频时代,vivago R1希望让创作从一次生成变成持续对话:The CHATS must go on。只要对话继续,故事就不会停下。
