智象未来 vivago R1 全球上线,国内版本「够搭」全新升级发布
2026年9月8日,智象未来(HiDream.ai)旗下内容创作智能体 vivago R1 全球上线,国内版本「够搭」全新升级发布。
一周之后的 9月15日,智象再度亮出模型佳绩:正式发布原生全模态音视频生成模型 HiDream-O1-Video-1.0。该模型在全球权威的两大模型榜单名列前茅,在 Artificial Analysis 图生视频模型排名前四,Arena.ai 图生视频竞技场排名第 8,跻身全球视频生成模型第一梯队。从智能体产品到底层视频生成模型,智象“基础模型 + 智能体”双轮驱动的技术战略,正在同时提速。

vivago R1 的核心突破,在于实现了从一句成片时代的“生成片段”到“完全交付作品”的范式跃迁。它依托智象“基础模型 + 智能体”双轮驱动技术战略,让创作者以自然语言对话的方式,即可完成从创意表达到高质量成片交付的完整创作流程。
R1 的上线,标志着 AI 视频创作进入“单反级交付时代”。每一位普通创作者,都能独立完成专业团队级的品质大片。
1.从 Sora 的 15 秒,到 R1 的五分钟
Sora 用 15 秒视频惊艳世界,成为 AI 视频生成的重要转折点。但时至今日,15-30 秒的片段式生成依然是行业主流。R1 的突破在于,能够一次性稳定输出 5 分钟高质量视频,并支持无限次多轮延长。
长视频的难点,不只是把时长拉长,而是让故事在多镜头、多角色、多场景之间持续成立。R1 通过 Agent 系统对长任务进行规划与调度:主 Agent 拆解创意,子 Agent 协同完成脚本、分镜、角色、场景与音效,确保角色形象、场景风格和叙事节奏在多段落中保持一致。
同时,依托智象自研 HD-AgentOS 的全流程调度与治理能力,R1 内容有效可用成功率提升至 85%,显著降低“抽卡”概率,让视频创作更具确定性。R1 还优化了跨镜头角色一致性和场景过渡自然度,弱化 AI 视频常见的“塑料感”和“瞬移感”,实现更自然的运镜衔接与音画对齐,让长视频更接近实拍质感。
在近日的媒体沟通会上,智象未来 vivago 产品负责人弓子健表示,无限时长的本质,“不是‘能生成一小时就很牛’,而是在更长的时长里保持叙事合理、人物一致、剧情连贯——不能第一秒小孩穿蓝衣服,结尾变成红衣服”。他将其概括为“长长稳”:第一是无限时长,第二是长思考,第三是稳定生成。长思考负责在开头建立完整的世界观和故事框架;“记得住”则依靠上下文工程,上下文里该记住的都要沉淀下来,不能这会儿记得角色穿红衣服,后面忘了就开始自由发挥。
从行业阶段看,弓子健将 AI 视频划分为 L1 到 L5:先解决“能用”,再解决“好看”;从 L3 开始,创作者真正开始叙事,需要写大量提示词描述角色与场景的互动,Agent 正是在这个阶段应运而生。“今天大家已经不再讨论‘AI 味’——不是接受了 AI 内容,而是能力已经成为默认。用户开始要求故事的合理性、内容的叙事性和表达的深度。就像看长篇内容:短内容拼视觉冲击和爆点,长内容必须消费内容本身——光看打来打去,看一分钟是不成立的。”
“这是一个渐进的概念,不是单维的:只有时长没有思考,长就没有意义;有了思考,十分钟里有两分钟是错的,整条片子也毁了。”弓子健认为,画面好看已经是基本功,故事合理、叙事真实才是分水岭,“这也是我们强调影视、广告、电商这些落地场景的原因,它们的痛点本质上都是这一个。”
长视频的地基,是单镜头的质量上限。本周发布的 HiDream-O1-Video-1.0 补上了这块拼图:原生支持 5-20 秒任意时长单镜头生成,输出 1080p 高清画面,模型会根据输入内容自主确定合适时长——让“讲多久”服务于“讲什么”,而非反过来迁就模型的固定模板。5 秒的镜头可以是一句干净利落的动作 punchline,20 秒的镜头则足以容纳完整的起承转合与情绪铺垫。R1 一次输出 5 分钟的成片,正是由这类高质量单镜头经 Agent 规划调度组合而成——先有“一段一段都成立”,才有“一整部都成立”。
2.Chat-First(对话优先):让创作回到表达本身
好的创作工具,应当顺应人的表达本能。对于视频创作而言,起点不应是节点、画布和参数,而应是创作者想要表达的内容。
R1 因此选择 Chat-First(对话优先)路线。因为对话是人类最自然的表达方式,也是 AI 最友好的创作入口。
当前 AI 视频工具大致有两条路线:一类是画布式、节点式工作流,将模型、工具和参数交给用户自行连接和调试,自由度高,但门槛也高;另一类是 R1 的对话式路线,用户只需用自然语言描述需求,R1 即可自动生成视频,并支持在对话中持续调整和迭代。

这种体验背后,是“做后”与“做厚”两条原则。“做后”,是把专业创作者的判断、审美和经验编码进 Agent 编排能力,形成强大的中后台;“做厚”,是构建 SkillHub,将抽象 AI 能力转译为产品广告、角色视频、故事短片、品牌内容等真实创作场景,让用户更容易理解能做什么、如何开始。
在完整流程中,用户只需表达目标,Agent 负责拆解和执行,SkillHub 则作为翻译层,自动匹配并编排所需 Skill 组合,将用户意图转化为可执行任务序列。
谈及路线取舍与行业竞争,弓子健表示:“大厂的优势非常明显,就是在成熟市场里挤压成本。但 AI 视频现在还没有稳定的场景可以挤压,大家都在开辟新场景——这恰恰适合创业公司。新瓶一定要装新酒:市面上很多产品,要么是旧需求套上 AI,要么是新需求套传统产品形态;我们要做的是新需求加新产品形态。如果只求四平八稳,我们肯定干不过大厂;要做出让用户觉得爽的产品,才有机会。Chat-First 就是这个取舍的结果——它不是共识,是选择。”
3.原生全模态基础架构,让 AI 创作走向项目制
视频生成的另一大挑战,是一致性:同一个角色、同一种声音,如何在数十个镜头、多次生成转换中始终如一。弓子健解释道,一致性落到工程上就是上下文工程的关键经验:上下文压缩一定会丢信息,关键是站在多模态的视角,知道哪些不能丢、哪些可以丢。
被问及画面中小号文字难以稳定生成的“疑难杂症”,弓子健解释,小字代表的是模型对细节的理解能力和生成的可控性,这份能力一直延伸到 Agent 层面的整体水平。“就像当年视频生成阶段的‘吃面’测试——一个案例背后考验的是全方面能力。小字能稳定生成,说明模型和 Agent 的整体能力上了一个台阶,而不是专门去修一个‘小字功能’。”
智象未来的解法,是以基础模型与智能体系统双轮驱动,共同支撑复杂视频创作。
一方面,智象自研的原生全模态世界模型技术理念,为 R1 提供多模态理解与生成基础能力。它能将文本、图片、视频、参考资产、文档说明和历史创作结果纳入同一任务语境,让 Agent 理解“任务全貌”,而非单点指令。
这一理念在本周落到了具体的模型上。9 月 15 日发布的 HiDream-O1-Video-1.0,被定位为“更懂真实世界的视频生成模型”,它的三项核心设计,与 R1 的产品哲学一一呼应:
先理解,再生成。模型前置多模态意图理解模块,同时接收用户的文本与图片输入,把口语化、碎片化、图文互补的创作意图“翻译”为专业分镜语言——覆盖镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、台词节奏与语气、光色影调、景别构图、运镜焦段,乃至背景声与音效设计。一张参考图加一句模糊愿望,模型先听懂,再开画。
联合降噪,而非流水线拼接。HiDream-O1-Video-1.0 对文本、视频与音频三种信号进行联合降噪:三者不再是“先出画面、后配音”的两段式流程,而是在同一生成过程中相互约束、相互对齐——画面运动牵引声音节奏,台词与音效反哺镜头情绪,文本条件贯穿始终。
用后训练对齐人类偏好。后训练阶段采用 Diffusion Reinforcement Learning,并设计与人工认知对齐的多模态 Reward 模型,对音频与视频内容同步打分。支撑这条路径的,是智象系统落地的三篇顶会工作:DMSampler(ICML 2026)以蒸馏模型为高效采样器,显著降低 Diffusion RL 的训练成本;DiffusionCompass(ECCV 2026)引入 off-policy 高质量样本锚定,抑制 reward 过拟合与模式坍塌;EvoID(CVPR 2026)则以强化学习驱动身份保持的视频生成自我演化。
在物理规律这类“硬指标”上,在与等主流视频生成模型的同题对比中,HiDream-O1-Video-1.0 在意图还原完整度、中长时叙事稳定性、人物身份保持与原生音频协同上展现出清晰优势——这也是其登上 Arena.ai 与 Artificial Analysis 两大竞技场榜单前列的技术底座。
“HiDream-O1-Video-1.0从架构之初便面向文本、视频与音频的统一表征。”智象未来 CTO 姚霆表示,“它不只是‘把画面做出来’,更是把用户意图翻译成可执行的专业分镜,并同步生成可信的声音。这是原生全模态技术从‘看得清、动得顺’,迈向‘听得懂、说得准、演得连贯’的关键一步。”

从更宏观的视角看,HiDream-O1-Video-1.0 是智象原生全模态世界模型矩阵的又一块拼图。在此之前,智象已先后发布图像模型 HiDream-O1-Image、交互式世界模型 HiDream-O1-World 与具身模型 HiDream-O1-Embodied,四者共享 UiT(Unified Transformer)统一底座,统一建模文本、图像、视频、3D 与具身数据,分别承担世界模型闭环中的空间理解、时间叙事、三维交互与具身反馈。正如智象未来创始人兼 CEO 梅涛博士所言,下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态、并走向原生统一的全模态。视频模型补位之后,这套矩阵不仅能进入世界、作用于世界,也能把世界讲清楚、演完整。
另一方面,智能体系统负责将模型能力组织为可持续推进的创作流程,在脚本、分镜、角色、场景、镜头和音效之间进行规划与调度,确保复杂叙事中的角色形象、声音特征和风格前后一致。
“vivago R1 的 Agent 是从基础模型里长出来的。”弓子健强调,团队做过图像模型、视频模型、交互式世界模型,这些积累让团队知道 AI 如何构建世界、Agent 的方向在哪里,“做模型的人清楚模型的上限在哪里,也知道怎么通过 Agent 的设计把上限拉高、把短板补齐。”
智象未来团队更倾向把模型和 Agent 看作一体的东西——HD-AgentOS 的工程构建里考虑了大量与模型的配合,“长长稳”的整套思考也来自模型本身。“模型能力当然远没有失效。我们不相信竞争只是算力和芯片的堆叠——模型侧的 know how 同样关键。”
这种模型与 Agent 一体化发展的思路,让创作不再是一次次孤立生成,而是围绕同一项目持续推进。
在弓子健看来,AI 视频用户正在分化为两类:一类在学 AI,哪个模型能用就用哪个;另一类是 AI Native 用户——目标是把事情办成,中间办得不好就不断教它、让它改。“第二类用户的黏性完全不同。”他表示,R1 的壁垒有两层:第一层是体验,“一个产品一开始就足够简单、足够懂你,由俭入奢易,由奢入俭难”;第二层是数字资产和沉没成本——角色形象、过程资产、项目档案都沉淀在产品里,“换一个产品,就得把照片重新传一遍、把‘这几个人分别是谁’重新讲一遍”。
R1 则在统一上下文中理解、组织、执行并持续迭代,用户可以“说不清的直接给”,同时,R1 推出资产库功能,沉淀用户生成、筛选并认可的内容,并可在后续创作中复用。一次创作不再只是一次性输出,而会成为下一次创作的素材基础。
由此来看,基础模型决定能力上限,智能体系统负责把能力转化为稳定、可控、可复用的作品交付。
4.全球创作者用作品说话:R1 让表达成为生产力
在今天举办的 vivago R1「够搭」沉浸式工作坊活动上,来自全球不同领域的创作者们,采用线上和线下的方式,分享 R1 的使用心得,并展示他们制作的作品。

近期,AI 版《西游记》上线后引发热议。活动现场,一位创作者用 R1 尝试了这一经典题材的再创作,并生成近 5 分钟西游题材作品。从角色造型、场景氛围到东方奇幻质感,R1 对经典文本的视觉转译能力得到直观呈现。

在真人质感上,R1 同样表现出色。另一位创作者带来一支励志短片,讲述体育老师周岚从迟疑到重新出发的过程。画面中,奔跑时的肌肉震颤、汗水光泽,以及脚步压过塑胶跑道的颗粒质感都被细腻还原,让人物情绪更具真实感。

提示词 体育老师周岚在训练与接力比赛中面对自己的迟疑。来到第二道弯,她一度想停下,却继续迈步,坚持跑向终点。次日清晨,她主动再次接过接力棒。影片将人物转变放进呼吸、步伐与交接棒等具体动作,以持续奔跑呈现重新出发的过程。 |
提交提示词后,R1 会自动理解人物关系、情绪转折与动作节奏,生成对应角色、场景与关键画面。创作者无需复杂操作,只需通过对话补充想法,即可推进内容生成。

在商业广告片制作上,R1 也展现出较强适配能力。现场一位 AI 创作者分享了红色折叠手机广告案例。R1 根据提示词理解产品、人物与场景关系,生成手机多视图、女设计师造型、工作室与户外生活场景,以及包袋、色卡、草图等视觉资产,呈现从创作、出行到回归设计的日常灵感流动。

提示词 一位年轻女设计师在一天中穿梭工作室、城市街道、咖啡馆和海边,用红色折叠手机记录色彩、构图与生活中的灵感,再将所见带回工作台。影片围绕手机开合、拍照和查看素材的使用动作,串联从创作到出行、再回到设计的日常。 |
现场之外,多位海外创作者也通过线上连线分享创作体验。一位创作者表示:“视频创作的终点,就是一次表达。”这也道出了许多体验 R1 用户的共同感受:当复杂流程被隐藏在对话之后,创作者可以更专注于表达本身。
弓子健介绍,R1 的核心用户是海外的内容创作者——YouTuber、TikTok 博主,以及一批把创作本身当目标的自由创作者。
“两年前用户把 AI 订阅当玩具,今天越来越多创作者把它当生产资料,预期它能帮自己把钱赚回来,这是消费心态的根本变化。”而「够搭」与海外版同步上线,正是看到中国创作者的内容质量和商业化能力都在快速提升,“国内高端创作者对生产工具的付费决策,和海外用户的决策链路是接近的,而且很多国内创作者的内容本身就发布在海外社媒”。
在目标市场的选择上,弓子健表示,YouTube、TikTok 等社媒本身已经是足够广的场景,R1 会以内容传播为核心,电视、大屏暂时不是专注方向。
弓子健判断,内容领域未来变化更大的可能是分发——当 AI 让创作足够简单、内容质量和叙事性足够好,传统的中心化推荐逻辑将不足以分发这些内容,纯好友关系分发又太弱,去中心化分发会是方向之一。“这也是我们坚持叙事性和连续性的原因,它们本身就在构建内容与人的关系。”他强调。
5.开创视频 Agent 新标准:CHATS™
R1 的实践充分表明,当产品真正进入专业场景,行业需要的就不再是零散的能力清单,而是一套可衡量、可依赖的交付标准。“做 Agent 是评估优先——先构建 benchmark,再围绕它做决策。”弓子健表示。
智象提炼出一套面向视频 Agent 的评估框架——CHATS™,用于衡量一个视频 Agent 是否具备真正的作品交付能力:
C(Consistency)一致性:角色、场景、风格在多镜头中保持稳定;
H(Human Intent)意图理解:准确理解用户创意,并能在多轮对话中持续推进;
A(Audio & Visual)视听完整度:不仅生成画面,也能组织声音、节奏与整体视听体验;
T(Timeline & Tale)时间线与叙事:让故事在多个镜头、多个段落中持续成立;
S(Stability)稳定交付:降低反复生成和返工成本,提高内容可用率。
这五个维度,不是实验室里的理想指标,而是 R1 在真实创作内测场景中被众多内测用户反复验证过的能力边界。智象希望通过构建一个用户视角的标准,推动 AI Agent 产品的更好发展。未来产品迭代中哪些场景保留、哪些舍弃,都将靠 CHATS™ 的数据说话。

2024 年 5 月,vivago.ai 上线,成为全球最早一批公开可用的 AI 视频生成产品;今年 5 月,vivago.ai 登顶 Product Hunt 日榜第一;今天,vivago.ai 全球用户突破 7000 万。两年时间,智象从“第一个可用”走到第一个“单反级交付”。
伴随 HiDream-O1-Video-1.0视频模型的发布,智象同步完成 C+ 轮融资,投资方包括新微资本、交子资本、工银资本——国资及产业资本正加速向原生全模态世界模型赛道聚拢。
关于效果与成本的平衡问题,弓子健表示,现阶段要先把能力做到天花板,再通过架构和工程优化让更多用户用得起。“未来更轻的版本不会牺牲效果,牺牲的是用户实际用不到的场景覆盖:复杂度降下来,成本自然就降下来。”
这就是 vivago R1 中“R”所承载的意义:一面是 Reasoning,用深度推理把灵感变成作品;一面是 Rock,致敬“The Show Must Go On”的创作精神——
无论如何,创作终将继续。