能力上来了,开始拼流程。
AIX财经(AIXcaijing)原创
作者 | 雷晶
编辑 | 金玙璠
8月20日,MiniMax发布多模态创作Agent工作台MiniMax Design。
它并不是一款单纯的视频生成器。用户给出一个创作需求后,主Agent会先理解目标、拆解任务,再调用文本、图片、视频、音频等能力完成不同环节。用户也可以进入Canvas画布、Skill、3D导演台和ComfyUI工作流,对中间过程继续调整。
MiniMax Design的前身是今年6月底亮相的MiniMax Hub,此后更名并接入H3。到了这次正式发布,MiniMax更明确地把它放到了“商业内容生产”的位置上。
为什么现在越来越多公司开始做视频生成Agent?原因在于单靠生成一段视频,已经无法满足真实创作需求。
文生视频、图生视频、人物一致性、镜头控制和视频编辑能力不断提升,模型已经能够生成越来越接近成片的视频内容。但进入商业场景,品牌宣传、电商素材、短剧等任务,往往还需要完成脚本策划、分镜设计、素材整理等环节。真正影响效率的,是这些环节能否被组织成一套连续流程。
所以,Runway、Pika等AI视频平台都在补充编辑、控制能力。MiniMax Design也是如此,依托MiniMax H3的视频生成能力,它尝试把模型、工具和视频创作流程放到同一个环境中。
我们也体验了一下MiniMax Design,重点看两个问题:它到底能替创作者接走多少重复工作,以及当Agent负责规划之后,底层视频生成能力能不能跟得上。
我们先从最接近商业场景的品牌宣传视频开始,让它做一个以陪伴为主题的家庭服务机器人品牌宣传片。
这个任务需要它理解需求后进行创意策划、角色设计、分镜规划,最终生成视频。
MiniMax Design规划页面
接到需求后,MiniMax Design先生成创意简报和故事方向。确认方向后,再进一步做视觉调研,然后交出完整的分镜脚本。整个流程比较接近传统视频制作中的前期策划阶段,它没有马上开始生成,而是先确定主题、人物关系和视觉方向,再把故事拆成具体镜头。
单看分镜脚本,它对需求的理解比较准确。围绕“陪伴”这个主题,它设计了家庭场景,也能够规划人物关系、镜头变化和情绪推进。
但最终成片到了后半部分,场景和人物都发生了变化,和前面的叙事没有完全接上。脚本里已经规划好的角色关系和剧情连续性,到了实际生成环节没有完全保持下来。
在这一轮任务
里,MiniMax Design已经具备相当完整的视频策划能力,但从分镜到成片之间存在明显的执行落差。对于需要连续叙事的商业视频来说,如何稳定还原前期创意,仍是影响交付质量的关键。
第二轮我们专门测试更难控制的动作场景。
过去做这类镜头,常见的方法是不断改提示词、重新生成,再从多个结果里挑一个接近预期的版本,也就是创作者常说的“抽卡”。当人物需要在固定空间中移动,或者镜头需要完成连续运镜时,单靠文字描述很容易出现问题。比如,角色位置飘忽、动作方向不一致、前后镜头接不上。对于动作戏、电影片段这类内容来说,画面好看只是及格线,人物关系和镜头语言更加重要。
MiniMax Design给出的工具是3D导演台。它提供了另一种方式,先搭建三维场景,在空间里可以直接调整角色位置、动作和镜头运动,把确定好的运镜方案作为参考,再生成最终视频。相当于先彩排,再开机。
我们也用一个动作场景的生成测试它的实际效果。原本我们想直接用蜘蛛侠做测试,但涉及IP形象无法通过审核,于是改成一个类似设定的原创角色,让一个拥有蛛丝移动能力的角色,在城市建筑之间穿梭。
在实测中,MiniMax Design先生成了一个3D运镜视频,让我们根据预览效果继续调整镜头距离、移动方向以及角色运动轨迹,直到确认整体镜头语言,再进入最终视频生成环节。
从结果来看,加入3D导演台后,这个复杂动作场景的可控性有所提高。角色在建筑之间穿梭时,镜头方向和运动轨迹都更明确,最终成片和预想效果基本对得上。
对于动作片、影视预告、游戏CG等需要复杂空间调度的内容,3D导演台提供了一种更接近专业制作流程的方式,让用户能够提前规划镜头,再交给模型完成生成,减少复杂场景制作中的试错成本。
在连续制作视频时,还有一个更大的难题是,怎么复用此前的视觉风格和设定,产出同类的视频,而不是同类型内容往往要重复走一遍相似的制作步骤。
如果每条视频都从头输入提示词,重新描述人物、场景和画面风格,效率低,且生成的结果还容易“跑偏”。针对这类需求,MiniMax Design做了Skill功能,把一整套视频制作流程封装成可调用的模板,让已经跑通的创作方式可以直接复用。
我们上传了一张小猫照片,调用3D动画Skill,让它制作一支《猫咪历险记》主题短片。
MiniMax Design规划页面
调用之后,MiniMax Design会按照预设流程一步步走:先把照片里的猫转化成3D动画角色,再做场景规划,最后进入视频制作。每个关键节点都会停下来让我们确认方向。
需要说明的是,我们没有改动它生成的故事大纲和分镜脚本,相当于全程用了默认配置。最后的剧情相对简单,更像一支基础的动画短片,谈不上特别出彩。但调用Skill之后,整套制作流程基本可以按照预设步骤直接推进,不需要再从头组织任务。
Skill的价值在于,把包含角色设定、视觉风格和制作流程的一套创作方法封装起来,方便后续复用。对于动画短片、科普视频、品牌内容等需要持续生产的场景,Skill可以帮助团队减少重复设置,提高批量生产效率。至于最终角色和视觉风格能否保持一致,仍然取决于模型和具体生成效果。
前面测的是MiniMax Design自己能不能干活,接下来我们选了另一款视频生成Agent产品LibTV,同样调用了MiniMax H3模型,并设计了两个更接近真实创作场景的任务,让它们同题竞技,目的是比较两套Agent和工作流。
第一题是15秒的黏土定格动画风格MV。
我们要求三只小动物组成乐队,包括橘猫主唱、柴犬吉他手和兔子鼓手,保持角色全程一致,同时完成舞台展开、乐队演出、场景切换、镜头拉远和片尾收束等完整流程。
先看创作过程,两款产品都会在接到需求后,自动规划视觉效果和分镜脚本。它们具体有两个不同点,一是“自动化”程度,MiniMax Design“不懂就问”,视觉效果、风格和分镜脚本、镜头都会经确认后再行动,LibTV更“自动”,需要用户确认和干预的节点更少,整个生成过程更自动,代价是用户对中间环节的把控空间也更小;二是规划的深度,MiniMax Design分镜脚本更加丰富,LibTV的则相对简单。
再来看最终成品。MiniMax Design生成的橘猫、柴犬和兔子在多个镜头中保持了较好的稳定性,角色形象没有明显变化。它的场景设计得更丰富,除了纯演出的镜头外,还设计了一些特写镜头和更动态的动作展示,结尾最后定格成手作贺卡,整个视频更加完整。
LibTV的成品设计比较单一,基本是乐队演出的固定视角平推,场景元素也比较少,更像是演出视频的拼接,而不是MV。视频也没有保持角色的一致性,小狗的形象在不同场景里不一致。我们要求的手作贺卡结尾,成品没有完整呈现出来,视频的情节不够完整。
第二题是续写电影《欢迎来龙餐馆》的结局。我们给出原片的剧情设定,要求生成一个师徒重逢、团圆收尾的结尾,弥补原片的遗憾。
相比从零创作,这个任务更考验AI视频Agent对于已有故事的理解能力。它不仅需要延续人物关系和情绪走向,还要保持原有角色设定,并完成一个符合剧情逻辑的结尾。
从结果来看,两款产品整体差异不大。MiniMax Design生成速度偏慢,但分镜更完整。它还加入了人物对白,从重逢到团圆的整个情节更完整。相对LibTV而言,它给的成品角色质感更像真人,没有AI生成人像常有的蜡像感。
LibTV则更偏向用背景音乐强化情绪,但没有对白,人物关系主要靠画面传达,因此能够承载的叙事信息相对有限。部分人物镜头的生成痕迹也更加明显,不够自然。
两轮比下来,MiniMax Design生成更慢,但在这两道题里,分镜完整度、角色一致性和中间环节的可控性表现更好;LibTV的优势则是确认环节更少,生成推进得更快,单个镜头的视觉完成度也不弱。
这样看来,同一个视频模型,放进不同的Agent和工作流中,最终呈现出的创作结果也会不同。MiniMax Design更偏向规划型,通过需求拆解、分镜设计和过程确认,提高复杂任务中的可控性;LibTV则更强调效率和快速产出,更适合作为灵感生成和视频素材工具。
它们体现的是视频Agent的两种产品取舍:一个希望通过更细的规划和人工确认,把用户的想法更稳定地落到成片;另一个则减少中间环节,让用户更快拿到结果。
05.结语
随着模型能力的提升,创作者更关心怎么把一个想法稳定、高效地变成成片。模型更多解决其中具体的生成任务,而Agent试图把这些分散的环节连接起来。尤其对于广告、电商、短剧等需要持续生产大量内容的场景,Agent带来的效率提升也更为突出。
从这个角度看,MiniMax Design的价值在于,MiniMax开始补上从模型到应用之间的一环。
相比只完成一次生成任务,工作台希望承载的是更完整的生产流程,脚本、素材、Skill和修改记录都可以沉淀在同一个项目里。理论上,这有机会提高用户的使用黏性和迁移成本,但最终能否转化成更高的留存和付费,还需要后续数据验证。
据高盛预计,全球AI视频生成市场将从2025年约30亿美元增至2030年约290亿美元。随着市场扩大,AI视频领域的竞争也会进一步加剧。一方面,厂商仍需要比拼底层模型能力,包括视频质量、生成速度和稳定性;另一方面,也需要竞争产品能力,比拼谁能更低门槛地串起视频创作流程。
目前,MiniMax主要面临两类竞争。一类是拥有视频模型能力的平台型厂商,例如快手、字节等,它们依靠模型和流量优势持续完善视频生成体验,可灵、即梦都在快速迭代,MiniMax仍需要继续提升模型的稳定性;另一类是聚焦应用层的视频Agent产品,例如LibTV、Flova等,以及动画创作Agent平台OiiOii、字节被曝内测的漫剧创作工具等垂直应用,MiniMax需要证明,除了模型本身,这套工作流能够形成足够的产品差异,让用户愿意持续留在这里完成创作。
*题图由AI生成。