那个拍出神作《牌子》的AI导演,带着他的巅峰之作回来了。这个正在威尼斯排队准备走红毯,同时斩获了两项AI影像大奖的小伙。
可能很多人都听过他的名字。
DiDi_OK。
前几天,DiDi_OK发了他用Seedance 2.5做的最新作品《Candy》,中文名叫《糖果》,我在看到之后,惊为天人。
直接转发,推荐所有人逐帧学习。
虽然在AI影视圈,DiDi_OK这个名字几乎已经家喻户晓了。
但是可能还是有很多朋友不知道这个名字,但没关系,你大概率也看过他之前的作品。
比如《箭头》、《网站》、《垃圾站》等等等等,而数据最好的,则是在今年2月,那个刷屏的《牌子》。
这个片子,光在B站上,就有2000万的播放,全网更是接近亿级。
我到现在还记得,我第一次看到牌子的那个晚上,在循环了6、7遍之后,我脑子里产生的那个念头:
“明明都是人类,为什么在DiDi_OK面前,我就宛如一个只会流口水的废物,这个人的脑子和审美,到底是怎么长的。”
不夸张的说,这是真实的感慨,DiDi_OK自那之后,也成为了我心中,没有争议的AI影像第一人。
而这次的《糖果》,更是DiDi_OK在这个主持人平行宇宙系列中,把技术和创意,拉到最高潮的巅峰之作。
如果没看过的,可以先看一遍,相信我,你一定会,惊为天人。
不像现在很多烂大街的油腻无比的AI作品,《糖果》依然有很强的Di味。
有一些高维规则的展开,有一些SCP的感觉,又有一些黑镜的意味。
甚至还有刘慈欣的影子。
当然,还有极强的叙事节奏、镜头语言还有他的审美。
所以这次《糖果》发布后,我觉得,是一个机会了。
我想找他聊聊,跟他做一个小小的专访,聊聊他的一切。
因为他人在国外,这几天又在威尼斯电影节领奖,所以我们还是有一些时差的,在碰了两天之后,我们终于约上了。
访谈那天,北京上午10点半。
他人在黑山,那边凌晨4点半,他起了个大早,因为6点多还要出发去山里。。。
我们痛快的聊了快2个小时,问了很多我想知道的问题,聊完之后,我觉得,我一定要把这些东西写出来,也给大家分享一下。
那接下来,我们,开始吧。
一. 他迎来了AI的时代
DiDi_OK,是一个非常有趣的人。
现在长期在伦敦,在WPP Production工作。
WPP是全球最大的广告与营销传播集团之一,大家耳熟能详的奥美,其实就是WPP的子公司...
而WPP Production是WPP旗下最核心的制作团队。
所以在AI出现以前,DiDi_OK就一直在做动画、3D和游戏相关的工作了。
他的本硕都是动画。
后来进入WPP,也先从动画做起。
他去英国的故事也特别有意思。
他那时候,还在国内跟朋友开工作室挣钱,反正就是拍些广告啥的。
他做着做着,然后就突然觉得,这事没意思。。。
有一天下午,他们甚至还在外面拍广告。
他突然问朋友:要不出国吧?
朋友问他:去哪?
他说:要不然英国吧?
去英国的原因也究极离谱,
因为他们以前拍完片,半夜会一起看影视飓风,Tim也是DiDi_OK的赛博偶像。
然后呢,Tim以前在英国。。。
那不如就英国吧= =
然后他真的回家学了半年英语,申请伦敦艺术大学。
他妈一开始甚至没帮他报,因为觉得这死孩子绝对考不上。
最后他自己还是偷偷报的,结果,还真考上了。。。
几年以后。
这个当年拍完广告半夜看影视飓风的小伙,受Tim邀请,坐到了影视飓风的AI课程里,给大家分享自己的创作心得。
你看,世界总是一个奇妙的圆,人生有时候也真的特别像一个写得有点俗的剧本。
在AI之前,他其实就已经开始在创作了。
2021年,他在伦敦艺术大学做过一部《Moth》。
而且那个时候,就很有Di味了。
一个被雾笼罩的封闭世界,中央有一座巨塔。
所有人都觉得那里绝不能碰,可主角却像飞蛾扑火一样,一定要上去。
哪怕真相让人失望,哪怕会死。
也想看一眼,世界真正的样子。
他脑子里,关于科技、关于未知世界、关于文明的东西,实在是太多了。
但是在过去,卡住他的,是那个时代的生产力。
传统动画的工作流程实在是太长了,几乎不可能有一个人独立制作一个影片的可能。
流程一多,人就多了一些,每多一个人,你脑子中的想法,变成语言传达出去,就会损耗一点。
而再经历建模、绑定、动画、后期等等等等的流程,那就是损耗损耗再损耗。
到最后,你脑海中的那个idea,那个会让自己兴奋会让自己起皮疙瘩的创意的东西,落在最终屏幕上的时候,可能连一半也不剩下了。
所以,他这些年,因为损耗,也一直在研究一个东西,用他的话说,那个东西叫:
力道。
怎么让自己脑海中的创意和感觉,尽可能最低损耗的传达给观众。
而终于,他等来了他的时代。
AI,来了。
二. 《糖果》:坏人会爆炸
如果让我介绍《糖果》。
我可能会认真解释半天:
这是一个关于一级文明、外星规则、暴力、秩序、人性和科技发展的科幻故事。
但是呢,我让DiDi_OK解释,他自己想了想,只用了十个字左右:
“坏人会爆炸,好人就没事。”
极其的朴素,但又精准。
这个故事一开始,人类能源使用能力抵达一级文明的门槛了。
然后土星的一颗卫星,叫“潘”。跑到了地球附近。
接着,全世界开始发生一件特别离谱的事。
只要一个人准备伤害别人。
砰,就炸了。
这个爆炸,不会变成血肉,会变成:
一大堆糖果。
一开始,大家都懵了。
外星人?新型武器?上帝?
后来慢慢发现,这个规则只专门针对:
暴力。
DiDi_OK给它设定的底层判断标准也非常的中国味。
就是四个字,起心动念。
这个片子上线之后,我看了4遍,我当时问了他一个我看的时候,感觉非常矛盾的一个话题,这好像,明明是一个反暴力的故事。
可大家看的最大的爽点,却是看坏人被另一个更强大的力量给干掉。
那这件事,本身就不暴力吗?
DiDi_OK当时就笑了,说你看到了精髓,而且,这其实就是他故意的。
片子后来把反复违反规则的人送去月球。
看起来仿佛太好了,文明和平了。
可这件事情背后,却一样带着群体暴力。
所以他甚至花了很长时间设计片子里代表大众意见的女性发言人。
他想让她拥有一种特别容易被大众接受、信任的气质。
有点像《三体》里的程心。
因为这件事情本身就带着一种“所有人都觉得这一定是对的。”的危险。
DiDi自己也没有站在绝对非暴力那一边。
他觉得现实里常有一个很残酷的问题:
善良的人,往往就是被欺负的人。
所以从中世纪的西方骑士到中国的侠客。
人类几千年一直在幻想一件事:
正义最好拥有力量。
于是这个时候,《糖果》的内核变得不一样了。
一颗外星卫星拥有判断什么是恶的最终解释权,全人类因为恐惧惩罚而文明,然后大家集体同意,把不符合规则的人送去月球。
这到底算文明?还是秩序?又或是暴政?还是一个比我们现在稍微好一点的世界?
DiDi_OK没有答案。
这个问题,属于每一个观众。
三. AI的真正进步
访谈之前,我把《箭头》《牌子》《网站》《垃圾站》等等DiDi_OK的片子又重新全部拉了一遍。
其实有一个最明显的变化,就是《糖果》这部片子,因为用的Seedance 2.5,所以终于敢变慢了。
比如这个教科书级别的长镜头。
讲道理,以前DiDi_OK的片子还是经常会快切的,比如《箭头》和《牌子》,经常5秒就会换一个场景。
理由特别简单,AI影像行业里的大家,可能都猜到这个现实原因。
因为你不敢慢,因为模型能力,完全达不到。
过去的模型能力,是无法支持长镜头的细节不变的这种镜头叙事的。
于是呢,就只能不停用新的视觉刺激,把模型来不及暴露的问题给掩盖过去。
但是《糖果》里,第一次出现了大量安静的叙事。
比如这个镜头。
实验室里,一个年龄稍大的官员往前走。
旁边年轻研究员一路跟着,态度非常谄媚,期待被注意。
但是官员一直很冷,直到突然搭理了他一句。
那个年轻人的身体立刻微微再弯了一点,眼神亮一下。
这时候,你能看出来:
“诶,他听到我说话了。”
但DiDi说,这才是他觉得模型真正突破的地方。
表演。
以前他一直觉得AI表演过不了,那些表演的细节度不够,所以,一直会少这些叙事。
现在Seedance 2.5在他眼里,这个鸿沟已经正式跨过去了。
开头那个女孩吃糖的镜头也是。
他特别在乎女孩脸上那个小痘痘。
我甚至第一次看的时候,都没有注意。
但是对DiDi_OK来说。
这是一个极其重要的信息锚点。
因为这个极小的信息点,会让观众第一眼看到的时候,会觉得,这是一个真实存在的人。
当演员的脸本身可以提供信息的时候,导演才敢把镜头停在那里。
还有这个手指甲超近特写下,皮肤和指甲的质感。
还有这个超近景特写中,角色呈现出来的高精度皮肤微观细节,包括毛孔、细纹、皮脂光泽及受光变化;同时细微表演如眼神、呼吸、肌肉牵动与微表情均具备可信度。
而这一点,DiDi_OK说,这种细节度和精细度,只有Seedance 2.5才能达到。
他觉得,这个模型,至少给他省掉了60%的叙事成本。
这个词我特别喜欢。
大家天天聊AI降低多少制作成本。
他聊的,是叙事成本。
我觉得,真正改变叙事的,从来都不只是所谓的分辨率更高或者价格更便宜。
是我们过去你只能绕着模型的缺陷去讲我们的故事。
但现在,模型开始允许我们,按我们脑海中的想法去讲故事。
这才是,真正的进步。
四. Seedance 2.5改变的一切
对于Seedance 2.5这个模型,我们聊了很多。
DiDi_OK说,假如现在有人告诉他。
以后这辈子都不会再有新的视频模型。
只能永远用Seedance 2.5。
他觉得,也够了。
因为坦率的讲,从我的视角看,Seedance 2.0发布的时候,全网的反响远比这一次2.5大。
但那时候,DiDi_OK觉得,2.0还可以,确实震撼,但是好像没有那么大的变革。
直到这次Seedance 2.5。
可能很多人第一眼觉得,啊?不还是AI视频吗?跟2.0区别也不是很大啊。
但是DiDi_OK觉得,这反而是一次真正意义上的跨时代升级。
我问他:到底跨在哪?
他说了两个词。
高度定制化。
高精度的运动规律。
这两个词听起来特别技术。
尤其“运动规律”,实在是没有所谓的“电影感”“1080P”“一镜到底”听起来性感。
但观众的眼睛特别诚实。
比如一辆车拐弯,车身应该有侧倾,悬挂应该有压缩,刹车和加速应该产生不同的俯仰。
一颗糖从人体里面炸出去,它应该有质量,有初速度,撞到东西以后会反弹,几百颗糖之间还会互相碰撞,跟镜头的距离不同,虚实也不一样。
所谓运动规律,其实就是:这个世界到底符不符合我们从世界认知到的物理规律。
所以《糖果》里面那个最核心的“糖果爆炸”,其实也是AI能力的一次极限测试。
DiDi_OK说,现在Seedance 2.5出来的视觉,已经可以经得起慢放和暂停了。
他甚至故意设计那种让大家来暂停看看的镜头。
就比如警察局的这场戏,画面里面同时有很多人,DiDi_OK给后面一个黑人角色单独设计了一条故事线。
先挣脱、然后推桌子、拿起电视,再准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。
DiDi_OK借助模型的能力,同时指挥十几个人的动作,每个人都有自己的故事线。
这就是DiDi所谓的第二个特点,定制化。
因为过去,我们用AI做一个怪兽啥的,其实真的都不算难。
难的东西往往都很日常,比如“让左边第三个人先往后看。然后拿起电视。右边警察继续保持现在动作。灯闪以后第二个人爆炸。”
AI真正进入工业生产以后,最需要的能力,恰恰是这种定制化。
DiDi_OK说,从画面上,他感觉,几乎没有什么是他想实现,但是实现不了的了。
比如一堆糖果组成马蒂斯的《舞蹈》。
微缩景观下的移轴动画。
等等等等。
因为模型能力的增强,运动规律和可定制化都变得极强,所以也带来了另一个变化,过去的工作流很多就有点跟不上版本了。
比如过去,为了一个镜头,可能要垫好几张图,来让模型理解。
所以,他说那时候,他有一个很明确的优先级:
参考图,大于提示词,大于模型选择。
甚至为了让模型完成它能力本身完成不了的动画和运镜效果,他会大量使用Blender来建模进行参考。
比如角色和表面之间的运动追踪,就像手机屏幕上的字,以前AI生不准。那就一个字一个字追,全是后期进行人工修复的。
基本就是能工智人。
本质上很简单,都是因为模型能力达不到,而DiDi_OK又不想降低自己的作品效果,就会用很多其他手法来进行弥补。
然后,就来到了《糖果》。
他说,这套逻辑明显开始反过来了。
参考图的重要性明显下降。
Prompt的重要性开始疯狂上升。
因为模型理解能力变强了。
很多过去必须先做好的关键帧才能做的动画,现在可以直接用嘴说了。
所有的传统辅助是一个没用,很多过去要额外做两个星期的后期,也消失了。
DiDi_OK说,这是他第一个,几乎百分百纯度的AI片子。
甚至他用上Seedance 2.5之前,他已经用2.0做了3分钟的《糖果》了,做了将近40%,在他用上2.5之后,毅然决然,全部推翻重来。
这也是这个AI时代非常操蛋的一点。
你的苦心经营的半年的技巧,还有很多所谓保持一致性的工作流,可能就会被一次模型发布直接吞噬。
DiDi_OK说,那些都属于小数点后面的技术,他现在也越来越没有兴趣了,真正决定你上限的,还是你的个人能力,还有模型本身的理解力。
当模型开始吞掉工作流。
创作者剩下来的,才是真正属于创作者的东西。
五. 创作到底是什么?
我问DiDi_OK:“你觉得AI真的能算创作吗?很多人说,不就是抽卡吗?创作在哪里呢?”
他给我讲了一个特别好的例子。
2023年,他参与过一个F1赛车宣传片,实拍加虚拟制作。
那时候,很多镜头可能要NG500多次。
一天光场地费,就是10万英镑。
赛车漂移过去,轮胎擦地,然后烟冒出来了,导演觉得,那个烟不好看,再来。
所有调度一切归位,然后再来一遍。
就这样,不断的Roll,不断的挑选。
直到导演觉得,这个第397次的烟最好,就用这个第397次的镜头。
所以,DiDi_OK说,创作,从来都不是生成多少次的事,也不是AI不AI的事,因为本质上,传统影视,也是抽来抽去的逻辑。
真正的创作,是那个“不要”。
为什么这个导演,要第397次呢?前面那396次,为什么都不要呢?
这个“不要”,才是审美,才是判断,才是经验,才是那个真正的。
创作。
只不过,在AI加持之下,抽卡的速度变得越来越快,质量越来越高,是以前的传统影视,远远不可企及的。
但是反常识的是,模型越来越强以后。
DiDi一点都没有更轻松,反而更痛苦了。
过去一颗8秒镜头,磨两三天就差不多了,因为你知道,模型就那样了,上限就在那,可以安慰自己,这不是自己的问题。
但现在,有了Seedance 2.5这种级别的模型,第三次就能给你一个特别牛逼的结果。
那说明,它能做。
这时候,压力就全部给到DiDi_OK的身上了。
为什么我调度不出来?
为什么没想到那个机位?
为什么还不够好?
以前两三天一个镜头,现在他甚至可能磨一个星期。
他说:
“模型是明显能做到的,但是我却做不出,那明显就是我自己的问题,我还是太菜了。”
AI时代,也是一个残酷的时代。
当表达成本越来越低的时候。
平庸也会越来越没有借口。
聊到最后。
我问了他一个特别大的问题:“你拍了这么多文明、规则、社会、人性的东西,那你自己心里最底层,还相信人类吗?”
他说:“如果聊人类本身,那我一定是一个极度的悲观主义者。”
他说自己有时候,会陷入很严重的存在主义危机。
当AI真的能帮你完成越来越多事情的时候。
你自己到底还剩什么?
他公司里的新人也经常问:
老师,以后应该学什么?
他也不知道。
然后,他说出了我觉得整个访谈里,我最动容的一句话:
“当AI能帮我做所有事情的时候,我到底,是否真的是一个有意思的人呢?”
没有答案,就像他的作品一样。
写在最后
访谈结束以后,我又把《糖果》看了一遍。
我突然觉得,这部片子更好懂了。
DiDi_OK明明说自己对人类这么悲观,可他的作品里,总是有一种特别奇怪的底色:
希望。
突然感觉,在他的身上,我看了三体里面一个角色,就是维德的影子。
他可能平时不是特别愿意跟人互动,甚至对人这个物种有时候有一些悲观判断,可到了最后,他跟维德一样。
不希望人类输。
我特别喜欢这个矛盾,因为很多伟大的创作者,很多时候就是这样。
他们创作。
很少因为觉得这个世界已经很好了,恰恰是觉得它还不够好。
所以才会创造另外一个世界。
那个让很多人,能跟他一起感受美好的。
美妙世界。
那个拍出神作《牌子》的AI导演,带着他的巅峰之作回来了。这个正在威尼斯排队准备走红毯,同时斩获了两项AI影像大奖的小伙。
可能很多人都听过他的名字。
DiDi_OK。
前几天,DiDi_OK发了他用Seedance 2.5做的最新作品《Candy》,中文名叫《糖果》,我在看到之后,惊为天人。
直接转发,推荐所有人逐帧学习。
虽然在AI影视圈,DiDi_OK这个名字几乎已经家喻户晓了。
但是可能还是有很多朋友不知道这个名字,但没关系,你大概率也看过他之前的作品。
比如《箭头》、《网站》、《垃圾站》等等等等,而数据最好的,则是在今年2月,那个刷屏的《牌子》。
这个片子,光在B站上,就有2000万的播放,全网更是接近亿级。
我到现在还记得,我第一次看到牌子的那个晚上,在循环了6、7遍之后,我脑子里产生的那个念头:
“明明都是人类,为什么在DiDi_OK面前,我就宛如一个只会流口水的废物,这个人的脑子和审美,到底是怎么长的。”
不夸张的说,这是真实的感慨,DiDi_OK自那之后,也成为了我心中,没有争议的AI影像第一人。
而这次的《糖果》,更是DiDi_OK在这个主持人平行宇宙系列中,把技术和创意,拉到最高潮的巅峰之作。
如果没看过的,可以先看一遍,相信我,你一定会,惊为天人。
不像现在很多烂大街的油腻无比的AI作品,《糖果》依然有很强的Di味。
有一些高维规则的展开,有一些SCP的感觉,又有一些黑镜的意味。
甚至还有刘慈欣的影子。
当然,还有极强的叙事节奏、镜头语言还有他的审美。
所以这次《糖果》发布后,我觉得,是一个机会了。
我想找他聊聊,跟他做一个小小的专访,聊聊他的一切。
因为他人在国外,这几天又在威尼斯电影节领奖,所以我们还是有一些时差的,在碰了两天之后,我们终于约上了。
访谈那天,北京上午10点半。
他人在黑山,那边凌晨4点半,他起了个大早,因为6点多还要出发去山里。。。
我们痛快的聊了快2个小时,问了很多我想知道的问题,聊完之后,我觉得,我一定要把这些东西写出来,也给大家分享一下。
那接下来,我们,开始吧。
一. 他迎来了AI的时代
DiDi_OK,是一个非常有趣的人。
现在长期在伦敦,在WPP Production工作。
WPP是全球最大的广告与营销传播集团之一,大家耳熟能详的奥美,其实就是WPP的子公司...
而WPP Production是WPP旗下最核心的制作团队。
所以在AI出现以前,DiDi_OK就一直在做动画、3D和游戏相关的工作了。
他的本硕都是动画。
后来进入WPP,也先从动画做起。
他去英国的故事也特别有意思。
他那时候,还在国内跟朋友开工作室挣钱,反正就是拍些广告啥的。
他做着做着,然后就突然觉得,这事没意思。。。
有一天下午,他们甚至还在外面拍广告。
他突然问朋友:要不出国吧?
朋友问他:去哪?
他说:要不然英国吧?
去英国的原因也究极离谱,
因为他们以前拍完片,半夜会一起看影视飓风,Tim也是DiDi_OK的赛博偶像。
然后呢,Tim以前在英国。。。
那不如就英国吧= =
然后他真的回家学了半年英语,申请伦敦艺术大学。
他妈一开始甚至没帮他报,因为觉得这死孩子绝对考不上。
最后他自己还是偷偷报的,结果,还真考上了。。。
几年以后。
这个当年拍完广告半夜看影视飓风的小伙,受Tim邀请,坐到了影视飓风的AI课程里,给大家分享自己的创作心得。
你看,世界总是一个奇妙的圆,人生有时候也真的特别像一个写得有点俗的剧本。
在AI之前,他其实就已经开始在创作了。
2021年,他在伦敦艺术大学做过一部《Moth》。
而且那个时候,就很有Di味了。
一个被雾笼罩的封闭世界,中央有一座巨塔。
所有人都觉得那里绝不能碰,可主角却像飞蛾扑火一样,一定要上去。
哪怕真相让人失望,哪怕会死。
也想看一眼,世界真正的样子。
他脑子里,关于科技、关于未知世界、关于文明的东西,实在是太多了。
但是在过去,卡住他的,是那个时代的生产力。
传统动画的工作流程实在是太长了,几乎不可能有一个人独立制作一个影片的可能。
流程一多,人就多了一些,每多一个人,你脑子中的想法,变成语言传达出去,就会损耗一点。
而再经历建模、绑定、动画、后期等等等等的流程,那就是损耗损耗再损耗。
到最后,你脑海中的那个idea,那个会让自己兴奋会让自己起皮疙瘩的创意的东西,落在最终屏幕上的时候,可能连一半也不剩下了。
所以,他这些年,因为损耗,也一直在研究一个东西,用他的话说,那个东西叫:
力道。
怎么让自己脑海中的创意和感觉,尽可能最低损耗的传达给观众。
而终于,他等来了他的时代。
AI,来了。
二. 《糖果》:坏人会爆炸
如果让我介绍《糖果》。
我可能会认真解释半天:
这是一个关于一级文明、外星规则、暴力、秩序、人性和科技发展的科幻故事。
但是呢,我让DiDi_OK解释,他自己想了想,只用了十个字左右:
“坏人会爆炸,好人就没事。”
极其的朴素,但又精准。
这个故事一开始,人类能源使用能力抵达一级文明的门槛了。
然后土星的一颗卫星,叫“潘”。跑到了地球附近。
接着,全世界开始发生一件特别离谱的事。
只要一个人准备伤害别人。
砰,就炸了。
这个爆炸,不会变成血肉,会变成:
一大堆糖果。
一开始,大家都懵了。
外星人?新型武器?上帝?
后来慢慢发现,这个规则只专门针对:
暴力。
DiDi_OK给它设定的底层判断标准也非常的中国味。
就是四个字,起心动念。
这个片子上线之后,我看了4遍,我当时问了他一个我看的时候,感觉非常矛盾的一个话题,这好像,明明是一个反暴力的故事。
可大家看的最大的爽点,却是看坏人被另一个更强大的力量给干掉。
那这件事,本身就不暴力吗?
DiDi_OK当时就笑了,说你看到了精髓,而且,这其实就是他故意的。
片子后来把反复违反规则的人送去月球。
看起来仿佛太好了,文明和平了。
可这件事情背后,却一样带着群体暴力。
所以他甚至花了很长时间设计片子里代表大众意见的女性发言人。
他想让她拥有一种特别容易被大众接受、信任的气质。
有点像《三体》里的程心。
因为这件事情本身就带着一种“所有人都觉得这一定是对的。”的危险。
DiDi自己也没有站在绝对非暴力那一边。
他觉得现实里常有一个很残酷的问题:
善良的人,往往就是被欺负的人。
所以从中世纪的西方骑士到中国的侠客。
人类几千年一直在幻想一件事:
正义最好拥有力量。
于是这个时候,《糖果》的内核变得不一样了。
一颗外星卫星拥有判断什么是恶的最终解释权,全人类因为恐惧惩罚而文明,然后大家集体同意,把不符合规则的人送去月球。
这到底算文明?还是秩序?又或是暴政?还是一个比我们现在稍微好一点的世界?
DiDi_OK没有答案。
这个问题,属于每一个观众。
三. AI的真正进步
访谈之前,我把《箭头》《牌子》《网站》《垃圾站》等等DiDi_OK的片子又重新全部拉了一遍。
其实有一个最明显的变化,就是《糖果》这部片子,因为用的Seedance 2.5,所以终于敢变慢了。
比如这个教科书级别的长镜头。
讲道理,以前DiDi_OK的片子还是经常会快切的,比如《箭头》和《牌子》,经常5秒就会换一个场景。
理由特别简单,AI影像行业里的大家,可能都猜到这个现实原因。
因为你不敢慢,因为模型能力,完全达不到。
过去的模型能力,是无法支持长镜头的细节不变的这种镜头叙事的。
于是呢,就只能不停用新的视觉刺激,把模型来不及暴露的问题给掩盖过去。
但是《糖果》里,第一次出现了大量安静的叙事。
比如这个镜头。
实验室里,一个年龄稍大的官员往前走。
旁边年轻研究员一路跟着,态度非常谄媚,期待被注意。
但是官员一直很冷,直到突然搭理了他一句。
那个年轻人的身体立刻微微再弯了一点,眼神亮一下。
这时候,你能看出来:
“诶,他听到我说话了。”
但DiDi说,这才是他觉得模型真正突破的地方。
表演。
以前他一直觉得AI表演过不了,那些表演的细节度不够,所以,一直会少这些叙事。
现在Seedance 2.5在他眼里,这个鸿沟已经正式跨过去了。
开头那个女孩吃糖的镜头也是。
他特别在乎女孩脸上那个小痘痘。
我甚至第一次看的时候,都没有注意。
但是对DiDi_OK来说。
这是一个极其重要的信息锚点。
因为这个极小的信息点,会让观众第一眼看到的时候,会觉得,这是一个真实存在的人。
当演员的脸本身可以提供信息的时候,导演才敢把镜头停在那里。
还有这个手指甲超近特写下,皮肤和指甲的质感。
还有这个超近景特写中,角色呈现出来的高精度皮肤微观细节,包括毛孔、细纹、皮脂光泽及受光变化;同时细微表演如眼神、呼吸、肌肉牵动与微表情均具备可信度。
而这一点,DiDi_OK说,这种细节度和精细度,只有Seedance 2.5才能达到。
他觉得,这个模型,至少给他省掉了60%的叙事成本。
这个词我特别喜欢。
大家天天聊AI降低多少制作成本。
他聊的,是叙事成本。
我觉得,真正改变叙事的,从来都不只是所谓的分辨率更高或者价格更便宜。
是我们过去你只能绕着模型的缺陷去讲我们的故事。
但现在,模型开始允许我们,按我们脑海中的想法去讲故事。
这才是,真正的进步。
四. Seedance 2.5改变的一切
对于Seedance 2.5这个模型,我们聊了很多。
DiDi_OK说,假如现在有人告诉他。
以后这辈子都不会再有新的视频模型。
只能永远用Seedance 2.5。
他觉得,也够了。
因为坦率的讲,从我的视角看,Seedance 2.0发布的时候,全网的反响远比这一次2.5大。
但那时候,DiDi_OK觉得,2.0还可以,确实震撼,但是好像没有那么大的变革。
直到这次Seedance 2.5。
可能很多人第一眼觉得,啊?不还是AI视频吗?跟2.0区别也不是很大啊。
但是DiDi_OK觉得,这反而是一次真正意义上的跨时代升级。
我问他:到底跨在哪?
他说了两个词。
高度定制化。
高精度的运动规律。
这两个词听起来特别技术。
尤其“运动规律”,实在是没有所谓的“电影感”“1080P”“一镜到底”听起来性感。
但观众的眼睛特别诚实。
比如一辆车拐弯,车身应该有侧倾,悬挂应该有压缩,刹车和加速应该产生不同的俯仰。
一颗糖从人体里面炸出去,它应该有质量,有初速度,撞到东西以后会反弹,几百颗糖之间还会互相碰撞,跟镜头的距离不同,虚实也不一样。
所谓运动规律,其实就是:这个世界到底符不符合我们从世界认知到的物理规律。
所以《糖果》里面那个最核心的“糖果爆炸”,其实也是AI能力的一次极限测试。
DiDi_OK说,现在Seedance 2.5出来的视觉,已经可以经得起慢放和暂停了。
他甚至故意设计那种让大家来暂停看看的镜头。
就比如警察局的这场戏,画面里面同时有很多人,DiDi_OK给后面一个黑人角色单独设计了一条故事线。
先挣脱、然后推桌子、拿起电视,再准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。
DiDi_OK借助模型的能力,同时指挥十几个人的动作,每个人都有自己的故事线。
这就是DiDi所谓的第二个特点,定制化。
因为过去,我们用AI做一个怪兽啥的,其实真的都不算难。
难的东西往往都很日常,比如“让左边第三个人先往后看。然后拿起电视。右边警察继续保持现在动作。灯闪以后第二个人爆炸。”
AI真正进入工业生产以后,最需要的能力,恰恰是这种定制化。
DiDi_OK说,从画面上,他感觉,几乎没有什么是他想实现,但是实现不了的了。
比如一堆糖果组成马蒂斯的《舞蹈》。
微缩景观下的移轴动画。
等等等等。
因为模型能力的增强,运动规律和可定制化都变得极强,所以也带来了另一个变化,过去的工作流很多就有点跟不上版本了。
比如过去,为了一个镜头,可能要垫好几张图,来让模型理解。
所以,他说那时候,他有一个很明确的优先级:
参考图,大于提示词,大于模型选择。
甚至为了让模型完成它能力本身完成不了的动画和运镜效果,他会大量使用Blender来建模进行参考。
比如角色和表面之间的运动追踪,就像手机屏幕上的字,以前AI生不准。那就一个字一个字追,全是后期进行人工修复的。
基本就是能工智人。
本质上很简单,都是因为模型能力达不到,而DiDi_OK又不想降低自己的作品效果,就会用很多其他手法来进行弥补。
然后,就来到了《糖果》。
他说,这套逻辑明显开始反过来了。
参考图的重要性明显下降。
Prompt的重要性开始疯狂上升。
因为模型理解能力变强了。
很多过去必须先做好的关键帧才能做的动画,现在可以直接用嘴说了。
所有的传统辅助是一个没用,很多过去要额外做两个星期的后期,也消失了。
DiDi_OK说,这是他第一个,几乎百分百纯度的AI片子。
甚至他用上Seedance 2.5之前,他已经用2.0做了3分钟的《糖果》了,做了将近40%,在他用上2.5之后,毅然决然,全部推翻重来。
这也是这个AI时代非常操蛋的一点。
你的苦心经营的半年的技巧,还有很多所谓保持一致性的工作流,可能就会被一次模型发布直接吞噬。
DiDi_OK说,那些都属于小数点后面的技术,他现在也越来越没有兴趣了,真正决定你上限的,还是你的个人能力,还有模型本身的理解力。
当模型开始吞掉工作流。
创作者剩下来的,才是真正属于创作者的东西。
五. 创作到底是什么?
我问DiDi_OK:“你觉得AI真的能算创作吗?很多人说,不就是抽卡吗?创作在哪里呢?”
他给我讲了一个特别好的例子。
2023年,他参与过一个F1赛车宣传片,实拍加虚拟制作。
那时候,很多镜头可能要NG500多次。
一天光场地费,就是10万英镑。
赛车漂移过去,轮胎擦地,然后烟冒出来了,导演觉得,那个烟不好看,再来。
所有调度一切归位,然后再来一遍。
就这样,不断的Roll,不断的挑选。
直到导演觉得,这个第397次的烟最好,就用这个第397次的镜头。
所以,DiDi_OK说,创作,从来都不是生成多少次的事,也不是AI不AI的事,因为本质上,传统影视,也是抽来抽去的逻辑。
真正的创作,是那个“不要”。
为什么这个导演,要第397次呢?前面那396次,为什么都不要呢?
这个“不要”,才是审美,才是判断,才是经验,才是那个真正的。
创作。
只不过,在AI加持之下,抽卡的速度变得越来越快,质量越来越高,是以前的传统影视,远远不可企及的。
但是反常识的是,模型越来越强以后。
DiDi一点都没有更轻松,反而更痛苦了。
过去一颗8秒镜头,磨两三天就差不多了,因为你知道,模型就那样了,上限就在那,可以安慰自己,这不是自己的问题。
但现在,有了Seedance 2.5这种级别的模型,第三次就能给你一个特别牛逼的结果。
那说明,它能做。
这时候,压力就全部给到DiDi_OK的身上了。
为什么我调度不出来?
为什么没想到那个机位?
为什么还不够好?
以前两三天一个镜头,现在他甚至可能磨一个星期。
他说:
“模型是明显能做到的,但是我却做不出,那明显就是我自己的问题,我还是太菜了。”
AI时代,也是一个残酷的时代。
当表达成本越来越低的时候。
平庸也会越来越没有借口。
聊到最后。
我问了他一个特别大的问题:“你拍了这么多文明、规则、社会、人性的东西,那你自己心里最底层,还相信人类吗?”
他说:“如果聊人类本身,那我一定是一个极度的悲观主义者。”
他说自己有时候,会陷入很严重的存在主义危机。
当AI真的能帮你完成越来越多事情的时候。
你自己到底还剩什么?
他公司里的新人也经常问:
老师,以后应该学什么?
他也不知道。
然后,他说出了我觉得整个访谈里,我最动容的一句话:
“当AI能帮我做所有事情的时候,我到底,是否真的是一个有意思的人呢?”
没有答案,就像他的作品一样。
写在最后
访谈结束以后,我又把《糖果》看了一遍。
我突然觉得,这部片子更好懂了。
DiDi_OK明明说自己对人类这么悲观,可他的作品里,总是有一种特别奇怪的底色:
希望。
突然感觉,在他的身上,我看了三体里面一个角色,就是维德的影子。
他可能平时不是特别愿意跟人互动,甚至对人这个物种有时候有一些悲观判断,可到了最后,他跟维德一样。
不希望人类输。
我特别喜欢这个矛盾,因为很多伟大的创作者,很多时候就是这样。
他们创作。
很少因为觉得这个世界已经很好了,恰恰是觉得它还不够好。
所以才会创造另外一个世界。
那个让很多人,能跟他一起感受美好的。
美妙世界。
我,30岁“包工头”,1分钟1000元不敢挣真人短剧的产能开始在全国范围内“塌陷”了。
作者丨《中国企业家》记者 陈浩
编辑丨张昊 马吉英
来源丨中国企业家杂志
8月24日下午,《中国企业家》在郑州一处老办公楼见到石艺源的时候,他刚挂断一个电话。
屋里那台五级能耗的旧空调正在费力地转着,墙上、柜子里摆满了剧组开机纪念照和奖杯,桌上摊着一本没拍的男频短剧剧本。这是一位老朋友给他的——前两年常合作的一些平台短剧业务暂停了,老朋友自己拍了4部,据说都爆了,现在想再拉一支队伍,喊石艺源一起投资制作。
老朋友出30多万元,要他再投10万元。
“所以我刚才一直打电话问行情。”他说,“过了年我没开机,一直在做AI。现在AI什么行情我都知道,但如果让我去拍短剧,我肯定也要各方面去打听。”
打听回来的数字是这样的:去年日薪8000元到10000元的主演,现在有的三五千元也拍;他常合作的一个中年演员,去年对外报1500元,现在最低500元也接,即便如此,一个月最多也就干十几天;场务之前正常是400元一天,现在听说200元一天也有人干。大部分工种,价格降幅几乎都是“腰斩”起步。
“没办法。”他说,“大环境不好,大家都没活。你不降,没人找你,但你就是再降,就算不要钱,有时候没人找你也是白费心思。”
他掰着手指数了一些熟人的去向:一个年初还在当主演的演员,去卖房子了;一个中年演员4月找他想做AI,现在在当保安;还有朋友去开服装店、直播间、做风水命理师……
过去3年,郑州被业内称作“竖店”。据行业数据,这里聚集了上千家微短剧企业和近4万名从业人员,市场规模近百亿元,日均开机近百部。其中占多数的,正是中小型公司。
2026年春节前的一周,两件事接踵而至:红果短剧(以下简称“红果”)收缩保底政策,全国握有大额保底额度的制作公司几乎在同一天接到通知——没有开机的项目,一律停掉;紧接着,字节跳动正式发布视频生成模型Seedance 2.0,AI短剧的制作门槛被再度击穿。春节过后,真人短剧的产能开始在全国范围内“塌陷”。
按往年的节奏,3月中旬本该是复工旺季。可石艺源直到现在,今年只做了4部真人剧,其中2部还没上线。公司十来号人,放了一个多月的长假。“我就相当于一个包工头。”他这么给自己定位,“上游没活干,下游只能歇业。”
暗涌
这个“包工头”30岁,河南尉氏人,2019年从大连艺术学院影视表演专业毕业。他出生在农村,从小由爷爷奶奶带大,父母很早就去了外省打工。毕业前,他在北京找到一份短视频导演的工作,合同都谈妥了,但女朋友在郑州,家里催着安定,他放弃了。
回郑州后,一度没活干。他去女朋友上班的商超应聘储备干部,面试过了,要签合同的那天,一家广告公司打来电话,让他去试镜演员。这边合同没签,他就去了那家广告公司面试,终于可以干回本行,他兴奋极了。
郑州是国内信息流广告的高地。他当时并不了解,还以为进了“传销组织”。后来干起来发现挺简单,主要就是给教辅App和各类消费贷产品拍引流广告,“一天最多能拍几十条”。台词最后一句话永远是:点击视频下方链接就可以下载了。
石艺源现在回想起来,那时他还拍过一种内容,几乎就是短剧的雏形——把网络小说的高潮片段拍成视频投出去,把用户导到小说阅读平台。但那些视频算不上剧,只是一段“钩子”——一个从广告基因里长出来的产品,从第一天起就是为转化付费,不为手艺付费。这件事,他几年后才真正体会到。
信息流广告演员的生活很“安逸”:底薪4000元,朝九晚五,双休,没活干时就歇着。他心里那点躁动压不下去,在公司要给他转正交五险一金的时候,辞职了。期间,他去考了一次北京电影学院导演系的研究生——一个字没复习,交卷时开玩笑地对监考老师说:老师,你等着我,明年我肯定考上。
考完从北京回来,2019年11月12日,他在郑州注册了河南艺影源影视传媒有限公司,干到年底一共挣了1万多元,“还不如上班,但那时候就是有一股闯劲”。
这股闯劲撑着他熬过了新冠疫情。他不只拍中视频赚播放量补贴,还天天跑黄金批发市场拍“金价探店”,靠给粉丝代购黄金一单挣一二百元。2022年信息流广告大爆发,他一天能赶几个组,“屌丝男”“霸总”无缝衔接,那时日薪能到800元,甚至1000元。
那时,一种叫“直播剧”的直播形式也在快手等平台上兴起:豪门恩怨演到情绪顶点,主播就开始卖货。他一般演“反派”:“第一次去演的时候,记忆深刻,主播就在一个臭烘烘的猪圈里,我的戏份是一脚踹开门喊‘还钱’,那天直播间人气高得吓人。”这配角的戏份,一场也能挣五六百元。
2022年年中,朋友叫他去演短剧。30集一天拍完,他惊了。现场两台机器对着两拨演员:一拨对着镜头演,另一拨在旁边背词,画外还有一个人拿着本子替他们搭话。谁忘词谁下去背,刚背好的顶上,基本一条过。
那天下午5点,他还要赶去演直播剧,担心拍不完,结果不到点导演就放他走了。他很开心,一天挣两份钱,像捡了便宜,但并不知道自己正在走进一个此后几年疯狂扩张的新业态。
最后一环
入行后,石艺源只用了几个月就干上了导演。
2022年12月,有人找他导一部100集的剧,五天拍完,导演费1500元一天。第一天拍到凌晨三四点,第二天一早六七点又出工了,他咬了一口包子,结果上面沾着血——熬了一夜,嘴唇干裂出了血。他听说那部剧投了几万块钱,但具体投资额和收益跟他无关。
这是短剧产业链最典型的生存形态。郑州大部分公司做的是短剧承制,接平台或大公司派下来的单子,赚一道差价。整个行业公认的纯承制利润率在5%到8%,而剧组是以天为单位烧钱的组织——他算过,一开机,一秒至少是一元硬成本,而一场雨、一次场地超时、一次男女主的超时,就能把这点利润吃掉。所谓承制费,本质上不是利润,而是团队出租时间的基础价格。
石艺源后来想明白了,一级供应商真正卖的并不是制作能力,而是从平台手里拿到订单的资格。垫资压力、用工风险和不确定性被一层层向下推,最终落在最没有议价能力的产业链末端——只有那里,才需要用真实的人、真实的天数、真实的现金,去兑现合同上的利润。
入行头两年,他还赶上了一轮商业模式的换轨。刚开始,短剧是小程序付费的天下,一部剧八九成的流水要拿去投流,充值款从微信提现还要被抽成。他听说投流的ROI在1.2上下就基本可以挣钱,而提现抽成点数还在一路上涨,吃掉所剩无几的利润。
后来抖音切断了向微信小程序跳转的通道,把这部分流量收进了自家生态。2023年8月,红果上线,用免费模式跑了一年,到2024年下半年,免费剧与付费剧已在市场上各占一半,转过年的春节,免费就成了主流。石艺源对红果的体量没有概念,他只知道,自己上线的剧,最终多半都进了这类免费平台的作品库。
2023年,他去一家新成立的公司当执行导演,约定的薪资结构是1万多元底薪加几个点的分成,他看重的是分成。入职后,他只要开机在组里,每天基本要工作16个小时,平均只能睡三五个小时,出现过三次心悸和呼吸困难。巨大的压力实在难以支撑,3个月后他便离职了。
后来,正赶上咪咕想拍短剧,第一批就找到他。第一部是古装剧,采用的模式是共担成本共享收益,咪咕出大头。但横店剧组有个规矩是先充值再拍摄,由于时间问题,拍摄从7天砍到6天,在保证质量的情况下,他硬挤着拍完了。第二部《君临天下》拍满了7天,结果上线后数据没跑起来,也没挣到分成,“就只挣了个导演费”。
第三部是《盖世医尊》,也是他离“钱”最近的一次。该剧的二轮播放上了红果平台,跑出了成绩,他估摸着平台结给版权方的分账可能有上百万元。但那笔钱与他无关——他只约定了首轮分成权益,而且由于和合伙公司的纠纷,导演费也没拿到,唯一落袋的是一座咪咕的年度导演奖的奖杯。
在中小承制方的视野里,平台大概分成两类:咪咕属于一类,每个项目需要走投标中标流程,比较规范,一碗水要分给很多人,管控严格到一个月最多给一部戏。
红果则是把额度集中给少数头部公司,它们手里的活干不完,从平台接下的单子一个月能到上百部。而一个剧组满负荷运转,一个月最多拍3部——产能撑不起订单,干不完的单子,只能往下转。每转包一层,价格就被“剥掉”一层,直到落进没有转包余地的人手里。
2025年,石艺源开始接一家大型承制公司的活。那家公司一个月能做100多部红果的剧,他一个月能分到一到两部,他很清楚自己在链条中的位置。
他把红果的补贴比作当年“打车大战”:烧钱抢市场,退潮是必然的。对腰部以下的公司,账期永远是悬在头顶的剑。2025年底,和一家头部制作公司再谈合作时,账期已经在拉长,年底结清时他听说对方甚至是借钱贷款结的尾款。情分他记着,但不敢再干了——价格本来就低,账期再拉长,风险高到不值得冒险。
斟酌
春节过后,石艺源开始干AI。原因有两个——真人剧没有开机;两个做AI的朋友拉他合伙。“本身对AI不是很感兴趣,也不是我主动愿意做的,但是真人实拍短剧没活,也算是被逼到这条路上了。”他说。
他先去几家好朋友的公司考察,又花钱买了教程——3月组团队,4月磨流程,五一也没有放假,因为正经接到了第一单活。他并不算早,楼下一家更早转型的兄弟公司年前就去广州学习了一轮,“去年是学习,今年正儿八经干,但听说也没赚到什么钱”。
这单活是一部2D漫剧,出品方是一家网文平台,一共180分钟,合同上每分钟按约400元结算。实操下来,前六集大约12分钟,算力就花掉1万元,折合每分钟接近800元,是合同价的近两倍。
钱烧在抽卡上。AI生成的画面要保持一致——比如这个镜头戴着眼镜,下个镜头眼镜就没了,手表会消失,衣服的拉链会自己解开,穿帮一次就得重新生成一次。全片做完,算力花了6万多元,还不包含音乐、音效和配音,而总预算只有7万多元。
“真人剧要改片子,成本是人力和时间。AI改片子,每次重新生成都要花钱,改一遍就要付费,就怕客户无限制地改。”石艺源认为,这是AI剧与真人剧最本质的差别,AI剧的边际成本是刚性的。但甲方并不理解这个区别,他们只知道AI快,于是提出比过去更多的修改要求,AI确实提高了出片速度,也降低了甲方“推翻上一版”的决策难度。
第二单是一部横屏的仿真人剧,要求直出1080P——分辨率每高一级,单价和废片率一起涨。对方开价每分钟超过1000元,他没敢接:有了上一单的教训,他怕算力超预算,提出算力由对方另算,自己只按四五百元一分钟收制作费。
5个人做了一周,烧掉近30000元算力,产出了二十多分钟的片子,交上去被甲方全部打翻,最后只留下三分钟。后来,他索性改成完全按人/天计价,每人每天400元,不管这一分钟能不能用。最后干了半个多月,挣了1万多元。事后看,这是他今年做过最正确的判断。
更让他不安的,不是钱。真人时代,他至少知道自己是“三包”还是“四包”,到了AI时代,他连这个也不知道了,“我们在给谁干活?我们在挣谁的钱?”
真人剧的分包是“笨拙”的,需要场地、剧组和一群互相认识的人,链条因此是看得见的。AI的分包完全不需要这些,一条群发,一个网上的视频,不管认识不认识,就能完成一次转手——链条变得高效,也变得不可见。他从被层层抽成,变成了被无声地“稀释”。
与此同时,行业门槛也塌了。他见过从广州花万把元学了几天AI,回来就想要开公司的三门峡夫妻;做汽车美容的师兄也来问他这行能不能干;婚庆公司、工程公司和做新能源的老板一窝蜂进场……用他的话说,但凡跟视频沾点边的人都想入行,“而这个阶段真正稳定赚钱的,是卖教程和办培训的人”。
“没入局的人看不到坑,入局的人都已经踩到了。”
上半年的行业数据他也刷到过:仅抖音端,新增AI短剧22.19万部,播放量破亿的只有1055部,破亿率不足0.5%。在这样一个分母面前,他积攒了7年的经验开始失效。
平台对AI内容的态度也在收紧。7月22日,红果就“高频AI脸”泛滥、形象同质化和版权侵权发布公告,启动专项整治。半年里,AI剧从被热捧走到被规范。
也有同行劝他做自制剧和海外剧,搏一把爆款,他摇头,“自制剧搞不好,亏得更多,海外剧一旦大家都做,也不挣钱了。”能稳稳活下来的,要么手里有平台的稳定额度,要么有自己的发行投流路子,这两样他都没有。
那天的采访结束是傍晚,一行人去吃饭。饭桌上,石艺源的微信响了。有人辗转找到他的联系方式,问他能不能带着做AI短剧,他直接劝退了。不是保守,也不是不愿意带人,是他自己也不知道钱在哪里。7年前,他到处见组、求人给活干,如今有人来求他带路,他反而觉得自己能拿出来的最有价值的东西,是一句规劝。
他30岁,两个孩子,大的快上小学了,母亲在郑州帮他带孩子,父亲还在外省打工。他没当年那么“勇”了。
问他接下来怎么办,那本真人实拍剧还入不入局?他想了很久,先是描述了下他所观察到的现状:真人短剧其实已经在慢慢回暖,有人在开机了,只是不多。
“这个行业淘汰了很多人。”他语气平淡,“我不知道能不能等到回暖。有活的话,我会接,但得先斟酌好。”
本文仅代表原作者观点,不代表投中网立场
豆包工作今日上线:字节AI办公的"独立军团",到底能不能打?昨天刚写完TRAE和扣子并入豆包的消息,今天"豆包工作"就正式落地了。官网已经开放下载,电脑版可直接安装,也能在最新版豆包电脑版里切换使用。新用户登录就送30天订阅权益。
一天都没多等,字节这波是组织调整和产品发布踩着同个鼓点往前推。问题是——这个被字节寄予"AI主干业务"厚望的产品,到底是个什么东西?能不能跟腾讯WorkBuddy掰手腕?
不是聊天框,是"数字打工人"
先说清楚豆包工作跟普通AI助手的本质区别。你给它一个目标,它自己拆任务、调工具、操作电脑,最后把成品文件扔到你桌上。不是给你一段文字让你自己复制粘贴,而是指令进、成果出。
能力分三层:
第一层是生成和编辑。写方案、整理纪要、做调研报告、处理表格数据算基本功,PPT、文档、表格都能直接产出。亮点是"指哪改哪"——生成的文档里哪块不满意,直接框选那一段改,不用整篇重来。还能生成图片、视频、网页甚至简易应用,背后接的是Seedream 5.0 Pro和Seedance 2.5。
第二层是电脑操作。授权之后它能直接开浏览器搜资料、填表单、跨软件搬数据、用专业软件处理文件。长时间跑的任务可以丢给云电脑,你本地关机它照样跑。出门在外用手机就能远程给电脑派活。这部分能力主要来自TRAE团队在桌面端Agent摸爬滚打一年多的积累。
第三层是多智能体协作。平台上已经有100多个"工作伙伴"——UI设计师、HR招聘助手、数据分析师、短剧策划师等等。你可以拉几个AI组个"工作小队",比如做调研报告时让数据、研究、设计三个Agent分工并行,最后汇总成稿。这套技能+连接器+工作伙伴的生态框架,底子是扣子(Coze)的Agent开发平台。
200多个技能、10多个连接器(飞书、钉钉、企业微信、腾讯会议、邮箱等),覆盖面已经相当广。
真正的杀手锏:飞书十年数据喂出来的"企业大脑"
但以上这些,WorkBuddy也能做,阿里千问办公也能做。豆包工作真正的差异化在一个地方:飞书。
用飞书账号登录后,豆包工作能在你权限范围内读取飞书里的聊天记录、文档、会议纪要、日程——这些不是你手动喂给它的,而是企业天然沉淀的工作上下文。它知道你们项目讨论到哪了、上次会议定了什么、文档里谁提了什么意见,基于这些真实信息来干活,而不是靠你一句话重新描述背景。
干完的活还会回写飞书,沉淀成可复用的企业知识。用得越多,它越懂你的业务。飞书里原来的"豆包企业版"入口也已经升级成了豆包工作。
说白了,飞书十年攒下的企业协作数据——组织架构、文档知识库、会议决策链——正在被拆成豆包可以调用的一个个能力模块。飞书从一个独立产品变成了豆包的"企业大脑"。这是腾讯用腾讯文档+企业微信也在做的事,但飞书在产品深度和知识沉淀密度上有自己的优势。
安全方面也下了功夫:全链路Agent安全防护,继承飞书权限体系,个人数据和企业数据隔离,是国内首批通过办公智能体能力与云端基准测试双项认证的产品。
68块钱一个月,贵不贵?
定价直接亮牌:
68块的标准版对标WorkBuddy的付费档,价格不算离谱。但有个现实问题:Agent跑复杂任务的Token消耗是普通问答的10到90倍,一次网页抓取加表格生成可能就干掉平时一周的问答量。重度用户额度够不够用,得实际跑起来才知道。
从媒体实测反馈看,轻量任务——周报、纪要、单表分析、图文排版——一次过的概率不错;但多表公式、精细排版、复杂GUI操作还是会翻车,需要人工兜底。财务建模、法律合同这类零容错场景,现阶段只能当辅助不能当主力。
结语:四张牌桌,谁的咬合更紧?
豆包工作上线,AI办公正式进入四强对线:腾讯WorkBuddy、字节豆包工作、阿里千问办公、百度(文库+网盘)。
四家牌面都不弱。腾讯有社交关系链和企业微信生态,阿里有钉钉的组织架构和云算力,百度有搜索入口和文档资产,字节有豆包3.82亿月活的C端流量池+飞书企业数据+扣子生态框架+火山引擎云基础设施。
QuestMobile数据显示,今年6月豆包以3.82亿月活位居AI原生App第一,是第二名千问1.67亿的两倍多。这意味着豆包工作不需要冷启动——豆包里已经习惯用AI处理文档、查资料的用户,就是现成的转化池。
但入场券只是入场券。执行能力打平之后,下一轮拼的是谁的AI能嵌进用户的数据、业务流程和工作习惯里,让用户换不掉你。字节用两个月走完了组织整合、能力收拢、品牌独立三步,速度确实快,可流量和整合速度能抢到身位,不能替它跑完后半程。
品牌认知要靠时间沉淀,付费意愿要靠真实交付换,复杂任务的稳定性还要一个版本一个版本磨。对字节来说,豆包工作上线不是终点,是真正考试的开始。这个正在威尼斯排队准备走红毯,同时斩获了两项AI影像大奖的小伙。 可能很多人都听过他的名字。 DiDi_OK。 前几天,DiDi_OK发了他用Seedance 2.5做的最新作品《Candy》,中文名叫《糖果》,我在看到之后,惊为天人。 直接转发,推荐所有人逐帧学习。 虽然在AI影视圈,DiDi_OK这个名字几乎已经家喻户晓了。 但是可能还是有很多朋友不知道这个名字,但没关系,你大概率也看过他之前的作品。 比如《箭头》、《网站》、《垃圾站》等等等等,而数据最好的,则是在今年2月,那个刷屏的《牌子》。 这个片子,光在B站上,就有2000万的播放,全网更是接近亿级。 我到现在还记得,我第一次看到牌子的那个晚上,在循环了6、7遍之后,我脑子里产生的那个念头: “明明都是人类,为什么在DiDi_OK面前,我就宛如一个只会流口水的废物,这个人的脑子和审美,到底是怎么长的。” 不夸张的说,这是真实的感慨,DiDi_OK自那之后,也成为了我心中,没有争议的AI影像第一人。 而这次的《糖果》,更是DiDi_OK在这个主持人平行宇宙系列中,把技术和创意,拉到最高潮的巅峰之作。 如果没看过的,可以先看一遍,相信我,你一定会,惊为天人。 不像现在很多烂大街的油腻无比的AI作品,《糖果》依然有很强的Di味。 有一些高维规则的展开,有一些SCP的感觉,又有一些黑镜的意味。 甚至还有刘慈欣的影子。 当然,还有极强的叙事节奏、镜头语言还有他的审美。 所以这次《糖果》发布后,我觉得,是一个机会了。 我想找他聊聊,跟他做一个小小的专访,聊聊他的一切。 因为他人在国外,这几天又在威尼斯电影节领奖,所以我们还是有一些时差的,在碰了两天之后,我们终于约上了。 访谈那天,北京上午10点半。 他人在黑山,那边凌晨4点半,他起了个大早,因为6点多还要出发去山里。。。 我们痛快的聊了快2个小时,问了很多我想知道的问题,聊完之后,我觉得,我一定要把这些东西写出来,也给大家分享一下。 那接下来,我们,开始吧。 一. 他迎来了AI的时代 DiDi_OK,是一个非常有趣的人。 现在长期在伦敦,在WPP Production工作。 WPP是全球最大的广告与营销传播集团之一,大家耳熟能详的奥美,其实就是WPP的子公司... 而WPP Production是WPP旗下最核心的制作团队。 所以在AI出现以前,DiDi_OK就一直在做动画、3D和游戏相关的工作了。 他的本硕都是动画。 后来进入WPP,也先从动画做起。 他去英国的故事也特别有意思。 他那时候,还在国内跟朋友开工作室挣钱,反正就是拍些广告啥的。 他做着做着,然后就突然觉得,这事没意思。。。 有一天下午,他们甚至还在外面拍广告。 他突然问朋友:要不出国吧? 朋友问他:去哪? 他说:要不然英国吧? 去英国的原因也究极离谱, 因为他们以前拍完片,半夜会一起看影视飓风,Tim也是DiDi_OK的赛博偶像。 然后呢,Tim以前在英国。。。 那不如就英国吧= = 然后他真的回家学了半年英语,申请伦敦艺术大学。 他妈一开始甚至没帮他报,因为觉得这死孩子绝对考不上。 最后他自己还是偷偷报的,结果,还真考上了。。。 几年以后。 这个当年拍完广告半夜看影视飓风的小伙,受Tim邀请,坐到了影视飓风的AI课程里,给大家分享自己的创作心得。 你看,世界总是一个奇妙的圆,人生有时候也真的特别像一个写得有点俗的剧本。 在AI之前,他其实就已经开始在创作了。 2021年,他在伦敦艺术大学做过一部《Moth》。 而且那个时候,就很有Di味了。 一个被雾笼罩的封闭世界,中央有一座巨塔。 所有人都觉得那里绝不能碰,可主角却像飞蛾扑火一样,一定要上去。 哪怕真相让人失望,哪怕会死。 也想看一眼,世界真正的样子。 他脑子里,关于科技、关于未知世界、关于文明的东西,实在是太多了。 但是在过去,卡住他的,是那个时代的生产力。 传统动画的工作流程实在是太长了,几乎不可能有一个人独立制作一个影片的可能。 流程一多,人就多了一些,每多一个人,你脑子中的想法,变成语言传达出去,就会损耗一点。 而再经历建模、绑定、动画、后期等等等等的流程,那就是损耗损耗再损耗。 到最后,你脑海中的那个idea,那个会让自己兴奋会让自己起皮疙瘩的创意的东西,落在最终屏幕上的时候,可能连一半也不剩下了。 所以,他这些年,因为损耗,也一直在研究一个东西,用他的话说,那个东西叫: 力道。 怎么让自己脑海中的创意和感觉,尽可能最低损耗的传达给观众。 而终于,他等来了他的时代。 AI,来了。 二. 《糖果》:坏人会爆炸 如果让我介绍《糖果》。 我可能会认真解释半天: 这是一个关于一级文明、外星规则、暴力、秩序、人性和科技发展的科幻故事。 但是呢,我让DiDi_OK解释,他自己想了想,只用了十个字左右: “坏人会爆炸,好人就没事。” 极其的朴素,但又精准。 这个故事一开始,人类能源使用能力抵达一级文明的门槛了。 然后土星的一颗卫星,叫“潘”。跑到了地球附近。 接着,全世界开始发生一件特别离谱的事。 只要一个人准备伤害别人。 砰,就炸了。 这个爆炸,不会变成血肉,会变成: 一大堆糖果。 一开始,大家都懵了。 外星人?新型武器?上帝? 后来慢慢发现,这个规则只专门针对: 暴力。 DiDi_OK给它设定的底层判断标准也非常的中国味。 就是四个字,起心动念。 这个片子上线之后,我看了4遍,我当时问了他一个我看的时候,感觉非常矛盾的一个话题,这好像,明明是一个反暴力的故事。 可大家看的最大的爽点,却是看坏人被另一个更强大的力量给干掉。 那这件事,本身就不暴力吗? DiDi_OK当时就笑了,说你看到了精髓,而且,这其实就是他故意的。 片子后来把反复违反规则的人送去月球。 看起来仿佛太好了,文明和平了。 可这件事情背后,却一样带着群体暴力。 所以他甚至花了很长时间设计片子里代表大众意见的女性发言人。 他想让她拥有一种特别容易被大众接受、信任的气质。 有点像《三体》里的程心。 因为这件事情本身就带着一种“所有人都觉得这一定是对的。”的危险。 DiDi自己也没有站在绝对非暴力那一边。 他觉得现实里常有一个很残酷的问题: 善良的人,往往就是被欺负的人。 所以从中世纪的西方骑士到中国的侠客。 人类几千年一直在幻想一件事: 正义最好拥有力量。 于是这个时候,《糖果》的内核变得不一样了。 一颗外星卫星拥有判断什么是恶的最终解释权,全人类因为恐惧惩罚而文明,然后大家集体同意,把不符合规则的人送去月球。 这到底算文明?还是秩序?又或是暴政?还是一个比我们现在稍微好一点的世界? DiDi_OK没有答案。 这个问题,属于每一个观众。 三. AI的真正进步 访谈之前,我把《箭头》《牌子》《网站》《垃圾站》等等DiDi_OK的片子又重新全部拉了一遍。 其实有一个最明显的变化,就是《糖果》这部片子,因为用的Seedance 2.5,所以终于敢变慢了。 比如这个教科书级别的长镜头。 讲道理,以前DiDi_OK的片子还是经常会快切的,比如《箭头》和《牌子》,经常5秒就会换一个场景。 理由特别简单,AI影像行业里的大家,可能都猜到这个现实原因。 因为你不敢慢,因为模型能力,完全达不到。 过去的模型能力,是无法支持长镜头的细节不变的这种镜头叙事的。 于是呢,就只能不停用新的视觉刺激,把模型来不及暴露的问题给掩盖过去。 但是《糖果》里,第一次出现了大量安静的叙事。 比如这个镜头。 实验室里,一个年龄稍大的官员往前走。 旁边年轻研究员一路跟着,态度非常谄媚,期待被注意。 但是官员一直很冷,直到突然搭理了他一句。 那个年轻人的身体立刻微微再弯了一点,眼神亮一下。 这时候,你能看出来: “诶,他听到我说话了。” 但DiDi说,这才是他觉得模型真正突破的地方。 表演。 以前他一直觉得AI表演过不了,那些表演的细节度不够,所以,一直会少这些叙事。 现在Seedance 2.5在他眼里,这个鸿沟已经正式跨过去了。 开头那个女孩吃糖的镜头也是。 他特别在乎女孩脸上那个小痘痘。 我甚至第一次看的时候,都没有注意。 但是对DiDi_OK来说。 这是一个极其重要的信息锚点。 因为这个极小的信息点,会让观众第一眼看到的时候,会觉得,这是一个真实存在的人。 当演员的脸本身可以提供信息的时候,导演才敢把镜头停在那里。 还有这个手指甲超近特写下,皮肤和指甲的质感。 还有这个超近景特写中,角色呈现出来的高精度皮肤微观细节,包括毛孔、细纹、皮脂光泽及受光变化;同时细微表演如眼神、呼吸、肌肉牵动与微表情均具备可信度。 而这一点,DiDi_OK说,这种细节度和精细度,只有Seedance 2.5才能达到。 他觉得,这个模型,至少给他省掉了60%的叙事成本。 这个词我特别喜欢。 大家天天聊AI降低多少制作成本。 他聊的,是叙事成本。 我觉得,真正改变叙事的,从来都不只是所谓的分辨率更高或者价格更便宜。 是我们过去你只能绕着模型的缺陷去讲我们的故事。 但现在,模型开始允许我们,按我们脑海中的想法去讲故事。 这才是,真正的进步。 四. Seedance 2.5改变的一切 对于Seedance 2.5这个模型,我们聊了很多。 DiDi_OK说,假如现在有人告诉他。 以后这辈子都不会再有新的视频模型。 只能永远用Seedance 2.5。 他觉得,也够了。 因为坦率的讲,从我的视角看,Seedance 2.0发布的时候,全网的反响远比这一次2.5大。 但那时候,DiDi_OK觉得,2.0还可以,确实震撼,但是好像没有那么大的变革。 直到这次Seedance 2.5。 可能很多人第一眼觉得,啊?不还是AI视频吗?跟2.0区别也不是很大啊。 但是DiDi_OK觉得,这反而是一次真正意义上的跨时代升级。 我问他:到底跨在哪? 他说了两个词。 高度定制化。 高精度的运动规律。 这两个词听起来特别技术。 尤其“运动规律”,实在是没有所谓的“电影感”“1080P”“一镜到底”听起来性感。 但观众的眼睛特别诚实。 比如一辆车拐弯,车身应该有侧倾,悬挂应该有压缩,刹车和加速应该产生不同的俯仰。 一颗糖从人体里面炸出去,它应该有质量,有初速度,撞到东西以后会反弹,几百颗糖之间还会互相碰撞,跟镜头的距离不同,虚实也不一样。 所谓运动规律,其实就是:这个世界到底符不符合我们从世界认知到的物理规律。 所以《糖果》里面那个最核心的“糖果爆炸”,其实也是AI能力的一次极限测试。 DiDi_OK说,现在Seedance 2.5出来的视觉,已经可以经得起慢放和暂停了。 他甚至故意设计那种让大家来暂停看看的镜头。 就比如警察局的这场戏,画面里面同时有很多人,DiDi_OK给后面一个黑人角色单独设计了一条故事线。 先挣脱、然后推桌子、拿起电视,再准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。 DiDi_OK借助模型的能力,同时指挥十几个人的动作,每个人都有自己的故事线。 这就是DiDi所谓的第二个特点,定制化。 因为过去,我们用AI做一个怪兽啥的,其实真的都不算难。 难的东西往往都很日常,比如“让左边第三个人先往后看。然后拿起电视。右边警察继续保持现在动作。灯闪以后第二个人爆炸。” AI真正进入工业生产以后,最需要的能力,恰恰是这种定制化。 DiDi_OK说,从画面上,他感觉,几乎没有什么是他想实现,但是实现不了的了。 比如一堆糖果组成马蒂斯的《舞蹈》。 微缩景观下的移轴动画。 等等等等。 因为模型能力的增强,运动规律和可定制化都变得极强,所以也带来了另一个变化,过去的工作流很多就有点跟不上版本了。 比如过去,为了一个镜头,可能要垫好几张图,来让模型理解。 所以,他说那时候,他有一个很明确的优先级: 参考图,大于提示词,大于模型选择。 甚至为了让模型完成它能力本身完成不了的动画和运镜效果,他会大量使用Blender来建模进行参考。 比如角色和表面之间的运动追踪,就像手机屏幕上的字,以前AI生不准。那就一个字一个字追,全是后期进行人工修复的。 基本就是能工智人。 本质上很简单,都是因为模型能力达不到,而DiDi_OK又不想降低自己的作品效果,就会用很多其他手法来进行弥补。 然后,就来到了《糖果》。 他说,这套逻辑明显开始反过来了。 参考图的重要性明显下降。 Prompt的重要性开始疯狂上升。 因为模型理解能力变强了。 很多过去必须先做好的关键帧才能做的动画,现在可以直接用嘴说了。 所有的传统辅助是一个没用,很多过去要额外做两个星期的后期,也消失了。 DiDi_OK说,这是他第一个,几乎百分百纯度的AI片子。 甚至他用上Seedance 2.5之前,他已经用2.0做了3分钟的《糖果》了,做了将近40%,在他用上2.5之后,毅然决然,全部推翻重来。 这也是这个AI时代非常操蛋的一点。 你的苦心经营的半年的技巧,还有很多所谓保持一致性的工作流,可能就会被一次模型发布直接吞噬。 DiDi_OK说,那些都属于小数点后面的技术,他现在也越来越没有兴趣了,真正决定你上限的,还是你的个人能力,还有模型本身的理解力。 当模型开始吞掉工作流。 创作者剩下来的,才是真正属于创作者的东西。 五. 创作到底是什么? 我问DiDi_OK:“你觉得AI真的能算创作吗?很多人说,不就是抽卡吗?创作在哪里呢?” 他给我讲了一个特别好的例子。 2023年,他参与过一个F1赛车宣传片,实拍加虚拟制作。 那时候,很多镜头可能要NG500多次。 一天光场地费,就是10万英镑。 赛车漂移过去,轮胎擦地,然后烟冒出来了,导演觉得,那个烟不好看,再来。 所有调度一切归位,然后再来一遍。 就这样,不断的Roll,不断的挑选。 直到导演觉得,这个第397次的烟最好,就用这个第397次的镜头。 所以,DiDi_OK说,创作,从来都不是生成多少次的事,也不是AI不AI的事,因为本质上,传统影视,也是抽来抽去的逻辑。 真正的创作,是那个“不要”。 为什么这个导演,要第397次呢?前面那396次,为什么都不要呢? 这个“不要”,才是审美,才是判断,才是经验,才是那个真正的。 创作。 只不过,在AI加持之下,抽卡的速度变得越来越快,质量越来越高,是以前的传统影视,远远不可企及的。 但是反常识的是,模型越来越强以后。 DiDi一点都没有更轻松,反而更痛苦了。 过去一颗8秒镜头,磨两三天就差不多了,因为你知道,模型就那样了,上限就在那,可以安慰自己,这不是自己的问题。 但现在,有了Seedance 2.5这种级别的模型,第三次就能给你一个特别牛逼的结果。 那说明,它能做。 这时候,压力就全部给到DiDi_OK的身上了。 为什么我调度不出来? 为什么没想到那个机位? 为什么还不够好? 以前两三天一个镜头,现在他甚至可能磨一个星期。 他说: “模型是明显能做到的,但是我却做不出,那明显就是我自己的问题,我还是太菜了。” AI时代,也是一个残酷的时代。 当表达成本越来越低的时候。 平庸也会越来越没有借口。 聊到最后。 我问了他一个特别大的问题:“你拍了这么多文明、规则、社会、人性的东西,那你自己心里最底层,还相信人类吗?” 他说:“如果聊人类本身,那我一定是一个极度的悲观主义者。” 他说自己有时候,会陷入很严重的存在主义危机。 当AI真的能帮你完成越来越多事情的时候。 你自己到底还剩什么? 他公司里的新人也经常问: 老师,以后应该学什么? 他也不知道。 然后,他说出了我觉得整个访谈里,我最动容的一句话: “当AI能帮我做所有事情的时候,我到底,是否真的是一个有意思的人呢?” 没有答案,就像他的作品一样。 写在最后 访谈结束以后,我又把《糖果》看了一遍。 我突然觉得,这部片子更好懂了。 DiDi_OK明明说自己对人类这么悲观,可他的作品里,总是有一种特别奇怪的底色: 希望。 突然感觉,在他的身上,我看了三体里面一个角色,就是维德的影子。 他可能平时不是特别愿意跟人互动,甚至对人这个物种有时候有一些悲观判断,可到了最后,他跟维德一样。 不希望人类输。 我特别喜欢这个矛盾,因为很多伟大的创作者,很多时候就是这样。 他们创作。 很少因为觉得这个世界已经很好了,恰恰是觉得它还不够好。 所以才会创造另外一个世界。 那个让很多人,能跟他一起感受美好的。 美妙世界。
