当前位置: 首页 » 资讯 » 财经头条 » 正文

Seedance 2.5,要给机器人打工了

IP属地 中国·北京 字母榜 时间:2026-07-31 20:57:32



Seedance 2.5来了。

距离2.0发布才过去不到半年,字节就又扔出来一个大版本。

2.0有多火就不用多说了,上线即爆火,甚至于发布后一个礼拜,每天排队超过10个小时。短剧行业几乎人手一个Seedance 2.0,甚至于它一度被传成字节第一个真正赚钱的AI业务。

虽然火山引擎总裁谭待亲自出来辟谣说收入没那么高,但侧面也说明一件事,Seedance 2.0的确是火出圈了。

到了2.5版本,字节官方的说法是,延续Seedance 2.0统一的多模态音视频联合生成架构,重点突破长叙事能力、多模态参考能力和编辑能力。围绕真实的产业场景,让创作拥有更大的想象空间,并进一步释放生产力。

事实真的如此吗?

看了官方释出的演示,以及亲自上手后,可以肯定的是,Seedance 2.5确实超出预期。

01

Seedance 2.5有哪些优势?

我先问个问题:AI视频生成最大的痛点是什么?是画质不够好?是角色脸会崩?还是生成太慢?

都对,但都不是最痛的。真正让所有创作者头疼的是“短”。

市面上绝大多数AI视频工具,单次生成也就5到15秒。要是想做一个长一点的视频,也不是不行,但是得生成6段,然后自己拼。

拼完就会发现,第一段的人物和第二段的人物长得不太一样,第一段的灯光是暖的,第二段突然变冷了,第一段的镜头是手持跟拍,第二段变成了固定机位。

拼接的地方永远有一道缝,你得花大量时间去修、去调、去重新生成。很多时候,修拼接的时间比生成本身还长。

这是Seedance 2.5第一个值得吹的地方,原生30秒,一镜到底。

注意“原生”这两个字。它不是把6个5秒的片段粘在一起,而是模型一次性前向传播,从头到尾生成一整段30秒的视频。整个过程中,角色的长相、衣服的褶皱、光影的方向、运动的节奏,全部是连贯的。

Seedance 2.5模型从一开始就规划好了完整的30秒视频。

官方演示里有一段,歌手从化妆间起身,穿过后台走廊,和伴舞汇合,一起登台,最后镜头拉远到整个体育馆。从铺垫、推进、转折到收尾,30秒一气呵成。



光有长度还不够。第二个大升级是多模态参考能力

Seedance 2.0的时候,模型已经支持参考输入了,但数量有限,只有12个。到了2.5,总数直接干到50个,30张图片、10段视频、10段音频。

50个参考素材意味着你可以把主角的正脸、侧脸、全身照,场景的概念图、道具的细节图,把运镜参考视频、节奏参考音频全都一股脑扔进去。模型综合理解所有这些素材,然后生成一段符合你所有要求的视频。

多人同框、群像叙事,以前是AI视频的噩梦。现在你把每个人的参考图都喂进去,模型能同时还原多个人物的形象和声音,各主体特征保持稳定。官方演示的那个音乐会片段,钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团、观众席,十几组参考素材一起上,出来的画面里每个人物都有自己的样子,不是复制粘贴的脸。

更有意思的是Seedance 2.5多了一个功能叫做白模参考



什么叫白模?就是那种没有纹理的3D模型,灰扑扑的,像橡皮泥捏的。

你可以用白模搭出画面的空间结构、人物的姿态、运动的轨迹、镜头的机位,然后让Seedance 2.5参考这套结构来生成视频。

相当于你先用最便宜的方式把“骨架”搭好,确认构图和调度没问题了,再让模型把“皮肉”长出来。

以前你只能靠文字描述镜头,描述不清楚就反复生成,浪费时间浪费钱。现在有了白模,镜头怎么运动、人物站在哪、光从哪来,全部精准可控。

第三个大升级是编辑能力

AI视频生成有个老毛病,你想改一个小细节,就得整段重新生成。假如你想把桌子上的红色瓶子换成蓝色的,对不起,整段重跑。镜头运动、光影、人物动作,全部重新来一遍。

Seedance 2.5支持局部场景编辑。你指定要改的区域和内容,其他部分原封不动。换个产品、换个背景、换个手势,都可以定向修改,不需要从头再来。

还有时间戳控制。你可以精确指定第几秒发生什么事、镜头在什么时间切换、某个动作在第几秒出现。生成前可以通过prompt控制节奏,生成后可以针对指定片段进行修改。这对广告、短剧这种对时间精度要求高的场景,简直是刚需。

绿幕编辑也升级了。模型不只是简单地替换背景,它还会根据新场景的物理规则,重新渲染人物身上的效果,比如视频里衣服往哪边飘、头发怎么动、光影怎么打、步态节奏怎么变,全部跟着场景走。

最后还有个细节,Seedance 2.5专门优化了视频生成中常见的“油腻感”。

所谓油腻感,是指AI生成的人物皮肤,总是油光发亮的,像抹了一层油;物体材质也怪怪的,塑料不像塑料、金属不像金属;画面饱和度偏高,整体有一种说不出来的“AI味”。

字节对物体材质、人物肤质与眼神、光影、画面饱和度这些细节做了系统优化。同时减少了字幕和背景音乐不受控的情况,让成片更接近实拍的影视质感。

02

Seedance 2.5不只是给人准备的

今年3月OpenAI关掉了Sora消费者版,核心团队转去做机器人。视频生成模型练到最后,练出来的就是模拟世界的能力。

Seedance 2.5发布的当天,字节扔出来一个名单,包含徐工集团、小鹏汽车、穹彻智能、微分智飞、灵初智能等等,均为工业、生产相关企业。

你想让机器人学会抓杯子,得让它试成千上万次。每次都用真机器人、真杯子、真桌子,试错成本高得离谱,速度还慢。更麻烦的是,很多场景根本没法用真机测。

极端天气、罕见路况、突发事故,最需要训练的场景恰恰最难拿到数据。这就是具身智能喊了这么多年一直进展不快的原因。不是算法不行,是数据太贵……不仅贵,而且太少、太难搞。

因此,Seedance选择直接给具身智能生成训练用的数据。



穹彻智能是做具身智能大模型的,以前训练机器人得靠实体机器人一台一台采集数据,不同机型、不同场景、不同任务,数据量需求大,采集成本高。

现在有了Seedance,直接用视频生成模型扩充训练数据,不用实体机器人逐一采集,就能生成适配不同机型的操作数据。机器人还没动,训练数据已经生成好了。

Seedance优化了物理规律、材质质感、运动轨迹。生成出来的画面跟真实世界拍的越来越像。用这样的数据训练出来的机器人,到了真实世界适应能力反而更强,因为它在虚拟世界里已经见过各种各样的极端情况了。

微分智飞走得更远。这家做飞行机器人的公司,把Seedance融入了飞行机器人应用,搞出了一套标准化、高难度的数据集生成流程。

在过去,障碍物闪避、室内自主寻路、智能目标锁定,甚至复杂镜头运动下的姿态调整,这些场景如果用真实无人机去测,成本高、风险大,还不一定能复现。

改用Seedance生成以后,想生成多少生成多少,想多极端有多极端。

具身智能这个赛道,大家都在抢数据,谁的数据多、数据质量高,谁的模型就跑得快。以前这条路是堵死的,数据只能靠真实场景一点点攒。现在有了AI视频生成,相当于开了个数据外挂。

同时,Seedance目前也进入到了工业培训环节。

徐工集团就是如此,他们把Seedance用在了工业操作培训和工序SOP视频生成上。

以前工人培训,要么老师傅带,要么拍教学视频,要么做3D动画。但是拍视频和3D动画不仅贵,后面想要升级、改变工序,那么整个视频就得重新拍。

现在用Seedance生成,输入一段文字描述,直接生成标准的操作演示视频。哪怕后面工序改了,改改提示词重新生成一遍就行。

从机器人训练到工业培训再到产品设计,Seedance已经不只是一个做视频的工具了。它正在变成一种基础设施,渗透到实体产业的各个环节里。

03

能延续Seedance 2.0的神话吗?

6月FORCE 大会后的媒体沟通会上,有记者问火山引擎总裁谭待,说外面都在传Seedance单月收入超过10亿、毛利率70%,是不是真的?

谭待说,外面所有传的Seedance收入数据都是错的,而且偏高。他还补了一句话:“给我压力很大,财务天天问我是不是藏数了。”

“你想啊,文本生成一个token几分钱,视频生成一秒钟就得几块钱。30秒4K视频,一跑就是几十上百块的算力成本。用户越多,亏得越多。”

谭待表示,Seedance定价偏低。2.0 Mini版本每秒1.6分,标准版也贵不到哪去。这个价格,别说赚钱了,能不能覆盖算力成本都不好说。

谭待认为,现在外界过度关注Seedance的短期收入,是低估了它的技术意义。

谭待所指的技术意义,指的是视频生成是构建世界模型的基础。

Seedance对于字节来说,不只是一个赚钱的产品,它是字节整个AGI战略的一个核心抓手。现在亏的钱,是在给未来的世界模型交学费。

前面说的具身智能、工业仿真、自动驾驶,都是万亿级的市场,如果视频生成模型真能变成世界模型的雏形,那现在这点投入根本不算什么。

更重要的是,Seedance不是孤立在烧钱。它跟豆包、即梦、剪映、火山引擎是联动的。模型能力提升了,整个产品矩阵都受益。

这本身也是字节习惯的套路,用大规模投入换技术领先,再用技术领先换生态壁垒,最后用生态壁垒赚长期的钱。

但客观说,这条路也不是没有风险。

第一,世界模型这条路到底走不走得通,谁也不知道。

视频生成能力强不等于就能做出世界模型,中间还差着好几个量级。如果最后证明这条路走不通,那前面投的钱就打水漂了。

6月的时候,AI教母李飞飞写了篇文章,标题为《世界模型的功能分类》(A Functional Taxonomy of World Models),文章提到,市面上的世界模型分成三类:渲染器、模拟器、规划器。

视频生成模型属于第一类,优化的是视觉可信度,不是物理准确性。画面看着很美,但你没法信任它去设计一栋建筑或者训练一个机器人。

字节自己也有前车之鉴。Seed旗下的科研团队AI4S,今年也经历了一轮大调整,首席科学家顾全全、计算生物学负责人肖文之等核心成员相继离职创业。

在前沿探索上,投入大、周期长、不确定性高,哪怕是字节,也不是每条路都能走通。

第二,竞争对手也在追。可灵、Vidu、Veo,除了这些大家早已熟知的,现在还多了阿里的HappyHorse。Seedance现在领先,但领先优势能保持多久,不好说。

如果大家性能逐渐相似了,到时候行业再把价格战打起来,亏损只会更大。

第三,回到了谭待一开始提出的问题,定价高了没人用,定价低了亏死,视频生成作为一个新兴产业,它太年轻了,商业化的节奏不好把握。

怎么在技术投入和商业回报之间找到平衡点,是个大难题。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。