
赫拉克勒斯是希腊神话中的大力神,但他并非生来就是英雄。他杀了九头蛇、捉了牝鹿、扫了牛棚、摘了金苹果,完成了十二项试炼,英雄的身份才被确认。整条路走完,终点才被看见。
中国大模型的进程与此相似。文本基座从追赶到齐平,推理成本从高昂到普惠,商业化从质疑到验证。一项接一项,像在完成某种沉默的十二试炼。
7月31日,中国大模型的试炼里程碑又多了一项:沉积许久的MiniMax,发布了最新多模态模型H3。在此之前的很长一段时间里,这家公司承受着资本市场的严苛。H3的出现,让局面有了微妙的变化。 在我们试用H3之后,一个判断逐渐清晰:H3的效果已经达到甚至超越了Seedance级别的水平,真正站上了多模态视频生成的前沿。
中国大模型,又完成了一项试炼。而这,也将是MiniMax价值重估的新奇点。
01又一个里程碑
这次MiniMax H3的推出,将多模态模型从技术演示推向了生产力场景。理由有三。
第一,全模态输入。
维特根斯坦在《逻辑哲学论》里写过一句话:我的语言的界限意味着我的世界的界限。这句话在大模型时代有了新的含义——你的表达能力有多宽,AI能帮你实现的边界就有多远。
但每个人的表达能力并不相同。有人能用文字精确描述一个画面,有人脑子里有一个完整的场景,却无论如何也说不清楚。这时候,全模态输入的价值就显现出来了。
MiniMax H3不再把图片、视频、声音的生成、编辑和参考拆成彼此独立的任务,而是由文本、图像、视频与声音共同构成多模态上下文,统一理解创作意图。
换句话说,多模态输入拓宽了用户表达的边界。那些过去因为“说不清楚”而无法实现的想法,现在有了新的表达路径。
我们用H3生成了第一视角在老北京胡同中拍照的场景。用纯语言描述时,胡同的背景很难锚定,手机第一视角的表述也不够精确,但在H3模型中,直接将老北京胡同的场景和手持手机的人物作为参考输入,输出的景深、色彩、物品细节都非常完美,效果惊人得好。
这种能力让H3能够与实拍和传统视觉生成工作流形成有机结合,做的是“AI增强”而非“AI替代”。商用级的多场景内容生成,覆盖影视、广告、游戏、品牌、电商等高频场景,让H3从一开始就嵌入了生产力场景之中。
02价值回归的奇点
现如今围绕模型企业的资本开支和定价的争论,在大洋彼岸和国内市场都从未停止。AI产业链已创造超过1000亿美元的年化收入,这个数字放在任何行业都足够惊人。但相比早已突破万亿美元的资本投入,仍然显得微不足道。
今天所有大模型企业共同面对的现实:几乎没有一家公司能靠现有商业化收入完全覆盖Infra投入。
资本市场赌的显然不是现阶段大模型企业的内含价值,赌的是商业模式的颠覆性替代。大模型的替代能力:替代搜索、替代撮合、替代内容生产、替代代码编写,会在未来十年,系统性地蚕食互联网巨头最核心的利润池。
这个逻辑在方向上是成立的,但资本市场对“终局”的定价正在变得更加挑剔。当越来越多公司能够接近前沿模型水平时,单纯依靠模型性能领先已经难以形成长期估值溢价,真正考量的是模型能不能嵌入生产流程,而是成为可被量化评估的生产力工具。
在多模态领域,想要真正成为有替代性的模型,有两点核心要素:
其一,可掌控性。
视频创作的本质是反复修改。镜头不满意,要重拍;动作不自然,要调整;台词和画面氛围不匹配,要替换。传统的AI视频模型更像是“一锤子买卖”——输入提示词,生成一段视频,如果不满意,就再生成一次,直到碰巧出现一个能用的版本。这种抽卡式的内容创作效率太低。
H3改变了这个逻辑,支持多种维度的编辑与修改:角色替换、动作参考、背景替换、背景特效、台词替换与氛围感理解,并具备高精度的指令遵循能力。
创作者不需要因为一个细节不满意就从头生成,只需要精准地告诉模型“换掉这个角色”“调整这个背景的色调”“把这段台词换成另一句”,H3会在保持整体一致性的前提下完成精准修改。
影视制作、广告拍摄、游戏CG——这些对可控性要求极高的商业化场景,正是H3最擅长的领域。可掌控性解决了“敢不敢用”的问题。
其二,成本的可控性。
再好的模型,如果推理成本高到企业用不起,就只能停留在技术演示阶段。
高盛在研报中多次强调,推理成本压力正在推动大模型定价从激进竞争向理性阶段过渡。大模型从“能用”到“大规模用”,中间隔着的就是成本这道坎。
MiniMax在成本端的技术积累由来已久。H系列模型一直在tokenizer技术上保持着持续的探索,而H3彻底革新了前代的tokenizer技术,在重建和易学性上取得了全面的提升。使得 H3 在效率上可以取得有竞争力的效果,同时其高压缩率带来了 4 倍的序列长度收益,大幅降低了训练和推理成本——这也是支持H3提供原生2K分辨率的关键技术。
与此同时,H3在异构训练、负载均衡和GPU利用效率等方面进行系统性优化,在保证模型效果的前提下持续压降成本。而现阶段,成本优势本身就是最核心的竞争壁垒。
技术效率最终体现在了价格上。MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。
可掌控性解决了“敢不敢用”,成本的可控性解决了“用不用得起”。 这正是资本市场在“终局”与“当下”之间的那道裂缝里,最想看到的东西。
当市场不再为“稀缺上市标的”支付溢价,资本从参数竞赛转向对商业化落地能力的审视,那些真正能嵌入生产流程、产生可衡量商业回报的公司,反而会在价值回归之后走得更稳。
MiniMax H3让MiniMax在视频生成这个细分赛道上,完成了从“概念溢价”到“生产力定价”的切换,因此这正是MiniMax价值回归的奇点所在。
03开源的远见
除了预期内的商业化潜力以外,真正决定H3能否在产业侧产生持久影响力的,是MiniMax持续坚持的开源路线。而我们认为,这次MiniMax延续开源路线的选择,非常合理。
产业级的采纳,从来不是靠一家公司推动的,而是靠一个生态。
十年前,Kubernetes只是谷歌内部一个管理容器的工具。开源后用了不到十年时间,成长为拥有超过八万八千名贡献者、来自八千多家公司的全球最大开源项目之一。Kubernetes提供了中立的底层基础设施层,让上层应用可以在AWS、Azure、谷歌云之间自由迁移而无需重写。Helm、Prometheus、Istio等一系列标准化工具,围绕其API标准形成了完整的工具链。开源可以定义行业标准,让生态中的每个参与者都从中获益。
这个逻辑正在AI领域重现,开源模型的战略价值正在被行业重新评估。
瑞银在2026年7月的研报中指出,部分开放模型已接近高端前沿模型的能力,运行成本可能只有后者的三分之一至四分之一。AI初创公司Baseten的估算更加具体:开放模型在性能上通常落后闭源前沿模型约九十天,但运行成本可低百分之七十至九十。
MiniMax H3延续开源,为模型能力和商业化能力铺下了两层地基。
降低企业对单一模型方的依赖。
半数财富500强企业正通过Hugging Face部署私有模型或开源模型,倾向于根据具体业务定制多个模型,而非依赖单一供应商。开源模型让企业可以自主选择部署环境、基础设施和服务,减少对单一模型方的锁定风险。
在视频生成这个赛道上,企业的选择不再只有一家闭源供应商:H3的开源意味着他们多了一个可控、可定制、可私有化部署的选项。
满足企业对数据主权和私有化部署的需求。
视频素材往往涉及品牌资产、产品形象、商业机密等高度敏感的信息。影视公司不会愿意把自己的知识产权放到一个黑盒模型里去生成,广告主不会接受品牌视觉在每次生成时出现随机偏差。
开源模型允许企业自主选择部署环境,在自有服务器或私有云上运行,数据流向、访问权限和模型版本完全可控。这种“数据不出域”的能力,在合规要求日益严格的当下,正在成为企业级采购的核心考量。
此外,开源模型的价值在于被下载、部署、修改、优化之后产生的扩散效应。云厂商、推理平台、开发者、所有产业参与者都可以参与评测、适配、优化与改进。开源模型不需要在所有维度上击败最强闭源模型,只要在足够多的任务上“够用”,并且更便宜、更可控、更好部署,就会被源源不断地塞进各类场景。开放模型开始从“低成本平替”方案,进入能够影响企业技术架构和采购决策的前沿能力区。
MiniMax坚持了开源赛道,本质上是在提前卡位,抢占企业在“下一代生产力”采购决策中的优先级。这一点,也是我们看好MiniMax长期叙事的核心。
04结语:开始的开始
赫拉克勒斯完成了十二项试炼,但单独看每一件,都只是通往终点的一块基石。大模型的叙事也是如此。
从参数竞赛到稀缺溢价,再到商业化能力的全面检验,中国AI产业经历了三轮定价逻辑的切换。市场不再为“稀缺上市标的”支付溢价,但那些真正拥有技术纵深和落地能力的公司,反而会在回归之后走得更稳。
MiniMax也是如此。目前来看,资本市场基本卸掉了溢价的包袱,价值回归后反而获得了更干净的定价起点。
赫拉克勒斯的故事之所以成立,不在于完成了哪一项任务,而在于他一项接一项地完成了所有任务。MiniMax H3是一次节点式的爆发,但所有人都清楚,背后的压力和付出的努力,并不能被一两句言语所表达。
AGI的叙事从来没有一蹴而就,MiniMax价值的绽放才刚刚开始。