当前位置: 首页 » 资讯 » 科技头条 » 正文

赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

IP属地 中国·北京 编辑:钟景轩 时间:2026-08-08 04:06:10

张一鸣要的是,下一轮竞争中,Seed模型能力跻身世界第一梯队

作者丨高允毅

编辑丨岑 峰

近日,The Information爆出,在两周前的 Seed 全员会上,张一鸣罕见发声,明确拒绝以蒸馏手段追赶前沿大语言模型。他的态度很坚决:“字节跳动应该愿意为了长远目标牺牲一些短期利益。”

最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,智谱 GLM 5.2 Max、DeepSeek V4 Flash 分列第七、第八,中国模型已占据全球前十近半席位。反观字节 Seed 2.1 Pro,仅排在第 21 位,远低于其他中国模型。

论钱,字节年利润规模位居互联网头部;论人,Seed 团队汇聚了搜广推体系成长起来的顶尖算法人才;论算力,数万张 GPU 集群的智算中心正在全国铺开;论数据,抖音与 TikTok 坐拥全球最大的原生内容池。

样样不缺的字节,为什么在大模型榜单上追不上?

据字节员工透露,公司内部认为,字节不愿蒸馏,被认为是其大语言模型落后于中国其他人工智能实验室的原因之一。

01

三次被否决的“兵变”

蒸馏(Distillation),通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的“捷径”。而在公开报道中,字节内部至少有三次关于是否蒸馏的路线之争。

第一次冲突是在2025年1月。DeepSeek-R1横空出世,其推理风格席卷全球。Seed内部就有研究员提议跟进蒸馏,张一鸣拒绝了。他要的是 Seed 像人类一样“学习如何思考”,而不是学会模仿 R1 的“碎碎念”。

第二次冲突是英伟达Blackwell芯片部署后。算力差距拉大,对手拿到了英伟达最新的入场券,字节只能靠 H20 苦撑,蒸馏呼声再起。但张一鸣再次说不,字节选择增资2000亿,在乌兰察布和怀来加盖智算中心。

然后是Kimi K3成功跻身全球顶尖模型榜单带来的压力。每次国内开源新模型发布,都是一次压力测试。内部焦虑达到顶点,但在张一鸣眼里,榜单是虚的,商业主权是实的。

张一鸣每次都顶住了。据接近Seed的人士透露,内部对开源模型的蒸馏禁令通过API检测等技术手段硬性执行,早在2023年4月就已明令禁止将GPT生成数据混入训练集。

“字节刚开始也做蒸馏,后来张一鸣痛定思痛,说我们还是要走长远路。阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。” 国内某大厂高管曾对AI科技评论这样说。

大模型的蒸馏可以用“背老师的作业答案”来形容。这条路见效极快。几百万条高质量指令数据灌进去,模型在基准测试上的分数能在短短几周内突飞猛进,快速逼近被蒸馏模型的水平。在大模型竞速的早期,几乎所有玩家都试过这招。

但随着赛道进入深水区,争议随之爆发。2026 年以来,Anthropic 连续公开指责 Minimax、月之暗面、DeepSeek、阿里通义实验室存在蒸馏其模型的行为,将中国大模型的快速崛起直接归因于 “抄捷径”。

不过,颇具讽刺意味的是,Anthropic 自身也被曝多次蒸馏 OpenAI 模型、使用盗版书籍数据训练。

真正让张一鸣坚持 “不抄捷径” 的,是更深层的技术判断:在数据见顶、算力匮乏、全球模型 PK 进入白热化的阶段,靠蒸馏永远只能追在别人身后,甚至会在下一轮智能跃迁中彻底掉队

02

四个工程“死理”:为什么字节为何不做“蒸馏派”

从技术角度而言,字节 Seed 坚持从头训练而不做“蒸馏派”,是一套环环相扣的技术演进逻辑。从头训练虽然痛苦,但它是突破天花板的唯一解。

▎拒绝合成数据的"近亲繁殖"陷阱

蒸馏的本质,是用别人模型的输出当 “标准答案” 来训练自己的模型。它看起来高效,却藏着一个不可逆的致命缺陷:模型坍缩。

2024 年 7 月,牛津、剑桥等机构的联合研究登上《Nature》封面,首次系统证实,如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。

就像近亲繁殖,第一代看起来健康正常,但基因多样性在快速流失,繁衍几代后,隐性缺陷会集中爆发。

而ICLR 2025 的 Meta 研究进一步证实,训练数据中哪怕只掺入千分之一的合成数据,就足以触发模型坍缩;比例再低,毒性效应依然存在。而且模型参数量越大,在特定阈值下坍缩效应反而会被放大。不是堆参数就能解决问题。

为什么尾部信息这么重要?

真实世界的知识不是均匀分布的。常见问题、标准回答只占信息分布的 “头部”,而那些罕见的边缘场景、反常识的提问、方言俚语的微妙语义、小众领域的专业知识,都藏在分布的 “长尾” 里。这些长尾信息,决定了模型处理未知问题的上限,也是真正的智能边界。

AI 生成的 “标准答案”,天生就会抹平这些长尾。模型输出的永远是概率最高的回答,它会自动过滤掉小众、反常、不确定的内容,只留下最 “正确” 也最平庸的结果。用这样的数据反复训练,模型会变得越来越自信,也越来越狭隘。虽然基准测试分数可能还在涨,但它的 “世界观” 已经在悄悄坍缩。

这就是蒸馏的天花板,你永远只能逼近别人的能力上限,而且越追,自己的边界越窄。

字节最大的底气,恰恰是数据。抖音日均产出超 8000 万条短视频,头条日均推荐内容以亿计,海外 TikTok 覆盖 150 多个国家和地区,这是全球最庞大的原生人类内容池。从 PB 级的真实视频、文本、评论、交互数据中清洗降噪,比直接拿来几百万条 GPT 生成的干净指令难得多,但只有原生真实数据,才能完整保留现实世界的分布,包括那些奇怪、鲜活、不可预测的长尾。

Scaling Law 的本质,是用更多高质量真实数据推高智能的天花板。合成数据只能在已有边界内做平滑,永远无法突破边界。字节选的,是一条自己定义天花板的路。

▎拿回词表里的技术主权

很多人忽略了一个最底层的细节:词表。

词表是模型的 “眼睛”,它决定了模型把一段文字切分成多少个基础单元,每个单元对应一个向量表示。用别人的词表,就等于接受了别人的语言偏好和认知颗粒度。

比如 Llama 的词表是针对英语优化的,遇到中文成语、网络热梗、弹幕缩写,常常会被拆成四五个零散的单字。这不仅会大幅降低推理效率、拉高成本,更关键的是,语义的关联性被切碎了,模型从输入层就没真正理解中文的表达逻辑。

更致命的影响在多模态领域。

字节 Seed 系列的核心战场从来不是纯文本大模型,而是原生多模态。Seedance 2.0 已经实现原生音画同步的视频生成,支持 60 秒 2K 分辨率视频和 8 种语言的唇形对齐。这种能力的前提,是模型在底层就实现文本、视频帧、音频信号的原子级映射:每一个语义单元,都要和对应的视觉、声学单元在同一个向量空间里对齐。

如果你蒸馏了别人的模型,你继承的就是别人的编码地基。别人怎么切分视频 Token,你就得怎么切分;别人怎么对齐音文时序,你就得怎么对齐。后天微调可以改参数、调效果,但改不了底层的 Token 空间和语义框架。

不蒸馏,意味着字节可以从零定义规则:视频帧以什么粒度做 Token 化最合理、音频的节奏特征怎么编码进语言模型、多模态信号怎么做联合注意力…… 所有底层决策全部握在自己手里。

对要做视频生成、多模态交互的字节来说,地基的自主权,比短期的文本榜单排名重要得多。

▎硬件限制下的"重工业"内功

靠蒸馏做模型,本质是轻量级的 “微创新”:站在别人现成的基座上做微调,几百张 GPU 跑几周就能看到效果,见效快、成本低,是很多厂商快速追赶的首选路径。

但字节选的从头训练路线,完全是另一套游戏规则。要从零训练 200B 以上参数的 MoE 大模型,比拼的从来不是单点算法的优劣,而是整套工程体系的硬实力。这是真正的 AI “重工业”。

超大规模预训练里,最致命的指标叫MTBF(平均无故障时间)。一次完整的预训练周期往往长达数月,要调动数万张 GPU 并行计算。这期间任何一张显卡出现内存错误、任何一条高速链路发生通信闪断、任何一个算子触发精度溢出,都可能让整个训练任务中断,甚至导致前期投入的算力成本全部打水漂。

集群规模越大,故障发生的概率就越高。我们可以做一个简单推算:假设单张 GPU 的平均无故障时间是 10 万小时,那么由一万张卡组成的集群,平均每 10 小时就会遭遇一次硬件故障。如果没有毫秒级的故障检测、精准的断点续训和完备的容错恢复机制,大规模从头训练根本无从谈起。

对字节来说,这份挑战还要再上一个量级。受美国芯片出口管制限制,字节无法采购英伟达最新的 Blackwell 旗舰芯片,只能使用性能受限的 H20 芯片,单卡训练效率与海外顶尖平台差距显著。别人靠更强的单卡性能就能撑起训练效率,字节要追上差距,只能靠更大的集群规模、更高的资源利用率和更极致的工程优化来补。

这种先天限制,反而倒逼字节把基础设施能力推到了行业极限

公开信息显示,字节的训练集群已布局内蒙古乌兰察布、山西大同、河北怀来、张北、安徽芜湖等多个智算中心,搭建起数万张卡规模的分布式算力网络。2026 年字节 AI 基础设施资本开支已上调至超 2000 亿元,公司净利润同比出现明显下滑,核心原因正是三四季度算力采购与数据中心建设的集中投入。

张一鸣本人也将一半精力倾注在 Seed 团队。这笔千亿级的资金投入,加上创始人级别的注意力倾斜,押注的从来不只是某一个模型的效果,而是一整套能稳定支撑超大规模训练的全栈工程体系:从底层算子优化、集群通信调度,到训练故障恢复、算力资源管理,全部自主研发。

这套能稳稳撑起 “万亿参数从零训练” 的训练框架与基建能力,才是字节真正的技术护城河。走蒸馏路线的厂商,永远不需要攻克万卡级稳定训练的工程难题,自然也沉淀不下这套重工业级的系统能力。

当 Scaling Law 继续向前演进,模型参数规模持续攀升时,竞争的门槛会从算法转向工程。到那时,只有手握完整基建能力的玩家,才有资格留在牌桌上。

▎奖励模型的 “灵魂归属”:学答案,永远学不会思维

蒸馏学的是 “答案”,从头训练学的是 “思维”。

用别人模型的输出训练,你的模型学到的是对方的输出分布,包括说话的语气、回答的套路、甚至 RLHF 阶段被注入的价值观偏好。它知道什么问题该说什么话,但不知道为什么这么说;它模仿得了结果,模仿不了背后的推理链路。

更关键的是,模型的 “灵魂” 会打上别人的烙印。什么是好回答、什么该拒绝、什么场景用什么风格,这些底层偏好,在蒸馏过程中会被一并继承过来。后续你再做 RLHF、再调奖励模型,也只是在别人的地基上做装修,很难从根本上改变模型的行为模式。

而字节需要的,是完全对齐自身业务逻辑的奖励模型。

抖音的推荐讲完播率和互动率,电商讲的转化效率,短视频内容讲节奏感和视觉冲击力,这些独特的商业逻辑,必须深度植入 Reward Model,让模型在 RLHF 阶段就和字节系产品的目标对齐。

如果你蒸馏了GPT-4,模型的"灵魂"里刻着OpenAI的偏好逻辑。你在后训练阶段再怎么调,也是在别人的地基上装修。只有从头训练,从预训练到RLHF全链路自主,字节才能让模型真正对齐到自己那套极致的商业逻辑中。这不仅关乎效果,更关乎可控性。

03

字节的底牌:10万亿参数大模型

拒绝了捷径,字节的追赶路径是什么?答案正在浮出水面。

据《金融时报》报道,字节跳动正在讨论训练一个参数规模10万亿的大模型,显著超过阿里 Qwen 3.8-Max 的 2.4 万亿参数和月之暗面 K3 的 2.8 万亿参数,是目前国内已知参数规模最大的模型计划。该项目仍处于早期探索阶段,由 Seed Foundation 负责人项亮主导,与预训练数据负责人沈科协同推进,最终是否正式发布尚未确定。

这是一个非常 “字节” 的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。

Scaling Law 依然是当前大模型最可靠的进阶路径。在数据质量、训练效率达标的前提下,参数规模的提升会带来可预测的能力增长。当主流玩家还在 2-3 万亿参数区间内卷时,字节直接冲击10万亿,本质是用规模换时间,用更大的投入,跳过中间的追赶步骤,直接摸到下一个梯队的门槛。

但这同样是一场豪赌。

参数规模翻倍,训练难度不是线性增长,而是指数级上升。数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大的挑战。2000 亿资本开支、70% 的利润下滑、创始人一半的精力,所有筹码都压在了这条 “更慢更难”的路上。

这条路的价值,不止于技术本身。

当 DeepSeek 被 OpenAI 正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱,无论是全球化布局还是长期技术竞争,都站在更安全的位置。

未来 3 年,大模型的技术范式窗口期正在急剧收窄。头部玩家今天的技术路线选择,会决定未来十年甚至更久的竞争格局。

蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快,投入产出清晰可见。但它的代价,是永远失去定义终点的资格。

张一鸣在会议上,明确望大家以追求智能上限为目标,期待Seed 模型能力能跻身世界第一梯队。

技术主权,真正参与定义智能上限的机会,正是这条更难走的路的回报。

参考链接: https://www.theinformation.com/articles/bytedances-founder-rules-distillation-ai-models?rc=gznj9j

上车,雷峰网带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新