21CTO导读:在中美科技博弈白热化、大模型价格战空前激烈的关键节点,字节跳动创始人张一鸣向内部 Seed AI 团队下达了清晰的战术指令:放弃通过 “模型蒸馏” 捷径换取排行榜名次,宁可牺牲短期利益,也要坚定走长远的底层自主研发路线。
张一鸣在会上极其罕见地明确要求:即便在短期内需要承担性能指标下移、排行榜名次下滑的代价,字节跳动的 AI 团队也必须避免通过借鉴、复制或提炼竞争对手的模型系统来改进自己的 AI 产品。
他原话这样说的:“表示哪怕是落后,也不能把 AI 蒸馏,当作提升模型能力的捷径。”
在此次会议中,张一鸣再次提及了他一贯坚持的商业哲学 ——“延迟满足”。他这样强调道:
“人工智能的底层开发需要的是极其宏大的长远眼光和真正的延迟满足,而不是利用别人的成果去换取短期的排行榜排名。为了长远的终极目标,我们完全可以、也必须牺牲掉一些短期利益。”
张一鸣进一步向研发团队剖析,从长远来看,过度依赖对外部强模型的 “提炼”,虽然能在短期内迅速拉升模型指标,但会让人产生技术捷径的幻觉,进而从根本上阻碍和干扰真正意义上的底层技术创新与结构性突破。
在人工智能领域,“模型蒸馏” 原本是一种常见的模型压缩技术 —— 研发人员将能力极强、参数量庞大的 “教师模型”(如 OpenAI 的 GPT-4 或 Claude 3.5)产生的输出数据作为训练集,去投喂、训练参数量较小的 “学生模型”。
优势是:它能够以极低的时间和算力成本,将大模型的推理、逻辑与表达能力 “搬运” 到小模型上,使其在特定评测集(Leaderboard)中跑出极高的分数;
同时生出很多隐患:蒸馏出来的模型本质上只是对 “教师模型” 行为特征的摹仿(Mimicry),并没有真正掌握底层的涌现与泛化能力。一旦遇到超出蒸馏数据范围的复杂场景,模型便会迅速露怯。
随着国内 AI 大模型市场竞争趋于白热化,各大厂商纷纷打起价格战与性能战,追求 “快速出成果” 的浮躁心态让部分开发者对 “蒸馏” 产生了强依赖。创始人张一鸣的禁令,无疑是在字节跳动内部给这种 “甜头” 敲响了警钟。
一段时间以来,华盛顿及 OpenAI、Anthropic 等美国头部 AI 巨头屡屡向中国同行发难,指责部分中国 AI 企业通过 API “套取” 或 “蒸馏” 其专有大模型的输出数据,用来训练“国产”模型。
随着这一技术争议上升为国家层面的科技竞赛焦点,双方的对抗正急剧升级:
美国财政部长斯科特・贝森特(Scott Bessent)日前发出强硬警告,声称美方正在密切调查相关行为,涉事企业可能面临来自华盛顿的严厉金融制裁,甚至被直接列入美国商务部的贸易实体黑名单(Entity List);
中方针对美方的指控与威胁,亦提出了严正批驳,指出华盛顿频繁滥用国家安全概念搞 “人工智能霸权主义” 与技术封锁,并明确表示中国将保留采取相应反制措施的权利。
对于业务横跨全球的字节跳动而言,恪守数据合规边界、建立完全自主可控且无版权瑕疵的数据训练全流程,不仅是研发战术的选择,更关乎整个集团全球化战略的合规安全红线。
然而,在面对全球 AI 巨头的竞速时,字节跳动公司大概率选择了最难走但也是最稳固的一条路。
放弃模型蒸馏,意味着字节跳动必须从最原始的数据清洗、预训练、强化学习(RLHF)以及复杂的架构设计做起。这需要投入数以亿计的算力资源与数年的漫长研发周期,且无法保证短期内能在公开榜单上碾压对手。
但正如张一鸣所倡导的那样 —— 在真正决定人类未来的科技战场上,从来就没有捷径可走。
是的。能够决定最终胜负的,不是靠借力跑出来的虚假名次,而是那些经得起时间考验、能够独立开拓人类技术边界的真正突破。
各位认为呢?欢迎讨论。
作者:场长
本篇文章为 @ 场长 创作并授权 21CTO 发布,未经许可,请勿转载。
内容授权事宜请您联系 webmaster@21cto.com或关注 21CTO 微信公众号。
该文观点仅代表作者本人,21CTO 平台仅提供信息存储空间服务。
请扫描二维码,使用微信支付哦。