不,你无法用600万美元复制一个DeepSeek R1

发布日期:2025-02-05 05:21:54 点击次数:67

中国AI创业公司企业DeepSeek最新发布的R1模型震惊美国股市,关键在于其相对低廉的训练成本,不过深入分析其过程就知道,并不是花600万美元就能复制一个相同的模型。

无论华尔街玩的是什么套路,DeepSeek R1模型真正让人惊叹的,是它极度便宜的训练成本,根据DeepSeek宣称,训练成本仅557.6万美元,几乎是其他科技巨头大型语言模型的十分之一成本,这个费用也差不多是一位AI主管的年薪而已。

这个惊人的宣示实际上未必如此惊天动地,我们需要一步步拆解他们的模型训练方式,就能了解其中奥妙。

首先,DeepSeek和R1模型并非一步登天,R1模型的训练费用其实和去年底发布的V3模型相同,而V3模型中的多数功能又和2024年初发布的V2模型共享。

在V2模型里,他们导入了两个重要的组件:DeepSeekMoE和DeepSeekMLA,前者代表了多重专家混合(Mixture of Experts),和ChatGPT4一样,他们将训练出的AI分为多种专家,根据对话内容调用合适领域的专家,以完成更精准而高效率的回应。后者则是多头潜在注意力机制(Multi-Head Latent Attention),在AI对话中,需要加载模型和文本,每个token需要对应的key和value,MLA则能够压缩value的存储空间,进而减少内存需求。

DeepSeek V3模型架构图。(Source:Github)

到了V3模型,他们再根据以上基础,导入负载均衡和多重token预测机制,进一步提升训练效率,根据DeepSeek宣称,训练V3模型总共使用278.8万H800 GPU工时,依每工时2美元推算,整体训练成本就是557.6万美元。

而R1模型的训练成本据称与V3模型相同,换言之,想要做出R1模型,并不是拿H800跑280万个工时就能做出来,还必须有前置研究、反复实验和前置算法架构。

相反地,从目前实测结果来看DeepSeek R1的表现与ChatGPT O1确实不相上下,甚至有自己的优势,既然DeepSeek是开源架构,就代表其他科技巨头可以用相似的模块,投入上百万或上千万个更高端的H100 GPU工时去训练模块,如此则能获得十倍于DeepSeek R1的成果。

从这个角度来看,你觉得NVIDIA有什么好紧张的吗?

(首图来源:NVIDIA)