DeepSeek悄悄造芯:中国AI的下一张底牌,藏在推理芯片里

DeepSeek悄悄造芯:中国AI的下一张底牌,藏在推理芯片里

DeepSeek悄悄造芯:中国AI的下一张底牌,藏在推理芯片里

你有没有发现一个有意思的现象。

这两年国内大模型公司卷得飞起。

比参数、比榜单、比价格战。

但真正的高手,已经在布局下一层了。

昨天,36氪曝出一条消息。

DeepSeek正在秘密研发自己的AI推理芯片。

项目已经推进了约一年时间。

正在接洽芯片设计、晶圆代工和存储厂商。

同时在扩招芯片工程师。

这条消息刚出来的时候,很多人第一反应是:又一家大模型公司要造芯了?

但仔细看进去,你会发现这件事没那么简单。

DeepSeek走的路,跟Groq、Etched那些专用芯片公司不一样。

它不是先做一个通用的AI芯片,再往上跑模型。

它是反过来。

把自己的MoE大模型架构,直接硬化到硅电路里。

说白了,就是让硬件适应模型,而不是模型适应硬件。

这种思路,业内叫"软硬协同"。

但真正敢这么干的公司,没几家。

因为这条路的门槛太高了。

你得既懂模型,又懂芯片。

两边都得是顶级水平。

DeepSeek的MoE架构,本身就是它的核心优势。

MoE的意思是混合专家模型。

每次推理不用激活全部参数,只调用一部分专家。

这样既能保持大模型的能力,又能降低推理成本。

但MoE有个痛点。

专家选择的逻辑,在通用GPU上跑效率不高。

因为GPU是为稠密计算设计的。

MoE的稀疏性,在GPU上会浪费很多算力。

DeepSeek的思路很直接。

既然软件层面已经优化到顶了,那就直接做到硬件里去。

把专家选择的逻辑,直接做成芯片里的电路。

这样一来,每一次推理的调度,都是硬件原生支持的。

效率能提升多少?

文章里的判断是:性能可能比英伟达GPU做推理差一个档次,但单位token成本可能低一个数量级。

注意这句话的重点。

不是性能最强。

是成本最低。

这才是真正的杀手锏。

很多人看AI芯片,只看性能跑分。

但推理场景的核心矛盾,从来不是够不够快。

是够不够便宜。

大模型的商业化,最大的拦路虎就是推理成本。

一个用户问一个问题,模型生成几百个字。

看起来没什么。

但如果是百万级、千万级用户同时在用呢?

算力成本是指数级增长的。

现在行业里的共识是。

训练阶段,大家还能咬咬牙买英伟达的卡。

推理阶段,必须想办法降本。

不然营收的增长,永远追不上算力的消耗。

DeepSeek这步棋,就是奔着这个痛点去的。

它不跟你比谁的芯片跑分高。

它跟你比谁的token成本低。

如果真能做到单位token成本低一个数量级。

那意味着什么?

意味着同样的预算,你能跑10倍的推理量。

或者说,同样的推理量,你只需要1/10的成本。

这个差距,在商业竞争里是碾压级的。

你看,这才是真正的竞争。

不是在同一个维度里卷价格。

是直接往下钻一层,换个维度打。

别人还在比模型能力的时候。

你已经在算每一个token的成本了。

这不是同一个级别的思考。

还有一点值得注意。

DeepSeek大概率会用国产制程。

7nm或者更成熟的工艺。

这个选择很务实。

先进制程固然好,但产能受限,成本也高。

推理芯片要的是量大利薄。

用成熟制程,反而更容易把成本打下来。

这也是中国AI芯片的一条独特路径。

不靠最先进的工艺。

靠架构创新和软硬协同。

用成熟工艺,做出更适合特定场景的芯片。

这条路,英伟达不会走。

因为它的商业模式是卖通用算力。

越通用,越能卖高价。

但对于中国公司来说。

这条路反而可能是破局点。

你做你的通用GPU。

我做我的专用推理芯片。

咱们不在一个赛道上。

晶圆厂内部生产线

其实这件事更大的意义,还不在DeepSeek一家公司。

在于它释放了一个信号。

中国的AI产业,已经从"模仿者",开始走向"参与定义下一代计算架构"了。

前几年,国内大模型公司的思路基本是。

英伟达出什么卡,我们就用什么卡。

OpenAI出什么模型,我们就对标什么模型。

整个产业的节奏,是被海外牵着走的。

但现在不一样了。

有人开始从底层架构层面思考。

什么样的硬件,才是最适合大模型推理的?

什么样的模型架构,才能把硬件的潜力发挥到极致?

这种思考,才是真正的创新。

不是在别人划定的框架里卷。

是自己画框架。

当然,这条路也没那么好走。

造芯片的难度,比做模型大得多。

周期长,投入大,失败率高。

DeepSeek能不能做成,现在还不好说。

但方向是对的。

而且你会发现。

最近中国AI产业的突破,越来越多发生在这种"软硬结合"的地方。

不是纯算法,也不是纯硬件。

是两者交叉的地方。

华为的昇腾,走的是类似的路。

从芯片到框架到模型,全栈自己做。

虽然单卡性能未必追得上英伟达。

但整集群的效率,反而可能更高。

因为每一层都是为彼此优化的。

这就是体系化竞争的优势。

你单拿一个环节出来比,可能都不是最强的。

但合在一起,整体效率反而更高。

很多人看科技竞争,喜欢比单项指标。

这个参数差多少,那个跑分差多少。

但真正的产业竞争,从来不是单项比赛。

是体系跟体系的比拼。

从底层芯片,到上层应用。

中间每一层都要打通。

哪一层有短板,整体效率就上不去。

反过来说。

如果每一层都能协同优化。

产生的合力,会比简单加起来大得多。

DeepSeek造芯这件事。

你可以把它看成一个缩影。

中国AI产业,正在从表层的应用创新,往底层的架构创新走。

这个过程不会快。

可能需要三年、五年,甚至更长时间。

但方向是对的。

因为真正的壁垒,从来不是某一个模型或者某一款产品。

是你能不能在整个技术栈上,都有自己的东西。

那样别人才卡不住你。

最后说两句。

很多人喜欢问:中国AI什么时候能追上美国?

这个问题本身就有问题。

因为不是只有一条路。

不是说美国走了这条路,我们就得跟着走。

真正的超越,从来不是在别人的赛道上跑得更快。

是找到一条新的赛道,让别人不得不跟着你跑。

DeepSeek的推理芯片,能不能成,现在还不知道。

但这种"换个维度打"的思路。

才是中国AI最需要的东西。

不是比谁更强。

是比谁更不一样。


来源:36氪 发布时间:2026年7月22日