中国人工智能初创公司 DeepSeek 从纯软件开发向全面垂直整合战略转变。据路透社消息,大约一年前,该公司开始开发自己的专用处理器(ASIC),专门针对 推理 (数据输出),而不是新模型的训练。
这一转变标志着公司的成熟:从打破市场的算法破坏者,DeepSeek转变为全栈技术巨头,致力于实现完全的计算主权。
⚙️战略焦点:为什么是推理,而不是训练?
专注于推理的决定在技术和经济上都是合理的:🔹 规模经济:模型训练是一次性(尽管巨大)的资本支出。而推理则产生持续的运营支出(OPEX),这些支出与用户数量成正比。🔹 架构优化:推理芯片不需要像训练芯片那样具有巨大的内存和互连带宽。这使得可以创建更节能、更便宜的专用解决方案,完美适应DeepSeek特定的模型架构(例如,MoE - Mixture of Experts)。
目前,该项目处于早期阶段:DeepSeek正在与外部合作伙伴进行秘密谈判,讨论架构设计、内存供应和合同制造问题。同时,公司正在积极招聘芯片架构师,创建内部硬件开发部门。
🌍地缘政治背景:硬件依赖性的演变
开发自己的“硬件”是对美国升级出口控制的直接回应,DeepSeek的创始人连文凡在2024年就称这是公司面临的主要系统风险。
DeepSeek硬件演变的历史清楚地展示了这一过程:
- Nvidia时代:基础模型R1在Nvidia H800芯片上进行训练,这是专为中国市场定制的削减版。
- 华为时代:2026年4月,DeepSeek推出了适应Ascend架构的V4模型。华为证实,他们的处理器被用于部分V4-Flash的训练。
- 主权硅时代:自有芯片旨在彻底摆脱对Nvidia有限供应和华为供应链潜在瓶颈的依赖。
🛠生态系统构想:芯片+Code Harness
DeepSeek的硬件计划与最近组建团队开发 Code Harness 的消息完美契合,这是一个旨在与Claude Code(Anthropic)和Codex(OpenAI)竞争的自主编程工具。
编写和检查代码的自主AI代理需要超低延迟(low latency)和高吞吐量来处理每秒数千个小请求。专门针对这种负载模式优化的自有推理芯片,将为DeepSeek提供关键的竞争优势,使Code Harness服务的速度和成本具有竞争力,使产品在大规模上具有经济可行性。
⚠️实施的障碍和风险
尽管计划雄心勃勃,但路透社公正地指出,项目的成功并不是必然的。DeepSeek将面临前所未有的挑战:
🔸 生产瓶颈:即使有出色的设计,也需要使用ASML的光刻设备和TSMC的生产能力来生产先进的技术过程(小于5纳米)的芯片,这些设备受到美国出口限制的严格控制。DeepSeek将不得不依赖国内的中国工厂(例如,SMIC),这些工厂在良品率方面仍然落后。
🔸 激烈的内部竞争:在中国定制AI芯片市场上,已经有一些预算庞大的重量级玩家,如阿里巴巴(T-Head/Yitian系列)和百度(Kunlun)。
🔸 全球竞赛:DeepSeek不仅与中国的巨头竞争,还与开发自有“硬件”的全球玩家(如OpenAI、Broadcom、Anthropic)竞争,这些玩家拥有更深的口袋和对世界最好的代工厂的访问。
🔸 激烈的内部竞争:在中国定制AI芯片市场上,已经有一些预算庞大的重量级玩家,如阿里巴巴(T-Head/Yitian系列)和百度(Kunlun)。
🔸 全球竞赛:DeepSeek不仅与中国的巨头竞争,还与开发自有“硬件”的全球玩家(如OpenAI、Broadcom、Anthropic)竞争,这些玩家拥有更深的口袋和对世界最好的代工厂的访问。
📌 要点:
• DeepSeek正在开发自己的AI芯片,专门针对推理,而不是训练
• 项目大约一年前启动,目前正在与设计、内存和生产合作伙伴进行谈判
• 主要目标:在美国出口限制的背景下,减少对Nvidia(H800)和华为(Ascend)的依赖
• 硬件开发与Code Harness的启动相辅相成:自有芯片将为AI编程代理提供低延迟和低成本
• 主要风险:对先进的海外工厂(TSMC)的访问受限,与阿里巴巴/百度和全球玩家的高竞争
Русский
English
中文
भारतीय
Eesti
Español
Deutsch
Български
Türkçe
Portuguesa