《DeepSeek 的硬件大棋:用存储换算力撬动 AI 生态》
作者认为 DeepSeek 的开源和架构创新不是不赚钱,而是在用 KV 缓存压缩、存储换算力和工具链建设,降低对 HBM、CUDA 和顶尖 GPU 的依赖,扶持中国 AI 硬件生态。
🧠 agentic reading|1️⃣ 精准输入
导语
这篇文章给出一个大胆判断:DeepSeek 不急于卖编程订阅、多模态或语音服务,是因为它的目标不是眼前应用收入,而是通过模型架构和开源技术,降低中国 AI 硬件生态对 HBM、先进 GPU 和 CUDA 的依赖,撬动一个 10 万亿美元级产业链。
1. DeepSeek 的反常行为需要一个更大的解释
作者先列出 DeepSeek 看似“不赚钱”的反常行为:不推出有竞争力的编程订阅,不做多模态、语音和视频,长期开源,还公开分享核心技术。若按应用公司逻辑,这像是在烧钱;但作者认为,梁文锋盯着的是更大的奖杯:让 DeepSeek 自己冲击 1 万亿美元市值,同时帮助中国形成 10 万亿美元级 AI 硬件生态。
DeepSeek 的技术路线一直逆风而行:选择难训练的 MoE,发明 GRPO 替代 PPO,使用 RLVR 提升推理,多 Token 预测带来投机解码和更密集训练信号,做零气泡流水线并行,开源专家负载均衡器,发展 MLA、DSA、CSA、HCA 等注意力机制来压缩 KV 缓存,又通过 Engram 用内存换算力,通过 mHC 稳定超大模型训练。
这些创新如果串起来看,目标不是让 DeepSeek 在某个应用功能上领先一点,而是系统性降低大模型训练和推理对稀缺高端硬件的依赖。
2. KV 缓存压缩打开长程智能体的成本空间
文章用 100 万上下文的 KV 缓存计算说明 DeepSeek 的核心优势。假设 KV 精度为 8-bit、索引器精度为 16-bit,DeepSeek V4 只需要 5.48GB HBM;GLM5 需要 60GB;Qwen3-235B-A22B 需要 89GB。更夸张的是,DeepSeek 是 1.6T 参数模型,GLM5 约 700B,Qwen3 只有 235B。
如果这种压缩被广泛采用,长程 AI 智能体的成本会大幅降低。因为长任务中缓存很小,就能把 long-held cache 转存到 SSD,并在需要时快速加载,避免每次重新计算。DeepSeek 还开发了从 SSD 高速重载 KV 缓存的技术。
这直接绕开 HBM 瓶颈。HBM 是全球短缺、制造难度极高的 AI 硬件关键部件;而中国在 NAND 闪存和 SSD 上有长江存储等本土力量。DeepSeek 把问题从“缺最先进显存”转移到“用更便宜、更充足的存储保存和重载缓存”。
3. NAND、LPDDR 和 Engram:用存储换算力
作者继续扩大存储逻辑。NAND 可以保存 KV 缓存,避免重复计算;LPDDR 则可作为模型权重的“大后方”,把权重按需流式传输到 HBM,减轻 HBM 容量压力。DeepSeek 的 MoE 架构专家数量庞大,并支持 4-bit 权重,天然适合这种方案。
LPDDR 还可用来存储海量 Engram。传统 Transformer 缺少天然知识检索机制,只能用昂贵计算模拟检索;Engram 用基于哈希、时间复杂度近似常数的瞬间查找,创造“条件内存”维度。代价是需要巨大内存空间,但好处是用便宜读存储替代昂贵前向计算。
这对中国硬件生态尤其重要。由于 EUV、先进封装和顶尖 GPU 的限制,中国芯片在原始 FLOPs 上可能长期落后。DeepSeek 的路线是在算力不足处减少计算,在存储充足处增加存储,用中国更可能供给的 NAND 和 LPDDR 补足高端算力短板。
4. 从模型创新到硬件生态扶持
作者把 DeepSeek 的关键技术逐一解释成“硬件友好”的生态设计。V2 中 MoE 让训练聪明模型减少 40% 到 50% 算力,MLA 把 KV 缓存砍掉 90%,让缓存转存 SSD 高效可行;DSA 降低长上下文计算量,减轻 HBM 带宽压力;mHC 用多条跨层信息高速公路稳定超深模型,只增加约 6.7% 训练时间,却显著提升推理和知识评测表现;CSA 与 HSA 继续压缩 KV Token,把缓存需求再砍 90%。
这些技术共同让国产 GPU、ASIC 和网络交换芯片从“不够顶尖”变成“在优化工作负载下够用”。DeepSeek 还重度投入 TileLang,让工程师一次编写高性能内核,就能在不同后端硬件上运行,从侧面绕开英伟达 CUDA 护城河。这个工具不仅帮助中国硬件,也可能帮助 AMD 等西方挑战者。
DeepSeek 的开源不是单纯理想主义,而是在把自家模型需求变成硬件厂商的设计规范,把模型实验室变成生态编排者。
如果这个生态形成,模型创新、编译工具、存储器件和国产算力芯片会互相抬升,而不是各自孤立追赶英伟达。
5. 更便宜的算力将打开强化学习和自动化研究
当计算需求下降、硬件选择增加,DeepSeek 就能挑战更大的训练计划,尤其是后训练阶段的强化学习。强化学习需要生成海量思考轨迹,动辄数万亿 Token;要训练支持 100 万上下文的模型,也必须生成同等长度的轨迹。这在旧硬件约束下极其昂贵。
作者认为,硬件多元化还会让 DeepSeek 拥有余力冲击 RSI,即让 AI 自主设计和执行算法实验的“自动化人工智能研究”。这种模式需要大量试错,成本极高,但若要探索算法设计未知空间,并走向 AGI/ASI,就必须先点亮这棵科技树。
6. 商业模式:技术换股权,生态换市值
最后,作者提出 DeepSeek 的赚钱方式可能类似 OpenAI 与 AMD、Cerebras 的交易:随着 OpenAI 采购和消耗芯片达到里程碑,OpenAI 可低价获得 AMD 或 Cerebras 的认股权证或期权。硬件公司获得超级客户绑定,AI 公司获得生态升值收益。
作者大胆预测,DeepSeek 正在或将会与中国存储、ASIC、CPU、网络协议栈等厂商签订类似协议。DeepSeek 通过联合调优帮助本土硬件承接全球顶尖 AI 工作负载,并以股权、期权或生态利益分享获得回报。
西方及其东亚盟友的 AI 概念股总市值已超过 10 万亿美元。作者认为,DeepSeek 若能在中国复制一个同体量硬件生态,并切走其中最肥的一块,就比卖订阅赚得多得多。它的商业闭环不是“模型收费”,而是“让整个替代硬件生态升值,并在升值中占位”。
结论
文章的判断非常激进,但解释力在于它把 DeepSeek 的技术选择、开源策略、注意力机制、存储优化、TileLang 和潜在股权合作串成一条线:降低 AI 对 HBM、CUDA 和顶尖 GPU 的依赖,把中国更有机会供给的 NAND、LPDDR、ASIC 和网络生态推到中心位置。如果这条线成立,DeepSeek 的护城河不是某个模型,而是它重写 AI 硬件成本结构的能力。
思想框架
文章先提出“DeepSeek 如何赚钱”的反常问题,再用 KV 缓存和存储替代算力解释技术底层,随后扩展到中国硬件生态和开源工具链。最后借 OpenAI 与硬件公司的股权绑定案例,推导 DeepSeek 可能通过扶持产业链来获取超级回报。
建议阅读原文:这篇是中文内容,精准输入只帮助你快速抓住重点,原文的叙事、语气和细节仍值得回读。
baoyu.io · 3 分钟
✍️ think & write|2️⃣ 费曼输出
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。