三周前,我在 Doha 的办公室同时打开两个终端:左边是 Ethereum mainnet 的 pending transaction 流,右边是国内技术社区的讨论串。那天晚上,一条消息像一根异常的大额转账一样卡住了我的注意力——梁文锋拒绝 KPI 和加班文化,而 DeepSeek 的估值刚刚突破了 600 亿美元。
作为一个在过去 26 年跟踪数据的人,我首先想到的不是这条新闻有多震撼,而是那个数字——600 亿——在链上会对应多少笔交易、多少 TVL、多少真实的使用量。我需要拆解它,就像拆解一个高收益的 DeFi 协议那样。Dữ liệu on-chain không nói dối,但 off-chain 的商业叙事却常会。所以这篇文章,我用处理链上数据的方法,来处理 DeepSeek 的公开技术报告、招聘信息、和融资传闻。
首先,我们必须澄清一个关键词:‘效率’。DeepSeek 技术路线的核心特征不是规模优先,而是效率优先。这个判断不是来自媒体的渲染,而是来自一组硬数据。
根据 DeepSeek-V3 的技术报告(2024 年 12 月发布),该模型总参数量为 6710 亿,但激活参数仅为 370 亿。这意味着什么?在每次推理或训练时,模型只会‘唤醒’总参数中约 5.5% 的部分用于计算。这就像一条拥有 100 个节点的区块链,但每笔交易只需要 5 个节点验证,其余节点处于休眠状态,不消耗算力。这个设计被称为 DeepSeekMoE(稀疏专家混合架构)。
更惊人的是训练成本。DeepSeek-V3 的训练消耗了 278.8 万 H800 GPU 小时。按当时市场租赁价折算,约 557 万美元。作为对比,Meta 的 Llama 3 405B 训练消耗了 3080 万 GPU 小时,成本约 6100 万美元。效率差异是两个数量级。这一个数字,就解释了为什么华尔街会为 DeepSeek 的潜力感到不安。
这里我们必须诚实:DeepSeek 的效率优势,部分是被迫的。美国芯片出口管制限制了其获得最先进的 H100 和更高带宽的 NVLink 互连。主力训练卡 H800 和 A800 在 NVLink 带宽上被刻意削弱。这就像在一条链上限制了区块 Gas limit,但通过优化 calldata 和状态存储,硬是在同样 Gas limit 下塞进了更多交易。他们的效率之路,本质上是‘约束下的系统性优化’,这个背景在大多数媒体叙事中被淡化了。
接着,我们来拆解另一个话题:算法创新的深度。
文章提到 DeepSeek ‘在没有传统指标的情况下取得成功’。这句话背后,藏着一个更硬核的技术事实:GRPO(Group Relative Policy Optimization)。传统强化学习对齐方法(如 PPO)依赖一个庞大的 Critic Model(价值模型)来估计每条动作的未来回报。这个 Critic Model 的参数量往往与主模型相当,训练成本极高。DeepSeek 的 GRPO 直接丢弃了 Critic Model,改为在同一组输出中比较相对优劣来更新策略。
这个算法创新的意义,相当于在以太坊的 stateless client 设计中找到一个办法绕过 Verkle Tree 的复杂状态存储,直接采用二进制 trie + 零知识证明来验证区块——极大地减少了验证成本,但代价是必须重新设计协议的核心逻辑。
在推理层面,DeepSeek 的 MLA(多头潜在注意力)架构同样值得关注。传统 Transformer 的注意力机制在长上下文推理时,需要缓存大量的 Key-Value 矩阵,导致推理显存开销随上下文长度线性增长。MLA 通过把 Key-Value 矩阵压缩到一个低秩潜在空间中,显著减少了缓存需求。这使得 DeepSeek 在长上下文(128K+)的推理场景下,单位 Token 的边际成本远低于使用标准 Multi-Head Attention 的模型。
那么,这些技术选型如何影响商业竞争?
V3 发布初期,输入定价为每百万 Token 约 0.27 美元(缓存命中时更低)。而 OpenAI GPT-4o 的定价在 2.50 至 5.00 美元之间。这意味着 DeepSeek 的 API 价格仅为 OpenAI 的约 1/10 到 1/18。这个定价不是慈善,而是成本结构的直接反映——低推理成本支撑低定价,低定价带来开发者流量,流量反哺模型迭代。这形成了一个飞轮:开源权重(MIT 许可证)吸引开发者,开发者部署到自己的集群,这些集群上的反馈数据又被用于改进下一个版本。
Giả định tin cậy họ đang đặt ra——市场给 DeepSeek 600 亿美元的估值,默认了这个飞轮会持续转下去,忽略了一个隐藏的限制:规模不经济悖论。当调用量爆发时,长上下文和 Agent 场景的推理开销是指数增长的。如果定价刚开始就没留足利润空间,后期需要靠规模效应摊薄成本。但 DeepSeek 的算力储备并不自主可控——它依然依赖租用或已购的 H800/A800 集群,这不像拥有自有 H100 集群的巨头那样可以无限线性扩容。
深层看,这种商业模式更像是一个‘AI 基础设施提供商’,而不是‘SaaS 应用商’。这与区块链领域的共识层提供商相似——做的是中继和验证的生意,赚的是过路费。但风险也在这里:如果下一代模型(V4/R2)遇到多模态扩展的技术债,或者开源社区(Qwen、Mistral、Llama)快速吸收同样的效率技巧,那么 DeepSeek 的护城河会在 6 到 12 个月内被稀释。
现在,我们必须对‘无 KPI 文化’做一个反常识的辨析。
在链上,我们会看一个协议所谓的 ‘去中心化’ 是否真实——通常治理代币集中在几个地址手里,就是伪去中心化。同理,DeepSeek 的 ‘无 KPI’ 叙事也需要用同样的怀疑眼光看待。我的判断是:拒绝 KPI 的部门主要是前沿研究团队,而非整个组织。 像 API 定价、成本控制、开源节奏这些商业环节,必须有清晰的绩效导向。如果整个公司都没有 KPI,那么 600 亿美元的估值根本无法在内部获得运营共识。
更深层的是幻方量化的角色。梁文锋的母公司幻方量化通过量化交易积累了巨额利润,并自建了 GPU 集群。这使得 DeepSeek 可以在完全不依赖外部融资的情况下运营。这就像一条没有代币发行的链——它不靠 gas 费燃烧叙事来维持,而是靠母公司的法币储备直接为验证节点发工资。这种 ‘不融资’的底气,不是管理叙事,而是资金和算力的双重自主权。

根据链上数据分析我的经验,一个项目如果连续三个月 TVL 上涨但用户地址数不涨,就有集中化风险。DeepSeek 目前的融资故事也存在类似的迷雾:600 亿美元估值的来源并不清晰。公开时间线显示,2025 年上半年融资传闻区间为 75 亿到 300 亿美元;下半年有媒体引述私募股权交易消息,称估值可能达 600 亿。这个数字可能是二级份额交易价,也可能是媒体推算,缺乏公司官方确认。
所以,我的下一个问题是:如果 600 亿美元是真,那么对应的是什么?
目前 DeepSeek 的公开收入数据不透明。但从 API 价格推断,假设其日均 Token 生成量为 2000 亿(这是一个乐观估计),日均收入可能在 50 万到 100 万美元之间,年化约 2 亿到 3.6 亿美元。用这个数字去推 600 亿美元估值,市销率(P/S)高达 166 倍到 300 倍。在 AI 领域,这个倍数意味着市场不仅是为现有收入买单,而是为未来 3 到 5 年‘AI 基础设施层关键节点’这个位置买单。
这与当前加密市场的某些高估值链(如 Solana)有相似之处——你看重的不是它今天有多少 TVL,而是它未来能否成为结算层标准。押注 DeepSeek 就是在押注 ‘高效小模型’ 路线最终能战胜 ‘大模型+大力出奇迹’ 路线。
不过,链上数据教我们的另一课是:任何高估值协议都会遇到安全性的拷问。对 DeepSeek 来说,最大的安全问题不是代码漏洞,而是单点故障——它极度依赖母公司幻方的资源,且技术栈高度自研。如果某个核心研究员离开,或者幻方的量化业务遭遇黑天鹅,整个公司链条都会摇摆。这就像一条链的核心开发团队突然离开,虽然社区还在,但后续升级将群龙无首。
Theo bằng chứng on-chain,我不会只看一个协议的 TVL,我还会看它的开发者流失率。对于 DeepSeek,我会关注它的开源仓库活跃度、Issue 响应时间,以及核心贡献者是否留在国内。这些信号比媒体标题更可靠。
说到底,DeepSeek 的故事给整个 AI 和加密世界提供了一个镜像:即使没有最先进的硬件(H100),没有自由的全球市场,一个团队依然可以通过架构创新和严格的工程纪律,把计算效率推到极限。这个经验对 DeFi 同样适用——不是拥有一条性能最强的链就能赢,而是谁能用最小的资源获得最大的安全性,谁才能穿越熊牛周期。
但我们必须把眼光放回 2026 年的现实。当前全球 AI 竞争格局中,基础模型层已经变得像基础设施一样重。OpenAI、Google、Anthropic 都在通过自研芯片和超大规模集群来降低单位成本。而中国的大模型公司却在芯片管制的阴影下,用 ‘效率算法’ 来参赛。这本身就是一场不对称战争:一边在扩充算力,另一边在压缩算法复杂度。
从我的角度看,DeepSeek 的 600 亿美元估值,反映的不仅是市场对一家公司的认可。它更像是一个信号——这个信号告诉所有在加密和 AI 交叉领域做开发的人:世界正在从 ‘算力即权力’ 转向 ‘算法即权力’。算力可以像流动性一样租用,但算法的迭代效率才是真正的护城河。
回看 2024 年,我在 ETHDenver 的技术 track 上分享过 MEV 提取的分析:在巨大的套利面前,普通交易者总是最后的买单者。今天的 AI 市场也一样——当巨头们还在比拼谁能买下更多 H100 集群时,DeepSeek 用 557 万美元训练成本证明了,真正的深谋远虑不是堆算力,而是能用手头的资源做出同样的事。

但这一切的前提是:DeepSeek 必须成功克服下一代模型的扩展性障碍。那些在单模态语言模型中高效的架构,在视觉、语音等多模态任务中是否依然有效?这是一个未被验证的假设,也是一个最大的风险敞口。
让我们回到一个更基础的问题:你愿意把你的核心业务建立在一条估值 600 亿美元、但训练成本只有竞争对手百分之一的模型之上吗?在链上,我们会把这个选择交给 TVL 来回答:如果开发者真的信任,他们会锁仓进去。对于 DeepSeek,开发者的信任体现在他们的部署规模和调用量上。而这些数据,目前依然不可见。
在市场下行的阶段,人们总是更关注 ‘流动性撤退’ 和 ‘安全风险’。但我认为,DeepSeek 给我们的启示比 ‘下一个 OpenAI 在哪里’ 更重要:它证明了在一个受限的环境中,效率优化和架构创新可以战胜蛮力算力。这不仅是 AI 领域的转折点,也是 DeFi 领域长期以来的共识:真正的护城河不是 TVL 的高度,而是协议在极端波动下的稳定性。
最后,我想用链上的一个常规操作来结束:查看公开的代码仓库,看看这个 ‘无 KPI 文化’ 的团队,是只在输出论文,还是在持续提交 commit。开源社区的热度迟早会枯竭,真正的历史性项目,会像那些在熊市里依然默默维护代码的协议一样,在下一个牛市到来时,让人突然感到惊讶。
至于 600 亿美元是泡沫还是估值起点,我的答案是一个反问句:如果它的 API 调用量在六个月内翻十倍,你还会觉得这个数字高吗?如果六个月后,它的模型没有顺利迭代,你还会觉得这个数字低吗?数据的答案,永远比叙事的答案真实。