DeepSeek 在 2026 年 5 月完成了成立以来的第一笔外部融资:超过 500 亿人民币,约合 74 亿美元,估值 500 亿美元以上,中国最值钱的 AI 创业公司。
但真正让我把材料翻来覆去看了几遍的,不是金额,是结构。这 500 亿里,约 200 亿是梁文锋自己出的;其余外部投资人的钱,大部分不直接买 DeepSeek 的股权,而是进了一个由梁文锋控制的有限合伙——五年锁定期,零投票权。
拿钱,不交权。
这篇适合关注 AI 行业、想知道”DeepSeek 为什么现在才融资”的读者。如果只追模型发布的新闻,这篇可能有点绕;但如果你想知道一家不缺钱的公司怎么设计自己的第一轮融资,往下看。
前阵子中文互联网流出了一份路演纪要:四小时的投资人线上会,梁文锋一个人从持续学习讲到华为芯片。纪要是非官方的,Momentum Works 后来做了英文翻译,翻译时明确标注”未经发言人确认”。我把它和 Forbes、Reuters 的报道对照着读了一遍,想理清三件事:梁文锋怎么从量化基金走到大模型;DeepSeek 的技术底牌到底是什么;以及为什么偏偏是 2026 年,这家”钱从来不是问题”的公司第一次拿了别人的钱。
幻方不是前史,是来路
很多报道介绍梁文锋,爱用”量化大佬跨界做 AI”。看完材料我觉得”跨界”这个词不太准。
他 1985 年生在广东湛江,17 岁进浙江大学读电子信息工程,硕士念信息与通信工程,研究方向是机器视觉。在量化圈,这种履历是少数派:没有海外留学背景,没有物理或数学博士,纯本土工科出身。2015 年他和浙大校友创办幻方量化,几年时间做到国内量化私募”四大”之一,峰值管理规模约 80 亿美元。
关键要看幻方在赚钱之外攒下了什么。量化交易的核心竞争力就两样:算力,和 AI 工程能力。幻方很早把 AI 定为公司主线,自建”萤火”系列超算,做到万卡级 GPU 集群,从算子优化到集群调度都自己动手——幻方官网写过一组数字:LSTM 算子快 20% 到 6 倍,Attention 算子快 30%。
这两样东西,恰好是大模型研发最贵、最难攒的两样。
所以 2023 年 7 月他成立深度求索,幻方首期自投 30 亿,算力和工程班底直接沿用。与其说是转行,不如说是把手里的牌打到了另一张牌桌上。
“钱从来不是问题,芯片才是”
梁文锋 2023 年说过一句话,后来被反复引用:”钱从来不是我们的问题,先进芯片的出口管制才是。”
这句话能解释 DeepSeek 前三年的几乎所有动作。不融资,因为不需要——幻方的利润足够养一个不盈利的实验室,有报道称其量化基金 2025 年收益率超过 55%。API 定价敢往死里压、模型敢直接开源,因为它的账本上从来就没有”靠卖模型回本”这一栏。业内叫它”价格屠夫”,底色其实是资本结构:它不是拿 VC 的钱烧出来的公司,没有对赌,没有退出压力,开源砸的是别人家的定价体系,不是自己的估值叙事。
有意思的是,三年后的路演纪要里,他还在讲同一套逻辑。纪要里有个现成的例子:有投资人问融资之后会不会加大数据方面的投入,他回答说高质量数据标注的瓶颈是时间不是钱,”即使没有更多钱,现有资金也够我们以最快速度扩张”。翻译一下:这轮钱不是来救急的。
技术底牌:被出口管制逼出来的效率
技术上的事,公开材料比八卦扎实,三组数字就能讲完。
DeepSeek-V3,2024 年 12 月发布。MoE 架构,总参数 671B,每个 token 只激活 37B;自研 MLA 注意力把 KV cache 压下去;FP8 混合精度训练。完整预训练用了 2.788M 个 H800 GPU 小时——2048 张卡跑大约两个月,折合约 557 万美元。同量级的 Llama 3.1,业内普遍估算训练成本是它的十倍上下。技术报告还专门强调训练全程稳定,这个规模的 MoE 能做到这点,本身就少见。

差出一个数量级这件事,画出来比写出来直观。
DeepSeek-R1,2025 年 1 月发布。在 V3 的底子上做强化学习,把推理能力拉到对标 OpenAI o1,建模成本在 500 万美元量级。
第三组数字是市场给的:R1 开源一周后,英伟达单日市值蒸发近 6000 亿美元,是美股历史上最大规模的单日市值缩水。
这里得补一句公道话:557 万美元只是那次正式训练运行的成本,不含前期实验、基础设施和人力。Epoch AI 做过估算,这个案例把账算全的话,总投入要高出不少。但就算翻几倍,成本差距依然是碾压级的。
我的判断:护城河不在某一代模型里,模型会一代代换;能延续下去的是”算法和工程协同设计”这套方法论。MLA、FP8、流水线并行,每一项都冲着同一个目标去——在拿不到最顶级卡的约束下,把 H800 的效率榨到极限。这是被出口管制逼出来的能力。纪要里梁文锋自己说得也不客气:中国模型在成本和产品上可能有结构性优势,”因为他们不需要这么做,所以不发展这种能力”。
为什么偏偏是 2026 年
“钱不是问题”说了三年,为什么 2026 年 5 月忽然要拿 500 亿外部的钱?我把公开信息拼起来,觉得原因有三层,分量不一样。
最表面的一层是算力账。投资人会上有人问得很直白:全球头部 AI 玩家从芯片采购到集群调度,每家都是千亿美元级的投入,中国的算力短板多久能补上?AGI 冲刺阶段的算力账单,已经不是一家量化基金的利润能长期覆盖的量级——哪怕梁文锋嘴上说钱不是瓶颈。
中间一层是上市。首轮关闭后,7 月 DeepSeek 就启动了新一轮,估值约 740 亿美元,路透社报道明确指向境内 IPO。回头再看首轮:引入腾讯、宁德时代这类战略股东,理顺股权结构,是很标准的上市前动作。
最深的一层,我认为是和国家对齐。这轮融资里唯一的例外条款,给了国家人工智能产业投资基金:它是唯一一家直接投资 DeepSeek 主体、拿到真实投票权、且不受五年锁定期约束的投资方。换个说法,这 500 亿买到的不只是股权,还有北京在这家中国最重要的 AI 公司里的一个正式席位。

顺序倒过来看更清楚:DeepSeek 并不缺钱,它缺的是另外三样东西——算力要储备、上市要铺路、和国家的关系要摆到明面上。这三件事在 2026 年凑齐了。
200 亿跟投:整笔交易里最值得琢磨的部分
回到梁文锋自己那 200 亿。
按路透社报道,他个人认购了这轮融资的 40%,约 200 亿人民币——既是创始人,也是本轮最大的出资方,据报道这笔交易让他的净资产直接翻倍。CNBC 还提到一条不太寻常的条款:投资人不得挖 DeepSeek 的员工。
整笔交易作为一个案例,最特别的不是金额,是条款设计。这张结构图把三条出资路径画在了一起:

为什么创始人要自己跟投这么重?我的理解分三层,而且三层互为因果。
最直接的是控制权的算术。他自己拿 40%,其余外部资金几乎全走”无投票权的有限合伙”通道。这么设计的结果是:融完这轮,梁文锋对公司的控制权没有被稀释,反而被法律结构加固了。
往上一层是信号。一家奔着 IPO 去的公司,创始人重金跟投是给公开市场投资人最硬的利益绑定——你自己敢掏 200 亿,说明你对这个估值有信心。
而最实在的一层,我认为是他本来就不缺钱。这轮融资是战略性的,不是生存性的。既然不是等着钱救命,大头自己出,估值上行的大头也就留在自己手里。
纪要里有段问答值得单独拎出来。有投资人说:你们一直很纯粹地做研究,现在行业走到了资本市场,你既要对团队和投资人负责,后面还有公众股东,怎么平衡纯 AGI 研究和资本市场?他的回答大意是”我们全都要”——今年能有几亿美元的 B2B 收入,加上消费端用户,公司已经接近脱离纯烧钱阶段;最坏情况下,”卖 API 也够养活一家上市公司”。
把这段话和交易结构放在一起看,逻辑就通了:外部股东没有投票权,就没有人能逼他放弃前沿研究去变现。”全都要”的前提,是先把”要什么、不要什么”的决定权攥在自己手里。
几个我存疑的地方
写到这,有几处必须交代清楚,免得这篇文章显得比事实更确定。
那份四小时纪要是流出的非官方记录,Momentum Works 翻译时标注了”未经发言人确认”。我引用的观点在方向上可信,和他其他场合的公开表态对得上,但逐字表述别太当真。
腾讯 100 亿、宁德时代 50 亿这些数字,路透社报道时用的措辞是”考虑中”。最终出资名单,DeepSeek 官方没有确认过。
第二轮的状态目前说法打架。有报道称纪要泄露后 DeepSeek 把新一轮融资”无限期暂停”,但路透社 7 月 15 日还在报道这轮融资推进中。后者更新,信源也更硬,我倾向于相信在推进,但这件事值得持续盯着。
接下来盯什么
如果你也想持续跟踪这家公司,比起追模型发布,有三个信号更值得看。
先看结构,再看金额。这轮最有信息量的不是 500 亿,是”钱进 LP、投票权留在梁文锋手里、国资直投拿例外条款”这个设计。上面那张结构图可以直接当模板用:之后 DeepSeek 的 IPO 招股书披露股权结构时,拿它对照,能看出很多名堂。
把”考虑中”和”完成了”分开记。举个例子,这轮消息刚出来时,腾讯和宁德的金额满天飞,但口径一直是传闻。这类案例读多了会发现,财经报道里”考虑””洽谈””计划”和”完成””确认”是两回事,混着读容易被带节奏。
把非官方纪要当线索,不当事实。那份纪要信息量确实大,但它没有经过本人确认。合理的用法是:拿它形成判断,再去找官方信源交叉验证——公开访谈、技术报告、公司声明,对得上的才采信。
另外记一个纪要里的判断,未来一两年可以拿来验证:国内做大模型的公司太多了,最后只会剩下三四家。这话从坐在牌桌上的人嘴里说出来,分量不一样。
延伸阅读
如果你只想再读一篇,优先读第一篇,和这篇对照着看最省时间。
- 听完姚顺宇的 4 小时访谈:AI 的下半场不拼神话:同样是四小时长访谈的整理。那篇讲模型能力接近之后差距落在哪,这篇讲一家模型公司的钱和控制权,可以对照着看。
- 深度揭秘 Claude Code:为什么它是最强大的 AI 编程助手?:纪要里梁文锋说当下最重要的产品方向还是 coding agent。想看 coding agent 在工程上怎么组织、源码里长什么样,可以从这篇开始。
说明:本文基于 2026 年 5-7 月公开报道(Forbes、Reuters、CNBC 等,原始信源为 The Information 的首发报道)与网络流传的 DeepSeek 融资路演纪要(Momentum Works 英译版)整理写成。纪要为非官方记录,未经发言人确认;部分出资金额在成文时仍是传闻。文中观点为个人整理与判断,不构成投资建议。