南风窗 1小时前
计划有变,他准备当首富
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

作者 | 荣智慧

编辑 | 向现

9 月 9 日,深度求索委托中信证券筹备科创板 IPO 的消息被证实。创始人梁文锋合计持有约 78% 的股权。若公司市值 " 按计划 " 突破 1 万亿元人民币,梁文锋资产约为 7800 亿元,将超过现首富、字节跳动创始人张一鸣(资产约 5429 亿元),成为中国首富。

这个 " 首富 " 的含金量,不仅取决于资本市场对其技术路线的定价,更取决于中国人对中国人工智能第一大模型的信心。

与字节跳动靠流量、广告赚钱不同,深度求索的价值建立在一个 " 不那么确定 " 的命题上:英伟达 GPU 正以 " 一年一更新 " 的速度疯狂迭代,美国已经切断先进芯片对华出口,深度求索的 " 效率路线 " 能不能在算力差距拉大的情况下持续领先?

用户在 DeepSeek 手机客户端上提问 / 新华社记者黄宗治摄

9 月 8 日,美国财政部长贝森特发表演讲称," 中国永远无法在 AI 领域超越美国。" 同一天,美国国家安全局、网络安全与基础设施安全局、联邦调查局发布网络安全公告,指责 6 家中国企业 " 蒸馏 " 美国前沿大模型。9 月 10 日,美国大模型巨头 Anthropic 发布报告,宣称 7 家中国企业提取 Claude 模型能力。

地缘政治对抗短期内难有转圜,而中美大模型企业 " 资本量级 " 也显示了巨大鸿沟。拟上市的 Anthropic 冲击 2 万亿美元估值,OpenAI 迈向 1 万亿美元,SpaceXAI 估值 2500 亿美元;如果深度求索凭借 " 中国大模型估值天花板 " 地位,上市市值冲到理想状态的 1.5 万亿元,约合 2000 亿美元,仅为 Anthropic 的十分之一。

深度求索要面对的,就是这种 10 倍估值差距的 " 不对称竞争 "。

01 本来不想上市

2023 年,创始人梁文锋在深度求索成立初期立下三条 " 铁律 ":不融资、不商业化、不路演。

到了今年," 铁律 " 统统打破,深度求索从 " 坚决不融资 " 转向 " 光速 IPO"。

先是 4 月至 6 月完成首轮融资,金额 510 亿元,引入国家人工智能产业投资基金、腾讯、宁德时代,投后估值约 4000 亿元。首轮交割仅过去一个月,第二轮 500 亿元融资启动,投前估值约 5000 亿元。9 月初,被证实委托中信证券筹备 A 股科创板 IPO,有望年内递表。

今年 6 月,深度求索完成首轮外部融资

这家位于杭州、开发大语言模型的人工智能公司,资金来自梁文锋的 " 幻方量化 " 基金。" 幻方量化 " 成立于 2015 年,2017 年实现投资策略 AI 化,是中国最早、最知名的私募基金之一,管理资产规模超 700 亿元。截至 2025 年底,近 5 年收益均值达 114.35%,这也是梁文锋此前 " 不融资 " 的最大底气。

2025 年初,DeepSeek-R1 推理模型发布,以 " 物美价廉 " 轰动全球。其在多个推理基准测试中的性能堪与 OpenAI 的 o1 模型相当,后者是当时 " 地表最强 " 的大模型,而 DeepSeek 只是 " 无名小卒 ",仅用 557 万美元的成本完成了 OpenAI 花费 1 亿美元做到的事情。

DeepSeek 的技术路线演进,有三个关键节点。

2025 年上半年,它靠强化学习(RL)主导长思考模式,打破了行业依靠大规模监督微调(SFT)的传统,确立了算法和硬件协同的基础。从 2025 年底至 2026 年中,它先后发布 DeepSeek-V3.2、DeepSeek-VL2 及 DeepSeek-V4 系列,引入稀疏注意力(DSA)机制,补齐多模态和冷启动长思考等短板。9 月 10 日,新模型 V4.1 Flash 发布,技术倒向更轻量、吞吐量更大、专为 Agent 优化的异构架构。

DeepSeek-V4 和 DeepSeek-V3.2 的计算量和显存容量随上下文长度的变化

在技术路线上,深度求索走的是 " 不对称竞争 " 之路。因为客观条件摆在那里——无法跟美国巨头 " 硬刚 " 参数量和预训练规模,因此靠设计模型的输入输出链路、压榨硬件资源搞 " 效率创新 ",让模型的能力不比美国大模型差。

本来,DeepSeek 的核心优势就是 " 物美价廉 "。然而,今年 8 月提价后,它遭到国内友商的 " 背刺 ",不少成本敏感的开发者和中小企转投智谱和阿里;V4.1 Flash 新模型再度降低了算力成本——两下一合,DeepSeek 于 9 月 10 日启动 " 大降价 ",距离它涨价只过去了 20 多天。

Deepseek 8 月提价(上),9 月降价(下)

多年 " 地板价 ",深度求索赚钱了吗?据悉,2026 年前 7 个月,其营收为 4.75 亿元,是 2025 年的 10 倍,亏损约 7.15 亿元(去年全年亏损为 9.35 亿元)。今年砸下约 110 亿元布局基础设施,在内蒙古乌兰察布将建设一座 1 吉瓦超级数据中心,部署 16 万颗华为昇腾 950DT 芯片。

可以说,深度求索的基建开支暴涨、人力成本大增(不少员工跳槽),是打破 " 不融资 " 铁律的核心动因。

02 竞争白热化

深度求索的 IPO 推动之际,国内的竞争对手已经争相融资、上市。

金融政策先行一步 " 放开 "。港交所 18C 章特专科技新规顺利运转,A 股科创板第五章上市标准正式对 AI 大模型企业敞开大门,中国 AI 大模型企业展开了融资、估值大比拼。

智谱 AI 与 MiniMax 均于今年早些时候在香港上市。9 月初,月之暗面秘密申请港交所上市。

智谱 AI 页面

如果给中国独立大模型企业的市值(估值)排座次,深度求索以约 740 亿美元的估值位列第一;月之暗面估值为 500 亿美元,列第二;智谱 AI 市值约 495 亿美元,位于第三;MiniMax 市值约 131 亿美元,排在第四位。

剩下的三家估值均未超过 30 亿美元。阶跃星辰估值约 25 亿美元;零一万物估值约 15 至 20 亿美元;百川智能估值约 15 至 20 亿美元。

如果看以上 7 家公司上半年财报,其 ARR(年度经常性收入)的排名与其市值(估值)的排名并不一致。大模型公司之所以看 ARR,而不是看传统的净利润或总营收,主要是因为传统的指标估不出一直亏损的公司的价值,用 ARR 的 " 指数级增长斜率 " 可以更前瞻地捕捉到公司的成长速度。

智谱 AI 号称 " 中国版 Anthropic",API 收入暴涨,ARR 为 16 亿美元;月之暗面靠 Kimi K3" 爆发 ",正秘密与微软、亚马逊、谷歌谈判海外云平台托管,并获取最高 30% 的商业收入分成,ARR 约 10 亿美元;MiniMax 主打海外市场和 B 端接管,ARR 约 8 亿美元;深度求索靠高达 83% 的 API 毛利率,ARR 约为 5 亿美元。

MiniMax 中期业绩公告

阶跃星辰、零一万物、百川智能的 ARR 都在 4000 万— 6000 万美元上下,且均处于亏损阶段。

当然,前四名也都在亏损,只是亏多亏少的区别。2026 年上半年,MiniMax 亏了约 25 亿元;智谱 AI 亏了 20.72 亿元;深度求索亏了 7.15 亿元;月之暗面没公布数据。

而互联网巨头阿里巴巴(通义千问)、腾讯(混元)、字节跳动(豆包)以及百度(文心一言)并未独立上市,很难与独立大模型公司 " 平等比较 "。

美国的两家大模型巨头 Anthropic 和 OpenAI,基本上承担了全球除中国之外的 " 行业想象力 "。为了显示自己的大模型能力超群,它们均在 " 百年数学难题 " 上展开暴力破解,几天之内就解决了一系列重大猜想,令多位菲尔兹奖得主联名反对。反对是有道理的,但也侧面证明 AI 一发力,脑力劳动者就有了上顿没下顿了。

Anthropic 的 Claude 的实验版本刷新了 " 黎曼猜想 " 的数据

OpenAI 最新一轮估值 8520 亿美元,上市目标约 1 万亿美元;Anthropic 最新一轮估值 9650 亿美元,上市目标约 2 万亿美元。二者上半年营收均超过 130 亿美元,但 OpenAI 亏损 210 亿美元,Anthropic 盈利 5.59 亿美元、实现了历史性的 " 利润转正 "。

虽然中美大模型企业的市场环境、资本规模差异不小,但两边的头部玩家基本达成了一个共识——想赚钱,就得赚 B 端而不是 C 端的钱。

而普遍性的亏损,也是因为大家都在买芯片、买机柜、建数据中心、内存还涨价。总之,AI 已经是重资产游戏了,不上市就玩不下去了。

03 AI 的 " 涌现 "?

上市并没那么快。

随着 9 月 16 日美联储加息概率升高,Anthropic 和 OpenAI 均有意将上市推至 2027 年。

截至 9 月 13 日,浙江证监局官网尚无深度求索上市辅导备案信息。按辅导备案不少于 3 个月的流程计算,深度求索最快也要到 2027 年第一季度上市。

而深度求索面临的挑战,上市只是最简单的那一部分。一个最核心的问题是,深度求索走 " 效率创新 " 模式,能不能在硬件持续劣势的情况下令大模型保持领先?

当下,DeepSeek 能保持 " 物美价廉 " 的领先地位,一方面是 " 非对称异构 " 的做法还可以打破算力瓶颈,像最新的 V4.1 Flash 输入激活 8B,输出激活 16B,使它在处理超长上下文时需要的计算资源更少;一方面在显存(HBM)的读写和存储上,DeepSeek 将 KV Cache 压缩 437 倍,使它在使用国产芯片时依然能跑出 83% 的 API 毛利率。

与初代模型相比,Deepseek KV Cache 缩小了 437 倍

但是,软件层面的优化有其物理极限。当硬件的代差拉大到一定量级后,软件就很难弥补了。

如今,大模型实时推理动辄调用 2 万亿(2T)参数(静态显存空间至少占用 1TB),英伟达 GPU 的迅速迭代,对显存一秒内刷 1TB 的数据的需求,两三张卡就可以满足。而如果使用 3nm 以下、显存带宽为 2.0 — 4.0TB/s 的芯片,仅靠压榨硬件能力是满足不了需求的。

华尔街和 OpenAI 分析长线竞争时,一直鼓吹 " 暴力美学 " ——当算力规模突破某个临界点时,模型会涌现出算法完全无法预言的全新能力。因此美国人备齐所有的顶尖硬件,押注在智能的 " 涌现 " 上。

AI 竞争,已经向数万亿参数、原生多模态实时推理的深水区演变。对于中国大模型而言,算法的创新只是其中 " 一条腿 ",能不能跑得远,也得看 " 另一条腿 " 即国产半导体技术(光刻工艺、先进封装、HBM 显存等)能不能在 " 现有硬件撞到物理墙 " 的窗口期内,实现真正的国产化破局。

那个时候,"10 倍估值差异 " 就不再算得上什么 " 严重 " 问题。

值班主编 | 张来

排版 | 阿车

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 融资 美国 创始人 ipo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论