说实话,2025 年初那阵子,我朋友圈几乎被 DeepSeek 刷屏了。不是因为又冒出一个"AI 神器",而是这个中国团队把大模型的价格战,打出了新高度。今天不吹不黑,拿真实数据跟你聊清楚它到底牛在哪、坑在哪。
671B 参数,但每次只激活 37B
DeepSeek-V3 用的是 Mixture-of-Experts(MoE)架构:总参数量 6710 亿,但处理每个 token 只激活 370 亿参数。打个比方,这就像一家大公司,平时真正干活的只有一小部分人——效率高,成本还低。
它预训练用了 14.8 万亿 tokens,上下文窗口 128K,一口气读一部长篇小说没压力。最狠的是,权重完全开源(MIT 协议),意味着你可以自己下载、自己部署,不依赖任何厂商。
训练成本:557.6 万美元,GPT-4 的 1/20
DeepSeek 官方公布的 V3 训练成本约 557.6 万美元,用 2048 张 H800 显卡跑了两个多月。而业界普遍估算 GPT-4 的训练成本在 6300 万美元量级——差距约 20 倍。这个数字一出来,整个行业都坐不住了:原来大模型也可以这么省钱地训练?
价格屠夫:API 只要别人的零头
看官方人民币定价(这是最硬的数据):
| 模型 | 输入(缓存命中) | 输入(未命中) | 输出 |
|---|---|---|---|
| DeepSeek-V3 | ¥0.5 / 百万token | ¥2 / 百万token | ¥8 / 百万token |
| DeepSeek-R1 | ¥1 / 百万token | ¥4 / 百万token | ¥16 / 百万token |
对比 OpenAI 的 o1(输入 $15/百万、输出 $60/百万),R1 的价格差不多是它的 1/30~1/50。我见过不少创业团队,光是换 DeepSeek 当主力模型,月度 API 账单就能缩水一个量级。
推理是真的强:R1 的数理表现
R1 是 V3 加了一轮大规模强化学习跑出来的推理模型,官方技术报告里的数据:
- AIME 2024(数学竞赛):R1 拿 79.8%,逼近 OpenAI o1 的 74.4%~79.2%
- MATH-500:97.3%,把 GPT-4o 的 60.3% 甩开一大截
- Codeforces 综合评分:2029(代码能力是真实力)
我自己拿它写代码、解数学题,感受是:它会把思考过程一步步摊开,错了会自己复盘再试,比普通对话模型稳得多。
短板也别藏着
- 多模态基本没有:V3/R1 不能直接看图、识图,这是硬伤
- agent 工具调用不够顺:和 OpenAI 的 function calling 比,差一截手感
- 数据合规要注意:官方 API 的数据在境内服务器处理,企业用敏感数据建议走 AWS Bedrock,或者干脆自己部署开源权重
一句话总结
预算敏感、重推理、爱折腾开源的开发者和团队,DeepSeek 是 2025 年最值得先试的模型;但如果你要的是多模态、agent 丝滑体验,还是得看 GPT 系和 Claude 系。
(数据来源:DeepSeek 官方技术报告 / 官方 API 定价页 / 公开媒体整理,均为可核实数据。)
暂无评论