最近,DeepSeek 火得有点不讲道理。从我的朋友圈到国外媒体,从华尔街到硅谷,几乎所有人都在热议这个中国 AI 新秀。560 万美元训练成本、开源大模型、链式推理能力、股市动荡 ... 故事真是越讲越玄乎,热度越聊越高。
但就像小红书上那些 " 人均年薪百万 " 的生活博主一样,DeepSeek 的故事也被添了不少 " 滤镜 "。无论是将其视为 "AGI 已至 " 的革命性突破,还是贬低为 " 抄袭拼凑 " 的仿制品,这些极端观点都离真相有点远。
自己是一个数据从业者,也是 AI 行业的一个观察者,今天,我想来点 " 去滤镜 " 的工作,帮大家理性看待这家公司和它的技术。
先说时间线。DeepSeek 并不是 2025 年初才出现的神秘力量。早在 2023 年 11 月,他们就已经推出了 DeepSeek-Coder 系列模型,在代码生成领域就已经小有名气了。从那时到现在,他们基本上平均每 45 天就发布一次重大升级,这节奏比一些老牌科技公司迭代还快。
再看背景。DeepSeek 的母公司是中国的量化基金 " 幻方量化 ",这家公司早在 2017 年就开始研究 AI 在金融领域的应用,也不是什么新手。他们的 " 萤火二号 " 训练平台据说有上万张英伟达 A100 显卡,这在国内民营企业里算得上是顶配了。
业内人士估计,DeepSeek 及其母公司在 AI 硬件上的累计投入可能达到数亿美元级别。Tom's Hardware 甚至报道称,DeepSeek 可能耗资 16 亿美元购建算力基础设施。虽然这一规模仍低于 OpenAI、Anthropic 等美国巨头的投入,但远非 " 几百万美元 " 能概括的。
不过,DeepSeek 的真正成就确实在于通过架构创新和工程优化,大幅提高了算力利用效率。据说他们训练 V3 模型耗费的 GPU 小时数只有 Meta 的 Llama 模型的约 1/11。这种效率提升确实值得行业学习。
首先是多潜在注意力(MLA)技术。这个听起来很玄乎的东西,简单说就是对 Transformer 架构中的注意力机制做了改良,让模型存储和处理信息更高效,内存占用减少了 90%。这对于大模型的实际部署非常重要。
然后是 GRPO 算法,这是他们对 PPO 强化学习算法的改进版。通过这个算法,他们证明了无需像 OpenAI 那样使用复杂的蒸馏或搜索方法,也能达到类似的推理效果。这有点像是发现了一条效率更高的 " 捷径 "。
关于 " 知识蒸馏 " 的争议,确实需要澄清一下。真正的知识蒸馏是用大模型的概率输出来训练小模型,但 ChatGPT 的 API 根本不提供这些概率值,只给文本输出。即使 DeepSeek 用了部分 ChatGPT 生成的文本来训练,这在业内也很常见。斯坦福的审计报告显示,DeepSeek 训练数据中只有约 0.4% 含 GPT 生成内容。
有个开发者曾比较过 DeepSeek R1 和 OpenAI o3-mini 在模拟小球碰撞的编程任务上的表现。结果发现 DeepSeek 生成的代码在物理参数上有问题,运动轨迹出现了偏差;而 o3-mini 的解答虽然简化,但物理约束更合理。这表明 R1 在某些专业领域的理解还有提升空间。
DeepSeek R1 发布后,NVIDIA 股价暴跌 17%,市值蒸发了惊人的 6000 亿美元。为什么?因为有投资者认为:" 既然 DeepSeek 能用这么少的 GPU 做出这么好的模型,那么对高端 GPU 的需求肯定会急剧下降。"
DeepSeek 确实开放了模型权重和基础代码,这点值得肯定。但我们也要认清,没有哪个开源模型是 100% 透明的。根据 Open Source Initiative 的评估,DeepSeek 的训练代码开放度约为 43%(相比之下,Meta 的 Llama 3 达到了 92%),而且没有公开完整的训练数据集构成。这并不奇怪,毕竟涉及版权和商业机密。
开源也带来了安全挑战。Cisco 实验室的测试显示,在最高安全设置下,DeepSeek R1 对 100% 的恶意提示都产生了响应,而 GPT-4o1 的拦截率达到了 74%。这说明 R1 的安全训练数据占比太小(据估计仅 0.02%),且缺乏足够的安全对抗训练。
对 DeepSeek 的误读,某种程度上反映了大家对 AI 技术的期待与焦虑。经过这一番梳理,我们可以看到,DeepSeek 既不是 " 革命性颠覆 ",也不是 " 浮夸营销 ",而是 AI 进化道路上的重要一步。它通过工程创新和开源贡献,为行业带来了新思路和活力。
在这个 AI 百花齐放的时代,我们需要理性、开放的态度。既不盲目追捧新技术,也不固守成见拒绝创新。只有这样,才能真正理解和把握 AI 发展的脉搏,让技术更好地为人类服务。



登录后才可以发布评论哦
打开小程序可以发布评论哦