企业观察报 2小时前
大模型告别暴利时代,两大模式加速分化
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

陈廷梁第一次意识到大模型不那么值钱了,是在核对公司月度账单时发现的。

他是浙江数新网络有限公司董事长。这家公司深度使用国内外各类主流大模型,从 GPT-4 到 DeepSeek,从 Claude 到智谱等模型,日常调用量在同行中属于第一梯队。

正因如此,他对 API(应用程序编程接口,即调用大模型服务的网络接口)价格的变化比大多数人更敏感。陈廷梁在接受《企业观察报》采访时表示,同样 1 万条数据处理任务,2024 年用 GPT-4 Turbo 要花 160 美元,现在用国产模型,只要十几元人民币。

这不是陈廷梁和数新智能独有的体感。

2026 年以来,整个行业经历了一轮惨烈的价格战:阿里云通义千问 API 输入价格直降 97%,腾讯混元 API 直接免费,小米 API 系列降幅最高达 99%。

从百元到厘

每隔一段时间,就会有大模型降价消息传出。陈廷梁对此已经见怪不怪。但把时间拉长到两年来看,降价从来不是一蹴而就,而是一场自 2024 年延续至今的持续性下探。其中,降幅最为剧烈的一轮,发生在 2026 年上半年。

据公开信息,2024 年初,主流大模型的 API 定价普遍在每百万 Token(大模型处理文本时的最小计量单位)几十元到上百元。彼时,用户调用月之暗面模型撰写一篇深度分析文章,单次成本即高达数十元;智谱、文心一言等头部国产模型亦处于同一价格高位。国际厂商的定价更贵:OpenAI 的 GPT-4 输入侧每百万 Token 收费 72 美元,输出侧高达 217 美元。若用该模型润色一篇普通英文论文,仅输出成本即达上千元人民币。

真正的转折发生在 2024 年 5 月 6 日。

据公开信息,2024 年 5 月,DeepSeek 发布第二代 MoE(混合专家模型,一种仅按需激活部分参数的高效架构)模型,其数学与编程能力已逼近 GPT-4。该模型 API 输入侧每百万 Token 收费 1 元,输出侧每百万 Token 收费 2 元,整体定价约为同期 GPT-4 的百分之一。

在接下来的 17 天中,字节、阿里、腾讯、科大讯飞等 7 家企业密集跟进,旗下共计 21 款模型先后宣布降价。

但此前的下探尚属温和,真正的价格雪崩,在两年后才轰然到来。2026 年 4 月,DeepSeek V4 预览版亮相;次月,正式版上线。据公开信息,2026 年上半年,国内大模型行业共发生六轮降价事件(分别由 DeepSeek、智谱、阿里、字节、腾讯、科大讯飞等厂商发起),其中三轮为永久性价格下调,三轮为限时促销。仅这六轮的累计降幅,已超过 2024 年初至 2025 年底所有降价幅度的总和。

到 2026 年 6 月,大模型 API 定价格局已彻底改写。主流头部模型的每百万 Token 价格全线落至 0.3 元至 6.5 元区间,部分高频调用场景下的模型已进入厘级计价时代。

价格如此低,反倒给陈廷梁带来了新的困惑:厂商究竟还能否盈利?这究竟是战略性亏损的市场扩张行为,还是技术工程优化后成本本就如此?

降价的三重逻辑

大模型价格下探的背后,暗含着三重逻辑。

第一重逻辑:算法让算力用在刀刃上。

两年前的稠密模型,每次推理都要激活全部参数,好比一个团队里所有人无论是否对口都必须同时上场,造成大量计算冗余。如今,以智谱 GLM-5.2 为代表的 MoE 架构,拥有 7440 亿总参数,但每次推理仅激活其中约 400 亿个(约占 5.4%),实现精准调度。配合稀疏注意力机制,可将显存占用降低 75%,单台机器的吞吐量提升一倍,从而使单位 Token 的算力成本直接减半。

《企业观察报》从智谱了解到,公司云端业务毛利率,从 2024 年的 3.3% 上升至 2025 年的 18.9%,同比提升近 5 倍。财报解释,该毛利率改善的核心原因,源自推理环节的深度工程优化,单位 Token 运行成本显著下降。

第二重逻辑:低价抢入口,能力锁用户。

当下的低价 API 策略,本质上是对 AI 应用生态入场券的争夺。2025 年,智谱把一款主力模型价格直降 90%,从 50 元 / 百万 Token 降至 5 元 / 百万 Token,平台注册开发者由此突破 400 万。价格门槛的降低直接拉动了用户规模的扩张。《企业观察报》获悉,进入 2026 年第一季度,智谱平台 Token 调用量较上年同期增长 400%。

这套路径的底层逻辑是,通过降价获取开发者用户基数,再依托模型本身的能力维持用户黏性,再依托增值能力兑现商业回报。

第三重逻辑:开源模型引爆价格战。

如果说前两重逻辑是厂商的主动出牌,那么第三重逻辑则来自开源阵营的结构性压力。开源模型之所以能成为价格战的重要推手,关键在于其在成本与性能之间找到了平衡点:既不像闭源顶配模型那样昂贵,又不像早期开源模型那样性能差。这种够用且便宜的中间态,恰好击穿了商业模型的定价锚点。当开发者可以免费下载、本地部署甚至商用改用时,闭源厂商的 API 定价便失去了参照系,只能被动应战。国内开源模型凭借这一优势,已成为重塑全球大模型定价体系的关键变量。

技术工程降本、低价抢夺生态入口、开源模型带来的行业竞争压力,三重力量叠加,共同把大模型 API 的价格推向历史低位。但价格触及低位之后,行业并没有走向统一的发展路线,反而出现分化:有的模型持续走低价路线,有的则凭借更强的智能不断提价。陈廷梁的困惑也随之升级:从最初的为什么这么便宜,变成了便宜的到底够不够用,贵的到底值不值。

模型分层

多种命运

大模型行业烧完钱之后,沉淀下来的是架构、工程能力和生态积累。这一特征决定了,价格战结束后,大模型不会像共享单车那样陷入同质化报废,而是会走向分层。

业内人士分析,未来只有两种模型能活下去,要么足够便宜,要么足够出色。前者覆盖底层,后者占据顶层,中间地带将日益逼仄。

首先是底层,便宜到可以规模化使用。

底层的代表是 DeepSeek。据公开资料,2026 年 5 月,其 V4 Pro 版本把缓存命中场景下的输入价格降至 0.025 元 / 百万 Token。打个比方,生成一百篇作文的调用成本,还不到一瓶普通矿泉水的价格。

这一层的典型应用场景是:日常邮件撰写、会议纪要整理、批量信息提取,这类任务不需要顶尖的推理能力,但要足够快、足够便宜、足够稳定。

其次是顶层,贵但不可替代。

另一类模型则选择了与低价路线截然相反的方向:聚焦最复杂的任务场景,以更高定价提供普通模型无法企及的专业能力。Anthropic 的 Claude Fable 5 直接涨价一倍;智谱 GLM-5.2 的输入价格约为 DeepSeek V4 Pro 的 5 倍。高价没有成为障碍,反而成了筛选门槛:这恰恰说明,高端模型能为用户创造更大的价值。

这一层的任务不是生成一篇作文,而是编写一段能节省数百万成本的代码,推演一个能帮助基金规避风险的金融模型,分析一份决定商业成败的专利文件。编程、科研、金融、法律等领域,客户愿意为更强的智能付费,因为投入产出比足够高。

夹在二者之间的模型处境最为尴尬:既不够便宜,能让人随意调用;也不够聪明,让人甘心支付高价。既拿不到规模效应的红利,也够不着能力溢价的资格。那些比 DeepSeek 贵、比 Claude 笨的模型,在分层格局中将逐渐失去容身之地。

那么普通企业该如何选择?陈廷梁给出了一个建议:公司可以在内部可以建立一套模型路由机制:对于报告生成、信息提取、知识库问答等不同任务,同时运行 GPT、Claude、DeepSeek、Kimi、豆包和智谱 GLM 等多款模型,从准确率、成本、响应速度、稳定性等多个维度进行评分,然后根据任务难度自动分派:简单任务交给底层模型,复杂任务调度顶层模型,业务无需绑定任何一家单一厂商。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 阿里 阿里云 科大讯飞 编程
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论