驱动之家 08-06
豆包智商拉满 国产大模型将超越5万亿规模:需百万显卡算力
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_caijing1.html

 

快科技 8 月 6 日消息,国产大模型中,Qwen3.8 Max、Kimi K3 参数量已经到了 2.4 万亿、2.8 万亿的级别,再下一步就是 5 万亿参数量了,这一次可能是字节率先行动。

晚点 latepost 刚刚报道称,字节正在讨论训练一个超过 5 万亿参数量的大模型,会是国内已知规模最大的大模型了。

不过这个计划还在早期阶段,不一定会最终发布。

5 万亿参数量的规模也被认为是 GPT-5.6 或者 Opus 5 级别的,通常来说参数量越大,大模型的性能就越强,OpenAI 及 Anthropic 就是靠着更高的参数量来实现性能领先的优势,据悉他们内部已经在训练甚至完成 10 万亿参数量大模型的准备了。

但是超高参数量也意味着超高的投入,尤其是算力资源,5 万亿参数需要大量 AI 显卡才行,让 DeepSeek 算了下,以 H100 的算力为基准,训练这样的大模型需要 10 万颗 H100 训练 347 天,或者 100 万张显卡训练 35 天时间。

百万卡也到了 GW 级别的算力规模,要求是非常高的,字节也不可能一下子就投入这么多算力,合理的做法是 20-30 万张显卡训练 3-4 个月,再算上准备及后训练等,至少要半年时间,甚至一年之后才可能训练出来。

在算力资源上,目前最充裕的还是 OpenAI,SemiAnalysis 之前测算他们有 200 万张显卡的算力,Anthropic 也有 62 万张显卡的算力,DeepSeek 只有 6 万张,而且很多还是之前略显落后的 H20、H800 显卡。

以字节的财力满足 5 万亿参数大模型训练是没问题的,而且有了这样的大模型,豆包的能力做到 GPT-5.6/Opus 5 级别是没问题的,智商可以拉满,不用再被网友调侃了。

现在要看的就是字节是否真的准备推进这个大模型的训练了,他们要考虑的可能还是商业上的回报。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

kimi 智商
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论