驱动之家 20小时前
吃灰老卡再战三年!大神魔改P100显卡:跑35B大模型提速88%
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

快科技 7 月 24 日消息,一位开发者在社交平台上分享了他的新成果:通过一套自研的优化技术,让已经退役多年的 Tesla P100(16GB 显存)显卡在运行 35B(350 亿参数)大模型时,速度暴增 88%!

这张 Tesla P100 显卡是英伟达 2016 年发布的计算卡,基于 Pascal 架构,虽然它拥 16GB 的显存,但因架构太老,在运行现代大模型软件时,算力一直无法被有效调用。

该开发者通过复刻魔改 GitHub 平台上的 ik-llama.cpp 项目,专门为 Pascal 和 Volta 这两种老架构写了定制版的计算内核,相当于把之前浪费掉的算力重新利用了起来。

靠这套优化技术,该显卡在跑 35B 参数的 MoE 模型时,预填速度直接拉升 88%,解码速度也快了 30%。

而且由于 MoE 架构的特性,在每次推理时仅激活部分专家网络,并非全部参数同时参与计算。配合量化压缩后权重体积进一步缩小,单张 P100 的 16GB 显存便足以装入模型。

兼容性方面,该方案不仅适用于 Tesla P100,同样支持 P40、V100 及更早型号,且允许在同一台机器中混插不同架构的显卡协同工作。

目前该方案尚未打包为一键安装工具,需要从 GitHub 拉取源码自行编译,而且 Tesla P100 作为被动散热的计算卡无内置风扇,装机时还需额外解决散热问题,需用用户自行规划风道或加装水冷。

在海外二手市场上,P100 显卡价格已相当低廉,对愿意折腾命令行编译和硬件改装的用户来说,是用低成本在本地运行 35B 级大模型的可行路径。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:青山

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

tesla 英伟达 社交平台 举报
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论