科技狐 2小时前
实测混元 Hy4 preview:腾讯欠下的 AI 作业,补回来了吗?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

就在刚刚,腾讯发布并开源了他们最新的大模型 Hy4 preview,在这个模型发布密集程度堪比游泳池小孩的暑假尾声,腾讯交出了一份怎样的 " 暑假作业 " 呢?

据我们了解到,混元 Hy4 preview 的总参数是 7700 亿,激活参数为 490 亿,支持上下文长度 1024K,相比上一代 HY3 的 2950 亿总参数,210 亿的激活参数,192K 的上下文,有明显的迭代提升。

在 Hy4 preview 上,重点对生产力场景进行了优化,强化了复杂任务中的理解、规划、工具调用与持续执行能力。

HY4 preview 在参数规模上超过了智谱 GLM-5.2,但相比上万亿的 DeepSeek V4 Pro 和 Kimi K3,还存在差距。

预计腾讯会在下一代大模型产品,也就是 HY5 上将总参数提升至一万亿以上,这符合姚顺雨领导下混元 " 守正出奇 " 的风格:模型规模相对克制,在训练、评估和 Infra 上优化提升。

腾讯也公布了 Hy4 preview 跟其他模型的对比成绩,已经稳居开源模型第一梯队。

回到模型的具体表现上来,我们用腾讯的 WorkBuddy 调用 Hy4 preview 进行了测试。

首先是知识办公类的任务,我们准备了亚马逊、微软、谷歌、阿里和腾讯五家企业最新的财报,这里面包括 PDF、Word 文件,中文和英文、季度和年报。

我们让 HY4 preview(为了方便,后文称 Hy4 ),帮我总结他们今年第二季度在 AI 方面的收入和支出,同比和环比的数据,尤其是云业务的 AI 算力方面的收入,并做成 PPT 文件。

此外,我没有对 PPT 的设计风格做出规定,这完全看模型自己的理解和能力,同时也让 Hy3 和 DeepSeek V4 Pro 以相同的 prompt 执行了该任务。

这是腾讯 Hy4 给出的 PPT,从设计排版角度来说是好看优美的,关键字部分设置成蓝色,突出了重点。还提示了微软是年报,而非季报,数字按季均估算,空白处设置了柱状图背景。

而 Hy3 的表现如下,它的 PPT 信息齐全,但在排版设计上显然不如 Hy4 老道。

下面这个类似的设计更能说明 Hy4 排版细节上的进步,不同企业用背景色做了区分,文字做好了上下对齐,说明部分用了红色字体突出。

*Hy4  

*Hy3

简而言之,Hy3 像是初学计算机课的学生做出来的 PPT,仅仅是会做一些简单排版,而 Hy4 则是上完了所有计算机课的学生做出来的 PPT,成熟度更高,排版更优美。

仅仅是过了两个月,这足以见得 Hy4 preview 相比 Hy3 的进步,AI 的发展日新月异。

那么 DeepSeek V4 Pro 如何呢?可以看下面这张图。

显然,在做 PPT 这一块,腾讯 Hy4 和 DeepSeek V4 Pro 能坐在一张桌子上吃饭。

在上一次体验 Hy3 时,我们曾让它生成一个模拟碳酸钙生成过程的 2D 动画文件,为教学场景服务,虽然有不少值得称道的地方,但在细节处会有问题,比如在倒入溶液时,试剂瓶会穿过烧杯壁。

我们用相同的提示词让 Hy4 也生成了这个动画,相比 Hy3 版本,Hy4 版的模拟动画要好上不少,画面更精致,桌面有纹理,甚至试剂瓶和烧杯在桌面还有倒影。

下方的操作面板选项更丰富,除了 " 定量倒入 " 选项,实验操作面板还能搅拌、加速静置、离子视角等选项。

在反应过程中,倒入的物质和产生的沉淀,会在化学方程式上面有体现。

但不足之处依然有,例如试剂在倒入时,瓶塞没有取下,但这类问题都可以后续让大模型在上一版基础上修改,得到一个更合理的版本。

而且 Hy4 支持 1024k 的上下文,上下文变长的优势除了能一次输入更多内容,也支持更多轮的修改。

所以瑕不掩瑜,可以见到 Hy4 能力的进步还是非常明显的,而且在画面细节上的提升尤其令人惊喜。

有意思的是, 让 DeepSeek V4 Pro 用同一段提示词生成的演示动画,在倒入时,盖子也保留在试剂瓶口。

相比之下,Hy4   在画面设计和功能细节方面要好出不少,在总参数和激活参数比 DeepSeek V4 Pro 更低的条件下,Hy4 的表现让人眼前一亮,甚至让我怀疑混元团队为教学场景进行了优化。

如果是个人需求,比如我要开发一个记账工具,并且对这个工具提出了非常详细的个人需求,详情可以看这篇:0 元手搓一个 " 安卓常用工具 ",能帮我把 18 元月卡都省了?

而 Hy4 生成的记账工具,不仅满足了我的对消费分析功能的需求,而且还有惊喜:在统计的下方,有导出备份和导入数据的按钮,可以导出 Json 文件,方便用户数据迁移,完成度相当高。

另一个场景是游戏,我们直接一句话让 Hy4 生成一个《超级马里奥》游戏,AI 自己写代码,跑游戏测试,修改 bug,测试可玩性,做视觉认证,保证游戏画面接近原版马里奥。

生成的游戏画面有《超级马里奥》的味道,游戏玩法也得到还原,有分数、关卡和时间设定,通过跳跃躲避障碍物、踩踏攻击敌人、收集金币,吃到蘑菇后能增加生命值和能力,有火球攻击技能,也能复活三次。

同时,马里奥还有声音效果,游戏体验进一步提升。

不过缺点也有,受限于提示词简单,它的游戏过程不够长,虽然有关卡,但每个关卡难度都一样。

而相比之下,Hy3 和 DeepSeek V4 Pro 生成的初版《超级马里奥》,则比较粗糙。

当然了,我们还可以进一步对 Hy4 提出更多细节要求来制作马里奥游戏,时间关系,这里就不再演示,非常建议大家自己探索。

想要加入更多的游戏创意玩法对一个 AI 来说可能有些难,但是如果是玩法固定,不需要创意的游戏,就属于 AI 的舒适区了,比如五子棋,可以选择游戏模式,可选禁手规则,同样音效也有。

如果上班摸鱼没游戏玩,可以直接让 AI 给自己手搓一个小游戏,开发游戏这种事情,约等于上班干活。

最后,我们来看一个 SVG 动画,这是 Hy3 生成的一个火箭升空效果。

而在 Hy4 上,火箭的升空效果变成了这样,可以看到,不管是火箭、发射架,还是地面、背景的天空,都有更多细节。

而且 Hy4 版的 SVG 动画还有交互设计,鼠标拖曳可以环绕查看,滚动滚轮可以推拉镜头,空格直接发射。

在右下角,还有火箭发射各个阶段的标注,右上角显示高度、速度等信息,包括左下角的点火按钮,也比 Hy3 版的发射要更有仪式感。

整体而言,Hy4 preview 的各个方面,都要比 Hy3 有了长足的进步,在多个场景下,与更早一些发布的 DeepSeek V4 Pro 不相上下,甚至表现更好。

这还是 Hy4 的 preview 版本,他们希望在用户使用过程中获得更多真实反馈,待到   Hy4   正式版发布,会更加令人期待。

定价方面,Hy4 preview 的 API 每百万 Tokens 输入价格为 6 元,如果命中缓存为 0.3 元,输出价格 18 元,在 WorkBuddy/CodeBuddy 、元宝、ima 等产品上可以免费体验。

在很长时间里,腾讯都被诟病在 AI 方面投入少,战略上摇摆不定,致使自己落后竞争对手,大模型第一梯队,都在说 DeepSeek、Kimi、Qwen、豆包,没人在讨论混元。

但从 2025 年底开始,腾讯开始疯狂给补作业:高薪挖来姚顺雨,并改组内部团队,成立基础模型部,并由姚顺雨全面接管;

在算力基础上,腾讯开始进入买买买的节奏,最新财报显示,他们在第二季度花费了超过 500 亿元人民币用于采购算力。

不管是人事组织架构,还是硬件基础,腾讯已经彰显了他们在 AI 上的决心,他们的努力也正在得到回报:WorkBuddy 在桌面办公 Agent 市场占有率一骑绝尘;混元大模型正在缩小与顶尖大模型的差距,2027 年的 Hy 绝对值得期待。

欠下的作业总归要补的,早补总比晚补好。

编辑:饿羊羊

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论