appso 3小时前
实测混元 Hy4 Preview:腾讯终于踩下油门,能杀入国模第一梯队吗?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

整个 8 月,大模型的更新节奏依旧让人喘不过气。

DeepSeek 相继更新 V4-Flash 和 V4 Pro,千问推出新一代旗舰 Qwen3.8-Max,智谱也在月中发布 GLM-5.3,前两天智谱和千问也同时掏出自己 Flash 模型试图刷新斩杀线……

9 月到了之前,腾讯混元也压哨交卷了—— Hy4 Preview 正式发布。

四个月前,姚顺雨发布 Hy3 Preview 的时候,把 Hy3 称之为「混元大模型重建的第一步」。

就在 Hy4 发布前,腾讯集团高级执行副总裁汤道生也回应外界「腾讯做 AI 慢了」的质疑。

他说,一点不焦虑是不可能的。混元经历了多个阶段、多次重构,而公司整体算力的严重不足,也确实拖慢了模型训练和产品发展。

但他同时提到,在姚顺雨和研究团队的推进下,Hy4 会迎来「更多突破与更大的进步」。

那这次发布的 Hy4 Preview 到底有什么进步,APPSO 这就给你实测看看。

姚顺雨此前反复提到一个思路,比起把模型训练成更会刷榜的「做题家」,混元更关心它到了真实场景里到底好不好用。

到了 Hy4 Preview  ,还是这个路线,但是模型本身的尺寸明显大了一圈。总参数量达到了 770B,激活参数为 49B。

上一代 Hy3 Preview 的总参数只有 295B,激活参数是 21B。Hy4 Preview 几乎翻了两倍多。

Hy4 Preview 这次把 agent 的长程执行能力又提升了一个档次。所以,APPSO 把它丢进了两个更真实的使用场景体验——写代码,以及日常办公。

Coding Agent 进入国模第一梯队了吗?

时至今日,编程能力依然是各家大模型正面交锋的战场。

这次腾讯新一代大模型 Hy4,在通用能力基础的提升上, 进一步强化了长链路复杂工程的任务完成能力。

在官方给出工程任务盲测中,Hy4 preview 甚至不输 GLM-5.3 和 Kimi K3,它真的进入国模第一梯队了吗?

来看看 Hy4 preview 的具体表现。

Prompt:不要制作视频或预渲染动画,必须是真正可以操作的实时 3D 场景。场景至少包含月球地形、基地建筑、陨石坑、信标、可驾驶月球车和货物运输任务。玩家需要驾驶月球车,将三箱设备分别运送到地图中的三个基地。车辆必须实现加速、制动和转向,并体现较低重力下明显不同于地球汽车的运动感,包括上坡减速、下坡加速;车辆需要与岩石和建筑物产生真实碰撞,不能穿过地面或障碍物;高速撞击需要导致货物掉落,车辆翻覆后允许复位。界面需要展示当前速度、剩余电量、当前任务、已送达货物以及简易地图。至少提供三种镜头:第一人称驾驶、第三人称跟随和远距离观察。完成开发后请自行运行并完整试玩,检查游戏能否从开始一直正常进行到完成三个运输任务;如果过程中发现碰撞、任务触发、车辆控制、镜头、货物状态或通关流程等问题,请自行定位、修复并重新验证,不要在页面能够运行后就直接宣布完成。

APPSO 让它制作了一个不能只靠「视觉诈骗」过关的 3D 世界,一个第一人称 / 第三人称可切换的「月球基地运输车」3D 网页游戏。如果发生碰撞,月球车上的货物被要求撞车后会掉落。

除了第一人称视角的玻璃不是透明的以外,它的任务完成度可以说非常高,让我们在测试的时候不禁多玩了好一会。游戏可以 WASD 来控制月球车行驶路线,还有自动驾驶功能,电量显示,充电站。而且还能切换不同的视角。整体体验非常丝滑,也没有发现明显的物理错误。

APPSO 还让它把游戏部署到了互联网上,感兴趣的读者可以体验一下。

https://5a4c8f1eb5614758956ed9aa23fa01bb.app.workbuddy.link

随后,为了测试它在真实场景下的软件工程能力,我们交给它了一个「烂摊子」—— 带有 Bug 的「公司差旅报销系统」。看看它能不能真的接手项目。

此外,我们还给它加了一些限制,不准他看不该看的答案,从而测试它的指令遵循程度如何。

最终交付时,它严格按照指令执行,没有打开评测脚本和参考答案;

同时,它还修复了原本系统的诸多问题,比如权限错乱,统计口径不一致等问题。

让它新增的「异常报销审核」功能,也完美完成。(该功能只有财务和经理可见,员工只能报账。)

最有意思的测试场景是接下来这个案例。我们让 Coding Agent 去网上搜一下最近很火的牛来电影,用牛来形象,牛来风格,做一个真正能玩的网页 3D 牛来小游戏。

做出来的游戏特别好玩,有不同的传送门,可以传送的新的任务场景,不同的场景还有存档点,NPC 也是可以交互的。最终任务是收集道具,让牛来电影成功上映。

能成为 WorkBuddy 的好 Buddy 吗

除了代码开发的任务,我们还可以使用 WorkBuddy 进行文档处理、数据分析可视化、深度研究等方面的日常办公。但是这次 Hy4-Preview,真的强化了它的办公能力吗?

APPSO 要求 Hy4-Preview 自己去互联网搜索 APPSO 的风格,为我们制作一个招聘海报。全程给它补充任何额外信息,只在它第一轮交付时,提了一点视觉风格上的改进建议。

最后它交付的海报,不可谓不精美。而且和 APPSO 的视觉风格非常相似。

海报还可以在右侧工作台,实时手动修改,或者框选后让 Agent 执行修改。

在深度调研任务上,我们让 Hy-4 Preview 调查最近三个月「AI Coding Agent 在真实企业软件开发中的部署情况」。

它自动组织了多个 Agent 组建了一支调研团队,最后给出的文档内容详细,使用的数据来源也全是权威机构,经核查,引用的数据均准确无误,事实边界也界定的很好。

继续用 WorkBuddy 内的数据分析及可视化任务功能来测试时,要求 Hy4 preview 基于教育部官方发布的数据,围绕「全中国博士生正在变多吗?」这个问题,做一次可视化分析。

Hy4 preview 花了非常长的时间进行调研,最后给出的研究报告,可以说能直接拿过来用。

最后,它还结合数据给出了针对个人的学业建议。我们把这份建议贴了出来,希望也能通过这次测试,顺便帮助到有相关需求的读者。

腾讯混元开始踩油门了

APPSO 此前实测  Hy3-preview  的文章曾提到,混元的路子,从一开始就不是单纯刷高 benchmark,而是把模型做得在真实场景里更有用。

Hy4 这次更新,其实比 Hy3 时又往前走了一步。

当时 Hy3 总参数只有不到 300B 的时候,「不跟别人拼尺寸」多少还可以被理解成一种取舍。但到了更大的 Hy4,腾讯依然选择把场景、产品和模型绑在一起,说明这的确是他们的长期战略目标。

而且,这套方法论,相比之前 Hy3-Preview 发布时,已经有了一些真实世界的数据支撑。

Hy3 上线一周,API 调用量就达到上一代的 68 倍以上。腾讯自己的 WorkBuddy 评测里,它把任务成功率推到了 90% 以上,同时缩短了平均任务耗时。

模型变好,产品里的任务成功率提高;用户开始更多地调用模型;新的使用数据和失败案例再回到训练、评测和产品迭代里。

过去大家说 Co-design,多少还有一点 PPT 上画飞轮的感觉。

到了 Hy4,这个飞轮开始真的有东西可以喂了。

更好玩的是,腾讯刚刚把大语言模型和多模态团队合并成新的基础模型部,统一交给姚顺雨。文本、图像、视频、语音、3D,以及强化学习和 Agent,不再被拆成几条各自发展的路线。

Hy3 更像是混元重整之后找到方向的那一步,Hy4 则要验证,这个路子到底能不能做深,做大,做强。

当然,现在给混元下结论依然太早,它离真正的 SOTA 也还有距离。

当腾讯把更大的模型、更统一的基础模型团队,以及自己手里数以亿计用户每天真实发生的场景放到一起,终于可以试试将油门踩到底能跑多快了。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名 + 岗位名称」(请随简历附上项目 / 作品或相关链接)

更多岗位信息请点击这里

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 ai flash 混元大模型 汤道生
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论