闪存猎手 13小时前
腾讯开源770B模型同日对决谷歌Midjourney,但真正杀招藏在Anthropic的硬件标准里
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

本期 AI 日报集中释放了多条产品级更新:腾讯混元发布开源旗舰模型 Hy4preview,Midjourney V8.2 上线图像编辑模型,谷歌推出 Gemini Omni 1.1 Flash 视频模型。蚂蚁集团、阿里、小鹏和 Anthropic 也在同一周期内公布了各自的技术进展。

腾讯混元 Hy4preview:770B 参数与 1M 上下文

腾讯发布的开源旗舰模型 Hy4preview,总参数为 770B,上下文长度为 1M。该模型定位真实生产力场景,覆盖软件工程、办公、游戏开发和科研等领域。根据原文信息,Hy4preview 在内部盲测中评分优于 GLM-5.3 与 Kimi K3,这一结果被用来证明其在生产力场景中的性能表现。

Midjourney V8.2:从生成走向编辑

Midjourney V8.2 引入了图像编辑能力,包括指令微调、多图参考、局部重绘和画布扩展。其中指令编辑能力允许用户通过文本指令直接修改图像。对创作者来说,这意味着从单次生成转向对已有图像的灵活修改,视觉创作的控制精度有所提升。

谷歌 Gemini Omni 1.1 Flash:高清长时视频生成

谷歌推出的 Gemini Omni 1.1 Flash 是一个多模态模型,专注于高清、长时的视频生成。它提供场景扩展、运镜控制和参考视频片段等功能。场景扩展允许用户在已有视频结尾处无缝衔接并继续生成后续画面,每次扩展步长为 10 秒。这一设计直接回应了视频生成中连续性和可控性的需求。

蚂蚁集团与阿里:金融模型与智能体工作台

蚂蚁集团推出金融增强大模型 Ling-3.0-flash-Fin,该模型基于 Gemma 4 微调而成,专门用于金融分析。原文指出,它在信息检索、图表理解、数值计算和文本生成四大核心能力上表现突出,通用能力也得到提升,并计划开源。

阿里发布的智能体工作台 Qoder,从一个 AI 编程工具升级为面向所有人的智能体工作台。新版本将工作对象从 " 代码工程 " 转向 " 智能体任务 ",支持 " 读——改——验证——迭代 " 的自主闭环,并提供编程和通用两种模式。

小鹏 VLA 升级与 Anthropic MHS 标准

小鹏第二代 VLA 大模型进行了升级,重点提升对时间的理解能力,从 3D 扩展到 4D。模型推理效率得到优化,并引入整车大脑 Master Agent,将 L4 级体验下放至量产车型。升级还引入了 Infini-VLA 长时序架构,使模型能够理解和处理更长的时序数据,以应对动态驾驶环境。

Anthropic 推出 MHS 硬件标准,这是一套统一的控制与通信标准,用于连接 AI 智能体和物理设备。该标准的发布标志着 Anthropic 进入具身智能和物理 AI 领域,并已在生物医药等行业中展现出潜力。原文金句指出,MHS 标准将大模型竞争从对话延伸到动手操作领域,为 AI 操控物理世界提供了统一的接口。

本期日报的信息密度较高,但主线清晰:模型能力正在从文本对话向图像编辑、视频生成、金融分析、智能体执行和物理设备控制等多个方向同时扩展。腾讯、谷歌、Midjourney、蚂蚁、阿里、小鹏和 Anthropic 各自选择了不同的切入点,但都在解决同一个问题——如何让模型从 " 会回答 " 走向 " 能干活 "。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 谷歌 开源 蚂蚁集团 小鹏
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论