" 长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。" 谈及原生多模态的意义,一位多模态研究员如此表示," 视觉是一种更准确的反馈,也更贴近用户意图。"
过去一年,Coding 与 Agent 能力不断改写大模型的排名,也成为 AI 最快兑现商业价值的场景之一。与此同时,随着 Agent 开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。今年 1 月,OpenAI 发布的一份企业使用报告显示,在研发岗位最常使用的三类 ChatGPT 工具中,图片上传排在搜索和数据分析之后,位列第三。
随着 Agent 开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。刚刚过去的 7 月,月之暗面发布的 Kimi K3,就用一个极具说服力的成绩,把这场关于 " 视觉 " 的路线之争推到了台前。
所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与智能体的感知与决策。K3 发布后曾以 1679 分登顶 Arena Frontend Code 榜单。该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。浏览器开发平台 Puter 曾在测试网页中制造 5 处视觉偏差,K3 对照目标页与运行页截图,全部找出且没有误报。得益于出色的原生多模态能力,K3 能够看懂代码运行后的视觉问题,为下一轮修改提供依据。
除了月之暗面,阿里和字节也沿着原生多模态路线,将视觉作为通用模型的基础能力,在最新的 Qwen3.8-Max 和 Doubao-Seed-2.1 上,可以看到视觉理解和多模态输入都作为主要功能出现。而在国产模型头部梯队的另一边,一些团队则选择了更审慎的策略。此前,有业内人士指出,并非所有厂商都急于将视觉深度嵌入主干模型。这两句话并不矛盾。各家公司对多模态的长期价值没有太大分歧,真正的分歧在于时机和代价。在 Coding 快速迭代的阶段,要不要同步训练视觉,以及为此投入多少模型容量、数据和算力,正在影响国产头部模型的技术路线。
做原生多模态,到底有没有必要?随着当下 Agent 的任务链越来越长,这个问题开始变得愈发具体。" 很多时候我就喜欢截图输入。" 一位来自某头部基模团队的研究员表示," 可能文本也能做到同样的需求,但是你得花很多上下文去描述视觉关系。" 视觉输入能够带来更多便利,但不同用户对它的感知并不相同。" 一般人可能感觉不到,但对于开发者群体而言,有多模态还是很方便。" 不过,这种需求并不只属于开发者。上述研究员提到,他身边一些并非 AI 从业者的用户,使用模型最多的场景之一就是制作 PPT。" 更专业的人可能需要更多能力、更多模态,但普通用户也会在具体场景里用到它。"
纯文本模型本身仍然 " 看不见 "。实际系统可以调用 OCR 或独立 VLM,先把图片转换成文字、标签、坐标或结构化字段,再交给文本模型推理。这些工具可以通过 Agent 框架或 MCP 接入,用 " 外挂 " 的形式获得视觉能力。从这个角度来看," 如何让 Agent 获得视觉输入能力 " 这个命题,不仅是一个基模研发问题,也是一道产品题。如果系统调得足够好,上游一个大的语言模型做中枢,下游放一个小一些的视觉模型,就像老板把一件小事分配给员工,足以解决大量普通任务。
但在多模态研究员看来,这种模块化方案仍有边界。" 如果调用一个工具,总归还是两个模型:一个 LLM 是‘瞎子’,下游配一个能看清楚的小弟。" 他解释道,原生多模态模型内部的视觉输入与语言主干之间 " 通信的通道会更宽 ",而不是先把画面压缩成文字,再交给另一个模型判断。这种差异也会延伸到后训练。" 如果模型自己能做,肯定是更好的事情。" 月之暗面研究员陈屿说,原生多模态模型可以在视觉强化学习中重新读取自己生成的页面或图像,把视觉结果纳入同一条训练轨迹;如果依赖外部工具,感知结果还要在两个模型之间传递。而在需要反复查看屏幕的长链任务中,这种差别会更明显。外接视觉工具要先把画面转成文字,再交给主模型判断;原生多模态模型可以直接看懂页面变化,接着直接决定下一步怎么做。
在交流中,一位研究员向智能涌现回忆起第一次让 GPT-5.6 Sol 操作 PC 端 Agent 时,那种 " 震撼 " 的感受。GPT-5.6 Sol 不仅能自动打开浏览器,还能处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。开发者西蒙 · 威利森评价,模型 " 知道很多诀窍 ",为了完成目标,几乎会把能用的办法都用上。" 如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。" 上述多模态研究员说," 但很多面向用户的输出都是视觉的,比如网页、图片和视频,模型需要理解这些结果,再给自己反馈。"
事实上,对于视觉究竟只是模型完成任务的一种工具,还是理解世界不可缺少的部分,一直以来业内并没有达成共识。OpenAI 联合创始人、前首席科学家伊利亚 · 苏茨克维曾把文本称为 " 世界的一种投射 ":人类已经把大量现实规律压缩进语言,模型持续学习文本,仍可能获得对世界的理解。图灵奖得主、Meta 首席人工智能科学家杨立昆的判断几乎相反:" 绝大多数人类知识,并没有以文本形式表达出来。" 语言只是经过人类筛选和概括的信息;模型要理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习。文本是高度概括过的信息,图像和视频更像原始信号。原始信号包含文字没有记录的世界,也需要更多数据、算力和耐心,才能被提炼成可以泛化的知识。
" 多模态肯定不是决定性的,但它很重要。" 一位模型研究员说," 基础的图片、视频答题已经做得比较饱和了。下一步应该把多模态放进贴近生产的实际场景和复杂任务中。" 另一方面,随着 Agent 生态在大众用户间全面普及,用户对旗舰模型的期待也在变化。6 月底,智谱首席科学家唐杰在 X 平台向用户征集 " 下一版 GLM 必须加入哪些新功能 ",评论区反复出现的答案就是 " 视觉 "。此前,曾有多位业内人士向智能涌现表示,智谱与腾讯混元的下一代通用基座模型,都可能进一步向原生多模态迈进。趋势已经出现,但是否要全面强化原生多模态路线,基模团队们还面临着一个资源分配的问题。
" 对于 LLM 来说,多模态更像是一个挂件。" 一位来自某头部基模厂商的研究员说," 模型发展的核心不是多模态,而是完成任务的能力。" 从完成任务的角度看,模型看得更多,不等于干活能力一定更强。一个更现实的问题是:LLM 加入多模态能力后,甚至有可能削弱原有的语言、推理和 Coding 能力。" 任务越多,越难平衡。" 一位多模态研究员表示," 只做一个任务,可以一直往一个方向调;同时做两个任务,要么模型更大一点,要么数据更多一点。" 给模型接入视觉,并非简单增加一个输入接口。图像与文字的数据结构、信息密度和学习速度不同。当它们共同训练同一套主干参数时,视觉数据会与文本、代码、数学和推理争夺模型容量,不同训练目标也可能相互干扰。" 如果想做统一原生多模态模型,付出的资源肯定是 1+1 大于 2。" 上述研究员表示," 不是把两个单独模型的训练量和参数加起来,就能得到一样的效果。" 除了训练难之外,原生多模态在拓宽使用场景的同时,也让各家基模团队必须直面一个根本性的追问:为了让模型长出一双能看懂世界的眼睛,到底要押上多少算力、数据和模型容量,才能确保它不会因此忘了怎么思考和写代码。


登录后才可以发布评论哦
打开小程序可以发布评论哦