量子位 昨天
大模型给图片打分不再“靠嘴说”!结构图、频谱图当“物证”,用“视觉证据”来给图片打分
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

让大模型给一张图片打 " 质量分 ",它其实经常看走眼

一张干净的照片,和它偷偷加了噪声、被压过、糊了一点的 " 退化版 ",在你我眼里质量天差地别——但在多模态大模型(MLLM)的 " 眼睛 " 里,这两张图几乎长得一模一样

于是它给出的分数,往往是 " 凭感觉 " 估的,而不是 " 看证据 " 得出的。

现在,来自西北工业大学香港科技大学的研究团队提出了一个新框架——IQA-T1,第一次让多模态大模型在评估图像质量时,学会像专业检测员一样:

不再只靠 " 瞥一眼 " 的直觉,而是主动调用一套专业分析工具,生成噪声残差图、梯度分布、傅里叶频谱等结构化的 " 视觉证据 ",再一步步基于证据做出判断。

从 " 凭感觉打分 " 到 " 拿证据说话 " ——在 7 个图像质量评估基准上,IQA-T1 取得了综合最优(SOTA)的成绩,平均 PLCC/SRCC 达到0.795/0.784,同时给出的评估过程可解释、可追溯

论文与代码均已开源。

现有 MLLM 打分要么是 " 纯文本推理 "(易受语义偏见误导),要么是 " 区域裁剪推理 "(一堆没有解释的图像块);IQA-T1 则走向 " 工具生成视觉证据 " 的新范式。大模型打质量分,为什么会 " 凭感觉 "?

图像质量评估(Image Quality Assessment, IQA)的目标,是让机器打出的分数尽可能贴近人的主观感受。它是图像修复、增强、压缩等一系列视觉任务的 " 裁判 ",直接决定了视觉系统在真实开放环境中好不好用、稳不稳。

随着多模态大模型崛起,越来越多工作开始用它们的 " 推理能力 " 来做 IQA,希望既能给出分数,又能讲清楚 " 为什么是这个分 "。听起来很美好,但研究团队指出了一个共性的根本缺陷

现有 MLLM 打分,依赖的是带有语义偏见的内部视觉表征,而不是可验证的底层退化证据。

说人话就是:大模型的视觉编码器天生擅长理解 " 这是一只猫、这是一片海滩 " 这类高层语义,却对噪声、模糊、压缩伪影这类底层退化极不敏感。

论文里有一个很直观的刻画:给定一张原图和它加了噪声的退化版,人类会打出差异巨大的分数,但两者在大模型里的视觉表征却几乎相等——

表征几乎不变,质量却有明显差异。这就是所谓的语义偏见(Semantic Bias):模型手里根本没有足够的信息去感知退化,自然只能 " 猜 "。

现有方法试图打两个补丁,但都没打到点上:

纯文本推理(如 Q-Insight、VisualQuality-R1):生成一段结构化的质量描述再打分,但整个推理仍然建立在模型自己 " 脑补 " 的语义先验上,缺乏可验证的视觉锚点;

区域裁剪推理(如 Zoom-IQA、Q-Probe):把图里可能有问题的区域放大、裁下来喂给模型。可这些区域本质上还是一堆没有结构化解释的图像块,模型看到了也说不清 " 这块到底是噪声、是模糊还是伪影 "。

一句话总结:它们都没能给推理过程提供 " 证据 "。

核心思路:给大模型配一个 " 检测工具箱 "

IQA-T1 的解法,可以类比成医生看病的进化:

过去的模型像是只靠 " 望闻问切 " 经验下诊断的老中医;而 IQA-T1 像是学会了主动开CT、验血、拍片的现代医生——先拿到客观的检查结果(证据),再据此下判断。

具体来说,团队为模型准备了一个感知工具库。推理时,模型会自主决定调用其中哪些工具,每个工具专门 " 显影 " 一种特定的画质退化,把肉眼(和大模型标准表征)看不见的问题,转成一张张结构化的证据图

NoiseResidualMap(噪声残差图):用原图减去去噪版本,把传感器噪声、压缩噪声单独 " 抠 " 出来;

FourierMagnitudeSpectrum(傅里叶幅度谱):在频域里揪出周期性伪影;

GradientOrientationCoherenceMap(梯度方向一致性图):暴露因模糊、过度平滑造成的结构不一致;

……

这些证据图会被逐步融入推理链,成为模型每一步判断的 " 物证 "。这样一来,IQA 就从一个纯靠语义脑补的推理任务,变成了有据可查的证据驱动推理

工具库的设计也很讲究。团队梳理出 IQA 中7 个关键感知属性——结构、锐度、噪声、伪影、亮度、色彩、自然度,并据此设计了15 种视觉证据。所有工具还满足三条工程约束:统一调用接口、输出适度下采样(省 token)、结果完全确定性(保证数据构建、SFT、RL 三个阶段看到的证据完全一致)。

从 " 会用工具 " 到 " 会挑时机 ":两阶段训练

要让模型真正掌握这套本领,需要两种能力:知道怎么用工具,以及知道什么时候该用。IQA-T1 用一条两阶段训练流水线来解决。

左:监督微调(SFT)让模型学会 " 怎么用工具 ";右:强化学习(GRPO)模型学会 " 何时用工具 ",由工具使用奖励、重复惩罚、打分奖励等共同约束。第一阶段:监督微调(SFT)——先学会 " 怎么用 "

在自建的 Q-Tool 数据集上做监督微调,让模型掌握三件事:遵循结构化的推理模板、使用规范的工具调用语法、把视觉证据和质量判断关联起来。注意,模型不需要自己生成证据图(那是工具确定性产出的),训练时对证据图对应的 token 做了 loss masking。

第二阶段:强化学习(RL)——再学会 " 何时用 "

SFT 教会了 " 怎么用 ",但没优化 " 调用策略 "。于是团队用GRPO做强化学习,专门打磨模型自适应调用工具的策略。奖励函数由四部分精心组合:

格式奖励

:输出是否符合规范结构(含工具调用标签和最终分数);

打分奖励

:预测分与真值越接近,奖励越高(指数衰减);

工具使用奖励

:鼓励调用 " 适量 " 的工具——太少没证据,太多则惩罚冗余;

重复惩罚

:一旦反复调用同一个工具刷存在感,直接扣分。

四项加权求和(权重最高,给到 5),最终让模型学会用尽量少、尽量对的工具,拿到尽量足的证据

数据集 Q-Tool:第一个 " 证据推理 "IQA 数据集

现有 IQA 数据集里,没有一个支持 " 视觉证据推理 "。团队干脆自己造了一个——Q-Tool,包含11k 条高质量多模态推理链,每条都把工具生成的视觉证据和人类对齐的文字分析绑在一起。

Q-Tool 的三阶段构建流程: ( a ) 感知工具库构建; ( b ) 以人类先验为引导、由 GPT-4o 生成证据推理链; ( c ) 多层级验证,产出 11k 条高质量推理链。

它通过一条三阶段流水线构建:

工具库构建:

即前文的 7 属性 /15 证据工具集;

证据推理链合成:

先由人类专家写好推理模板(把画质评估拆成 " 看结构→分析噪声→评估色彩…… " 等阶段,并规定属性到工具的映射),再让GPT-4o在模板约束下生成完整推理链,避免模型放飞自我地 " 幻觉 ";

推理链验证:

工具是否用对、证据是否真正被引用、结论是否被证据支撑三个维度逐条审查,不合格的直接删除,边缘 case 人工精修。

实验结果:7 大基准综合 SOTA

团队在 KonIQ 上训练,并在覆盖真实失真、合成失真、算法退化、AI 生成内容的 7 个基准上评测跨分布泛化能力,对手包括传统手工方法、深度学习方法、以及最新的一众 MLLM 方法。

结果是,IQA-T1 拿下了7 个数据集平均 PLCC 0.795/SRCC 0.784 的综合第一

对比只会打分、不会解释的 MLLM 方法(如 Q-Align、DeQA),IQA-T1 在保持高精度的同时,还能给出可解释、有证据的推理链;

对比同样带推理的方法(如 Q-Insight、VisualQuality-R1、Zoom-IQA),它在合成失真(CSIQ)和算法退化(PIPAL)这两个硬骨头数据集上刷新了最好成绩,在真实图像和 AI 生成内容上也极具竞争力。

一个直观的例子最能说明问题:

面对同一张低质量图片(人类真值 GT=2.66),Q-Insight 打 2.30、VisualQuality-R1 打 2.41,都存在明显偏差且含有错误描述(红字);IQA-T1 则先调出梯度图确认结构模糊、再调出噪声残差图坐实噪声,最终打出2.67,几乎与人类判断一致。

更有意思的是关于" 工具怎么调 "的消融:

也就是说,工具不是用得越多越好——无关工具反而会引入冗余视觉 token 和干扰。IQA-T1 的动态调用平均每张图只用2.34 个工具,却拿到了全场最好的效果,还更省时省显存。这说明模型是真的在" 基于证据推理 ",而不是简单地 " 拟合分数 "。

更多案例显示:模型会针对图像的主要退化,自适应地调用最相关的工具(如亮度 / 色彩图、梯度图、噪声残差图),并把证据串进推理链,给出接近人类的分数。

此外,把框架换到 Qwen3-VL-2B、InternVL3.5-4B 等不同基座上,性能趋势依旧稳定——证明 " 工具化视觉证据推理 " 是一种通用机制,而非某个特定模型的专属技巧。

团队

这项工作由西北工业大学香港科技大学联合完成。论文第一作者为西北工业大学的Jinjian Wu与香港科技大学的Jiaqi Tang(共同一作),通讯作者为西北工业大学的Wei Wei教授与香港科技大学的Qifeng Chen教授。

团队希望这项工作能启发更多研究:把结构化的视觉证据引入多模态推理系统,让大模型的 " 感知 " 变得更可靠、更可解释。

论文:https://arxiv.org/abs/2607.12375v1

代码:https://github.com/zibuyu-02/IQA-T1

模型:https://huggingface.co/zibuyu-02/IQA-T1

数据:https://huggingface.co/datasets/zibuyu-02/Q-Tool

Demo:https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

西北工业大学 香港科技大学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论