AI 下一步往哪儿走,顶会往往最先露出风声。
9 月 8 日至 12 日,ECCV 2026 正在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了 Google、Meta、Apple、Amazon 等全球科技巨头作为主要赞助商。
作为计算机视觉顶会的 ECCV,向来是前沿学术的竞技场,但今年,一个更贴近现实世界的技术命题被摆上了桌面:
Agentic Commerce(智能体商业)。
没听错吧?在一个纯 CS 视觉顶会上,一帮顶尖学者开始认真研究如何让 AI 做生意了。
镜头拉到 MARS2 Workshop,台下座位早已坐满了人。
台上星光熠熠,牛津、MIT、伦敦玛丽女王大学等机构的研究者轮番登场,聊的都是多模态 AI 正在攻克的前沿问题。
会场外的配套挑战赛也已决出优胜方案,10 万美元奖金池,吸引 64 支全球团队入场,累计提交超过 1060 份方案。
人气、阵容、奖金、议题热度,都拉满了。
把这些要素串在一起的,是一家中国科技公司:钛动科技。
△MARS2 Workshop 优秀论文展示区
这场 Workshop 名叫 MARS2,全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》(大模型时代的多模态推理与慢思考:迈向 System 2 及以上)。
它指向一个正在发生的现实:智能体商业正在改变消费者发现、比较、购买的完整交易链路。那么,当这条链路越来越多地由 AI 智能体参与甚至代理,多模态 AI 能否先看懂内容、理解意图,并据此优化商业动作?
根据 ECCV 官网公开信息,MARS2 是本届 ECCV 全部 Workshop 中,唯一一个由中国科技公司牵头举办的 Agentic Commerce 方向的 Workshop。
所以,全球研究者们在 MARS2 Workshop 上,碰撞出了哪些「让 AI 做生意」的解法?
直击 MARS2 Workshop 现场
首先,判断一道题的学术分量,最快的方法是看台上坐着谁。
那么,MARS2 都有谁在?我看到了这 4 个名字:
牛津大学教授 Yarin Gal,是现代贝叶斯深度学习的代表学者之一,领导牛津 OATML 实验室,长期研究 AI 给出的答案到底靠不靠谱。
MIT 助理教授 Paul Pu Liang,同时任教于 MIT Media Lab 和 EECS,带队研究多感官智能,专门解决文字、语音、视频等不同信息如何被模型放在一起理解的问题。
伦敦玛丽女王大学的 Shanxin Yuan主攻数字人与运动智能;林雪平大学的 Fahad Shahbaz Khan长期研究视觉识别、视觉语言模型和多模态理解。
能把这样一套阵容凑到同一张议程表上,MARS2 的学术号召力,已经不用多解释了。
4 位嘉宾的分享,共同指向多模态 AI 的下一步:不再只是「看见一段视频、说出几句描述」,而是能在复杂、动态、跨模态的信息中找到证据,理解事件如何发生、意图如何形成,并把判断转化为可靠行动。
这条从「看见」到「想明白」的完整链路,恰好也是 MARS2 多模态 AI 挑战赛(MARS2 2026 Challenge)赛题设计的底层逻辑。
更具体地说,MARS2 多模态 AI 挑战赛要回答这个问题:AI,能看懂营销视频吗?
技术拆解来看其实就三层:
先看懂整条视频,再找到关键时刻,最后读懂背后的营销意图。
这三层能力,也分别对应挑战赛设置的三条赛道。
△图片由 AI 生成
三条赛道共用的考卷叫 M-CAR。
这是一个基于钛动科技真实商业场景构建的高质量数据集,包含 3108 支广告视频,覆盖 30 多种语言。总计 36.5 小时的视频被精细拆分为 18198 个语义片段,平均约 7 秒就有一个独立片段。
选手需要在本地让模型逐一答题,再把结果上传至 EvalAI,由平台统一评分和排名。
一番较量下来,最有意思的结果出现了。
MAC 最高分达到 86.67,VTG 和 MDC 的最高分则分别为 62.27 和 63.53。
从整体理解到精准定位和策略推理,冠军方案成绩相差 20 多分。
看来,看懂广告讲了什么,只是第一步;要在长视频中找准关键时刻、进一步拆解营销意图,仍是多模态 AI 更难啃的题。
再把不同类型的模型拉到一起比比,也能看出明显的「偏科」。
作为对照基线的商用模型,在三个赛道中表现都比较稳;通用模型和任务专用模型则各有长短,其中任务专用模型在 VTG 赛道尤其突出。
就是说,AI 进了考场也讲究术业有专攻。
整体情况说完,再看谁把卷子答得最好。
来自中国科学技术大学、南开大学、中山大学等知名高校的学者,以及来自字节跳动、京东、小红书等知名企业的代表纷纷参赛,最终,在 MAC 赛道,The Boys 以 86.67 分拿下冠军;VTG 赛道冠军是 Ya PTers,成绩为 62.27 分;MDC 赛道又被 The Boys 以 63.53 分收入囊中。
字节跳动背景的团队 The Boys 一支队伍拿下两个冠军和一个亚军,属实有点能打。
△竞赛团队背景分布图
而且这次参赛还有硬限制。
MAC 和 MDC 使用的模型不能超过 14B,VTG 不能超过 8B,并且只能使用开源权重。
想靠巨型闭源模型硬压分数?此路不通。
选手只能在有限的模型体量里,把数据处理和推理方法往细了做。
(是时候展现真正的技术了 .jpg)
△钛动科技 CTO Tracy Chen 博士为获奖团队颁奖
这场挑战赛给学术界和产业界留下了三个关键信号。
第一,它划清了当前多模态 AI 的能力边界。
前面的成绩已经说明,模型看懂广告的大致内容问题不大,可一旦需要跨越多个片段,梳理时序关系、追溯前因后果,再作出商业判断,表现就会明显下滑。
这正是从「System 1」感知走向「System 2」推理的距离。
说得更直白一点,AI 已经会看广告了,但离真正看懂一门生意、参与商业决策,还有一段路要走。
第二,它给出了一条性价比更高的优化路线。
一般提到提升模型能力,大家最先想到的就是加参数,但这次的消融实验给出了一个有点反常识的结果。
VTG 赛道有团队为模型补上一条跨模态「音频证据时间线」,把人声、音乐和其他声音发生的时间标出来,再与画面逐一对齐,模型定位精度直接提高了 16.7 分。
相比之下,参数量从 4B 扩展到 8B 反而 -0.2 分。
这对产业界的提示很直接:
算力有限时,与其急着换更大的模型,不如先让模型听全、看全,再把信息对准。
第三,它给出了一套清晰的落地思路。
三个赛道的冠军方案用到了 Proposer-Critic 双模型验证、从粗到细的两阶段定位,以及按照视频时长来灵活分配模型处理的视觉信息量,虽然听上去技术名词不少,但核心逻辑就一句话:
让 AI 拿着证据回答问题。
举个例子,现在要让 AI 判断一条广告是如何向消费者传达产品的核心卖点和实际价值,冠军方案不会让模型看完整条视频后,直接拍脑袋报一个答案。
它会先快速扫一遍,构建镜头级、带时间戳的证据表征,由主模型生成答案;最后交给另一个模型独立进行证据一致性批判,抑制无证据支撑的幻觉输出。
视频越长、问题越复杂,系统还会相应多分配一些 Token,让模型有足够空间处理信息。
竞赛技术方案报告把这套思路概括为「证据链工程」。
这启发业界,模型有多大固然重要,但真正进入商业流程后,信息怎么组织、不同模态如何对齐、推理链路是否可靠,同样决定了 AI 到底能不能干活。
比赛结束后,这些成果也不会只停在领奖台上。
赛事设计、评测结果和优胜方案已经整理成技术报告,相关评测基准与代码也会向研究社区开放(地址放文末了)。
钛动科技 CTO Tracy Chen 博士认为,MARS2 Workshop 的成功举办验证了一个判断—— AI Agent 正在从概念走向真实的商业场景,营销是少数既需要复杂智能、又能快速验证效果的领域之一。
钛动科技品牌公关 VP 张羽雪在闭幕致辞中也表示,MARS2 Workshop 的讨论展现了前沿技术如何解决真实商业难题,而这正是钛动科技在国际顶尖学术会议组织讨论、举办挑战赛的目的。
围绕多模态 AI 接下来该补什么、又该怎么补,答案如今更加具象化了。
为什么是钛动科技
聊到这儿,还有一个问题绕不过去。
为什么钛动科技可以把 Agentic Commerce 的核心技术关切带进 ECCV?
事实上,MARS2 要回答的「AI 能否看懂商业视频并理解营销意图」这个问题,钛动已经在真实业务中回答了近十年。
从覆盖全球 200 多个国家和地区、服务 10 万 + 品牌出海、累计管理 4 亿 + 条广告策略、1400 万个 SPU 的业务实践中,钛动积累了一套从「看懂」到「理解」的多模态能力,MARS2 是钛动长期业务积累与多模态 AI 布局的一次自然延伸。
支撑这一步的积累,一头扎在真实业务里,一头长到了模型和技术上,现在又顺着 Workshop 走进了学术社区。
业务这头,钛动 2017 年开始服务企业出海,每天琢磨的事都很具体:
帮中国公司去不同国家找用户、做内容、投广告,再把花出去的钱赚回来。
一条广告上线,用户看了多久、在哪一帧划走、有没有点击和下单,后台很快就会给出结果。换个国家、换批用户,答案还可能完全不同。
这本身就是一道多模态题。
几十秒的视频里,画面、文案、音乐、产品和人物情绪挤在一起,共同影响用户最后买不买。
近 10 年来,钛动反复处理这些场景,也一点点摸清了什么内容、面对什么人、放到什么市场更有效。
这些来自真实商业活动的反馈,又被持续沉淀为模型能够调用的营销知识,成了钛动继续往多模态模型层走的底子。
然后,就有了一款专门面向跨境营销的自研多模态模型,钛极(Tec-Chi)。
钛极有多能打?成绩已经摆上桌面。
今年 1 月,钛极问答推理模型 Tec-Chi-Think-1.0-32B,以 85.82 分登顶广告营销专业大模型测评榜 SuperCLUE-Mkt。
大约半年后,钛极的内容理解模型 Tec-Chi-VL-1.0-27B 又在 SuperCLUE-AdsVU 出海营销视频理解测评中,以 86.43 分斩获总榜第二的成绩,与阿里巴巴千问 Qwen3.7-Max-20260608 共同位列榜单亚军。
在营销这个专业领域,钛极大模型已经稳站全球前列。
不过成绩单背后,人们总是会关注更实际的问题:
它真能干活吗?
营销多智能体平台 Navos 就此登场。
如果说钛极大模型负责看懂和想明白,那发布于 WAIC 2026 期间的 Navos 就是一个执行者:
它把散落在不同模型、工具和业务流程里的能力收进同一个入口,再按照企业目标调用不同的专业 Agent,把 AI 真正放进市场洞察、内容生产、广告投放和效果优化等营销流程。
??这不就是如今常见的「大模型 + 智能体平台」那套打法吗?
确实,方法论本质相同,真正拉开差距的是:结果。
商业社会很残酷,但也很真实,一项技术只有让人真正赚到钱才有上桌的可能。
这方面,我翻到了一个挺有意思的案例。
今年 7 月,钛动科技正式成为 ChatGPT Ads 全球首批官方技术合作伙伴,在 ChatGPT Ads 首批广告主定向邀请测试中,某出海品牌经过钛动 AI 技术团队优化,营销成本明显下降,ROI 提升到了原来的 2.5 倍。
当然,一个案例只能说明这条路跑通过,能不能复制还得看更大的业务盘子。
钛动招股书显示,2025 年前三季度,其 AI 营销解决方案收入达到 1.16 亿美元,同比增长 68.5%,占公司总收入的 89.5%,同期净收入留存率达到 132.5%。
翻译翻译,老客户整体留下来的同时,还在继续增加投入。
到这里,钛动一直强调的「Useful AI」就不难理解了:
真实业务提出问题,数据和反馈进入模型,Agent 把模型能力放进工作流,最后用商业结果验答案。
从数据到模型,再到应用和可以验证的商业价值,这条路,钛动已经在产业里跑了起来。
MARS2 所做的,就是把这套已经在商业战场跑起来的技术闭环进一步开放给全球研究者,让产业问题进入学术研究,再让研究成果回到产业接受验证。
回过头看,钛动科技能在 ECCV 牵头发起 MARS2,一路都有迹可循。
技术公司扎堆当「顶会出题人」,图什么?
另外你发现没,技术公司在顶会里的角色,已经悄悄变了。
以前顶多派几个研究员去发发论文、做做报告,重在参与,现在不一样了——
越来越多垂直赛道的头部技术公司,直接下场当起了「议程设置者」。
摇身一变,直接从交卷的人变成了出题的人??
国内这类消息我最近是没少刷到,转头一看国外,好嘛也一个样。
CVPR 2025 的 Embodied AI Workshop,组织者名单里就出现了 NVIDIA、Meta、Apple、Microsoft、Adobe、Amazon 等一串熟悉的名字。
同年的自动驾驶 Workshop,还继续举办 Waymo Open Dataset Challenge,把自动驾驶汽车在真实道路上遇到的问题,直接摆到全球研究者面前。
没办法,谁让 AI 越往真实世界走,最难的问题就越容易出现在产业一线。
企业最先碰到问题,急着要答案,而研究者天天憋着新招,也急着找地方试。
两边一拍即合,Workshop 自然就成了碰头的地方。
钛动牵头 MARS2,走的也是这条路。
招股书显示,2025 年前三季度,钛动营收约 1.30 亿美元,同比增长 74.5%,其中 AI 营销解决方案占总收入的 89.5%,净利润达到 5568 万美元。
再把时间拉长,钛动已经连续三年保持超过 82% 的毛利率,账上现金储备超过 4.4 亿美元。
这份商业成绩背后,是一个相当复杂的多模态业务现场。不同市场、不同文化、不同用户,再加上画面、声音、文案和营销目标同时出现,随便拎出一项,都够多模态 AI 好好研究一番。
△钛动团队在 MARS2 Workshop 现场
所以它把问题搬进了 MARS2,钛动出题,全球顶尖研究者带来新思路新方法,好的方案再回馈整个产业。顺带着,全球 AI 人才也借这个机会,直接和产业一线接上了头。
Agentic Commerce 方向的「产学研连接器」,钛动把这个角色立住了。
再往深一层看,MARS2 指向的,也是多模态 AI 接下来一个越来越清晰的方向:
回到真实商业场景里去。
过去比的是模型能不能看懂图片和视频,接下来要比的,是它能不能在不同语言、文化和商业目标交织的环境里,真正解决问题。
顶会开始讨论什么,往往预示着技术下一步会往哪里走。
这一次,方向指向了真实商业世界。
而钛动科技,已经提前一步,把这道题摆上了桌面。
完整报告:
https://openreview.net/forum?id=60wA5w8i5L
开源地址:
https://mars2workshop.github.io/eccv2026/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦