金磊 发自 凹非寺
量子位 | 公众号 QbitAI
你敢相信么,现在的 AI,已经把 " 横店 " 给直接搞到了线上了!
以后啊,人要进横店拍戏,可能就会出现两种方式了。
一种是像以前一样,本人肉身进剧组;另一种,则变成了坐在电脑前,进入线上虚拟片场,在数字化的影棚中调度人物、道具和摄像机,完成影视创作。
这便是在阿里硬核少年技术节 5.0 博见社北京工业场中,群核科技所分享出来的颇为有趣的案例。
据介绍,相关团队将横店的部分线下片场扫描、重建,并放到线上作为 3D 影视基地,创作者可以直接进入这些虚拟片场,使用数字化影棚进行内容生产。
毕竟之前我们还在聊的是 AI 生成视频,而现在,它已经开始把真实片场搬进电脑了。
不过更有意思的,还在后面。
今年,硬核少年技术节旗下的博见社首次设置了两场对话。一场是我们刚才提到的北京工业场,它的主题是 "AI 下一站:从生成内容到构建世界 ",虎鲸文娱、美图、群核科技等企业带来了 AI 产业实践。
而杭州学术场,则联合 CCF 人工智能与模式识别专业委员会,邀请来自清华大学、南京大学、上海交通大学、天津大学、山东大学和上海人工智能实验室等机构的学者,讨论 " 从生成式 AI 到智能体进化 "。
从北京这边的分享来看,AI 已经开始进片场、组团队、搭建三维世界;但当麦克风给到杭州那边,却有人站出来 " 唱反调 "。
在杭州场的圆桌讨论中,有人用电力革命类比今天的 Agent:
当前的 Agent 大概只相当于电灯泡刚刚被发明出来,确实比蜡烛好了一些,但电力后来催生的电网、电机、家用电器,以及一系列过去从未出现过的新事物,我们今天还没有真正看到。
相隔一千公里的北京和杭州、工业圈和学术圈,怎么会对 Agent 的观点如此南辕北辙?
杭州学术场:Agent 发展像电灯泡
我们先来看下杭州学术场这边。
在正式进入讨论之前,南京大学教授高阳在致辞中提到,从早期的逻辑智能体、强化学习智能体,到今天的大模型智能体,AI 正在把曾经的哲学设想一步步带入工程现实。智能体在底层能力、工程框架、可靠性与安全性上还有许多问题没有答案。此次博见社让学术前沿与产业真问题相遇,共同寻找智能体的下一步。
而从现场来看,与会嘉宾们首先针对一个非常现实的问题展开了讨论——
Agent 究竟发展到哪一步了?
对于这个问题,有一说一,嘉宾们其实没有给出统一的答案。毕竟今天大家口中的 Agent,本身就包含了完全不同的形态;如果观察维度不同,得到的判断自然也会不同。
比如从应用能力看,天津大学教授、国家优青郝建业认为,Coding Agent 已经很难再被简单划入初期。原因是,它们已经能够接手相当一部分过去由程序员完成的具体工作,这种替代并不只存在于演示视频里,而是在真实业务中逐渐发生。
但如果把视角转向底层技术,郝建业给出的判断又会谨慎许多:
今天 Agent 能力的提升,仍然高度依赖基座模型;至于 agent 架构设计的很多思想理念比如 MAS、Loop Engineering 等概念,学术界其实早已研究多年。只不过在强基模出现以后,这些过去无法发挥性能的技术路线,终于获得了进入大规模应用的机会
换成具身智能,进度条又要往回拉。
机器人进入现实世界后,需要同时处理视觉、空间、物体、动作以及环境中的各种突发变化。实验室里完成一次流畅演示,与进入工厂、家庭后长期稳定工作,完全是两个难度等级。
再往前一步,真正能够像人和动物一样,在开放世界里不断学习、自己发现问题、自己设置目标的 Agent,甚至被现场嘉宾判断为处在 " 比初期更早 " 的位置。
这种 Agent 目前缺乏成熟的理论和方法。持续学习过程中,还会遇到灾难性遗忘、模型可塑性不足等问题。换句话说,模型可能学会了新的东西,却把旧能力忘掉;即便持续给它新的经验,它也未必能够无限吸收。
这么看下来,Agent 并没有一条统一的进度条。
在代码、检索等数字空间中,它已经能够完成一些相当复杂的工作;到了现实世界,稳定性和泛化能力立刻成为难题;至于持续自主学习,很多最基础的问题还没有答案。
在发展阶段之外,现场的第二个争论更加尖锐:
从生成式 AI 走到 Agent,究竟是量变,还是质变?
多数嘉宾的判断偏向量变。
在他们看来,今天 Agent 能够执行更长的任务,主要得益于基模能力增强、上下文窗口变长、工具调用更加稳定,以及 Harness 持续优化。能力确实在提升,但底层技术范式还没有发生明显变化。
真正的质变,应该发生在 Agent 能够突破基座模型原有能力上限之后。
与会嘉宾对此给出了比较清晰的标准:
Agent 要能够判断自己的结果是否正确,发现问题后主动修正,并将任务执行过程中产生的经验沉淀下来,形成自我进化。只有跨过这一步,它才算从依赖人类数据和预设流程,走向真正的自主学习。
不过,山东大学教授韩忠义从产品形态出发,给出了另一种观察。
过去的生成式 AI 主要负责回答问题,而 Agent 已经开始规划任务、调用工具,甚至直接替人完成工作。从 " 告诉你该怎么做 ",走到 " 它自己动手去做 ",无论底层技术是否发生范式变化,用户感受到的产品形态确实已经不同。
上海人工智能实验室青年研究员张航帆,则把这两种观点接到了一起。
在他看来,技术进步通常是一小步一小步积累起来的,很难在某个精确时间点突然发生指数级跃迁;可当一项能力的成功率跨过临界点时,用户的体验会突然发生改变。
比如一项任务,过去执行一百次只能成功一次,现在一百次只失败五次。站在技术演进角度看,这是持续量变;站在用户角度看,它已经从 " 不可用 " 变成了 " 可以交给它做 ",这当然可以被理解为质变。
顺着这个逻辑,现场的第三个问题也就自然出现了:
Agent 真正获得自我进化能力,到底还缺什么?
杭州场的四场主题报告,刚好从不同角度拼出了答案。
郝建业关注的是工具调用、长期任务、记忆和安全。工具让 Agent 从聊天框进入真实环境,记忆让它能够把一次任务中的经验带到下一次任务,而安全则决定它能否进入生产系统,承担真正有风险的工作。
所以在郝建业看来,Agent 的价值并不只体现在单次生成能力上,更重要的是,它能否持续调用工具、沉淀经验,并在安全边界内完成长时间协作。
上海交通大学人工智能学院长聘教轨副教授温颖,则把问题放进了持续强化学习。
人工提供的高质量数据总会遇到上限,模型要继续进步,就需要形成 " 生成—评估—训练 " 的循环:自己产生新的经验,再从中筛选有效部分,用于下一轮更新。
但大语言环境与传统强化学习有一个明显区别。传统强化学习通常把策略、环境和评价信号分开处理,而在大语言模型里,同一套参数可能同时参与行动、推理和评价。策略、环境模型和验证器彼此耦合,任何一处更新都有可能影响其他环节,训练自然也更容易产生波动。
清华大学智能产业研究院副研究员周浩,则把大规模 Agent 系统所需的能力归纳成三项:
第一是低时延基座模型,支撑高频搜索、决策和执行;第二是自演化强化学习,让 Agent 可以根据反馈持续优化;第三是可学习的长程记忆,让它在跨上下文、跨任务时维持状态,形成长期协作。
张航帆关注的,则是最近越来越频繁出现在 Agent 领域的另一个词—— Harness。
通俗理解,Harness 是一套围绕大模型搭建的任务执行框架。它负责理解目标、拆解任务、管理上下文、调用工具,并根据环境反馈调整接下来的动作。
如果把基座模型看作一个聪明的大脑,Harness 更像负责组织工作的执行系统。没有这套系统,Agent 可能知道很多,却很难稳定完成一项持续数小时甚至数天的复杂任务。
而张航帆进一步研究的 Self-Harness,则是希望 Agent 能够自动诊断和优化自己的运行框架。也就是说,未来 Agent 不仅要完成任务,还要逐渐学会改进自己完成任务的方式。
把这些问题放到一起,会发现杭州学术场真正关心的,已经超出了 "Agent 能不能干活 "。
它还要知道自己干得对不对,哪里出了问题;一次任务结束后,哪些经验值得保留,哪些能力应该更新;更进一步,它要能够把执行过程产生的反馈,转化成下一轮能力增长。
这才是所说的 " 电灯泡 " 背后,尚未完全建成的电网。
点亮一盏灯,并不等于电力革命已经完成;长期供电、稳定运行,并将电力接入无数生产和生活场景,需要的是一整套系统。
北京这边,已经开始给 AI 搭建真实世界
如果说杭州学术场讨论的是 Agent 距离最终形态还缺哪些底层能力,那么北京工业场关心的,就是现有能力如何先进入真实生产。
所以这里的问题要具体得多。
比如一段视频到底能不能交付、人物会不会突然变脸、商品颜色会不会跑偏、AI 做出来的东西最后到底有没有人愿意买单等等。
虎鲸文娱集团 CTO 杜颜龙,先从文娱的本质谈起。
在他看来,小说用文字构建世界,影视用镜头构建世界,游戏用代码构建世界,演唱会则用现场构建世界。媒介不同,但最终目的都指向同一件事:让观众相信这个世界、进入这个世界,并在其中产生情绪和共鸣。
过去一百多年,影视行业用一整套工业流水线构建这个世界,并孜孜以求解决三个核心问题:成本、周期和品质。AI 出现后,这套构建世界的方式迎来了系统性重写。而 AI 的价值,最终也要落到这三个核心问题上来回答。
首先被提及的自然是成本和周期,但在杜颜龙看来,影视行业真正难啃的骨头,依旧是品质。降本增效不是目的,在越来越多的观看场景里以极致的视听语言讲好一个故事,才是行业真正的目标。
一条 Prompt 生成几秒钟的惊艳画面,和完成一部真正能让观众坐下来看的影视作品,中间还隔着编剧、美术、导演、拍摄、剪辑和声音设计等大量专业环节。
古装人物的对白需要符合时代语感,服装造型需要考虑人物身份、地域和场合;画面要有构图、材质和光影,镜头运动还要服务故事节奏。
AI 不仅要能生成内容,还要理解什么样的故事成立、什么样的画面高级,以及什么样的镜头能够让观众进入剧情。杜颜龙因此把影视品质拆成了三类审美:编剧审美、美术审美和导演审美。
沿着这个判断,虎鲸文娱给出了三个面向未来的观点。
首先,AI 不会取代真人。真人演员、导演和创作者依旧会参与影视内容生产,AI 更可能与他们形成新的协作关系。在生产过程和内容交付上,人和 AI 的关系都值得研究。
其次,AI 一定会重写影视生产流程。只靠一个通用模型、一句话生成影视精品,在可见时间里仍然不现实;真正的产业落地,需要完整的模型、工具和生产技术栈,并把它们接进已有的影视流程。
最后,当内容供给因 AI 而大幅增加后,精品内容会变得更加稀缺。那时真正值钱的,可能不再是 " 能不能生成 ",而是 " 什么值得被生成 "。
这种价值转移,在美图公司技术副总裁兼美图影像研究院负责人刘洛麒的分享中,也有类似体现。
刘洛麒先提出了一个现实问题:模型能力已经很强,但从一款强模型到普通用户低门槛使用,中间仍然存在巨大的产品鸿沟。
过去做软件,通常围绕功能展开。功能越做越多,入口、菜单和参数也随之增加,用户需要自己判断该用什么工具、怎样组合这些工具。
Agent 出现后,这套逻辑开始改变。越来越多的功能被藏到 Agent 后面,用户只需要表达目标,系统负责理解意图、拆解任务,并决定调用哪些模型和工具。
刘洛麒将这种变化总结为,从功能堆叠走向智能决策,从交付功能走向交付成果。
△美图公司技术副总裁兼美图影像研究院(MT Lab)负责人,刘洛麒
但美图很快发现,单个 Agent 依然难以完成复杂任务。
原因在于,真实创作通常包含多个目标,而且每个目标都有自己的上下文。把所有事情都交给同一个 Agent,它很容易顾此失彼。
于是,美图开始把软件从 Agent 升级为 Agent Teams,让不同 Agent 各自处理策划、设计、修图、调色和执行,再通过协作完成整条任务。
比如在美图设计室中,用户真正需要的并不只是一张好看的商品图。从商业角度看,这张图还要符合目标用户偏好,适应不同平台的尺寸要求,投放后还得观察是否带来付费和增长。
因此,美图设计室组织了 4 个专业 Agent 和 70 个 Skill,从市场分析、内容生成、视觉创作,一直做到投放分析,最终交付一套可以直接使用的商业物料。
这也意味着,AI 产品的价值正在从 " 做出内容 ",继续向 " 解决问题 " 转移。
一张图够不够好看,只是最开始的一关;它能不能被用户直接使用,能不能进入业务流程,最终能不能带来收入,才决定这项 AI 能力究竟有没有价值。
再回到开头那座被搬到网上的横店片场。这一次,我们可以把背后的逻辑说得更清楚一些。
群核科技 AI 业务线高级总监龙天泽认为,当前视频生成模型主要在二维像素层面学习。它可以不断逼近三维世界,却很难真正理解空间结构。
比如把一张房间图片交给模型,让它补出另外几个视角,每张图片单独看可能都很逼真,但如果把它们放在一起对照,门窗、家具以及墙面的位置经常互相矛盾。
这类问题在几秒钟的视频里或许还不明显,可一旦进入十几分钟甚至更长的影视内容,人物、道具和场景就很容易发生穿帮,难以进入严肃的生产流程。
群核科技给出的解法,是在生成视频之前,先建立一个明确的 3D 空间。人物、道具、场地和摄像机的位置先在三维环境中固定,再将关键画面交给视频模型完成最终生成。
龙天泽将这套分工概括为:
视频模型负责审美和语言控制,3D 模型负责一致性。
这套思路还有一句非常形象的总结——一次搭建,全篇复用。
一间客厅、一座宫殿或者一条街道,在 3D 空间中搭好以后,就可以被不同镜头反复调用;人物和摄像机也能够在其中调整,而不需要每生成一个镜头,就重新抽卡一次。
横店线下片场被扫描、重建并搬到线上,正是这条路线的延伸。
走到这一步,AI 视频的竞争重点也开始变化。过去大家看的是单个镜头是否足够惊艳,现在则要考察人物和场景能否在长视频中保持一致,镜头能不能精确控制,以及整条生产链的效率是否足够高。
为了解决效率问题,群核科技还将 3D 片场与视频 Harness 结合起来。3D 片场负责提高一致性和品质,视频 Harness 则通过关键帧和预览流程,降低长视频制作中的重复生成成本。
到了这里,北京工业场的三场主题分享,其实已经连成了一条非常清晰的线。
虎鲸文娱讨论的是 AI 怎样进入影视工业流程,并理解专业审美;美图讨论的是软件怎样从提供工具,走向直接交付成果;群核科技则进一步把一次性的内容生成,推进到可复用、可控制的空间构建。
而在随后举行的工业场圆桌中,嘉宾们也进一步讨论了 " 生成内容 " 和 " 构建世界 " 之间的区别。
杜颜龙认为,生成内容更像一次单向交付,而构建世界意味着资产可以不断沉淀,人与内容之间也会产生持续互动;龙天泽则将构建世界理解为对现实世界的仿真,它可以成为短剧、游戏,甚至机器人训练的前置流程。
刘洛麒所强调的,是世界应当具备因果规律、物理规律和可交互性。只有理解并维持这些规律,AI 才真正开始从生成一个样本,走向构建一套系统。
与此同时,工业落地还必须面对创意与精准之间的选择。
节日滤镜、娱乐玩法可以容忍一定偏差,用户更在意好不好玩;但到了电商领域,商品颜色、材质和款式一旦发生变化,这张图就无法使用。
流水线式生产更在意成本与效率,精品内容则需要大量人工参与和精细控制。同一种 AI 能力放进不同场景,验收标准可能完全不同。
所以,当高质量内容越来越容易生成后,价值会继续向上转移:对用户的理解、对创意的判断,以及将内容分发给合适人群的能力,都会变得更加重要。
学术圈和工业圈,其实在追同一个闭环
现在我们再回头看开头的那组 " 冲突 ",其实就不难理解了。
北京工业场展示的是,AI 已经能在具体行业里做到什么;杭州学术场追问的,则是这些局部能力什么时候才能连接起来,形成一个真正能够自主运转和持续进化的系统。
两场讨论的重点不同,却指向了同一个闭环:
执行、验证、反馈、更新。
在学术场,Agent 执行完任务后,需要判断结果是否正确,发现错误后进行修正,再把有效经验写入记忆、技能或者模型参数,逐渐形成持续学习能力。
在工业场,AI 生成的内容同样需要接受验证。一段视频要经过审美和逻辑检查,虚拟片场要保证人物与空间一致,商品图要准确还原材质和颜色,内容投入市场后,还要继续观察它是否带来了业务价值。
杭州想解决的是 " 能力怎样不断增长 ",北京关心的是 " 结果能不能稳定交付 "。
因此,横店片场已经被搬到线上,与 Agent 仍处在电灯泡时代,完全可以同时成立。
工业界正在具体场景中补齐流程、数据、空间和行业规则,让一盏盏灯先亮起来;学术界则继续研究记忆、验证、Harness、强化学习和自主进化,试图搭建能够连接这些灯的完整电网。
One More Thing:
博见社,还只是硬核少年技术节 5.0 的一部分。
7 月 20 日,这场横跨阿里巴巴 ATH 事业群和淘天集团的年度技术活动,在杭州、北京两地同步启动,并持续一周。
开幕式上,淘天集团集中发布了 AIGX 技术体系的四项成果,包括拍立淘全模态实时 Agent、全场景 AI 创作工作台 if Studio、Coupella 智惠引擎和 Agentic 推荐系统 Dream。
除此之外,技术市集集中展示了 30 余项 AIGX 技术成果;AI Hackathon 首次设置业务创新和灵感脑洞双赛道,吸引百余支团队参加;Whoisspy 趣味赛则把 Agent 放进桌游,让人类与 AI 直接同场对战。
从首届技术展示,到后来引入 AI Hackathon、模型挑战,再到如今将学术场和工业场放在同一场技术节中,硬核少年技术节已经连续办到第五届。
而这一次,最有意思的可能恰恰是,北京和杭州没有给出一个整齐划一的答案。
有人已经把横店剧场扫描进电脑,展示 AI 今天能把事情推进到什么程度;也有人提醒大家,电灯泡才刚刚亮起来,后面的电网还远没有建好。
这大概也是 AI 当下最真实的状态。
局部已经足够科幻,完整系统仍处于早期。


登录后才可以发布评论哦
打开小程序可以发布评论哦