战刃出鞘 14小时前
合肥押中AI独角兽:多模态赛道,3个月狂融21亿,凭什么?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

7 月 23 日,智象未来(HiDream.ai)拿到了 15 亿元 C 轮融资。三个月里,这家多模态大模型公司已经搞了三轮。三轮加起来超过 21 亿元,估值破了 10 亿美元,成了全球 AI 独角兽。

允中从凹非寺发来消息。量子位公众号 QbitAI 也放了这条。

钱拿得这么密,背后谁在跟?别急着猜,先看数字:15 亿不是小数目,三轮超 21 亿,估值 10 亿美金。投钱的不是傻子,他们看准了什么?多模态大模型,这赛道挤了多少家?智象未来能连拿三轮,说明它手里有东西。但三个月三回融资,节奏快得像在抢时间。

那家叫量子位的媒体,公众号 QbitAI,第一时间报了。允中这个人,名字摆在那,从凹非寺发回报道。凹非寺是哪?不重要,关键的是消息来源真实。

现在的问题是:这轮 15 亿,会是最新一轮吗?或者更早的那轮才是起点?三轮都发生在近三个月,中间隔了多久?没人说具体日期,只给了 7 月 23 日这个点。其他两轮的时间表和金额,只字未提。21 亿这个总数,够不够支撑到下一轮?

独角兽的门槛是 10 亿美金。智象未来跨过去了。但估值这东西,是钱堆出来的,还是技术撑起来的?三轮融完,投资人等着看产出。多模态大模型,不是光烧钱就能跑通的。

钱摆在那,谁掏的、为什么掏,才是关键。这一轮的投资方名单拉出来,活脱脱一场 " 神仙打架 "。社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本牵头领投,跟投的还有厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家。老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本也跟着加码。这些资本平时各玩各的,风格和布局逻辑差得远,这回却罕见地一起砸钱到同一家创业公司身上。你说,这家公司到底有什么,能让这么多路数不同的金主同时看对眼?

智象 C 轮融资的时间卡在 AI 行业变轨的节骨眼上。大语言模型拿钱拿到手软的日子,快到头了。参数是越堆越大,但估值溢价的市场分歧也越来越大,上市 AI 公司的股价在抽风。资本回过味来了:光靠堆参数、拼跑分,护城河挖不深。

钱开始往视觉赛道涌。2026 年国内 AI 视觉融资干了快 300 亿元。字节系的 Seedance、可灵 ARR 涨得猛,独立创业公司也在搂大钱。多模态是除了 AI Coding 之外,商业上确定性最高的方向。

智象的投资人名单透着一股不寻常。社保基金头一回下场投多模态大模型公司,工银资本也是第一次出手。跟投的还有安徽、上海、浙江、福建、湖南多路国资。上影股份和华策影视两家影视龙头并肩进来。东方富海、弘颐资管、敦鸿资本这些市场化 VC 也挤上了车。

AI 公司融到后面,股东结构一般都是越走越窄。智象倒好,国资、产业、市场化机构一轮全部攒齐。不同属性的钱,奔的是同一个方向上的不同切面。

国家级资本看的是路线。全模态世界模型要是跑通了,那就是下一代 AI 基础设施。影视资本卡的是内容产业革命的位。上影和华策已经和智象签了合作:新型内容创制、院线场景升级、AI 跨屏营销、大屏制片标准。不是投一笔钱就完事。地方国资算的是产业账。合肥赌过长鑫和京东方,现在智象被放在了类似的位置上。

AI 通到 AGI 的路,正在分叉。过去全靠规模法则,杨立昆说得难听但点中了要害:LLM 是个书斋思想家,只能处理符号。世界模型要让 AI 理解物理世界的空间、时间、因果和交互。

智象从视觉像素做起,搞原生全模态。一张图包含的信息密度极高,空间、光影、材质全在像素里。传统多模态就是在语言模型外面挂个图像插件,文字是主轴,其他是插件,信息在模块间传递一次就损耗一次。

智象的 UiT 架构走的是另一条路。图像像素、文本 Token、视频体素、音频、动作、空间信号,通通塞进同一套 Transformer 里理解、生成、推理。没有独立文本编码器,不用 VAE 做传导,所有信号统一 tokenization,端到端在一个网络里搞定文生图、长文本渲染、指令编辑、主体驱动、故事板生成。

2026 年 5 月,原生全模态架构拿出了硬成绩。HiDream-O1-Image(8B 开源版)匿名上 Artificial Analysis,拿了文生图开源模型第一,还是前 20 里参数最小的。商用版 HiDream-O1-Image-1.5 冲到全球第三,光影、复杂构图、指令跟随和中英文字渲染都干得漂亮。

一次评测登顶不代表终局,视觉大模型的竞争正在加速。榜单排名从季度变动缩到月度,周期越来越短。但这件事有坐标意义:行业还在争论 " 世界模型能不能 work" 时,至少有一条技术路线,已经在第三方评测里交出了可验证的答卷。多路资本集体重仓智象未来,赛道热度是一回事。更深层的驱动力,恐怕要回到这家公司在底层架构上的差异化选择。这让它在一片 AI 创业公司里,质地不太一样。这出 " 荒诞科幻片 ",可能比 SOTA 更有说服力。多数 AI 创业公司重技术、轻落地,智象未来却早早搭起了 "1+1+3" 商业化体系。底层技术、平台能力、场景应用三级跳。WAIC 上发布的 vivago R1 多模态创作智能体,成了技术落地的核心标杆产品。行业视频生成的长期痛点是什么?时长受限、画面跳变、人设错乱、可用性低。vivago R1 针对这些做了突破,成了全球首款支持无限时长视频自主生成与编辑的创作智能体。产品搭载长链路叙事规划能力,先完成整体脚本与镜头规划,再分段落地生成、智能纠错。单段任务失败独立重试,不拖累整体进度。依托这套架构,vivago R1 把 AI 内容商用有效成功率拉到 85%,跨过了企业规模化商用的门槛。AI 从辅助工具,升级成了内容生产的核心生产力。

近期创作者社群流传一个测试案例。有人在 vivago R1 上输入指令:生成一部 " 叶什尔查姆风格 " 的荒诞科幻短片。叶什尔查姆是土耳其上世纪六七十年代商业电影黄金时代,类似好莱坞,以高产和明星制著称。后期低成本山寨片因粗粝道具、拼贴素材和夸张表演走红海外,比如《土耳其星战》——真人套硬纸板喷银漆怪兽服、泡沫石头道具、手绘背景、演员绑石头在蹦床上模拟飞行,直接剪辑真实爆炸镜头。精髓是 " 廉价到极致,反而形成独特幽默感 "。

对 AI 视频模型,这个风格考验的是理解 " 不完美 "。模型既要输出符合物理规则的画面,又要刻意保持低成本质感,还要在假与可笑间踩中风格阈值。大多数模型倾向于输出 " 好看的画面 " 而非 " 对的风格 "。vivago R1 的处理结果被创作者社群认为 " 精准捕捉了那种荒谬感 " ——硬纸板怪兽、手绘背景、廉价特效都被复现,镜头叙事逻辑连贯。一个把假做到极致的风格,成了检验模型对真实理解深度的试金石。

这个案例不是展示精美画面,而是指向更本质的能力:一个可用的创作工具,必须能理解风格、执行意图、保持叙事连贯,不止生成漂亮单帧。扎实的产品能力也获全球市场认可。vivago 海外版覆盖 100 多个国家和地区,累计服务超 5000 万用户。今年 5 月灰度版登顶 Product Hunt 日榜第一,被硅谷知名 product hunter Chris Messina 推荐,评价为 "Think Claude Code, but for video"。商业化落地能力稳居行业第一梯队。

前两年 AI 竞赛比的是谁更 " 读懂 " 人类已有知识。现在比的是谁更 " 看懂 " 并 " 推演 " 这个物理世界。这是从文本智能到物理智能的范式跃迁,也是世界模型赛道最迷人的不确定性。沿原生全模态技术路线,智象未来的演进节奏与落地效果值得长期追踪。它不仅是国产 AI 在底层架构上的主动突围,更可能为 " 大模型如何跨越纸上谈兵、真正走进物理世界 " 提供范本。这一轮融资尘埃落地,世界模型的牌桌摆开。真正的竞赛,才刚刚鸣枪。

作者声明:作品含 AI 生成内容

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论