
Lightricks 分拆出的开放世界模型公司 LTX 今日正式发布 LTX-2.5。这是一款开源权重的视频及 " 世界 " 模型,通过与 ComfyUI 的战略合作,实现了在该节点式工作流工具中的原生集成。目前,该模型权重已在 Hugging Face 上线,并内置于 ComfyUI 中;用户也可通过 LTX API 调用托管服务。
在商业化策略上,LTX 采取分层许可模式:年经常性收入(ARR)低于 1000 万美元的组织可免费使用,大型公司则需协商许可协议。LTX 表示,其模型累计下载量已突破 3300 万次,成为市场上应用最广泛的 " 开放世界 " 模型系列。
重构生成管道,聚焦效率与多模态能力
LTX-2.5 并非在旧核心上简单叠加功能,而是对生成管道进行了近乎全面的重构。主要技术升级包括:
新型扩散视频解码器:在保持高压缩比的同时,减少高动态画面伪影,提升文本和面部细节的重建质量。
原生多镜头生成:将完整序列渲染为单一输出,确保角色、场景和声音在剪辑间的一致性,避免拼接痕迹。
定制化语言骨干网:采用定制的 Gemma 4 及专用提示词增强器,更精准地处理复杂的多主体提示词。
物理 AI 与机器人优化:提供针对非电影领域数据微调的预训练检查点,服务于机器人技术等实时应用场景。
高效蒸馏模型:经 NVIDIA 优化,可在 RTX GPU 上本地运行且内存需求更低,以较低成本提供接近全模型的质量。
LTX 声称,该模型的成本约为同类产品的八分之一,渲染时间仅为七分之一,并支持从数据中心 GPU 到 Mac 等多种硬件环境。
速度与质量表现:数据背后的硬件前提
LTX 公布的性能数据显示,LTX-2.5 在两台 NVIDIA 顶级 GB200 芯片上自托管测试时,生成一段 10 秒、720p 分辨率的视频仅需 6.8 秒,速度快于实时播放。若通过 LTX 托管 API 以 1080p 分辨率完成相同任务,耗时为 23.7 秒。
值得注意的是,上述极速成绩依赖于远超常规部署水平的顶级硬件。在横向对比中,LTX 基于端到端测量数据称,Google Gemini Omni Flash 耗时 52 秒,xAI Grok 1.5 耗时 63 秒,而字节跳动 Seedance 2.5 和快手 Kling 3.0 Pro 的耗时分别高达 317 秒和 398 秒。
在质量盲测中,LTX-2.5 以 67% 的胜率领先,高于 Seedance 2.5(65%)和 Gemini Omni Flash(55%)。但 LTX 强调,这些数据均由供应商报告或委托测量,未经独立验证,仅作为方向性参考,企业应结合实际工作负载进行测试。
战略抉择:为何押注 " 开源权重 " 而非封闭 API
LTX 联合创始人兼 CEO Zeev Farbman 指出,视频和世界模型的应用场景远比语言模型广泛,封闭 API 无法满足企业构建定制化工作流的需求。" 开放性并非慈善,而是我们的战略。"Farbman 表示,通过提供免费开源权重吸引开发者,待客户业务规模化(ARR 超过 1000 万美元)后再转化为许可收入,是更符合行业特性的商业模式。
ComfyUI 联合创始人兼 CEO Yoland Yan 则将 ComfyUI 定位为开放生态的连接层。他表示,ComfyUI 已成为 LTX 重要的客户获取渠道,许多企业在内部通过 ComfyUI 验证工作流后,才会转向正式的商业合作。这种 " 先实验、后授权 " 的路径,允许企业在自有硬件上进行敏感数据测试,无需担心 IP 泄露或按次计费成本。
应用场景延伸:从虚拟制作到边缘计算
除了传统视频生成,LTX-2.5 正渗透至更多企业级场景。Farbman 列举了计算摄影降噪、水模拟特效、动画关键帧插值等非电影类应用。Yan 则指出,实时世界模型正在改变虚拟制作流程,使导演能在拍摄现场即时获得接近后期效果的预览,大幅缩短反馈周期。
在开发者生态方面,LTX 与 Asteria 及 Reactor 等平台合作,推动低延迟推理在交互式头像、实时机器人等领域的应用。Yan 以 Reddit 上病毒式传播的互动体验 "Flipbook" 为例,展示了开源权重结合低延迟推理如何创造出即时生成的可点击世界。
尽管 ComfyUI 存在学习曲线,但 Yan 认为这是保留专业创作能力的必要代价。" 我们不会牺牲高阶功能的专业性," 他说," 这正是我们与移动端简易创意工具的核心差异。" 目前,LTX-2.5 已通过 Hugging Face、ComfyUI 及 LTX API 全面开放。
【星途科讯 图文丨 Patrick 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦