同一个提示词,同一个场景,两个 AI 视频平台交出的答卷却像隔了一条街。有作者用南宋女子制作莲子羹的提示词,分别让豆包和 Muse 生成视频,结果差异集中在一颗莲子上。
豆包生成的视频里,莲子保持了自然的球形,糖块和莲子的大小比例也对得上。Muse 这边,莲子变成了椭圆形,糖块明显偏大,看起来不像真实食物该有的样子。
蒸汽暴露了物理理解的差距
比形状更直观的是蒸汽。豆包生成的蒸汽是透明的,沿着正确的路径上升,有立体感。Muse 的蒸汽则显得模糊,和背景融在一起,看不出该有的层次。
这类细节恰恰是 AI 视频最容易翻车的地方。食物在烹饪过程中会变形、会冒气、会和配料发生体积关系,模型如果没抓住这些规律,画面再精致也会露馅。
物理一致性成了分水岭
作者在对比中给出的判断很直接:豆包在物理一致性和食物质感两方面,都明显优于 Muse。对于想要高质量结果的用户来说,豆包是更可靠的选择。
这条对比的价值不在于谁赢谁输,而在于它把评价标准拉回到了具体画面。一颗莲子的形状、一团蒸汽的走向,比任何参数表都更能说明问题。


登录后才可以发布评论哦
打开小程序可以发布评论哦