星途科讯 3小时前
原生支持视频理解,谷歌Gemini 3.8 Flash对标GPT-6与Claude
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

本月人工智能领域新品密集发布。谷歌推出 Gemini 3.8 Flash,直面 OpenAI 最强模型 GPT-6 Astra 与 Anthropic 编程利器 Claude Fable 5.1 的竞争。尽管在通用能力上面临挑战,但 Gemini 3.8 Flash 在视频理解领域建立了显著优势。

原生视频输入与代理式理解

Gemini 3.8 Flash 支持文本、图像、视频、音频和 PDF 多模态输入,上下文窗口超过 100 万 token。其核心突破在于 " 代理式视频理解 ":模型并非简单将视频转换为截图,而是能自主导航时间线,动态决定检查哪些帧、转录文本或音频片段以回答问题。

谷歌数据显示,该方法处理长视频时 Token 消耗最多降低 88%,同时回答质量提升约 7%。用户可直接询问视频中特定时刻的细节,如 " 演讲者何时提及某主题 " 或 " 某人进房前发生了什么 ",无需手动快进查找。

竞品的能力边界

相比之下,GPT-6 Astra 虽拥有 105 万 token 上下文窗口,但官方文档明确不支持音频和视频输入。Claude Fable 5.1 上下文窗口为 100 万 token,擅长图表等视觉信息理解,但其输入输出能力仅限于 " 文本和图像 "。

虽然用户可通过提取帧或生成转录文本等方式间接处理视频,但这并非原生功能。Gemini 3.8 Flash 从设计之初便旨在直接接受并推理此类多模态数据。

音频与视频的双重优势

音频处理同样是 Gemini 3.8 Flash 的强项。模型可直接接收音频输入,在多模态任务中直接对声音内容进行推理,无需预先转化为文本。在处理视频时,模型能结合视觉帧、音频和时间戳协同工作,甚至自主判断是否检索转录文本或检查特定片段的音频。

这一能力适用于讲座分析、假期视频检索等多种场景。

Gemini 3.8 Flash 并非谷歌最大或最昂贵的模型。作为迄今最智能的 Flash 系列模型,它旨在平衡复杂推理、代理功能与速度成本效益。

尽管 GPT-6 Astra 和 Claude Fable 5.1 在高难度推理和长周期代理任务上可能表现更佳,但随着视频数据在 AI 交互中的占比日益增加,Gemini 3.8 Flash 凭借原生视频理解能力占据了差异化优势。用户只需上传视频或粘贴链接,即可体验其 " 观看 " 与分析能力。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看