今日,阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,并在千问 AI 平台提供。据悉,该模型可处理文本、图像、音频和视频输入,并支持 1M 上下文,重点提升了在真实生产力场景中的任务处理能力。

官方公布的数据显示,在累计 30 项评测中,Qwen3.8-Omni-Flash 相比上代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。其中,在音视频 Agent、Coding 和长程任务方面,WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,在 UniClawBench 中取得 69.6 分,此外 LongAudioSpan、OmniVideoBench 等音视频基础能力也有所提升。

据官方透露,该模型的音视频能力接近 Gemini-3.8-Flash,音频能力整体超过了 Gemini-3.8-Flash。同时,其 API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。
应用方面,Qwen3.8-Omni-Flash 可支持长音视频理解,按需描述、Agentic 主动取证、会议任务推进和视频深度研究报告等工作。在 OmniVideoBench 的测试中,其 Agentic Understanding 准确率从 63.4% 提升至 67.8,同时 Token 消耗从 145736 降至 79117,降幅约为 45.7%。此外,该模型还可用于音乐视频创作、短剧翻译、长电影解说等音视频生产场景。

此外,千问方面进一步扩展了 Qwen-MM-Plugins,并开源 Qwen-Live Harness。其中,Qwen-MM-Plugins 面向长音视频的按需感知、工具调用与工作流执行,并提供 Video2Note、Omni Skill Creator 等能力;Qwen-Live Harness 则面向实时、持续的全模态交互。同时千问还推出 Qwen3.8-Omni-Flash-Realtime,可在音视频流输入的同时完成感知与响应,并结合实时上下文调用工具。

近期,千问方面持续推进模型产品的升级。此前在 8 月,Qwen3.8-2.4T-A95B 开源,其总参数规模达到 2.4 万亿,激活参数 950 亿。随后其发布旗舰模型 Qwen3.8-MAX,总参数量达 2.4 万亿,同时也是目前 Qwen 系列中参数规模最大的模型。8 月 26 日,千问办公上线 Qwen3.8-Flash,并同步推出标准模式,所有用户可通过标准模式体验这一模型,标准模式下单任务生成速度提升约 100%,Token 消耗平均减少 75%。
【本文图片来自网络】


登录后才可以发布评论哦
打开小程序可以发布评论哦