【CNMO 科技消息】9 月 18 日,千问新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线。据 CNMO 科技了解,该模型支持文本、图像、音频和视频输入,并支持 1M 长上下文处理,可在理解内容的基础上自主规划任务、调用工具并完成创作与交付。




从功能来看,Qwen3.8-Omni-Flash 在延续编程、文本处理和 GUI 操作能力的同时,进一步扩展了音视频相关任务处理能力。针对长音视频理解,模型可面对数小时视频内容,从问题出发决定关注的画面和声音信息,并通过多轮取证定位关键内容。结合工具后,还可从会议中提炼纪要、待办事项与风险信息,并继续执行发邮件、写代码或检索多模态资料生成报告等后续任务。
在音视频创作方面,模型可用于音乐视频制作、短剧翻译和长电影解说等场景。例如,在音乐视频创作中,模型可理解歌曲结构、节奏和情绪,输出带时间戳的句级歌词;在短剧翻译中,可完成角色识别、口语化翻译、配音克隆、音轨重混与成片质检;在长电影处理中,则可完成情节提炼、解说规划、配音配乐、剪辑渲染和最终质检。

此外,该模型还可将长视频内容转化为可复用的信息资产,包括自动梳理知识点、拆解步骤,生成图文对应的 PDF 笔记,并进一步转化为经过校验和评测的 Agent Skill。实时交互版本 Qwen3.8-Omni-Flash-Realtime 则可在音视频流输入过程中同步完成感知与响应,适用于口语陪练、空间音频感知和智能客服等场景。

配套方面,官方同步扩展了 Qwen-MM-Plugins,新增面向音视频理解与创作的多项能力,并开源 Qwen-Live Harness,用于持续、实时的音视频交互与任务执行。根据官方数据,在累计 30 项评测中,Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%;同时,API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。
目前,该模型已上线千问 AI 平台。


登录后才可以发布评论哦
打开小程序可以发布评论哦