QwenCloud发布首个智能体多模态模型
🚀 来认识 Qwen3.8-Omni-Flash,这是通义千问首个围绕智能体能力构建的全模态模型!
原生音视频理解、推理和工具调用整合在同一个模型中:理解内容、规划任务、用工具执行、交付结果。
亮点:🥳
- 能完成任务的音视频智能:联合推理所见所闻,在长工作流中编排工具,自动剪辑vlog、翻译短视频,还能把电影整理成摘要。
- 重大飞跃:音视频能力接近 Gemini 3.8 Flash;在 WildClawBench-MM 和 UniClawBench 上,智能体性能平均提升 19.5 分。
- 支持 100 万 token 上下文的智能体感知:主动探索长视频,定位关键瞬间的精度更高,在 OmniVideoBench 上相比静态理解少用 51.8% 的 token。
相比 Qwen3.5-Omni-Plus,视频输入成本降低了约 89%,让长格式音视频理解和智能体工作流比以往更经济。
为了帮助你基于全模态构建应用,我们还开源了 Qwen-MM-Plugins 和 Qwen-Live Harness!🛠️
我们迫不及待想看到你用 Qwen3.8-Omni-Flash 创造出什么!👀
获取你的 API Key⬇️
-QwenCloud:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖