通义千问发布 Qwen3.8-Omni-Flash 多模态模型
🚀 欢迎认识 Qwen3.8-Omni-Flash,通义千问首个围绕智能体能力构建的全模态模型!原生音视频理解、推理和工具调用在这一个模型中合为一体:理解内容、规划任务、调用工具执行,最终交付结果。
亮点:🥳
- 可完成实际任务的音视频智能:对所见所闻联合推理,在长工作流中调度工具,自动编辑vlog、翻译短视频,以及将电影整理成片花总结。
- 重大飞跃:音视频能力接近 Gemini 3.8 Flash;在 WildClawBench-MM 和 UniClawBench 上,智能体性能平均提升19.5分。
- 支持100万token上下文,具备智能感知:主动探索长视频、定位关键片段,准确率更高,在 OmniVideoBench 上比静态理解少消耗51.8%的token。
相比 Qwen3.5-Omni-Plus,视频输入成本降低约89%,让长音频视频理解和智能体工作流比以往更廉价易得。
为了帮你基于全模态能力构建应用,我们还开源了 Qwen-MM-Plugins 和 Qwen-Live Harness!🛠️
我们迫不及待想看到你用 Qwen3.8-Omni-Flash 构建出什么作品!👀
- 博客:
- 阿里云通义千问:
- 通义千问 Studio:
- API:
- Qwen-MM-Plugins:
- Qwen-Live Harness:即将推出
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖