同一个AI模型,现在可以把思考调成三档用
Qwen3.8-27B 发布了。它是一个紧凑、容易部署的稠密模型,基于 Qwen3.5 架构,原生支持视觉语言理解,同时能把思考深度调成不同档位。
它默认在回答前先思考。开发者可以通过 reasoning_effort 参数选择思考深度:xhigh 是默认档,给需要深入分析的复杂任务;medium 在准确性和速度之间取平衡;low 优先速度和成本。简单查询走低档,复杂任务走高档,同一个模型不用分版本部署。
官方还提醒了一句:多轮智能体任务里,降低思考档位不等于端到端更快。单轮响应是快了,但失败和重试可能变多,总延迟和 token 消耗反而上升。
长文本部分需要手动开。模型原生支持 262,144 个 token 上下文。输入加输出超过这个数,可以启用 RoPE 缩放(YaRN),最高扩到 100 万 token。开启方式有两种:通过引擎启动标志传入配置,或者修改模型 config.json 里的 rope_parameters。
开源框架实现的是静态 YaRN,缩放因子恒定,不随输入长度变化。这种设置可能损害短文本性能,所以只在确实需要长上下文时才打开。官方建议把 factor 调到接近实际负载:如果典型工作量在 524,288 个 token 附近,factor 设为 2.0,而不是 4.0。
模型兼容 vLLM、SGLang、TokenSpeed、Unsloth 等框架,各框架都发布了部署指南。对需要处理长文档的应用来说,这个开关是一个选项,不是默认能力。