有人让本地AI“想”一整晚才回答,还说挺值
Simon 的评价引发讨论。有人指出,这来自一个糟糕的默认设置,而且很容易改。具体怎么改?有人直接问:“简单的更改是什么?”
在 Strix Halo 上,xhigh 级别的回答通常要跑一整晚:睡前开始,醒来才看到结果。有人调侃,xhigh 像是召唤爱因斯坦、霍金、费曼和牛顿的灵魂来长时间辩论。
等待是值得的。一位从 3.6 升上来的用户说,旧版经常要反复问“还有别的需要考虑吗”,模型还是会漏东西。新版第一次给出的结果通常就是对的。
有人讽刺说,这不叫过度思考,叫 AGI 模式。也有人不想等。一位用户把思考级别固定在 medium,第一次不够准就跑第二遍;另一位在尝试 medium,想通过调提示词在中档思考下拿到好结果。
更极端的是关掉思考。有人在 unsloth 里关掉后,生成速度只有每秒 4 个 token,快不起来。
另一条路是降低量化等级。有用户在 RTX 3090 上保持 xhigh,把模型从 Q4_XL 换成 Q3_XL,上下文更长。结果出乎意料地好,只是处理时间依旧让人等得久。
还有人分享了另一个聊天模板,用法是 --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek。分享者只给了链接和命令,没提效果。
有用户为它辩护:这个模型是个例外,聪明和想太多是一体的。他顺势设想,如果 Qwen3.8-35B-A3B 也有这种改进,会“统治世界”。
Simon Willison 在 Mastodon 上写道,他记不得上次玩本地模型这么开心是什么时候了。