三个指令,普通显卡让AI独立写完整个项目
作者在RTX 5060 Ti的16GB显存上本地运行Qwen 3.8 27B,用OpenCode做代理编码工具。他总共给了3个提示词。模型自主完成了一个完整的API和MCP(模型上下文协议)服务器项目,全程处理的token超过100万。
73k上下文能塞进16GB,靠的是llama.cpp的一组配置。主上下文的KV cache用q4_1量化,MTP草稿上下文用q5_1。同时打开原生MTP投机解码(spec-type=draft-mtp, n-max=2)。KV cache量化就是把缓存数据存成更低精度,把显存省出来。投机解码则让草稿模型先生成候选token,主模型批量验证,提升吞吐。
三个提示词各管一段。第一个让模型生成约1500行Markdown规格说明,里面包括结构分析、可爬取的HTML节点、预期JSON载荷、技术栈选择。分页逻辑、会话认证和搜索端点也在其中。第二个让它给出模块化的NestJS API实现计划,拆成9个执行阶段。第三个把OpenCode设成严格编排者。之后模型自主跑了约2小时。上下文快满时,它自动做状态摘要,继续构建。最后写单元测试、执行linting,交付功能完整的代码。
这次运行的采样参数是temp=0.4、top_p=0.90、top_k=15、min_p=0.02。官方对思考模式的推荐是另一组值:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0。presence_penalty和repetition_penalty则分别是0.0和1.0。两组差距不小,温度一项就差了两倍多。作者没说为什么改参数。任务在这组参数下跑完了,官方推荐值不是唯一可行的设定。
评论区出现了不同玩法。有人用IQ3_XXS量化,在16GB显存上推到150k上下文。提示处理速度900到600 t/s,解码20 t/s。有人在AMD 6800上用Vulkan跑,最大上下文86784,解码39.91 t/s。也有一批对量化的保留意见。有评论者说不信任q3,坚持用q6。有人担心KV cache量化会让上下文信息出错。另有人说自己用q4只能拿到32K到37K上下文窗口,觉得不够实用。
同样的16GB显存,量化等级、显卡品牌、后端不同,结果差距很大。作者没有公开三个提示词的具体内容,也没给出73k上下文下的实际生成速度。评论里有人问他,这套配置是试错试出来的,还是有其他方法。想在自己机器上复现同样的结果,只能逐个变量试过去。