AI Pulse
📡 X 信号

AI博主实测发现:Agent选择对效果影响和模型差不多大

我错了,我低估了 Agent 对模型的影响。

以前挑 AI 干活,思路是选模型:要深度就 GPT,要中文就 DeepSeek。但这次我用不同 Agent + AI 模型的组合,跑同一份深度调研报告,最后让更强的模型统一打分,才发现 Agent 的选择几乎和模型一样重要——不同组合出来的东西,根本不是一个量级的。

先说结论,我的最佳实践:
1. 纯编程:Codex + GPT;
2. 非编程的工作流:首选 Pi + GPT,备选 Claude Code + DeepSeek;
3. 严肃的中文写作:Claude Code + DeepSeek;
4. 创作型中文写作:Pi + DeepSeek。

原理其实就两层,想清楚就不难配:
模型层:GPT 推理深度好、严谨,但中文生成弱;DeepSeek 推理深度弱一些、不够严谨,但中文一流。
Agent 层:Codex 的约束非常多而且严格;Claude Code 约束也多,但体感略好于 Codex;而 Pi Agent 几乎不约束,把最大的发挥空间交给模型。

同一份调研报告,四种组合的实测差距非常直观:
1. Codex + GPT:最严谨,但非常干瘪。证据链挑不出毛病,可读性和参考度却都不够,像一份完美的填空报告;
2. Pi + GPT:完整而且丰富,参考性非常高。一个推理深度足够的模型,配一个不设限的 harness,丰富度刚好被补上;
3. Claude Code + DeepSeek:报告丰富,但完整度不够,深度任务里会漏东西;
4. Pi + DeepSeek:内容洋洋洒洒,但明显存在漂移——跑着跑着就离题了,逻辑漏洞自己很难发现。

一个提醒:如果你用了 DeepSeek + Pi 这种最奔放的组合,最后最好让一个更强的模型做一次复合复检,把逻辑漏洞补掉。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新