AI Pulse
📡 X 信号

微软AI员工聊AI: harness占六成性能

微软AI员工聊AI: harness占六成性能

这是对一位从事 AI 工作的 $MSFT 员工的访谈,内容涉及模型对比,以及他的观点:配套框架占性能的 60%,基础模型只占 40%:

1. 在他看来,Claude 模型在多步推理上表现非常出色——如果你有需要拆解、多步推理的复杂任务的话。与之相对,OpenAI 模型在执行单步任务时表现更好。

2. 他发现,和 OpenAI 模型相比,使用 Claude 时他需要要求返工的次数更少;这也是为什么对复杂任务来说,OpenAI 实际要贵 20-30%——因为模型需要反复调整输出,才能达到他要求的质量。

3. 对比 Claude Code 和 $MSFT GitHub Copilot 时,他提到 Claude Code 原生适配模式的首次通过率更高。他估计这个优势在 20-30% 区间,但他认为 GitHub Copilot 长期会通过优化集成缩小差距。

4. 他认为所有模型都在逐渐商品化,60% 的性能取决于配套框架,只有 40% 由模型本身决定。

5. 根据他的说法,长期来看,行业会从基于 token 的定价转向基于结果的定价,因为成本可预测,企业不可能给 AI 无限预算。

6. 他确实注意到初级开发岗位的招聘变少了;对于那些能被雇佣的人来说,智能体相关技能已经是必需品。另外,现在招聘开发者不再看硬核软件开发技能,而是要看判断优劣的能力,知道智能体应该做什么。他预计 3-5 年内,65-70% 的开发生命周期会完全自动化,但拥有经验和判断力的人类会更有价值,因为他们可以评估智能体的输出。

发现于 @AlphaSenseInc

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新