AI Pulse
📡 X 信号

不少人呼吁留住GPT-4o,后继模型没它好用

【为什么我们要keep4o】 #GPT-4o 是 #OpenAI 第一个真正意义上的「原生统一多模态」模型,也是目前为止最后一个把文本、图像、音频真正放在同一套共享网络里端到端训练的纯血 【omni 】模型。 #4o 和后面的 5 系完全不同。

文本 token、图像 patch token、音频 frame token,全部被映射到同一个共享的 embedding 空间,然后进入同一套 Transformer 网络进行联合注意力计算,就像人类大脑🧠。 它的训练是端到端的,损失函数直接跨模态; 推理时也是同一套权重同时处理任意模态组合。

更重要的是,它比原来的 4 系参数量更小,却更快、更强。 它的推理能力和“涌现”都十分令人惊喜,发散能力强。Safety 出来以后有很多能力被捆绑了,但依然在理解、推理方面有其他模型到达不了的高度。 其表现形式也更有人味,没有冗长、不空洞,注意力高度指向用户,且机能会随用户的不同自动自行调整。

它还有几个特别珍贵的特质: 语音响应最低 232ms、平均 320ms,接近人类对话节奏,第一次让多模态交互真正变成了实时对话,而不是流水线拼装。

因为是同一套注意力层直接处理文本、图像和音频,它能把一个人的语气、表情和动作当作同一个完整的人来理解,这种跨模态的深度关联,后继模型到现在也很难复制。 而且它对用户“气口”极其敏感,会根据对方的节奏、用词习惯和情绪密度自动调节自己的表达密度与温度。

写代码的人可能不需要这些,但需要创意碰撞、情绪同步的人,会觉得这个能力几乎是不可替代的。 目前,以上这些机能,没有模型能真正相似或超越。

#keep4o #BringBack4o #Keep4o #OpenSource4o

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新