图像token用量降95%,准确率持平,开发者求评价,高票:可能不重要
我将图像处理的token使用量与GPT-4o直接视觉相比减少了约95%,同时保持了大致相同的准确率。这有多重要?
我正在测试一种降低基于图像的LLM推理成本的新方法。
我在MOMA Graph基准上进行了评估,使用了1,315个问题。与直接使用GPT-4o处理原始图像相比,我观察到大约:
* token使用量降低约95%
* 准确率与GPT-4o直接图像基线大致相同
我故意不分享实现细节,因为该方法仍在开发中。
我主要是想了解这个结果本身有多强。
如果这些数字在更大、更多样化的基准上成立,您会认为这是多模态AI效率方面的有意义成果吗?
在认真对待这一说法之前,您希望看到哪些证据?
例如:
* 更多数据集
* 更强的基线
* 统计显著性
* 延迟测量
* API成本比较
* 不同模型上的表现
* 失败案例分析
我特别希望收到来自从事多模态模型、VLM效率或推理优化工作的人们的反馈。
―― 高票评论(帖子共7条讨论)――
[+14] u/nieshpor: 经验法则:如果你对文献了解得不够多,无法判断其重要性,那它很可能不重要。
[+1] u/MaxDev0: 嗯,好吧,我假设这项技术是在API端实现的,对API调用方的计算需求很小。我想看到的是它在不同新模型以及基础模型难以应对的不同任务类别上的表现。我不太关心准确率,更关心决策匹配——比如决策是否同样匹配。但如果你说的是真的,这可能对大型语言模型产生巨大影响,我非常好奇它是如何工作的。
[+1] u/PortiaLynnTurlet: GPT-4o在视觉方面是个相当弱的模型,对吧?如果你能在使用更新模型时以相同准确率节省token,那就更有说服力了。
[+1] u/durable-racoon: 这方面已经有研究做了,X.com上也有很多推文。情况很复杂……但是的,有时发送图像可以节省token且不损失准确率……有时。Karpathy确实发过关于这个的推文。不过恭喜你自己发现了这一点——真的!
去看看之前的文献吧。