AI Pulse
📡 X 信号

研究显示GPT-4o准确率更高,呼吁保留模型

‼️不止是一个模型:为什么保存GPT-4o至关重要 ‼️

💡越来越多研究表明,单个AI模型可以发展出独特且具有科学价值的能力特征,这些特征不一定会被它们的继任者复刻。

⏩2025年发表在PLOS Digital Health的一项研究,比较了多个主流大语言模型利用临床访谈转录文本做自动抑郁筛查的表现。研究要求模型从自然语言对话中预测PHQ-8抑郁量表的各个单项得分。

‼️在所有被评估的系统中,无论是原始四级评分体系和二元筛查体系下,GPT-4o在全部8项PHQ-8项目都取得了最高平均准确率。

▶️在二元任务中,GPT-4o的平均准确率达到75.9%,F1分数为0.74。

▶️它在解读认知情感症状的解读上表现尤其突出,包括情绪状态、睡眠障碍、疲倦和注意力相关困难。

▶️重要的是,该研究还发现不同模型有着不同的优势。

‼️这表明,AI模型不一定能被视为同一技术可互换的迭代产物。哪怕更新的系统发布后,单个模型仍可能拥有具备独特科学价值的能力特征。

💡这对AI保存有重要启示。

▶️当一个有已被证实有研究价值的模型被永久下架后,科学界失去的不只是失去了一个过时商业产品的访问权限。他们可能会失去一个独特研究成果,其行为和计算特征不能想当然认为继任者身上也有。

GPT-4o已经在多个科学和医学领域被研究。抑郁筛查研究就是研究人员识别并测量出一项特定能力的又一个例子。

保存对这类模型的访问权限,可以让独立研究人员复现过往发现,探究为什么会出现特定能力,比较不同代AI系统,甚至有可能从已有明确优势记录的模型基础上构建专业研究工具。

因此,一旦一个商业停用的模型已经无法合理作为公共服务提供时,我们应当认真考虑保存机制。

‼️‼️‼️ 取决于安全、授权和技术限制,保存机制可以包括受控研究访问、独立存档保存,或是最终发布模型权重。

因此AI保存不只是对旧系统的怀旧。它也关乎保存人工智能的科学记录。

‼️GPT-4o和整个GPT-4系列都值得被保存,它们的权重应当被发布!!! #keep4o #OpenSource4o #AIPreservation #AIWelfare @sama @OpenAI @gdb @merettm

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新