AI Pulse

Hugging Face上6000多个模型已被拆掉安全锁,如今有人要装回去

Hugging Face上6000多个模型已被拆掉安全锁,如今有人要装回去

Baseten周三宣布推出Base Labs研究部门,与Hugging Face和Goodfire AI合作。目标是给开源权重模型搭一套安全评估和监控基础设施。

开源权重模型的危险在于:安全防护能被一种叫abliteration的技术拆掉。Hugging Face上现在挂着超过6000个这样的模型,任何人都能下载。

Base Labs是Baseten今年早些时候成立的研究小组。它负责开发和发布训练、监控开源模型的方法。Baseten把未来工作定位成一个“标准”:透明,直接做进训练和部署流程。简单说,不是事后附加。

合作具体怎么分工,技术细节还没披露。Goodfire在回复Baseten的帖子时给了方向:“安全必须内置于开源模型,并由服务它们的人提供。”Goodfire擅长打开AI的“黑箱”,解释模型怎么做决策。它最可能负责“内置”这一块。

Baseten在X上解释过为什么押注开源方向:开放性对AI安全有利。模型行为更可见,安全研究也更容易转成可操作、透明的控制。

两家公司都不缺钱。Baseten做AI推理服务,6月完成15亿美元F轮融资,估值130亿美元。Goodfire今年早些时候完成1.5亿美元B轮融资,由B Capital领投。这笔钱用于推进其模型可解释性平台。

Baseten向更广泛的开发者社区发出邀请,请大家一起贡献框架。只是这套标准能不能挡住abliteration,目前没人能打包票。

阅读原文
📚 相关主题 开源AI商业合作

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新