AI Pulse
📡 X 信号

Superlinked开源SIE,自托管成本降4倍

Superlinked开源SIE,自托管成本降4倍

这是一项重大突破!研究人员构建了一款全新的AI推理引擎,它可以做到:
- 将自托管成本降低约4倍
- 在单张GPU上运行完整智能体流水线
- 支持20多种架构,不只是大语言模型
而且它是完全开源的。

它解决了vLLM这类引擎存在的核心问题:如今大多数智能体流水线底层会运行4到5个小模型:
- 用于检索的嵌入模型
- 用于提升精度的重排序模型
- 用于实体提取的提取模型
- 用于生成的大语言模型

行业标准的部署方式是每个模型单独开一个服务端。vLLM部署大语言模型,TEI部署嵌入模型,其余所有模型都用自定义的FastAPI包装。

每个服务端都会预先保留一块GPU显存,无论是否有请求进来,这块显存都会被占用。GPU是按小时计费的,因此 idle 时间和繁忙时间的成本是一样的。这就是为什么换用小模型很少能降低账单——成本从来都不在推理调用本身,而在于维持服务端运行。

从架构层面解决问题的方法,就是让所有模型都在同一个进程中运行,根据流量动态加载和驱逐模型。Superlinked 开源的这款全新推理引擎正好做到了这一点。

SIE,也就是Superlinked Inference Engine,是一款Apache 2.0许可的服务端,它可以在单个API后运行85个以上的模型。整个流水线只需要四个调用:
- encode() 返回向量
- score() 返回相关性分数
- extract() 返回实体跨度
- generate() 运行小型开源大语言模型

模型会在第一次请求时加载,按照最近最少使用策略驱逐,因此单张GPU可以服务一组轮换使用的模型,不用每个模型独占一块隔离的GPU。

它可以在从笔记本电脑到Kubernetes集群的任何环境运行,还能接入Qdrant、Weaviate、Chroma、LanceDB、LangChain和LlamaIndex。

GitHub:(别忘了点亮Star 🌟)

想要深入了解,我的联合创始人还写了一份SIE实操指南。教程会带你走一遍真实场景的例子,你可以从中学习如何在单张GPU上部署和管理五个模型,包括一个小型语言模型、一个OCR模型、一个NER模型、一个重排序模型和一个目标检测器。

点击下方阅读。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新