vllm-jev把Jev推理从600ms砍到50ms提速最高50倍
😱什么?!单次推理时间从 600ms 暴降至 50ms,把 Jev 决策压成眨眼级!
开源引擎 vllm-jev 把 System One 推理从一次 600ms 砍到约 50ms,官方基准常见 5×–50×,并发最高约 43×,候选答案 + 概率,一次前向给出,不生成长文本。
核心亮点
🔹原生挂上 vLLM:调度、批处理、KV cache、编译全吃到
🔹已支持多模态 + Laya 全系;Valen / vjev 可图文同接口决策
🔹Linux NVIDIA 即开即用;Apple Silicon 已有一键脚本,Mac 部署在路上
🔹输出是 typed 决策(Choice / Noul / Score)+ 概率,适合路由、客服、游戏、产品迭代
3 步上手
1️⃣git clone && cd vllm-jev && uv pip install .
2️⃣vllm-jev serve ZefanCai/Open-Jev-2B(首次自动拉模型,默认 http://127.0.0.1:8795)
3️⃣POST /v1/systemone:塞 state + questions,拿回 choice 和 probabilities
Mac:source scripts/install_mac.sh 再 vllm-jev serve Valen-Team/Valen-Preview-0923。
仓库: #jev #vLLM #LLM #AI进化生活 #howto #开源 #多模态