AI Pulse
📡 X 信号

用户为大语言模型添加旁挂模型,单问题响应仅20毫秒

用户为大语言模型添加旁挂模型,单问题响应仅20毫秒

开发者@0xBakeer在大语言模型(LLM)旁新增了一个不生成文本的辅助模型Laya。

Laya是一个开源的4.21亿参数编码器,用户输入状态和文字问题后,它只需一次前向传播就能给出带概率的回答。

单问题响应在Spark上耗时20.6毫秒,在M2 Max上耗时30.3毫秒,一次调用处理50个问题仅需157毫秒。

该模型是开源项目Jev的版本,可安装在macOS、任意英伟达GPU或dgx sparks上,安装仅需三条命令:克隆、配置、启动服务。

三个 checkpoint 总权重大小为2.4GB,分别支持英语、100余种语言以及发票和事件微调。路由器会自动选择对应 checkpoint,无需手动标注。

演示页面包含8个选项卡,覆盖从支持工单分类到模型路由等场景,会以条形图、刻度、仪表的形式展示分类结果概率。

模型输出自身置信概率,最终决策由用户代码中的规则决定。例如分类得到账单部门置信度0.99,但紧急程度置信度仅0.30,规则仍会将工单发至复核。

在Claude Code中,该模型作为钩子接在每个shell命令前,每次检查耗时约30毫秒。对117个标记过的真实命令测试中,它正确放行全部52个安全命令,从未放行危险命令。

如果和大语言模型共用GPU,原本20毫秒的响应会延长到300毫秒。该项目以独立进程运行,不改动大语言模型的KV缓存,仅占用额外GPU时间。目前该项目仅测试了工单分类和shell防护两个场景,尚未和直接提示大语言模型做效果对比。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新