AI Pulse
📡 X 信号

研究者讨论开源JEV项目的技术路线

研究者讨论开源JEV项目的技术路线

Chat 告诉我要为下一个 YouTube 项目构建开源 JEV。这应该会很有意思。

我在考虑使用双向注意力 Transformer,并借鉴掩码语言模型训练的思路。目前训练数据、prompt 格式、损失函数是主要的未知项。

我将生成<PROMPT> <CHOICES> <JSON OUTPUT>格式的合成数据集,并且只针对 json 值训练,而非整个 JSON 字符串(也就是说,schema 是固定的,且保证符合结构化输出)。

换句话说,这是一个输出可验证的填空模型,所以甚至可以进行 RLVR 训练。我不确定输出头的最佳架构是什么,以下这些方案看起来都可行:

(a) 在特殊 token 列表(比如 “CHOICE_1”、“CHOICE_2” 等)上训练。选项会传入 prompt,我们使用标准交叉熵损失训练。

或者,(b) 可以使用某种编码器-解码器架构,将实际选项的嵌入与掩码 token 嵌入匹配。就像对比损失。

又或者,(c) 它可以实际生成整个词表上的概率,并使用约束解码从可用选项列表中找出最佳选项。从技术上讲,这需要自回归 LM 使用 llguidance/outlines 这类工具生成 token,所以我很确定这不是 JEV 要做的事。

目前我倾向于方案 (b)。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新