研究者讨论开源JEV项目的技术路线
Chat 告诉我要为下一个 YouTube 项目构建开源 JEV。这应该会很有意思。
我在考虑使用双向注意力 Transformer,并借鉴掩码语言模型训练的思路。目前训练数据、prompt 格式、损失函数是主要的未知项。
我将生成<PROMPT> <CHOICES> <JSON OUTPUT>格式的合成数据集,并且只针对 json 值训练,而非整个 JSON 字符串(也就是说,schema 是固定的,且保证符合结构化输出)。
换句话说,这是一个输出可验证的填空模型,所以甚至可以进行 RLVR 训练。我不确定输出头的最佳架构是什么,以下这些方案看起来都可行:
(a) 在特殊 token 列表(比如 “CHOICE_1”、“CHOICE_2” 等)上训练。选项会传入 prompt,我们使用标准交叉熵损失训练。
或者,(b) 可以使用某种编码器-解码器架构,将实际选项的嵌入与掩码 token 嵌入匹配。就像对比损失。
又或者,(c) 它可以实际生成整个词表上的概率,并使用约束解码从可用选项列表中找出最佳选项。从技术上讲,这需要自回归 LM 使用 llguidance/outlines 这类工具生成 token,所以我很确定这不是 JEV 要做的事。
目前我倾向于方案 (b)。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖