HeadlinesBriefing favicon HeadlinesBriefing.com

逆向工程 Jev 类模型:选项评分入门

Hacker News •
×

训练一个小模型,在一组不断变化的文本选项中做出选择。Jev 类模型接收一段文本和 N 个文本选项,在一次前向传播中为每个选项返回一个概率,而不是逐词写出答案。Jev 是 Type Safe 用于此任务的商业模型,但 Type Safe 尚未公布其设计。本仓库是一个独立入门模型,具有相同的输入和输出形状。

同一个选项注意力头可以从图像块中为控制器按钮评分。一段十秒影片拼接了两个选定的五秒窗口:在七个 Doom 按钮上进行实时 deadly_corridor 战斗,然后是一个国际象棋控制器用五个按键走向并落子。Doom 窗口来自所提供的联合检查点,该检查点在其十个记录回合中平均取得 0.60 次击杀和 -97.50 奖励。国际象棋窗口来自更强的纯国际象棋检查点,该检查点在对随机走子者的 50 局采样对局中取得 4 胜、46 平、0 负,但对 Stockfish 0 级取得 0 胜、2 平、48 负。这些窗口是为活动性而选出的,并不代表典型玩法或能力。

安装游戏附加组件,并从已发布的联合检查点录制一段全新的 640×480 Doom 轨迹:uv pip install -e '.[games]' python examples/doom/play.py examples/checkpoints/joint-imitation.pt --episodes 10 --game-seconds 35.3 --device cpu --capture-resolution 640x480 --output runs/doom.mp4 --trace runs/doom-trace.json 以相同的视觉布局渲染轨迹。这会生成一部无声影片,因为作者拥有的配乐来源不属于本仓库。(cd examples/film && npm install && npx playwright install chromium) examples/film/make-film.sh runs/doom-trace.json runs/doom-film.mp4 10

本次发布包含 Doom 示例、国际象棋示例、单游戏检查点以及共享的 12 选项检查点。两个游戏都从 jevlike.vision 导入视觉评分器;两个示例中都没有第二份模型副本。架构 每个选项变成一个查询向量,即代表其文本的一小串数字。该查询为上下文 token 分配注意力权重。这些权重为该选项生成一个上下文向量。一个共享点积将每个选项与上下文对转换为一个分数。softmax 在选项之间运行。默认编码器从头学习字节嵌入。可选的 Hugging Face 路径使用冻结的预训练编码器。数据格式 每行使用一个 JSON 对象:{"context":"The customer needs a refund.","options":["refund","sales","technical support"],"label":0} label 是正确选项的从零开始的索引。每行可以有不同数量的选项,最少为两个。快速开始 从仓库根目录运行以下命令:uv venv source .venv/bin/activate uv pip install -e '.[dev]' jevlike-data synthetic --output data/synthetic jevlike-train data/synthetic/train.jsonl --validation data/synthetic/validation.jsonl --output runs/synthetic.pt jevlike-eval runs/synthetic.pt data/synthetic/test.jsonl jevlike-predict runs/synthetic.pt --context "Choose the exact badge amber badger. Badge: amber badger." --option "azure crane" --option "amber badger" --option "gold heron" 评估会打印 top-1 准确率、top-3 准确率、期望校准误差以及一个打乱上下文的对照。使用你自己的数据:按上述格式导出训练、验证和测试 JSONL 文件。

关键实体:公司:Type Safe

FAQ:什么是 Jev 类模型?

Jev 类模型接收一段文本和 N 个文本选项,在一次前向传播中为每个选项返回一个概率,而不是逐词生成答案。

FAQ Q:什么是 Jev 类模型?

FAQ A:Jev 类模型接收一段文本和 N 个文本选项,在一次前向传播中为每个选项返回一个概率,而不是逐词生成答案。