GitHub - firelex/jeff: Ajustes finos de Qwen3.5 e Gemma 4 para classificação zero-shot: modelos de decisão pequenos e rápidos que você insere no seu código, com o mesmo formato de solicitação do Jev. Você descreve uma situação e lista as opções em palavras simples; Jeff retorna uma probabilidade calibrada para cada opção a partir de uma única passagem direta. Sem texto gerado, sem análise: cerca de 22 ms por decisão em uma RTX PRO 6000 e 28 ms em um Apple M4 Max (MLX).
Zero-shot significa que as opções podem ser qualquer coisa: filas de suporte, intenções do usuário, rótulos de moderação, comandos de voz, movimentos de jogo. Suas categorias não precisam aparecer nos dados de treinamento; você as descreve, e Jeff escolhe. Estes são modelos muito pequenos. Eles fazem julgamentos extremamente rápidos e bem calibrados entre opções, e se encaixam facilmente no seu código local. Em benchmarks, eles se aproximam e, às vezes, superam o Jev; mas neste tamanho, seu raciocínio não corresponderá ao do Jev, que é executado em um modelo muito maior.
Construído inteiramente em hardware local. Treinamento em uma GPU de estação de trabalho RTX PRO 6000 (o 0.8B treina em cerca de 2 horas, o 2B em cerca de 3,5), todos os dados de treinamento sintéticos escritos por um modelo aberto (Qwen3.8-Flash-Next) em dois DGX Sparks, testes em um Mac Book. Sem GPUs em nuvem e sem saída de modelo fechado nos dados de treinamento. Jeff usa o mesmo formato de solicitação do Jev, mas não é afiliado ou endossado pela Type Safe, os criadores do Jev. Modelos no Hugging Face: Jeff-Qwen3.5-0.8B, Jeff-Qwen3.5-2B, Jeff-Gemma4-E2B.
Benchmarks: 4.599 perguntas de cinco benchmarks públicos, mais o nível difícil público do Jev Bench. A pontuação geral do Jeff iguala ou supera o Jev em classificação e grounding.