HeadlinesBriefing favicon HeadlinesBriefing.com

Por qué los LLM locales rinden menos

Hacker News •
×

Todos descargamos un modelo “AMAZEBALLZ” esperando máximo rendimiento, solo para descubrir que nuestra configuración local falla. Esta brecha surge de riesgos específicos de implementación durante la inferencia. Los laboratorios de referencia usan hardware y software muy distintos a los rigs caseros. Cada generación de GPU procesa la predicción del siguiente token de forma única, causando una divergencia natural respecto a las afirmaciones publicadas.

Para medir el rendimiento real, ejecuta benchmarks establecidos como terminal bench, hle, SWEthis, HELLAthat o MMLU-whatever. Evita pruebas zero-shot; los flujos agénticos requieren llamada de herramientas con contexto largo. Coincide exactamente con las configuraciones del sampler. Como señaló @wendell, las matemáticas son constantes. Usa los valores por defecto de la tarjeta del modelo: usualmente temp 1.0 y top-p 0.95. Temperaturas incorrectas generan bucles infinitos, mientras que samplers desajustados distorsionan las probabilidades, haciendo que las salidas se sientan antinaturales.

Matemáticamente, monitorea KLD (Divergencia KL). Transforma los logits en distribuciones de probabilidad y mide la desviación de la línea base. Un KLD más bajo indica mayor alineación, no mejor razonamiento. Desconfía de puntuaciones sospechosamente bajas en modelos cuantizados de HF sin puntos de referencia transparentes. Nunca confíes en métricas bajas sin entornos de ejecución completos. Ejecuta pruebas representativas, sincroniza plantillas de chat y acepta que cada despliegue de LLM moderno opera con variaciones leves.