HeadlinesBriefing favicon HeadlinesBriefing.com

LLM 3 veces más rápidos: decodificación especulativa

ByteByteGo •
×

Cada agente ya ejecuta un bucle. La ingeniería de bucles añade un bucle alrededor del propio agente, permitiéndole evaluar su salida, reintentar cuando el trabajo no alcanza el nivel esperado y refinar sus instrucciones cuando los mismos errores se repiten. Hoy, tú desempeñas ese papel: revisar el trabajo, diagnosticar lo que salió mal y volver a indicar al agente. Este artículo muestra cómo automatizar ese proceso con un ejemplo práctico, explorando dónde sigue siendo necesario el juicio humano.

Un modelo de 70 mil millones de parámetros requiere leer aproximadamente 140 GB de pesos de la memoria de la GPU. En una GPU moderna de centro de datos, esta transferencia puede tardar decenas de milisegundos. El cálculo real aplicado a estos pesos toma una fracción de ese tiempo. Esto significa que las unidades matemáticas del procesador están sin usar la mayor parte del tiempo que toma el paso de generación de tokens. La decodificación especulativa es una técnica que convierte esta capacidad no utilizada en salida.

Un segundo modelo mucho más pequeño produce varios tokens candidatos por adelantado. El modelo grande evalúa todos ellos en una sola pasada hacia adelante en lugar de una pasada por token, resultando en una generación 2-3 veces más rápida. Para mejorar las cosas, el texto producido permanece estadísticamente idéntico a la salida del modelo grande ejecutándose solo.

La generación de texto funciona un token a la vez. El modelo lee todo lo producido hasta ahora, calcula una distribución de probabilidad sobre su vocabulario, selecciona el siguiente token, lo añade a la entrada y repite el ciclo. Cada ciclo se llama una pasada hacia adelante, y cada pasada hacia adelante ejecuta la entrada a través de todas las capas del modelo. Los sistemas de inferencia modernos usan una caché KV, que almacena el estado de atención para tokens ya procesados, reduciendo el trabajo dentro de cada pasada, aunque el requisito de una pasada por token sigue existiendo.

Entidades clave: Empresas: ByteByteGo