HeadlinesBriefing favicon HeadlinesBriefing.com

Modelos pequeños: nueva frontera en IA

Hacker News •
×

Durante las últimas semanas, he estado jugando con gpt-5.6-luna. Es sorprendentemente capaz, rápido e inteligente. Regularmente lo veo hacer ~100 tps, y recorrer mi código, correo electrónico y base de conocimientos. Por supuesto, lo más importante de luna es el costo. He intentado ejecutar hilos de investigación bastante complejos, y es bastante difícil acumular una factura grande. Incluso haciéndolo buscar en miles de correos electrónicos, termino con un costo de API de decenas de centavos. Con GLM 5.3, incluso tenemos una nueva opción en la frontera de Pareto.

Cuando hago trabajo de codificación, casi siempre recurro a los modelos más caros y capaces (Fable 5, 5.6 Sol). Así que ha sido fácil pasar por alto el progreso que han hecho los modelos pequeños y rápidos. Una cosa que algunos inversores con los que he hablado han mencionado: "Es extraño que no veamos más empresas de IA de consumo. ¿Por qué?" Hay una respuesta sencilla: costos de token.

En los tiempos anteriores a la IA, el manual para grandes aplicaciones de consumo era así: crear algún tipo de sitio web convincente que sea bastante barato de operar, atraer a un montón de usuarios (típicamente con algo de viralidad), recaudar dinero, escalar a más usuarios, crear un mercado de anuncios. Esto describe aproximadamente a la mayoría de las grandes empresas de consumo (Google, Facebook, Snapchat, etc.). Pero, ¿y si quieres agregar IA a tu producto? Bueno, ¡ahora tienes costos de inferencia reales en cada solicitud! De repente, la cantidad de capital requerida aumenta drásticamente.

Una evaluación personal mía es construir un sitio de noticias diarias, personalizado para mí: investigar @calvinfo en internet, averiguar qué noticias podrían gustarle, construir un micrositio con las historias principales de hoy, personalizado para ellos, buscar en hn, reddit, twitter, etc. Con la generación anterior de modelos (clase Sonnet), gastarías ~$1 para llegar a cualquier parte. Cobrar $30/mes es insostenible para una aplicación de consumo. Hay mucho que podemos optimizar aquí, pero si cobras lo que cobra WSJ o The Economist, más te vale ofrecer un valor similar. Pero mirando a luna, los resultados son bastante decentes, y el costo promedio es de ~$0.10. ¡Ahora estamos hablando!

Donde creo que esto se vuelve aún más interesante es en el mundo de los negocios. Mi cofundador de Segment, Peter, y yo recientemente comparamos notas en una caminata. A través de sus varias startups, Peter ha visto dos tipos de trabajo: el trabajo "IQ 180" (algún tipo de genio científico loco que propone una solución loca que nunca pensaste) y el trabajo "escupidor de tokens" (ser ultra receptivo, empujar la pelota hacia adelante en docenas de frentes diferentes). Peter dirige múltiples empresas. Más allá de Segment, ha recaudado más de $100 millones para Charm Industrial, y recientemente cerró una Serie A para Revoy. Es increíblemente organizado y eficiente con su tiempo. Y sin embargo, Peter mencionó que ~95% del trabajo que hace cae en el cubo 2. Es saltar a llamadas, empujar a la gente, bloquear y tacklear. Para ser claro, Peter dice que sus empresas estarían muertas en el agua hoy sin una mente técnica de IQ 180 que resuelva los problemas profundos. Solo que la mayor parte de su trabajo cae en el cubo 2.

Creo que la demanda de modelos de "nivel frontera" va a seguir creciendo, especialmente para campos que requieren avances o descubrimientos novedosos (ingeniería, ciencia dura, entrenamiento de modelos). Pero también creo que la demanda de modelos "rápidos/baratos/suficientemente buenos" está a punto de despegar. Piensa en las personas con las que interactúas a diario: colegas, proveedores y clientes. Nueve de cada diez veces, quieres a alguien que sea súper receptivo y simplemente maneje las cosas por ti. La mayoría de los "tokens humanos" en las empresas hoy se gastan de esta manera: la contratación se inclina fuertemente hacia el arquetipo rápido/barato/suficientemente bueno. Hay mucho trabajo que debe hacerse para hacer realidad los modelos rápidos/baratos/suficientemente buenos para los negocios: nuevos arneses, seguridad contra inyección de prompts, roles y permisos. Pero estoy seguro de que lo resolveremos. Si también estás experimentando con hacer útiles los modelos pequeños, por favor contáctame. Amazon y Netflix son las excepciones notables. Peter también es modesto aquí; es agudo como una tachuela.