HeadlinesBriefing favicon HeadlinesBriefing.com

Petits modèles : nouvelle frontière de l'IA

Hacker News •
×

Au cours des dernières semaines, j'ai joué avec gpt-5.6-luna. Il est étonnamment capable, rapide et intelligent. Je le vois régulièrement faire ~100 tps, et parcourir mon code, mes e-mails et ma base de connaissances. Bien sûr, le plus grand avantage avec luna est le coût. J'ai essayé d'exécuter des fils de recherche assez complexes, et il est assez difficile d'accumuler une grosse facture. Même en lui faisant chercher dans des milliers d'e-mails, je me retrouve avec un coût API de quelques dizaines de centimes. Avec GLM 5.3, nous avons même une nouvelle option à la frontière de Pareto.

Lorsque je fais du travail de codage, je me tourne presque toujours vers les modèles les plus chers et les plus capables (Fable 5, 5.6 Sol). Il a donc été facile de manquer les progrès réalisés par les petits modèles rapides. Une chose que quelques investisseurs avec qui j'ai parlé ont mentionnée : "C'est étrange que nous ne voyions pas plus d'entreprises d'IA grand public. Pourquoi ?" Il y a une réponse simple : les coûts des jetons.

Avant l'IA, le manuel pour les grandes applications grand public ressemblait à ceci : créer un site Web convaincant qui est assez bon marché à exploiter, attirer un tas d'utilisateurs (généralement avec une certaine viralité), lever des fonds, passer à l'échelle avec plus d'utilisateurs, créer un marché publicitaire. Cela décrit à peu près la plupart des grandes entreprises grand public (Google, Facebook, Snapchat, etc.). Mais que faire si vous voulez ajouter de l'IA à votre produit ? Eh bien, vous avez maintenant des coûts d'inférence réels sur chaque requête ! Soudain, le montant de capital requis augmente considérablement.

Une évaluation personnelle que j'aime est de construire un site d'actualités quotidiennes, personnalisé pour moi : rechercher @calvinfo sur Internet, découvrir quelles actualités ils pourraient aimer, construire un micro-site avec les principales histoires du jour, personnalisé pour eux, chercher sur hn, reddit, twitter, etc. Avec la génération précédente de modèles (classe Sonnet), vous dépenseriez ~1 $ pour arriver quelque part. Facturer 30 $/mois est intenable pour une application grand public. Il y a beaucoup à optimiser ici, mais si vous facturez ce que facturent le WSJ ou The Economist, vous feriez mieux d'offrir une valeur similaire. Mais en regardant luna, les résultats sont assez décents, et le coût moyen est d'environ 0,10 $. Maintenant, on parle !

Là où je pense que cela devient encore plus intéressant, c'est dans le monde des affaires. Mon cofondateur de Segment, Peter, et moi avons récemment comparé nos notes lors d'une randonnée. À travers ses diverses startups, Peter a vu deux types de travail : le travail "QI 180" (un genre de génie scientifique fou qui propose une solution folle à laquelle vous n'avez jamais pensé) et le travail "cracheur de jetons" (être ultra réactif, faire avancer les choses sur des dizaines de fronts différents). Peter dirige plusieurs entreprises. Au-delà de Segment, il a levé plus de 100 millions de dollars pour Charm Industrial, et vient de clôturer une série A pour Revoy. Il est incroyablement organisé et efficace avec son temps. Et pourtant, Peter a mentionné qu'environ 95 % du travail qu'il fait tombe dans le seau 2. C'est sauter sur des appels, pousser les gens, bloquer et tacler. Pour être clair, Peter dit que ses entreprises seraient mortes dans l'eau aujourd'hui sans un esprit technique de QI 180 pour résoudre les problèmes profonds. Seulement que la plupart de son travail tombe dans le seau 2.

Je pense que la demande pour les modèles de "niveau frontière" va continuer à croître, en particulier pour les domaines qui nécessitent des percées ou des découvertes nouvelles (ingénierie, sciences dures, formation de modèles). Mais je pense aussi que la demande pour les modèles "rapides/économiques/assez bons" est sur le point de décoller. Pensez aux personnes avec lesquelles vous interagissez quotidiennement : collègues, fournisseurs et clients. Neuf fois sur dix, vous voulez quelqu'un qui est super réactif et qui gère simplement les choses pour vous. La plupart des "jetons humains" dans les entreprises aujourd'hui sont dépensés de cette façon — le recrutement penche fortement vers l'archétype rapide/économique/assez bon. Il y a beaucoup de travail à faire pour faire des modèles rapides/économiques/assez bons une réalité pour les entreprises : de nouveaux harnais, la sécurité contre l'injection de prompts, les rôles et les permissions. Mais je suis confiant que nous allons trouver une solution. Si vous expérimentez aussi pour rendre les petits modèles utiles, veuillez me contacter. Amazon et Netflix sont les exceptions notables. Peter est aussi modeste ici ; il est vif comme une lame.