HeadlinesBriefing favicon HeadlinesBriefing.com

Mercury 2.5 : IA plus rapide et moins chère

Hacker News •
×

Mercury 2.5 est le dernier modèle d'IA d'Inception, offrant une amélioration significative de la qualité par rapport à Mercury 2 tout en maintenant le même profil de faible latence et de faible coût. C'est désormais le plus grand modèle de langage à diffusion sur le marché, avec une augmentation de 40% de l'intelligence et des vitesses de 1 107 tokens par seconde sur les GPU NVIDIA. Le modèle prend en charge une fenêtre de contexte de 260K et est proposé à 0,20 $ par million de tokens d'entrée et 0,75 $ par million de tokens de sortie, avec une remise de lancement de 80%.

Les déploiements dans le monde réel montrent des améliorations spectaculaires. Open Call, une entreprise d'IA vocale, a réduit la latence de réponse de plusieurs minutes à une seule seconde (P99), tandis qu'Augment Code a réduit la latence de 82% et les coûts de 90% pour les agents de codage. Ces résultats soulignent la capacité de Mercury 2.5 à gérer efficacement des tâches complexes et multi-étapes.

En plus du modèle, Inception présente en avant-première Mercury Voice et Mercury Router. Mercury Voice optimise le temps jusqu'au premier token en dessous de 170 ms, idéal pour les agents vocaux. Mercury Router dirige intelligemment les invites vers le meilleur modèle en fonction de la qualité, de la vitesse et du coût, garantissant des performances optimales pour toute charge de travail.

Mercury 2.5 est disponible dès maintenant via l'API Inception, Baseten et Open Router. Pour les entreprises, Inception propose des déploiements dédiés, une mise à l'échelle automatique et des contrôles de conformité. Avec sa combinaison de vitesse, d'intelligence et d'abordabilité, Mercury 2.5 est prêt à alimenter la prochaine génération d'applications d'IA.

Entités clés : Entreprises : Inception, Open Call, Augment Code, NVIDIA | Personnes : Oliver Silverstein