HeadlinesBriefing favicon HeadlinesBriefing.com

Mercury 2.5: IA mais rápida e barata

Hacker News •
×

Mercury 2.5 é o mais recente modelo de IA da Inception, oferecendo um aumento significativo de qualidade em relação ao Mercury 2, mantendo o mesmo perfil de baixa latência e baixo custo. Agora é o maior modelo de linguagem de difusão do mercado, com um aumento de 40% na inteligência e velocidades de 1.107 tokens por segundo em GPUs NVIDIA. O modelo suporta uma janela de contexto de 260K e é precificado em US$ 0,20 por milhão de tokens de entrada e US$ 0,75 por milhão de tokens de saída, com um desconto de lançamento de 80%.

Implantações no mundo real mostram melhorias dramáticas. A Open Call, uma empresa de IA de voz, reduziu a latência de resposta de vários minutos para apenas um segundo (P99), enquanto a Augment Code reduziu a latência em 82% e os custos em 90% para agentes de codificação. Esses resultados destacam a capacidade do Mercury 2.5 de lidar com tarefas complexas e de várias etapas com eficiência.

Além do modelo, a Inception está apresentando o Mercury Voice e o Mercury Router. O Mercury Voice otimiza o tempo até o primeiro token abaixo de 170 ms, ideal para agentes de voz. O Mercury Router direciona inteligentemente os prompts para o melhor modelo com base em qualidade, velocidade e custo, garantindo desempenho ideal para qualquer carga de trabalho.

O Mercury 2.5 está disponível agora por meio da API da Inception, Baseten e Open Router. Para empresas, a Inception oferece implantações dedicadas, escalonamento automático e controles de conformidade. Com sua combinação de velocidade, inteligência e acessibilidade, o Mercury 2.5 está pronto para impulsionar a próxima geração de aplicações de IA.

Entidades-chave: Empresas: Inception, Open Call, Augment Code, NVIDIA | Pessoas: Oliver Silverstein