Un développeur qui utilise DeepSeek 4.1 Flash de façon intensive depuis environ un mois, sur une douzaine de projets, affirme qu'il est très performant et des ordres de grandeur moins cher que les modèles de pointe. En pleine session, il ne sait souvent pas dire s'il utilise DeepSeek ou Opus, et il ne remarque aucune différence notable dans les conversations, la qualité du travail ou la vitesse. Il estime que le modèle se comporte comme un modèle de pointe et s'étonne que les laboratoires de pointe ne soient pas davantage inquiets, notant que les modèles chinois distillés ne sont peut-être qu'à un ou deux mois derrière Anthropic et OpenAI pour traiter les mêmes charges de travail.
L'auteur affirme que les modèles actuels sont suffisamment bons pour des tâches non supervisées de haute qualité, si bien qu'il est souvent inutile de courir après les dernières sorties. Avec un abonnement mensuel de 10 dollars, DeepSeek devient pratiquement illimité, ce qui a transformé sa façon de développer. Il l'utilise pour des tâches répétitives, des tests exploratoires, la planification complexe et la recherche, et fait parfois appel à Opus 5.5 pour une relecture finale du code, avant que DeepSeek n'applique les corrections. La plupart des sessions coûtent bien moins d'un dollar.
L'auteur attribue cette accessibilité en grande partie aux optimisations de cache de DeepSeek, qui auraient réduit le cache KV d'environ 437 fois par rapport à son modèle V1. Conserver ce cache dans la mémoire du GPU représente l'un des principaux coûts des longues sessions de codage, et l'auteur suggère que cette approche consomme peut-être aussi moins d'eau et d'électricité que Claude.
L'auteur conserve tout de même des abonnements à des modèles de pointe grâce à son travail, et déclare viser une planification à long terme, la durabilité et un accès plus large à une intelligence de haut niveau. Il juge mal inspirée la focalisation de l'industrie technologique sur le fait de payer le prix fort. Concernant l'auto-hébergement, il estime qu'il n'est pas économique pour réaliser des économies, mais qu'il pourrait devenir intéressant pour la confidentialité à mesure que les optimisations de cache permettront de faire tourner le système localement.
Source: Hacker News · Résumé par HeadlinesBriefing