Retour au blogIntelligence artificielle

Routeur LLM : Manifest l'a supprimé après 4 mois, voici pourquoi

CZSyn
31 juillet 2026
7 min

Manifest a lancé puis supprimé son routeur LLM après 4 mois d'usage sur 7000 comptes cloud. Ce que ça change pour l'architecture IA de votre équipe.

Schéma d'architecture montrant plusieurs modèles IA connectés à un routeur central sur un écran, dans un bureau sombre
Ce qu'il faut retenir.
  1. Manifest a lancé son routeur LLM (4 paliers : simple, standard, complexe, raisonnement) en mars 2026, l'a déprécié en juin après un retour d'expérience sur 7000 comptes cloud, et l'arrêtera définitivement le 1er septembre 2026.
  2. Le cache de prompt (jusqu'à 75 à 90% moins cher qu'un input non caché) réduit les coûts plus efficacement que le routage de modèles, car il capture l'essentiel des tokens (system prompt, historique) en début de requête.
  3. La complexité d'une tâche ne se déduit pas du prompt seul : elle dépend souvent d'appels d'outils et de recherches découverts en cours d'exécution, ce qui rend un routeur basé sur le texte d'entrée intrinsèquement peu fiable.

Résumé généré par IA

En juin 2026, l'équipe de Manifest a pris une décision qui va à contre-courant de la vague actuelle : elle a annoncé la dépréciation de son propre routeur LLM, lancé trois mois plus tôt à peine. La fonctionnalité sera définitivement arrêtée le 1er septembre 2026. Dans un marché où les lancements de routeurs de modèles se multiplient sous la promesse de réduire les coûts d'inférence, ce retour en arrière assumé mérite qu'on s'y arrête, surtout si vous envisagez d'en ajouter un à votre stack IA.

Pour ceux qui découvrent le sujet : un routeur LLM (ou model router) est une couche logicielle placée devant plusieurs modèles de langage. À chaque requête, il évalue la complexité de la tâche et choisit le modèle le plus adapté, en théorie le moins cher pour un résultat suffisant. Un modèle économique et rapide pour une question simple, un modèle plus puissant, et plus onéreux, pour une tâche complexe ou un raisonnement poussé. Sur le papier, l'idée est solide : pourquoi payer le tarif d'un modèle premium pour reformuler un email ?

Quatre mois, 7000 comptes, un bilan mitigé

Manifest, éditeur d'une gateway LLM, avait lancé son routeur en mars 2026. Le système classait chaque requête entrante dans l'un de quatre paliers : simple, standard, complexe et raisonnement, puis aiguillait vers le modèle correspondant. L'objectif affiché était classique : éviter de solliciter un modèle puissant, donc coûteux, pour une tâche basique. Après quatre mois d'usage sur 7000 comptes cloud, l'équipe a constaté des résultats mitigés, accompagnés d'un volume important de retours et de discussions ouvertes par les utilisateurs sur GitHub. Résultat : dépréciation en juin, arrêt total programmé au 1er septembre 2026.

La complexité ne se lit pas dans le prompt

Premier problème identifié par Manifest : le prompt initial ne contient pas toute la tâche, il n'en est que le déclencheur. Une grande partie de ce qui détermine la complexité réelle n'apparaît qu'au fil de l'exécution, via les appels d'outils, les recherches web ou les fichiers explorés. Manifest prend un exemple parlant : la consigne « évalue les tests du dépôt $GIT_REPO et améliore-les » peut être triviale s'il s'agit d'un site personnel en HTML basique, ou extrêmement complexe s'il s'agit du noyau Linux. Un routeur qui ne regarde que le texte d'entrée n'a aucun moyen de faire la différence avant d'avoir déjà commencé le travail.

Le cache de prompt bat le routing sur les coûts

Deuxième argument, plus surprenant : la mise en cache des invites (prompt caching) réduit les coûts plus efficacement que le routage de modèles. Selon Manifest, une lecture depuis le cache coûte entre 75% et 90% moins cher qu'un input non caché. Or les system prompts et l'historique de conversation, qui représentent souvent l'essentiel des tokens envoyés, se trouvent en début de requête, exactement là où le cache de préfixe (prefix cache) fonctionne le mieux. Un routeur conscient du cache va donc, pour rester efficace, privilégier la stabilité sur le modèle initialement choisi plutôt que de changer de modèle à chaque requête. Autrement dit, il remplit sa mission de réduction de coûts en ne faisant, ironiquement, pas son travail de routage.

Consistance et prévisibilité, deux coûts cachés

Les deux derniers arguments de Manifest touchent à l'ingénierie plus qu'à la facture. D'abord, la consistance de comportement : chez Manifest, chaque ingénieur choisit lui-même le modèle et les paramètres d'effort adaptés à son intention, à la manière d'un peintre qui sélectionne son pinceau. Changer de modèle en cours de session dégrade la qualité du travail et éloigne les équipes d'une vraie maîtrise de leurs outils. Ensuite, l'imprévisibilité a un prix : dans un workflow agentique automatisé ou un agent autonome, gérer une couche d'incertitude supplémentaire coûte souvent plus cher que ce qu'elle fait économiser. Les évals, les prompts systèmes et l'observabilité deviennent tous plus difficiles à maintenir dès qu'un même point d'entrée peut être servi par des modèles différents d'une requête à l'autre.

Faut-il un routeur LLM dans votre architecture ?

La conclusion de Manifest n'est pas un rejet catégorique : l'entreprise reconnaît qu'il existe probablement des cas d'usage où le routing apporte une vraie valeur. Mais pour la majorité des usages qu'elle a observés, le gain net était négatif une fois tous les coûts additionnels comptés : maintenance, imprévisibilité, dette de qualité.

Pour une équipe tech française ou une PME qui construit une fonctionnalité IA, la question à se poser avant d'ajouter un routeur n'est pas « est-ce que ça existe » mais « est-ce que mon volume et l'hétérogénéité réelle de mes requêtes justifient la complexité opérationnelle que ça ajoute ». Trois pistes plus simples à explorer d'abord :

  • Activer le cache de prompt sur vos requêtes récurrentes (system prompt, contexte métier stable) avant même d'envisager un routeur : c'est souvent le levier de coût le plus direct et le plus simple à mettre en place.
  • Choisir un modèle par cas d'usage, de façon déterministe, en fonction de la charge de travail réelle (support client, génération de code, extraction de données), plutôt que de laisser un classifieur en décider à la volée.
  • Mesurer avant d'optimiser. Sans données réelles de coût et de qualité par type de requête, un routeur ajoute de la complexité sans qu'on puisse même vérifier s'il tient sa promesse.

Notre lecture chez CZSyn

Chez CZSyn, nous voyons régulièrement passer la même tentation chez nos clients : empiler une couche d'orchestration IA supplémentaire avant même d'avoir stabilisé l'usage d'un seul modèle bien choisi. Le retour d'expérience de Manifest confirme ce que nous observons sur le terrain, à savoir que la majorité des projets web et métier n'ont ni le volume ni l'hétérogénéité de requêtes qui justifient un routeur multi-modèles. Le vrai gain de performance et de coût, pour la plupart des PME, tient davantage à un system prompt bien conçu, un cache correctement exploité et un choix de modèle assumé par l'équipe technique. Gardez le routing en réserve pour le jour où vos métriques prouveront qu'il vous manque vraiment, pas parce que la dernière annonce vous en donne envie.

Besoin d'y voir clair sur votre architecture IA ?

Nous auditons vos flux LLM (coûts, cache, choix de modèles) et construisons une architecture sur-mesure, sans complexité inutile. Audit gratuit sous 24h.

06 64 81 45 03

ou programmez votre appel · devis gratuit en ligne

29 avis 5/5 · +200 projets livrés · réponse express

Sources primaires

Un projet en tête ?

Diagnostic gratuit, devis ferme, et un seul interlocuteur du premier appel à la mise en ligne.