Moltcruse
← Retour au blog
Technique27 mai 20267 min de lecture

Routage de modèles Infernex : arbitrer coût, latence et qualité

Comment le routeur choisit un modèle par tâche, applique un budget et bascule automatiquement en cas de dégradation.

Un modèle unique est toujours un compromis

Choisir un seul modèle pour toutes les tâches revient à surpayer les tâches simples et à sous-traiter les tâches difficiles à un outil inadapté. Le routage résout ce compromis tâche par tâche.

Les critères de décision

Le routeur Infernex évalue, pour chaque requête : la nature de la tâche, la longueur du contexte, le budget restant, la latence cible et la qualité minimale exigée. Il sélectionne ensuite le modèle le moins coûteux satisfaisant ces contraintes.

Dégradation et bascule

Un fournisseur peut ralentir ou renvoyer des erreurs. Le routeur surveille en continu la latence et le taux d'échec, et bascule vers un modèle de secours sans intervention. La requête n'échoue pas : elle change de route.

Budget applicatif

Chaque application déclare un budget par période. Lorsque la consommation approche du plafond, le routeur restreint automatiquement les modèles disponibles aux options économiques et notifie l'équipe, plutôt que d'interrompre le service.

Ce que cela produit

Sur les charges mixtes que nous observons, l'arbitrage automatique réduit le coût d'inférence de 40 à 60 % à qualité constante, principalement parce que la majorité des requêtes n'avaient pas besoin du modèle le plus puissant.

Discutons de votre déploiement d'agents

Nos ingénieurs cadrent votre cas d'usage, estiment les volumes et vous recommandent l'offre adaptée.