Routage de modèles Infernex : arbitrer coût, latence et qualité
Comment le routeur choisit un modèle par tâche, applique un budget et bascule automatiquement en cas de dégradation.
Un modèle unique est toujours un compromis
Choisir un seul modèle pour toutes les tâches revient à surpayer les tâches simples et à sous-traiter les tâches difficiles à un outil inadapté. Le routage résout ce compromis tâche par tâche.
Les critères de décision
Le routeur Infernex évalue, pour chaque requête : la nature de la tâche, la longueur du contexte, le budget restant, la latence cible et la qualité minimale exigée. Il sélectionne ensuite le modèle le moins coûteux satisfaisant ces contraintes.
Dégradation et bascule
Un fournisseur peut ralentir ou renvoyer des erreurs. Le routeur surveille en continu la latence et le taux d'échec, et bascule vers un modèle de secours sans intervention. La requête n'échoue pas : elle change de route.
Budget applicatif
Chaque application déclare un budget par période. Lorsque la consommation approche du plafond, le routeur restreint automatiquement les modèles disponibles aux options économiques et notifie l'équipe, plutôt que d'interrompre le service.
Ce que cela produit
Sur les charges mixtes que nous observons, l'arbitrage automatique réduit le coût d'inférence de 40 à 60 % à qualité constante, principalement parce que la majorité des requêtes n'avaient pas besoin du modèle le plus puissant.