Inférence
L'inférence est le moment où un modèle déjà entraîné génère une réponse à partir d'une nouvelle entrée, par opposition à la phase d'entraînement.
L'entraînement fixe les paramètres du modèle une fois pour toutes, ou presque. L'inférence est chaque appel suivant, par exemple une question posée à un chatbot, qui utilise ces paramètres sans les modifier.
La vitesse et le coût d'inférence sont ce que paie une entreprise à chaque utilisation d'un modèle, contrairement au coût d'entraînement, payé une seule fois par le fournisseur du modèle.