La pratique de laisser un modèle dépenser du calcul supplémentaire en répondant réellement à une requête — chaînes de raisonnement plus longues, tentatives multiples échantillonnées, auto-vérification — plutôt que d'investir du calcul seulement pendant l'entraînement.
Exemples
"Le modèle met plus de temps parce qu'il utilise du calcul au temps d'inférence pour vérifier sa propre réponse avant de l'afficher."
Origine et usage
Apparu dans les discussions techniques IA à mesure que les chercheurs découvraient que laisser un modèle « réfléchir plus » au moment de répondre pouvait améliorer la qualité autant qu'entraîner des modèles plus grands.
Utilisé pour parler de dépenser plus de puissance de calcul au moment de générer une réponse, pas seulement à l'entraînement.
MENTIONS OVER TIME
Vous voulez voir la fiche complète en anglais avec les tags de catégorie, la tendance, la répartition par plateforme et les votes de la communauté ? Consultez la Inference-Time Compute fiche complète en anglais →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]