La práctica de dejar que un modelo gaste cómputo extra mientras realmente responde una consulta — cadenas de razonamiento más largas, múltiples intentos muestreados, auto-verificación — en lugar de invertir cómputo solo durante el entrenamiento.
Ejemplos
"El modelo tarda más porque usa cómputo en tiempo de inferencia para revisar su propia respuesta antes de mostrarla."
Origen y uso
Surgió en discusiones técnicas de IA a medida que los investigadores descubrieron que dejar que un modelo 'pensara más' al momento de responder podía mejorar la calidad tanto como entrenar modelos más grandes.
Se usa para hablar de gastar más poder de cómputo al momento de generar una respuesta, no solo al entrenar.
MENTIONS OVER TIME
¿Quieres ver la entrada completa en inglés con etiquetas de categoría, tendencia, distribución por plataforma y votos de la comunidad? Visita la Inference-Time Compute entrada completa en inglés →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]