A prática de deixar um modelo gastar computação extra enquanto realmente responde uma consulta — cadeias de raciocínio mais longas, múltiplas tentativas amostradas, auto-verificação — em vez de investir computação só durante o treinamento.
Exemplos
"O modelo demora mais porque usa computação em tempo de inferência pra revisar a própria resposta antes de mostrar."
Origem e uso
Surgiu em discussões técnicas de IA conforme pesquisadores descobriram que deixar um modelo 'pensar mais' na hora de responder podia melhorar a qualidade tanto quanto treinar modelos maiores.
Usado para falar de gastar mais poder de computação na hora de gerar uma resposta, não só ao treinar.
MENTIONS OVER TIME
Quer ver o verbete completo em inglês com tags de categoria, tendência, distribuição por plataforma e votos da comunidade? Acesse o Inference-Time Compute verbete completo em inglês →
WHEN DID YOU FIRST HEAR THIS?
CLICK AN OPTION BELOW TO CAST YOUR VOTE.
[ VOTE TO REVEAL COMMUNITY RESULTS ]