Self-attention scaled is an important mechanism
So, Karpathy, to conclude the observations, discute sobre o scaled term. Like, it is not just the self-attention com aquela implementação. Tem um termo específico que torna o self-attention scaled. Esse termo seria a divisão pela raiz quadrada do tamanho do head size. E, o motivo, interessante, seria por algo que o Karpathy discutiu muito em outras aulas, principalmente a aula que ele fala de activations and gradients.
Precisa-se preservar uma distribuição gaussiana e assim manter os números difusos, sem serem muito grandes. E ele mostra que isso seria importante porque se usa o softmax. Ele mostra que se os números ficarem grandes, o softmax vai tender a criar uma distribuição com disparidade para um único valor e assim, as relações entre os tokens não serão estabelecidas como se buscaria, se relacionaria apenas um token com algum dominante na distribuição do softmax. Por isso, os números pequenos e, para isso, o scaled term.
Really great learning.