The Transformer implementation and GPT paper
So, interesting that Karpathy traça uma comparação regarding a implementação treinada no tiny_shakespeare dataset e o GPT. Ele mostrou uma tabela com distintas instâncias do GPT-3 treinados com configurações específicas.
Tem discussão sobre o número de tokens e o número de parâmetros do modelo. Man, really interesting. Paper focus. Regarding foundations, man, penso que seria nessa linha com livros, like, not with the goal per se, but to really learn and dominate a subject. That is great.
Really great learning.