Os nomes técnicos do que você já fez
Os tijolos ensinaram a fazer. Esta página ensina a chamar pelo
nome — porque é assim que está escrito em todo livro e artigo que você
vai ler daqui pra frente.
A estrutura
- Entradas (x) — os dados crus: letras viradas número, pixels, leitura de sensor.
- Pesos (w) e viés (b) — o peso diz o quanto cada informação importa.
A soma linear é
z = Σ(xᵢ · wᵢ) + b. É o tijolo 1, escrito em símbolo.
- Função de ativação — o filtro não-linear que decide o quanto o
neurônio dispara. É o tijolo 2 (a sigmoid). Tem outras: a ReLU
é a mais usada hoje, e é bem mais simples — se for negativo vira zero,
se for positivo passa direto.
O ciclo
Uma rede nasce com pesos aleatórios — não sabe nada. Aprende repetindo
quatro passos:
- Propagação direta (forward) — o dado atravessa a rede e vira palpite.
- Cálculo do erro (loss) — a distância entre o palpite e a resposta certa.
- Retropropagação (backpropagation) — pela regra da cadeia do
cálculo, descobre-se a derivada parcial da perda em relação a cada
peso:
∂L/∂w. Em português: quanto este peso específico teve culpa
no erro.
- Gradiente descendente — cada peso anda no sentido contrário ao erro:
w_novo = w_antigo - α · ∂L/∂w
O α (alfa) é a taxa de aprendizado — o tamanho do passo. No seu
código ele se chama taxa_aprendizado = 0.5. Passo grande demais e a rede
salta por cima da resposta; pequeno demais e ela leva uma eternidade.
A frase que precisa de calibragem
"Expandir esse código mínimo para redes multicamadas é exatamente o que
alimenta os grandes modelos de linguagem."
Meio verdade. O mecanismo é o mesmo mesmo: forward, loss, backprop,
gradiente descendente — um LLM treina com exatamente essas quatro etapas,
e é honesto dizer isso.
O que a frase esconde é o resto:
- Escala. Seu XOR tem 9 pesos. Um modelo grande tem centenas de
bilhões. Não é "o mesmo, maior" — em certa escala aparecem
comportamentos que não existiam antes.
- Arquitetura. LLM moderno não é camada densa empilhada: é
transformer, cuja peça central é a atenção — um mecanismo que
não existe em nada do que você escreveu até aqui.
- Dados e custo. Trilhões de palavras, milhares de placas, meses.
Vale saber disso agora para não levar susto depois: você entendeu o
motor. O carro de corrida usa o mesmo princípio de combustão, mas tem
muita peça que você ainda não viu.
Onde você está
- ✅ tijolo 1 — o neurônio ([[tijolo-1-um-neuronio-e-uma-continha]])
- ✅ tijolo 2 — a sigmoid ([[tijolo-2-a-sigmoid]])
- ✅ o erro e o backprop — você já rodou os dois, no AND e no XOR
- ✅ camada oculta — [[a-rede-inteira-xor-com-retropropagacao]]
Os quatro tijolos estão de pé. O que falta não é mais teoria de rede: é
ligar essa rede em alguma coisa sua.
Livraria do Neon · estante redes-neurais · o texto e o código são
do João; o que entra de novo aqui é a arrumação para a web