Os seis tipos de rede neural, e para que serve cada arquitetura
Não existe uma rede neural única e melhor. Existe a arquitetura certa para o formato do dado que você tem.
· 3 min de leitura
Revisado em
Existem vários tipos de rede neural artificial, cada uma com arquitetura e propósito específico. Não existe uma rede neural única e melhor: existe a arquitetura certa para o formato do dado que você tem e para o tipo de problema que precisa resolver.
Feedforward (FFNN): a mais simples
A rede feedforward, ou perceptron multicamadas, é a mais simples entre as redes neurais. O dado flui numa única direção, da entrada até a saída, passando por uma ou mais camadas ocultas, sem ciclo. É usada em classificação básica e regressão, onde não existe dependência temporal ou espacial a considerar.
Convolucional (CNN): a rede que enxerga
A rede convolucional é projetada para dado em grade, como imagem e vídeo. Usa camada de convolução, onde filtro específico escaneia uma área da imagem para identificar borda, forma e textura, capturando diferente característica visual que permite detectar objeto e rosto. É a arquitetura dominante em visão computacional: reconhecimento facial, classificação de imagem, diagnóstico médico.
Recorrente (RNN): a rede que lembra
A rede recorrente é feita para sequência de dado, como texto, áudio ou série temporal. Tem conexão recorrente, permitindo que informação de uma etapa anterior seja reutilizada na etapa seguinte, o que a torna capaz de processar dependência temporal. Aplicações típicas: processamento de linguagem natural, tradução automática, geração de texto, análise de sentimento, previsão de série temporal.
LSTM: a RNN que aprendeu a esquecer de propósito
LSTM é uma versão avançada de RNN, criada para resolver um problema comum em sequência longa: o sinal que se perde ou explode conforme atravessa muitas etapas. Ela tem um sistema de "portas" (entrada, esquecimento e saída) que regula o fluxo de informação, decidindo o que a rede deve lembrar e o que deve esquecer ao longo do tempo. É ideal para sequência longa, em tradução, geração de texto e previsão com dependência de longo prazo.
Transformers: a arquitetura por trás de GPT e BERT
Transformers dispensam a conexão recorrente e operam com atenção distribuída em paralelo, o que permite treinamento muito mais eficiente. O mecanismo de atenção avalia a relevância de cada palavra numa frase em relação às outras, independente da posição, permitindo lidar com dependência de longo alcance sem o gargalo da RNN. São a base de modelo como GPT e BERT, usados em tradução, resumo de texto, análise de sentimento e chatbot avançado.
GAN: duas redes competindo entre si
A rede adversarial generativa consiste em duas redes que competem: uma geradora, que cria dado falso, e uma discriminadora, que tenta identificar se o dado é real ou gerado. O objetivo da geradora é criar algo indistinguível do dado real; o da discriminadora é não se deixar enganar. Com o tempo, as duas melhoram juntas, e a geradora passa a criar dado extremamente realista. Aplicações: geração de imagem e vídeo, arte digital, melhoria de resolução de imagem, e também deepfake, o que traz consigo uma questão ética que a tecnologia por si só não resolve.
O critério para escolher
Cada arquitetura tem ponto forte e fraco próprio, e atende um tipo diferente de tarefa: do reconhecimento de padrão visual ao processamento de linguagem e à geração de conteúdo. A pergunta a fazer antes de escolher não é qual rede é mais avançada, é qual formato de dado você tem, imagem, sequência ou necessidade de criar algo novo, e qual dessas seis respostas foi desenhada para esse formato.
Perguntas
Dúvidas frequentes
Qual a diferença entre CNN e RNN?
CNN (rede convolucional) é feita para dado em grade, como imagem, identificando padrão visual através de filtro que escaneia a área. RNN (rede recorrente) é feita para sequência de dado, como texto ou série temporal, reutilizando a saída de uma etapa como entrada da próxima para lembrar informação anterior.
O que são Transformers, e por que substituíram a RNN em muita aplicação?
Transformers são a arquitetura por trás de modelo como GPT e BERT. Dispensam a conexão recorrente e usam um mecanismo de atenção que avalia a relevância de cada palavra em relação às outras, em paralelo, o que permite treinar de forma muito mais eficiente que RNN em tarefa de linguagem.
Como funciona uma GAN?
GAN, rede adversarial generativa, usa duas redes competindo entre si: uma geradora, que cria dado falso, e uma discriminadora, que tenta identificar se o dado é real ou gerado. Com o tempo as duas melhoram, e a geradora passa a produzir dado extremamente realista, como imagem sintética.
Sobre o autor
Raphael Fontes é executivo de tecnologia e lidera a tecnologia da Sesatech como Diretor de Tecnologia (CTO). Escreve sobre inteligência artificial, automação, engenharia, dados, gestão de projetos e liderança. Trajetória completa.