Os três modelos de aprendizado de IA: supervisionado, não supervisionado e por reforço
A pergunta que decide qual usar não é qual é o melhor. É que tipo de dado e de problema você tem na mão.
· 3 min de leitura
Revisado em
Existem três tipos principais de aprendizado em Inteligência Artificial: supervisionado, não supervisionado e por reforço. Cada um aborda um desafio diferente, e a escolha certa depende do tipo de dado disponível e do objetivo da tarefa, não de qual técnica é considerada mais avançada.
Aprendizado supervisionado: prever a partir do rótulo conhecido
No aprendizado supervisionado, existe um conjunto de dado em que cada entrada está associada a uma saída conhecida. O modelo aprende a relacionar entrada e saída, ajustando parâmetro para minimizar o erro entre a previsão e o resultado real, usando uma função de custo (erro quadrático médio para regressão, entropia cruzada para classificação).
Exemplo: imagem de fruta rotulada com o nome dela, e o modelo aprende a classificar imagem nova. Aplicações: classificação de imagem, reconhecimento de fala, previsão de valor.
A vantagem é precisão alta quando há bastante dado rotulado disponível. O desafio é justamente esse: dado rotulado é caro e trabalhoso de obter, e o modelo pode sofrer overfitting, ajustando-se tanto ao dado de treino que perde capacidade de acertar dado novo.
Aprendizado não supervisionado: achar padrão sem rótulo
Aqui o dado não tem rótulo. O objetivo é identificar padrão ou estrutura oculta sem orientação específica, agrupando dado conforme característica inerente. Um objetivo comum é reduzir a quantidade de variável preservando a informação principal, usando técnica como Análise de Componentes Principais.
Exemplo: dado de cliente de e-commerce sem rótulo dizendo a qual grupo ele pertence. O modelo identifica segmento, como "jovem que compra eletrônico" e "idoso que prefere roupa", sem que ninguém tenha definido esses grupos de antemão. Aplicações: agrupamento de cliente, compressão de dado, redução de dimensionalidade.
A vantagem é identificar padrão oculto sem precisar de rótulo, lidando bem com dado complexo e de alta dimensão. O desafio é que o resultado pode ser difícil de interpretar, porque não existe uma resposta correta previamente conhecida para validar o modelo.
Aprendizado por reforço: aprender fazendo, com recompensa e penalidade
No aprendizado por reforço, um agente interage com um ambiente dinâmico e recebe recompensa ou penalidade conforme a ação tomada. Em vez de aprender só de dado estático, o modelo busca maximizar a recompensa acumulada ao longo do tempo, equilibrando explorar ação nova e repetir o que já sabe que funciona.
Exemplo clássico: um agente aprendendo a jogar xadrez, recebendo recompensa por jogada boa e penalidade por jogada ruim, ajustando estratégia até maximizar vitória. Aplicações: controle de robô, jogo, navegação de veículo autônomo.
A vantagem é ser muito eficaz em problema de decisão sequencial, aprendendo direto da interação com o ambiente. O desafio é o custo: o treinamento pode ser intensivo em tempo e recurso, especialmente em ambiente complexo, e existe uma dificuldade natural em equilibrar explorar opção nova contra repetir ação já conhecida.
Qual escolher
A pergunta certa não é qual modelo é melhor. É que tipo de dado você tem e que tipo de problema precisa resolver. Dado rotulado e pergunta de previsão pedem supervisionado. Dado sem rótulo e necessidade de descobrir estrutura pedem não supervisionado. Ambiente dinâmico com decisão sequencial pede reforço.
Muito sistema real combina mais de um tipo, usando não supervisionado para explorar o dado antes de decidir como rotular, ou supervisionado dentro de um ciclo de reforço maior. Entender a diferença entre os três é o que permite montar essa combinação de propósito, em vez de aplicar a técnica que está na moda ao problema errado.
Perguntas
Dúvidas frequentes
Qual a diferença entre aprendizado supervisionado e não supervisionado?
No supervisionado, cada entrada de dado tem uma saída conhecida (um rótulo), e o modelo aprende a prever essa saída. No não supervisionado, o dado não tem rótulo, e o modelo busca padrão ou estrutura oculta por conta própria, como agrupar cliente parecido sem saber de antemão os grupos.
O que é overfitting?
É quando o modelo se ajusta tanto ao dado de treinamento que aprende até o ruído específico daquele conjunto, e perde a capacidade de generalizar para dado novo. É o principal risco do aprendizado supervisionado quando o dado de treino é muito específico.
Quando usar aprendizado por reforço?
Em problema de decisão sequencial, onde o modelo precisa agir repetidamente num ambiente e aprender pela consequência de cada ação, como controle de robô, jogo e navegação de veículo autônomo. É o modelo certo quando existe um ambiente dinâmico para interagir, não só um conjunto de dado estático.
Sobre o autor
Raphael Fontes é executivo de tecnologia e lidera a tecnologia da Sesatech como Diretor de Tecnologia (CTO). Escreve sobre inteligência artificial, automação, engenharia, dados, gestão de projetos e liderança. Trajetória completa.