Перейти к содержимому

Processamento de Linguagem Natural - Visão Geral do Curso - NLP 2026

André Santanchè

0:00 / 0:00

Processamento de Linguagem Natural - Visão Geral do Curso - NLP 2026

214 просмотров · 1 месяц назад
André Santanchè
14,2 тыс. подписчиков
214 просмотров · 1 месяц назад
Neste vídeo, apresento uma visão geral da disciplina de Processamento de Linguagens Naturais (PLN). Veja mais detalhes sobre a disciplina em: https://www.ic.unicamp.br/~santanche/... A disciplina está organizada em três blocos. No primeiro bloco, o foco será nos fundamentos de recuperação de informação, que estão fortemente relacionados à PLN. O segundo bloco apresenta as bases de PLN e fundamentos estatísticos de modelos de linguagem e a progressão histórica que permite compreender os modelos modernos. O terceiro bloco apresenta o PLN no contexto de redes neurais e Transformers. Este curso explora a evolução das formas de representação do conhecimento, desde o espectro de estruturação dos dados até a integração entre modelos estatísticos de linguagem e grafos semânticos. Inicialmente, abordamos o espectro de estruturação dos dados, diferenciando dados estruturados, semiestruturados e não estruturados (Manning et al., 2009; Elmasri & Navathe, 2010). Discutimos a natureza do texto humano e os desafios de recuperar e processar informações não estruturadas no contexto da Recuperação de Informação (Information Retrieval - IR) e de sistemas como o IBM Watson (Brown, 2012), destacando o contraste entre a manipulação de símbolos computacionais com regras bem definidas e a complexidade do significado ancorado na cognição humana. Em seguida, damos uma visão geral dos níveis de representação linguística (morfologia, sintaxe e semântica) e das etapas que compõem o pipeline de um sistema de PLN, com destaque para as seguintes fases: Tokenização e análise morfológica (ex.: decomposição de prefixos, radicais e sufixos em palavras) Análise sintática e semântica lexical e composicional (lidando com ambiguidades contextuais, como os diferentes sentidos da palavra cell) Análise pragmática, do discurso e raciocínio baseado em conhecimento Geração de texto Dentro deste contexto, são mencionadas duas grandes abordagens para a representação do conhecimento: a semântica formal (baseada em modelos simbólicos e grafos de conhecimento) e a semântica vetorial (baseada em embeddings). A aula aprofunda a hipótese distribucional (Jurafsky & Martin, 2025), demonstrando como modelos estatísticos aprendem representações vetoriais de palavras e sustentam operações no espaço vetorial (como king – male + female = queen). O curso trabalhará com o conceito de Modelo de Linguagem, que será tratado desde seu modelo estatístico até a implementação em deep learning, incluindo Large Language Models. Será dado enfoque na arquitetura Transformer e temas dentro deste contexto: encoder-decoder, self-attention mechanism, modelos generativos, etc.