Inteligência Artificial – Embeddings, Tokenização e Transformers
Gabarito: letra E. Embeddings geram vetores semânticos que representam o significado das palavras em alta dimensão; tokenização quebra o texto em unidades (palavras/subpalavras); e modelos Transformer utilizam o mecanismo de atenção multi-head para processar sequências. A alternativa E associa corretamente cada técnica ao seu propósito.
Alternativa A — ❌ Incorreta
Associa embedding a "Compactação ZIP", tokenização a "Criptografia" e Transformer a "Kernel do SO". Nada disso corresponde às técnicas de LLMs.
Alternativa B — ❌ Incorreta
Traz "Vetores de frequência" para embedding (embora vetores de frequência existam, o correto são vetores semânticos densos); "Segmentação por palavras" poderia ser tokenização, mas a descrição mais adequada é "Quebra em unidades" (abrange subpalavras); e "Árvores de decisão" para Transformer está errado – são modelos de aprendizado de máquina, não a arquitetura Transformer.
Alternativa C — ❌ Incorreta
Lista "Lista de stopwords" (filtragem, não embedding), "Regex" (expressão regular, não tokenização completa) e "Hashing SHA" (função hash criptográfica, não relacionada a Transformer).
Alternativa D — ❌ Incorreta
Apresenta "Vetor de bytes" (muito baixo nível para embedding semântico), "Base64" (codificação, não tokenização) e "Execução paralela" (paralelismo, mas não o núcleo do Transformer).
Alternativa E — ✅ Correta ⟵ GABARITO
Embeddings produzem vetores semânticos; tokenização realiza a quebra em unidades (tokens); o modelo Transformer emprega atenção multi-head para capturar relações contextuais. A associação é precisa e reflete o funcionamento de LLMs.
Gabarito: letra E.