Pular para o conteúdo principal

Questão de Programação — Linguagens de programação — FGV 2024

ProgramaçãoLinguagens de programação
Código
fg077337
Banca
FGV
Órgão
CVM
Ano
2024
Nível
Superior
Cargo
Analista - Perfil 7 - Ciência de Dados - Tarde
Um dos principais fatores que tornam viável a aplicação de modelos grandes de linguagem (LLMs) é o controle do espaço de probabilidade de tokens através da redução de dimensionalidade do vocabulário, sem perda da capacidade de reconstruir qualquer token válido da linguagem sendo modelada.Considerando esse objetivo, dois algoritmos que podem ser utilizados para esse fim são:
  1. AUMAP, BPE;
  2. BT5, UMAP;
  3. CBPE, WordPiece;
  4. DWordPiece, T5;
  5. EUMAP, GTE.
Revelar gabarito e comentário

GabaritoC — BPE, WordPiece;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Algoritmos de tokenização subword para LLMs

Gabarito: letra C. Os dois algoritmos clássicos para redução de dimensionalidade do vocabulário em modelos de linguagem são BPE (Byte-Pair Encoding) e WordPiece. Ambos quebram palavras em subunidades (subwords) e permitem reconstruir qualquer token válido, mantendo um vocabulário de tamanho fixo e gerenciável. UMAP é um algoritmo de redução de dimensionalidade para visualização de dados, T5 é uma arquitetura de modelo, e GTE é um modelo de embeddings – nenhum deles é usado para tokenização.

A questão testa o conhecimento sobre técnicas de tokenização empregadas em LLMs. O BPE é usado em modelos como GPT e RoBERTa; o WordPiece é usado no BERT.

Tokenização subword para LLMs
  • 1Objetivo
    • Reduzir dimensionalidade do vocabulário
    • Reconstruir qualquer token válido
  • 2Algoritmos corretos
    • BPE (Byte-Pair Encoding)
      • GPT, RoBERTa
    • WordPiece
      • BERT
  • 3Algoritmos incorretos
    • UMAP (redução de dimensionalidade)
    • T5 (arquitetura de modelo)
    • GTE (embeddings de texto)
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

UMPA é um método de redução de dimensionalidade (não linear) para dados tabulares ou de alta dimensão, não para vocabulário de tokens. BPE está correto, mas sozinho não forma um par válido com UMAP.

Alternativa B — ❌ Incorreta

T5 é uma arquitetura de modelo (Text-To-Text Transfer Transformer), não um algoritmo de tokenização. UMAP novamente não é tokenizador.

Alternativa C — ✅ Correta ⟵ GABARITO

BPE e WordPiece são os dois algoritmos mais conhecidos para tokenização subword. Ambos constroem um vocabulário a partir de pares de caracteres/símbolos mais frequentes (BPE) ou baseado em probabilidade (WordPiece), permitindo representar qualquer token da linguagem sem perda de reconstrução.

Alternativa D — ❌ Incorreta

WordPiece está correto, mas T5 é um modelo, não um tokenizador.

Alternativa E — ❌ Incorreta

UMPA e GTE (General Text Embeddings) não são algoritmos de tokenização. GTE é um modelo de embeddings de texto.

NÃO CAIA NESSA!

A banca coloca UMAP e T5 – algoritmos populares da área de aprendizado de máquina, mas que não servem para tokenização de texto. O candidato que conhece superficialmente pode confundir UMAP (redução de dimensionalidade) com o objetivo descrito no enunciado. Lembre-se: a tokenização subword é feita por BPE, WordPiece, Unigram – jamais por UMAP ou T5.

Gabarito: letra C.

Link permanente: /questoes/fg077337