Questão de Estatística — Cálculo de Probabilidades — FGV 2025
Estatística›Cálculo de Probabilidades
Código
fg121760
Banca
FGV
Órgão
TCE-PI
Ano
2025
Nível
Superior
Cargo
Auditor de Controle Externo - Controle Externo - Específica de Tecnologia da Informação - Sistemas, Engenharia de Dados e Ciência de Dados (Manhã)
Um conceito fundamental na modelagem probabilística de sequências de palavras é o de n-grama. Com relação a esse conceito, analise as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa.( ) Um modelo bigrama assume a aproximação de que a probabilidade da próxima palavra em uma frase, considerando todas as palavras anteriores, é dada pela probabilidade condicional apenas da palavra imediatamente anterior.( ) O modelo trigrama é também conhecido como modelo de Markov de terceira ordem.( ) O cálculo de probabilidades em modelos n-grama é geralmente realizado utilizando logaritmos para evitar o fenômeno do underflow numérico.As afirmativas são, respectivamente,
AV – F – F.
BV – V – F.
CF – V – F.
DF – V – V.
EV – F – V.
Revelar gabarito e comentário▾
GabaritoE — V – F – V.
Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.
Modelos n-grama em processamento de linguagem natural
Gabarito: letra E — sequência V – F – V. A primeira afirmativa está correta (bigrama usa apenas a palavra imediatamente anterior), a segunda está incorreta (trigrama é modelo de Markov de segunda ordem, não terceira) e a terceira está correta (logaritmos evitam underflow numérico). A base conceitual está na definição de modelos de Markov aplicados a sequências de palavras, tema clássico de processamento de linguagem natural e modelagem estatística de texto.
Um n-grama é uma sequência contígua de itens (palavras, caracteres, etc.) extraída de um texto. Em modelagem de linguagem, o objetivo é estimar a probabilidade de uma sequência de palavras . Pela regra da cadeia, essa probabilidade seria o produto de probabilidades condicionais de cada palavra dado todo o histórico anterior — algo computacionalmente inviável. A aproximação de Markov simplifica isso: assume-se que a probabilidade de uma palavra depende apenas de um número fixo de palavras anteriores, não de todo o histórico.
No bigrama (), a probabilidade de uma palavra depende apenas da palavra imediatamente anterior: . No trigrama (), depende das duas palavras anteriores: . A ordem do modelo de Markov é definida pelo número de palavras anteriores consideradas: um modelo de Markov de ordem usa as palavras anteriores. Portanto, o bigrama é um modelo de Markov de primeira ordem, o trigrama de segunda ordem, e assim por diante.
A terceira afirmativa trata de um aspecto prático crucial: ao multiplicar muitas probabilidades pequenas (como as de um modelo n-grama), o resultado tende a zero rapidamente, causando underflow numérico — o computador não consegue representar números tão pequenos. A solução é trabalhar com logaritmos das probabilidades, transformando o produto em soma, o que mantém a precisão e evita o underflow. Essa é uma técnica padrão em PLN e em qualquer modelo probabilístico com muitos fatores.
Afirmativa
Análise
Valor
1
Bigrama usa apenas a palavra imediatamente anterior
V
2
Trigrama é modelo de Markov de segunda ordem, não terceira
F
3
Logaritmos evitam underflow numérico
V
Modelos n-grama: Bigrama (n=2) (1 palavra anterior, Markov de 1ª ordem); Trigrama (n=3) (2 palavras anteriores, Markov de 2ª ordem); 4-grama (n=4) (3 palavras anteriores, Markov de 3ª ordem); Cálculo prático (Logaritmos evitam underflow, Produto vira soma)
Afirmativa 1 — ✅ Verdadeira
A afirmativa descreve exatamente a aproximação bigrama: a probabilidade da próxima palavra é aproximada pela probabilidade condicional apenas da palavra imediatamente anterior. Isso é a essência do modelo de Markov de primeira ordem aplicado a texto. A regra da cadeia completa seria , mas o bigrama simplifica para . Portanto, a afirmativa está correta.
Afirmativa 2 — ❌ Falsa
O trigrama considera as duas palavras anteriores, não três. A ordem do modelo de Markov é o número de palavras anteriores usadas: bigrama = 1ª ordem, trigrama = 2ª ordem, 4-grama = 3ª ordem, e assim por diante. A afirmativa diz que o trigrama é de terceira ordem, o que está errado — seria de segunda ordem. Essa é uma pegadinha clássica: confundir o tamanho do n-grama (n=3) com a ordem do modelo (k=2).
Afirmativa 3 — ✅ Verdadeira
O uso de logaritmos para evitar underflow é uma prática padrão em modelos n-grama e em qualquer modelo probabilístico com muitos fatores. Ao multiplicar muitas probabilidades pequenas, o resultado tende a zero, e o computador pode não conseguir representá-lo (underflow). Trabalhar com logaritmos transforma o produto em soma, evitando esse problema e mantendo a precisão. A afirmativa está correta.
NÃO CAIA NESSA!
A banca explora a confusão entre o tamanho do n-grama e a ordem do modelo de Markov. Lembre-se: a ordem é sempre . Bigrama (n=2) → 1ª ordem; trigrama (n=3) → 2ª ordem; 4-grama (n=4) → 3ª ordem. Não caia nessa troca!
PEGA ESSA DICA!
Para fixar, monte uma tabela mental: n-grama | palavras anteriores | ordem de Markov. Bigrama: 1 palavra anterior, 1ª ordem. Trigrama: 2 palavras anteriores, 2ª ordem. 4-grama: 3 palavras anteriores, 3ª ordem. E lembre-se: logaritmos são usados para evitar underflow, transformando produto em soma.