Pular para o conteúdo principal

Questão de TI - Ciência de Dados e Inteligência Artificial — Modelagem Dimensional — VUNESP 2023

TI - Ciência de Dados e Inteligência ArtificialModelagem Dimensional
Código
vu196945
Banca
VUNESP
Órgão
CIJUN
Ano
2023
Cargo
Ana ( )

Na modelagem multidimensional de banco de dados para Data Warehouse, tabelas de dimensão armazenam os dados descritivos relacionados aos fatos.

 

Quando uma dimensão é denominada Junk (lixo),

  1. Aestá contida dentro da própria tabela fato por ter somente sua chave como atributo.
  2. Bpode estar relacionada com a tabela fato em visões diferentes pela mesma chave substituta.
  3. Ctem como vantagem diminuir o tamanho da tabela fato associada.
  4. Ddeve possuir conexão com outras dimensões.
  5. Eestá normalizada e subdividida em tabelas menores de domínio.
Revelar gabarito e comentário

GabaritoC — tem como vantagem diminuir o tamanho da tabela fato associada.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Modelagem dimensional: dimensão Junk

Gabarito: letra C. A dimensão Junk (lixo) é uma tabela de dimensão que agrupa atributos de baixa cardinalidade e sem relação entre si, que não justificam dimensões próprias — e sua principal vantagem é exatamente diminuir o tamanho da tabela fato associada, pois evita que esses atributos sejam armazenados diretamente na fato, reduzindo o número de colunas e a largura das linhas.

A modelagem multidimensional para Data Warehouse organiza os dados em tabelas de fato (que armazenam as medidas, os números que se quer analisar) e tabelas de dimensão (que armazenam os atributos descritivos, o contexto textual que qualifica os fatos). O modelo mais comum é o esquema estrela, em que a tabela fato fica no centro e as dimensões ao redor, cada uma ligada por uma única junção. As dimensões são desnormalizadas de propósito: quanto mais atributos descritivos em uma dimensão, mais rica é a análise possível — mas cada atributo adicionado à fato aumenta o custo de armazenamento e degrada o desempenho das consultas.

É aí que entra a dimensão Junk. Imagine uma tabela fato de vendas que precisa registrar, para cada venda, o canal de venda (loja física, internet, telefone), a forma de pagamento (cartão, boleto, pix) e a bandeira do cartão (Visa, Master). Cada um desses atributos tem poucos valores possíveis (baixa cardinalidade) e não se relacionam entre si. Criar uma dimensão para cada um seria um desperdício — seriam dimensões minúsculas, com poucas linhas. A solução clássica é criar uma única dimensão Junk que combina todas as combinações possíveis desses atributos: cada linha da dimensão Junk representa uma combinação (canal + pagamento + bandeira), e a tabela fato guarda apenas a chave estrangeira para essa dimensão. Assim, em vez de três colunas na fato, há apenas uma chave — a fato fica menor e mais estreita.

A dimensão Junk é, portanto, uma técnica de consolidação de atributos de baixa cardinalidade em uma única tabela de dimensão. Ela não é normalizada (não é subdividida em tabelas menores), não precisa de conexão com outras dimensões, não fica dentro da fato e não usa chaves substitutas diferentes para visões diferentes. A pegadinha da banca está em confundir a dimensão Junk com outras técnicas de modelagem, como a dimensão degenerada (que fica na fato) ou o floco de neve (que normaliza). Guarde o critério: Junk = agrupar atributos de baixa cardinalidade para enxugar a fato.

Dimensão Junk
  • 1O que é
    • Agrupa atributos de baixa cardinalidade
    • Atributos sem relação entre si
  • 2Efeito na tabela fato
    • Diminui o tamanho
    • Reduz largura das linhas
  • 3O que NÃO é
    • Não fica dentro da fato (degenerada)
    • Não normaliza (floco de neve)
    • Não se conecta a outras dimensões
LEVEL · soulevel.com.br

Alternativa A — ❌ Incorreta

Afirma que a dimensão Junk está contida dentro da própria tabela fato por ter somente sua chave como atributo. Isso descreve a dimensão degenerada, não a Junk. A dimensão degenerada é um atributo que fica na própria tabela fato, sem tabela de dimensão separada (ex.: número do pedido, número da nota fiscal). A dimensão Junk, ao contrário, é uma tabela de dimensão separada, com chave própria e vários atributos combinados.

Alternativa B — ❌ Incorreta

Diz que a dimensão Junk pode estar relacionada com a tabela fato em visões diferentes pela mesma chave substituta. Isso não é uma característica da dimensão Junk. A chave substituta (surrogate key) é usada em todas as dimensões para garantir estabilidade, mas a ideia de "visões diferentes pela mesma chave" não define a Junk. A Junk tem uma única chave substituta que referencia uma combinação de atributos — não há múltiplas visões.

Alternativa C — ✅ Correta ⟵ GABARITO

A vantagem central da dimensão Junk é diminuir o tamanho da tabela fato associada. Ao consolidar vários atributos de baixa cardinalidade em uma única dimensão, a fato passa a ter apenas uma chave estrangeira em vez de várias colunas descritivas. Isso reduz a largura das linhas da fato, economiza espaço em disco e melhora o desempenho das consultas, pois menos dados precisam ser lidos. É exatamente o que a alternativa afirma.

Alternativa D — ❌ Incorreta

Afirma que a dimensão Junk deve possuir conexão com outras dimensões. Não há essa exigência. A dimensão Junk é uma tabela independente, ligada apenas à tabela fato. Ela não precisa (nem deve) se relacionar com outras dimensões — sua função é justamente evitar a proliferação de dimensões pequenas e desconexas.

Alternativa E — ❌ Incorreta

Diz que a dimensão Junk está normalizada e subdividida em tabelas menores de domínio. Isso descreve o esquema floco de neve (snowflake), que normaliza as dimensões em subdimensões. A dimensão Junk é o oposto: ela é desnormalizada por construção, agrupando atributos em uma única tabela justamente para evitar a normalização e a complexidade.

NÃO CAIA NESSA!

A banca mistura três conceitos de modelagem dimensional: a dimensão degenerada (alternativa A), o floco de neve (alternativa E) e a dimensão Junk (gabarito). O candidato que confunde Junk com degenerada ou com normalização cai nas alternativas erradas. A Junk é uma técnica de consolidação — ela junta atributos de baixa cardinalidade para enxugar a fato, não para normalizar ou para ficar dentro dela.

PEGA ESSA DICA!

Para fixar, compare os três conceitos lado a lado:

Critério

Dimensão Junk

Dimensão Degenerada

Floco de Neve

Onde fica

Tabela de dimensão separada

Dentro da tabela fato

Tabela de dimensão normalizada

Função

Agrupar atributos de baixa cardinalidade

Guardar atributo sem dimensão própria

Eliminar redundância nas dimensões

Efeito na fato

Diminui o tamanho

Não altera o tamanho

Não altera diretamente

Normalização

Não

Não

Sim

Na prova, ao ver "Junk", lembre-se: consolidação de atributos de baixa cardinalidade para reduzir a fato.

Gabarito: letra C

Link permanente: /questoes/vu196945