Pular para o conteúdo principal

Questão de Banco de Dados — ETL (Extract Transform Load) — Quadrix 2023

Banco de DadosETL (Extract Transform Load)
Código
qg027833
Banca
Quadrix
Órgão
CRM-MG
Ano
2023
Nível
Superior
Cargo
CRM - MG - Analista de Sistemas
No Pentanho, uma das ferramentas ETL disponíveis no mercado, a etapa que tem como função principal permitir a classificação (ordem crescente ou decrescente) das linhas com base nos campos especificados é denominada
  1. Aconcat fields.
  2. Bsort rows.
  3. Cset file value.
  4. Dsplit field to rows.
  5. Eunique rouws.
Revelar gabarito e comentário

GabaritoB — sort rows.

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Ferramentas ETL: etapas de transformação no Pentaho

Gabarito: letra B. A etapa que classifica as linhas em ordem crescente ou decrescente com base em campos especificados é o Sort Rows (ordenar linhas), um passo de transformação do Pentaho Data Integration (Kettle). As demais alternativas desempenham funções distintas — concatenação de campos, definição de valor de arquivo, divisão de campo em linhas e remoção de duplicatas —, nenhuma delas relacionada à ordenação.

O Pentaho Data Integration (PDI), também conhecido como Kettle, é uma ferramenta ETL amplamente utilizada para extrair, transformar e carregar dados. Dentro do PDI, as operações são organizadas em steps (passos) que compõem um job ou uma transformation. Cada step executa uma função específica sobre o fluxo de dados, e é exatamente essa granularidade que a questão explora: identificar qual step corresponde à função de ordenação.

O Sort Rows é o step responsável por ordenar as linhas de um fluxo de dados com base em um ou mais campos, em ordem crescente ou decrescente. Ele é essencial em pipelines que exigem dados ordenados para operações subsequentes, como junções (merges) ou agregações que dependem de sequência. Na prática, o usuário configura o step informando os campos a ordenar e o sentido (ascendente/descendente), e o PDI reorganiza o fluxo conforme essa especificação.

Para entender a questão, é útil comparar os steps mencionados nas alternativas, pois cada um atende a uma necessidade distinta de transformação:

Step

Função principal

Sort Rows

Ordena linhas por campos especificados (crescente/decrescente)

Concat Fields

Concatena o conteúdo de dois ou mais campos em um único campo

Set File Value

Define um valor (ex.: nome de arquivo) em uma variável ou campo

Split Field to Rows

Divide o conteúdo de um campo em múltiplas linhas, usando um delimitador

Unique Rows

Remove linhas duplicadas do fluxo de dados

A pegadinha da banca está em oferecer steps com nomes parecidos ou funções complementares, mas que não realizam ordenação. O candidato que conhece apenas o conceito genérico de ETL, sem dominar os steps específicos do Pentaho, pode confundir Sort Rows com Unique Rows (ambos mexem com linhas) ou com Split Field to Rows (ambos envolvem linhas). A distinção crucial é que Sort Rows reorganiza a ordem das linhas, enquanto Unique Rows elimina duplicatas e Split Field to Rows desmembra um campo em várias linhas.

Guarde essa fronteira: ordenação = Sort Rows; deduplicação = Unique Rows; concatenação = Concat Fields; divisão = Split Field to Rows. É exatamente nesse contraste que as alternativas se separam.

Alternativa A — ❌ Incorreta

Concat Fields concatena (une) o conteúdo de dois ou mais campos em um único campo de saída. Por exemplo, juntar os campos "Nome" e "Sobrenome" em um campo "Nome Completo". Não realiza nenhuma ordenação de linhas — apenas combina valores dentro de cada linha.

Alternativa B — ✅ Correta ⟵ GABARITO

Sort Rows é o step do Pentaho que ordena as linhas do fluxo com base nos campos especificados, em ordem crescente ou decrescente. É exatamente a função descrita no enunciado: "permitir a classificação (ordem crescente ou decrescente) das linhas com base nos campos especificados".

Alternativa C — ❌ Incorreta

Set File Value é um step que define um valor (geralmente um nome de arquivo ou caminho) em uma variável ou campo do fluxo. Ele é usado para configurar parâmetros dinâmicos, não para ordenar linhas.

Alternativa D — ❌ Incorreta

Split Field to Rows divide o conteúdo de um campo em múltiplas linhas, usando um delimitador (ex.: vírgula, ponto e vírgula). Por exemplo, um campo com "A,B,C" vira três linhas: "A", "B" e "C". Essa operação aumenta o número de linhas, mas não as ordena.

Alternativa E — ❌ Incorreta

Unique Rows (grafado como "Unique Rouws" na alternativa) remove linhas duplicadas do fluxo de dados, mantendo apenas uma ocorrência de cada valor distinto. É uma operação de deduplicação, não de ordenação. A grafia incorreta "Rouws" é um distrator visual para confundir o candidato.

NÃO CAIA NESSA!

A banca explora a semelhança entre steps que atuam sobre linhas. O candidato pode confundir Sort Rows (ordena) com Unique Rows (remove duplicatas) ou Split Field to Rows (divide em linhas). A palavra-chave do enunciado é "classificação" — só o Sort Rows faz isso. Com treino, você identifica essas trocas de longe 💪.

PEGA ESSA DICA!

Para questões de ferramentas ETL, monte uma tabela mental dos steps mais cobrados: Sort Rows (ordenar), Unique Rows (deduplicar), Concat Fields (concatenar), Split Field to Rows (dividir), Filter Rows (filtrar), Select Values (selecionar campos). Associe cada um a um verbo de ação — isso resolve a maioria das questões de nomenclatura.

Gabarito: letra B

Link permanente: /questoes/qg027833