Pular para o conteúdo principal

Questão de Banco de Dados — Banco de Dados — FGV 2024

Banco de DadosBanco de Dados
Código
fg077296
Banca
FGV
Órgão
CVM
Ano
2024
Nível
Superior
Cargo
Analista - Perfil 7 - Ciência de Dados - Tarde
Uma certa organização gostaria de compartilhar dados com um grupo de pesquisadores de uma universidade para a condução de um estudo sobre problemas ergonômicos nos seus escritórios. Entre os dados coletados, há informações sensíveis sobre seus funcionários; portanto, o responsável pela coleta decidiu anonimizar os dados. Isso foi feito removendo-se nomes e outros campos identificadores e adicionando-se um número identificador próprio a cada funcionário. Dessa forma, a identidade dos funcionários seria preservada. Após a verificação de uma amostra, o pesquisador responsável pelo estudo recomendou medidas que deveriam ser aplicadas antes que os dados pudessem ser aceitos para o estudo.O problema que mais provavelmente motivou a recomendação do pesquisador e uma medida que pode mitigar esse problema são, respectivamente:
  1. Aos dados podem ser reidentificados usando uma combinação dos campos restantes → embaralhamento dos campos;
  2. Bo número identificador não é suficiente para separar os dados → hashing usando os campos restantes;
  3. Cos dados podem ser reidentificados utilizando dados externos ao conjunto compartilhado → privacidade diferencial;
  4. Dos dados podem ser reidentificados através de engenharia reversa do número identificador → randomização não linear dos identificadores;
  5. Eo campos restantes podem ser usados para deduzir informação não inclusa no conjunto de dados → k-anonimato.
Revelar gabarito e comentário

GabaritoC — os dados podem ser reidentificados utilizando dados externos ao conjunto compartilhado → privacidade diferencial;

Comentário gerado por IA. É um apoio ao estudo, ancorado em fontes, mas pode conter imprecisões — confira sempre na fonte oficial (lei, súmula, edital e gabarito da banca). Encontrou um erro? Use “Reportar”.

Anonimização de dados e privacidade

Gabarito: letra C. O problema mais provável é a reidentificação dos dados por meio de combinação com dados externos (ataque de ligação), e a medida de mitigação mais eficaz entre as opções é a privacidade diferencial, que adiciona ruído controlado para proteger informações individuais.

A simples remoção de nomes e substituição por um identificador próprio (pseudonimização) não é suficiente para garantir o anonimato, pois os demais campos (quasi-identificadores) podem ser cruzados com bases de dados públicas para reidentificar os funcionários. A privacidade diferencial é uma técnica reconhecida que oferece garantias formais contra esse tipo de ataque.

Problema

Medida de Mitigação

Descrição

Reidentificação por combinação com dados externos (ataque de ligação)

Privacidade diferencial

Adiciona ruído controlado para proteger informações individuais, garantindo que a presença ou ausência de um indivíduo não altere significativamente os resultados de consultas

Reidentificação usando combinação dos campos restantes

Embaralhamento dos campos

Permuta valores, mas ainda permite reconstrução por inferência; não é medida robusta

Número identificador insuficiente para separar dados

Hashing usando campos restantes

Hashing pode ser revertido por força bruta ou ataques de dicionário; não resolve reidentificação

Reidentificação por engenharia reversa do número identificador

Randomização não linear dos identificadores

Improvável se o identificador for aleatório; não mitiga ataque principal via outros campos

Dedução de informação não inclusa no conjunto

k-anonimato

Técnica de anonimização, mas não se aplica diretamente à inferência de novos atributos

Alternativa A — ❌ Incorreta

O embaralhamento dos campos (shuffling) não é uma medida robusta; ele apenas permuta valores, mas ainda é possível reconstruir associações por inferência. Além disso, a reidentificação por combinação dos campos restantes é um risco real, mas o embaralhamento não é a mitigação padrão.

Alternativa B — ❌ Incorreta

O número identificador é suficiente para separar os dados (de fato, ele serve como chave), e hashing dos campos restantes não resolveria o problema de reidentificação, pois os hashes poderiam ser revertidos por força bruta ou ataques de dicionário.

Alternativa C — ✅ Correta ⟵ GABARITO

Identifica corretamente o risco de reidentificação via dados externos e propõe a privacidade diferencial como medida. A privacidade diferencial garante que a presença ou ausência de um indivíduo não altere significativamente o resultado de consultas, protegendo contra ataques de ligação.

Alternativa D — ❌ Incorreta

Engenharia reversa do número identificador é improvável se o identificador for aleatório e não sequencial. A randomização não linear dos identificadores não mitiga o ataque principal (linkage via outros campos), pois os demais campos continuam expostos.

Alternativa E — ❌ Incorreta

O problema descrito – deduzir informação não inclusa – refere-se a inferência de atributos, não a reidentificação. Embora o k-anonimato seja uma técnica de anonimização, ele não se aplica diretamente à inferência de novos atributos, e sim à prevenção de reidentificação por quasi-identificadores. A alternativa mistura conceitos.

Gabarito: letra C

Link permanente: /questoes/fg077296