Anonimização de dados e privacidade
Gabarito: letra C. O problema mais provável é a reidentificação dos dados por meio de combinação com dados externos (ataque de ligação), e a medida de mitigação mais eficaz entre as opções é a privacidade diferencial, que adiciona ruído controlado para proteger informações individuais.
A simples remoção de nomes e substituição por um identificador próprio (pseudonimização) não é suficiente para garantir o anonimato, pois os demais campos (quasi-identificadores) podem ser cruzados com bases de dados públicas para reidentificar os funcionários. A privacidade diferencial é uma técnica reconhecida que oferece garantias formais contra esse tipo de ataque.
Problema | Medida de Mitigação | Descrição |
|---|
Reidentificação por combinação com dados externos (ataque de ligação) | Privacidade diferencial | Adiciona ruído controlado para proteger informações individuais, garantindo que a presença ou ausência de um indivíduo não altere significativamente os resultados de consultas |
Reidentificação usando combinação dos campos restantes | Embaralhamento dos campos | Permuta valores, mas ainda permite reconstrução por inferência; não é medida robusta |
Número identificador insuficiente para separar dados | Hashing usando campos restantes | Hashing pode ser revertido por força bruta ou ataques de dicionário; não resolve reidentificação |
Reidentificação por engenharia reversa do número identificador | Randomização não linear dos identificadores | Improvável se o identificador for aleatório; não mitiga ataque principal via outros campos |
Dedução de informação não inclusa no conjunto | k-anonimato | Técnica de anonimização, mas não se aplica diretamente à inferência de novos atributos |
Alternativa A — ❌ Incorreta
O embaralhamento dos campos (shuffling) não é uma medida robusta; ele apenas permuta valores, mas ainda é possível reconstruir associações por inferência. Além disso, a reidentificação por combinação dos campos restantes é um risco real, mas o embaralhamento não é a mitigação padrão.
Alternativa B — ❌ Incorreta
O número identificador é suficiente para separar os dados (de fato, ele serve como chave), e hashing dos campos restantes não resolveria o problema de reidentificação, pois os hashes poderiam ser revertidos por força bruta ou ataques de dicionário.
Alternativa C — ✅ Correta ⟵ GABARITO
Identifica corretamente o risco de reidentificação via dados externos e propõe a privacidade diferencial como medida. A privacidade diferencial garante que a presença ou ausência de um indivíduo não altere significativamente o resultado de consultas, protegendo contra ataques de ligação.
Alternativa D — ❌ Incorreta
Engenharia reversa do número identificador é improvável se o identificador for aleatório e não sequencial. A randomização não linear dos identificadores não mitiga o ataque principal (linkage via outros campos), pois os demais campos continuam expostos.
Alternativa E — ❌ Incorreta
O problema descrito – deduzir informação não inclusa – refere-se a inferência de atributos, não a reidentificação. Embora o k-anonimato seja uma técnica de anonimização, ele não se aplica diretamente à inferência de novos atributos, e sim à prevenção de reidentificação por quasi-identificadores. A alternativa mistura conceitos.
Gabarito: letra C