Questão de Biologia — Bioinformática — CESPE / CEBRASPE 2025
- Código
- ce406589
- Banca
- CESPE / CEBRASPE
- Órgão
- EMBRAPA
- Ano
- 2025
- Cargo
- Ana ( )
- CCerto
- EErrado
GabaritoC — Certo
Gabarito: CERTO. A afirmação está correta: os dados brutos de sequenciamento são comumente armazenados no formato FASTQ, que inclui a sequência e a qualidade de cada base; os genomas de referência utilizam FASTA para a sequência de nucleotídeos e GFF/GTF para as anotações (localização de genes, exons, etc.). Essa é a convenção padrão na bioinformática.
A bioinformática é a ciência que desenvolve e aplica ferramentas computacionais para armazenar, recuperar e analisar dados biológicos, especialmente sequências de DNA, RNA e proteínas. Na genômica, os dados gerados por sequenciadores de nova geração (NGS) são enormes e precisam de formatos padronizados para serem processados e compartilhados. Cada formato tem uma finalidade específica, e conhecê-los é essencial para quem trabalha com análise de genomas.
O formato FASTQ é o padrão para dados brutos de sequenciamento. Ele contém quatro linhas por leitura (read): a primeira começa com '@' e traz o identificador; a segunda é a sequência de bases; a terceira é um '+' (opcionalmente seguido do identificador); e a quarta linha contém os valores de qualidade (Phred score) codificados em caracteres ASCII. Essa informação de qualidade é crucial para filtrar leituras de baixa confiança durante o processamento.
Já o formato FASTA é mais simples: cada sequência é precedida por uma linha de cabeçalho que começa com '>', seguida do nome/descrição, e depois as linhas com a sequência de nucleotídeos ou aminoácidos. É usado para representar sequências de referência, como genomas completos, cromossomos ou proteínas, sem informação de qualidade.
Para as anotações, os formatos GFF (General Feature Format) e GTF (Gene Transfer Format) são os mais utilizados. Eles descrevem a localização de genes, exons, CDS, etc., em um genoma de referência, com colunas tabuladas contendo: sequência (cromossomo), fonte, tipo de feature, posição inicial, posição final, escore, fita, fase e atributos. A diferença entre GFF e GTF é sutil: o GTF é uma variação do GFF com regras mais rígidas para os atributos (ex.: obrigatoriedade dos campos 'gene_id' e 'transcript_id').
Na prática, um pipeline de análise genômica começa com os dados brutos em FASTQ, que são alinhados contra um genoma de referência em FASTA, e as anotações em GFF/GTF são usadas para interpretar as regiões alinhadas (ex.: identificar variantes em exons). Portanto, a afirmação do item está correta.
Para memorizar, associe: FASTQ = Qualidade (dados brutos com qualidade); FASTA = Apenas sequência (referência); GFF/GTF = Genes (anotações). Na prova, se a banca inverter esses papéis, você já sabe que está errado.
✅ CERTO.
Link permanente: /questoes/ce406589