Uma Assembleia Legislativa iniciou um projeto de transformação digital para d...

Uma Assembleia Legislativa iniciou um projeto de transformação digital para disponibilizar informações históricas contidas em milhares de documentos arquivados ao longo de décadas. O acervo era co...


publicidade
Uma Assembleia Legislativa iniciou um projeto de transformação digital para disponibilizar informações históricas contidas em milhares de documentos arquivados ao longo de décadas. O acervo era composto por proposições digitalizadas, pareceres, atas de reuniões, documentos administrativos e registros orçamentários armazenados em formato PDF, muitos deles originados de processos de digitalização de documentos físicos. Para viabilizar consultas, análises estatísticas e integração com sistemas corporativos, tornou-se necessário converter o conteúdo textual desses documentos em informações estruturadas passíveis de processamento computacional.
Assinale a alternativa que apresenta a abordagem tecnicamente adequada para a extração de informações em um cenário com essas características.
Analisando...
publicidade

🚀 Desbloqueie a explicação completa

Veja comentários detalhados e resoluções exclusivas para entender o gabarito desta questão.

Criar conta grátis
  • David Castilho
    David Castilho EQUIPE
    29/08/2026 • 15:01
    Vamos falar sobre um desafio bem comum em órgãos públicos: a digitalização e o processamento de documentos legados, especialmente quando há milhares de arquivos históricos em PDF, muitos deles digitalizados a partir de papel. Nesses casos, o grande problema é que o conteúdo dos arquivos digitalizados, geralmente em PDF, está muitas vezes em formato de imagem (foto das páginas), impedindo o acesso direto ao texto para buscas, análises e integração com sistemas automáticos, já que o computador não 'enxerga' palavras e frases, apenas pixels.
    Dentre as alternativas apresentadas, várias cometem equívocos conceituais. Converter PDF em imagens (letra A) só dificulta mais o trabalho, pois sistemas analíticos continuam não reconhecendo texto em imagens. Indexar apenas os nomes de arquivos (letra B) não traz acesso ao conteúdo interno do documento, só ao título do arquivo, e os nomes muitas vezes são pouco informativos. Compactar os arquivos (letra C) serve apenas para economizar espaço em disco, não ajuda a entender ou extrair o que está escrito nos textos. Salvar em arquivos binários padronizados (letra D) também não transforma a imagem em texto processável: só muda a forma de guardar o mesmo conteúdo.
    A alternativa correta é a letra E: utilizando técnicas de Reconhecimento Óptico de Caracteres (OCR). O OCR permite que o computador 'leia' os textos presentes nas imagens dos PDFs digitalizados, extraindo esse texto para manipulação, busca e análise. Só assim as informações históricas ficam realmente disponíveis para consultas inteligentes, análises estatísticas e integração com outros sistemas.
    Portanto, o gabarito é a alternativa E.
publicidade
🍪

Utilizamos cookies e tecnologias semelhantes para aprimorar sua experiência de navegação. Política de Privacidade.