David Castilho
EQUIPE
29/08/2026 • 15:01
Vamos falar sobre um desafio bem comum em órgãos públicos: a digitalização e o processamento de documentos legados, especialmente quando há milhares de arquivos históricos em PDF, muitos deles digitalizados a partir de papel. Nesses casos, o grande problema é que o conteúdo dos arquivos digitalizados, geralmente em PDF, está muitas vezes em formato de imagem (foto das páginas), impedindo o acesso direto ao texto para buscas, análises e integração com sistemas automáticos, já que o computador não 'enxerga' palavras e frases, apenas pixels.
Dentre as alternativas apresentadas, várias cometem equívocos conceituais. Converter PDF em imagens (letra A) só dificulta mais o trabalho, pois sistemas analíticos continuam não reconhecendo texto em imagens. Indexar apenas os nomes de arquivos (letra B) não traz acesso ao conteúdo interno do documento, só ao título do arquivo, e os nomes muitas vezes são pouco informativos. Compactar os arquivos (letra C) serve apenas para economizar espaço em disco, não ajuda a entender ou extrair o que está escrito nos textos. Salvar em arquivos binários padronizados (letra D) também não transforma a imagem em texto processável: só muda a forma de guardar o mesmo conteúdo.
A alternativa correta é a letra E: utilizando técnicas de Reconhecimento Óptico de Caracteres (OCR). O OCR permite que o computador 'leia' os textos presentes nas imagens dos PDFs digitalizados, extraindo esse texto para manipulação, busca e análise. Só assim as informações históricas ficam realmente disponíveis para consultas inteligentes, análises estatísticas e integração com outros sistemas.
Portanto, o gabarito é a alternativa E.
Dentre as alternativas apresentadas, várias cometem equívocos conceituais. Converter PDF em imagens (letra A) só dificulta mais o trabalho, pois sistemas analíticos continuam não reconhecendo texto em imagens. Indexar apenas os nomes de arquivos (letra B) não traz acesso ao conteúdo interno do documento, só ao título do arquivo, e os nomes muitas vezes são pouco informativos. Compactar os arquivos (letra C) serve apenas para economizar espaço em disco, não ajuda a entender ou extrair o que está escrito nos textos. Salvar em arquivos binários padronizados (letra D) também não transforma a imagem em texto processável: só muda a forma de guardar o mesmo conteúdo.
A alternativa correta é a letra E: utilizando técnicas de Reconhecimento Óptico de Caracteres (OCR). O OCR permite que o computador 'leia' os textos presentes nas imagens dos PDFs digitalizados, extraindo esse texto para manipulação, busca e análise. Só assim as informações históricas ficam realmente disponíveis para consultas inteligentes, análises estatísticas e integração com outros sistemas.
Portanto, o gabarito é a alternativa E.