Resposta direta. Um documento digitalizado (PDF de imagem, foto de página, ofício escaneado) entra no SEI como imagem: a busca textual e o Ctrl+F não encontram caracteres em uma imagem, e assistentes que recebem apenas texto também não. OCR (reconhecimento óptico de caracteres) e modelos de visão podem gerar texto a partir dessa imagem para indexação e consulta na ferramenta — sem alterar o arquivo original no SEI. O texto extraído deve ser conferido contra o documento original antes de qualquer uso oficial, porque a qualidade depende da digitalização de origem.

Por que isso importa no SEI

O SEI é o sistema "destinado à produção, padronização, tramitação, uso e acesso a documentos e processos administrativos em meio eletrônico" (MGI — SEI, acesso em 18 ago. 2026). Documentos produzidos dentro dele são texto; mas parte relevante do acervo chega de fora — documentos externos digitalizados, anexos de terceiros, processos físicos migrados. Sem extração, essa parte fica invisível para busca e para qualquer análise assistida.

Como a extração funciona, em camadas

Ferramentas de extração costumam combinar caminhos diferentes conforme o tipo de documento:

  • Documentos editáveis e HTML (produzidos no próprio SEI ou em editores) já contêm texto: a extração aproveita esse texto diretamente.
  • PDFs e imagens passam por OCR, que reconhece os caracteres na imagem; quando o resultado é insuficiente, cadeias de fallback tentam outros motores ou configurações.
  • Modelos de visão interpretam a imagem como um todo — úteis para páginas de baixa qualidade, carimbos, tabelas complexas ou fotografias de documentos, que podem ser encaminhadas diretamente a eles.

O ponto de "camadas" é que nenhum método sozinho cobre todos os casos; a combinação amplia a cobertura, mas não a garante.

O que afeta a qualidade

  • Resolução e contraste da digitalização (documentos escuros, inclinados ou com ruído reduzem a acurácia).
  • Tipo de texto: impresso é bem reconhecido; manuscrito é incerto.
  • Layout: colunas, tabelas e carimbos sobrepostos confundem a ordem de leitura.
  • Idioma e caracteres especiais (acentos, símbolos jurídicos).
  • Páginas parcialmente ilegíveis — nenhum método recupera o que não está na imagem.

Como revisar o resultado

  • Compare trechos críticos (nomes, números, datas, valores) com a imagem original.
  • Trate texto extraído como insumo, não como documento oficial: o documento no SEI continua sendo a fonte.
  • Prefira ferramentas que indiquem de onde cada informação foi extraída (página/documento), para conferir rápido.
  • Registre quando um documento não pôde ser lido, em vez de assumir que "estava vazio".

Como o SEIA11 trata documentos digitalizados

O SEIA11 faz extração em camadas, com OCR e fallbacks de visão para documentos digitalizados, e usa o texto extraído para resumo, busca e respostas com citação das fontes recuperadas. O texto extraído deve ser conferido contra o documento original antes de uso oficial. Detalhes de compatibilidade em Compatibilidade; veja também como o SEIA11 extrai documentos.

Nota técnica: descrição do fluxo de extração verificada no produto em 18 ago. 2026; revisada a cada mudança relevante do pipeline.