Resposta direta. Um documento digitalizado (PDF de imagem, foto de página, ofício escaneado) entra no SEI como imagem: a busca textual e o Ctrl+F não encontram caracteres em uma imagem, e assistentes que recebem apenas texto também não. OCR (reconhecimento óptico de caracteres) e modelos de visão podem gerar texto a partir dessa imagem para indexação e consulta na ferramenta — sem alterar o arquivo original no SEI. O texto extraído deve ser conferido contra o documento original antes de qualquer uso oficial, porque a qualidade depende da digitalização de origem.
Por que isso importa no SEI
O SEI é o sistema "destinado à produção, padronização, tramitação, uso e acesso a documentos e processos administrativos em meio eletrônico" (MGI — SEI, acesso em 18 ago. 2026). Documentos produzidos dentro dele são texto; mas parte relevante do acervo chega de fora — documentos externos digitalizados, anexos de terceiros, processos físicos migrados. Sem extração, essa parte fica invisível para busca e para qualquer análise assistida.
Como a extração funciona, em camadas
Ferramentas de extração costumam combinar caminhos diferentes conforme o tipo de documento:
- Documentos editáveis e HTML (produzidos no próprio SEI ou em editores) já contêm texto: a extração aproveita esse texto diretamente.
- PDFs e imagens passam por OCR, que reconhece os caracteres na imagem; quando o resultado é insuficiente, cadeias de fallback tentam outros motores ou configurações.
- Modelos de visão interpretam a imagem como um todo — úteis para páginas de baixa qualidade, carimbos, tabelas complexas ou fotografias de documentos, que podem ser encaminhadas diretamente a eles.
O ponto de "camadas" é que nenhum método sozinho cobre todos os casos; a combinação amplia a cobertura, mas não a garante.
O que afeta a qualidade
- Resolução e contraste da digitalização (documentos escuros, inclinados ou com ruído reduzem a acurácia).
- Tipo de texto: impresso é bem reconhecido; manuscrito é incerto.
- Layout: colunas, tabelas e carimbos sobrepostos confundem a ordem de leitura.
- Idioma e caracteres especiais (acentos, símbolos jurídicos).
- Páginas parcialmente ilegíveis — nenhum método recupera o que não está na imagem.
Como revisar o resultado
- Compare trechos críticos (nomes, números, datas, valores) com a imagem original.
- Trate texto extraído como insumo, não como documento oficial: o documento no SEI continua sendo a fonte.
- Prefira ferramentas que indiquem de onde cada informação foi extraída (página/documento), para conferir rápido.
- Registre quando um documento não pôde ser lido, em vez de assumir que "estava vazio".
Como o SEIA11 trata documentos digitalizados
O SEIA11 faz extração em camadas, com OCR e fallbacks de visão para documentos digitalizados, e usa o texto extraído para resumo, busca e respostas com citação das fontes recuperadas. O texto extraído deve ser conferido contra o documento original antes de uso oficial. Detalhes de compatibilidade em Compatibilidade; veja também como o SEIA11 extrai documentos.
Nota técnica: descrição do fluxo de extração verificada no produto em 18 ago. 2026; revisada a cada mudança relevante do pipeline.