Você pega uma digitalização, joga em uma ferramenta de OCR online e recebe de volta uma parede de erros tipográficos — um “3” lido como “8”, um “O” como “0”, tabelas embaralhadas a ponto de ficarem irreconhecíveis. A ferramenta não está quebrada. A imagem é que não estava pronta.
Os motores de OCR (Tesseract / PaddleOCR / serviços em nuvem) são modelos de reconhecimento de caracteres que se alimentam de pixels. Forneça a eles imagens borradas, de baixa resolução, com marcas d’água ou inclinadas, e você receberá como retorno uma saída borrada e de baixa qualidade.
Números reais de benchmarks (das comparações da OpenBenchmarking e ExpertBeacon 2025):
| Motor | Precisão geral | Preço |
|---|---|---|
| Google Cloud Vision | 96,7% | Pagamento por chamada |
| Amazon Textract | 95,8% | Pagamento por chamada |
| Microsoft Azure | 93,5% | Pagamento por chamada |
| Tesseract (código aberto) | ~90% | Grátis, roda localmente |
Note que esses ~90% são o número para “entrada ideal”. Se você joga uma foto de tela tirada com o celular ou uma imagem de baixa resolução extraída de um PDF, é normal a precisão cair para 60–70%.
Este guia explica como elevar esses 60% até 95% — cinco etapas de pré-processamento, cada uma com limiares concretos de “o que fazer e até onde ir”, mais um fluxo de trabalho puramente no frontend (Compressor de Imagens + Recortador de Imagens + OCR em Lote).
Etapa 1: Resolução — o DPI precisa ser 300 ou mais
Os modelos de OCR são treinados em digitalizações a 300 DPI. Dê a eles uma captura de 800×600 e eles não conseguirão ler textos pequenos; dê a eles um original de 4000×3000 e eles trabalharão devagar, desperdiçando processamento.
Limiares empíricos:
- Texto impresso corrido: lado maior com pelo menos 2000 px (~A4 a 300 DPI)
- Tabelas, recibos, tickets: lado maior com pelo menos 2400 px (mais detalhes)
- Escrita manual: lado maior 3000+ px (alta variação dos caracteres, precisa de mais contexto)
- Fotos com celular: lado maior com pelo menos 2500 px, e manter a página plana
Abaixo desses limiares, nenhum motor vai te salvar. Apps dedicados de digitalização de documentos (Adobe Scan, Microsoft Lens) detectam bordas automaticamente, corrigem perspectiva e redimensionam para a resolução certa — recomendamos fortemente instalar um.
Mas se a sua fonte já é uma digitalização de baixa resolução, não amplie com interpolação — vai ficar ainda mais borrado. A única saída é digitalizar de novo.
Etapa 2: Contraste — preto o suficiente, branco o suficiente
Os modelos de OCR dependem do delta de escala de cinza entre pixels para separar texto do fundo. Texto com contraste máximo é o mais fácil de ler.
O que fazer:
- Texto preto sobre fundo branco é o ideal. Texto colorido, cinza sobre cinza ou texto invertido (branco sobre preto) reduzem significativamente a precisão.
- Se o original tem fundo azul-claro com texto cinza, baixe a saturação para 0 e suba o contraste para +50 em qualquer editor de imagem — a precisão do OCR pode subir entre 10 e 20 pontos percentuais.
- Documentos antigos digitalizados ganham um tom amarelado — empurre a temperatura da cor para o frio (tirar o amarelo), ou converta direto para escala de cinza. Os modelos de OCR lidam melhor com escala de cinza.
Verificação rápida: amplie para 100%. Você consegue ler cada caractere em menos de um segundo? Se não, provavelmente o OCR também não conseguirá.
Etapa 3: Remoção de ruído — Moiré, artefatos de compressão, marcas d’água
Três tipos de ruído destroem o OCR mais do que tudo:
| Tipo de ruído | Origem | Solução |
|---|---|---|
| Padrões de moiré | Re-fotografia de tela | Use um app dedicado (Adobe Scan), ou refaça a foto em outro ângulo |
| Artefatos de compressão JPEG | JPGs salvos várias vezes | Converta para PNG primeiro, depois aplique OCR |
| Marcas d’água, carimbos, anotações | Já presentes no original | Recorte as regiões sem texto com o Recortador de Imagens |
Na prática, faturas com marcas d’água semitransparentes fazem o OCR ler o texto da marca d’água junto com o corpo, misturando tudo numa saída inutilizável.
Abordagem mais confiável: antes do OCR, passe a imagem pelo Compressor de Imagens para recodificar o formato (PNG → JPG ou vice-versa). Isso elimina artefatos de compressão antigos e controla o tamanho final ao mesmo tempo.
Etapa 4: Endireitar — além de 3 graus, a precisão cai
Tesseract é bastante sensível ao ângulo de inclinação. De 0 a 3 graus quase não importa; além de 5 graus a precisão despenca; passando de 10 graus fica praticamente inutilizável.
Correção manual:
- Gire em qualquer editor, ajustando em incrementos de 0,5 grau, até que as linhas de texto fiquem perfeitamente horizontais
- Ou use o
HoughLinesPdo OpenCV para detectar o ângulo de inclinação automaticamente
Opção automatizada: apps como Adobe Scan, Microsoft Lens e Baidu Netdisk Scan já trazem detecção automática de bordas + endireitar embutidos — você tira a foto e recebe uma imagem limpa e alinhada, pronta para o OCR.
Se a fonte for exportada de um PDF, a função de rotação do próprio leitor de PDF geralmente dá conta.
Etapa 5: Escolha o motor e os parâmetros certos
Depois que as quatro etapas de pré-processamento acima estiverem firmes, o último passo é a escolha do motor e dos parâmetros.
Seleção do motor:
| Cenário | Motor recomendado |
|---|---|
| Impresso em inglês | Tesseract eng (código aberto, grátis, local) |
| Impresso em chinês | Tesseract chi_sim + eng (combinado) |
| Tabelas, tickets | Reconhecimento estruturado dedicado (PaddleOCR, Amazon Textract) |
| Escrita manual | Serviços em nuvem (Google ML Kit, reconhecimento de escrita da Baidu) |
Parâmetros-chave do Tesseract:
--psm 6: assume um bloco uniforme de texto (a maioria dos cenários de documentos)--psm 11: texto esparso (cardápios, recibos, placas)--psm 12: combinado com OSD (Orientation and Script Detection) para detectar a orientação automaticamentepreserve_interword_spaces=1: preserva os espaços entre palavras (não ative para chinês)
Antes de rodar lotes, gaste 5 minutos testando em uma única imagem para ajustar os parâmetros. Em trabalhos em lote, parâmetros errados custam dezenas de minutos.
Na prática: um fluxo de três ferramentas, puramente no frontend
Não quer instalar software nem enviar arquivos para a nuvem (privacidade)? As três ferramentas da Piick rodam inteiramente no seu navegador, localmente — as imagens nunca saem do seu computador.
Fluxo de trabalho
- Recortador de Imagens: corte as áreas irrelevantes (marcas d’água, assinaturas, carimbos, margens excedentes), deixando só a região central de texto.
- Compressor de Imagens: recodifique a imagem (Qualidade 80, largura máx. 1920 px) para remover artefatos de compressão antigos e controlar o tamanho.
- Imagem para Texto em Lote: envie um
.zipou arraste várias imagens. Cada uma é reconhecida individualmente e tudo é empacotado para download — um.txtpor imagem, mais um arquivo de texto consolidado e um índice CSV.
Por que essa combinação funciona
- O recorte elimina distrações — marcas d’água, carimbos e margens excedentes nunca entram no reconhecimento
- A compressão apaga artefatos — o ruído JPEG antigo é sobrescrito pela nova codificação
- OCR em lote local — o Tesseract.js roda no navegador, sem upload de dados. Ótimo para faturas, documentos de identidade, documentos internos
Boa opção para
- Digitalizar contratos em papel / faturas: processe em lote dezenas de digitalizações
- Trechos de livros / artigos: transforme pedaços de capturas em texto editável
- Fotos de quadro branco, capturas de slides: converta em lote em atas de reunião
Não é boa opção para
- Escrita manual (precisão baixa, precisa de serviços em nuvem)
- Tabelas complexas (linhas e colunas se misturam, precisa de ferramenta de reconhecimento estruturado dedicada)
- Fórmulas, capturas de código (reconhecimento abaixo de 50%, OCR não recomendado)
Converter imagem em texto é 80% pré-processamento, 20% ajuste do motor. Domine bem as cinco etapas acima (resolução, contraste, remoção de ruído, endireitar, seleção de parâmetros) e mesmo o Tesseract open source passa dos 95% de precisão.
Precisa processar digitalizações em lote? Abra a ferramenta Piick Imagem para Texto em Lote, envie um .zip ou arraste algumas dezenas de imagens — no tempo de tomar um café, seus arquivos de texto consolidados estarão prontos.