Tienes un escaneo, lo pasas por una herramienta de OCR en línea y recibes una pared de errores tipográficos: un “3” leído como “8”, una “O” como “0”, tablas revueltas hasta quedar irreconocibles. La herramienta no está rota. La imagen no estaba lista.
Los motores de OCR (Tesseract / PaddleOCR / servicios en la nube) son modelos de reconocimiento de caracteres que se alimentan de píxeles. Si les pasas imágenes borrosas, de baja resolución, con marcas de agua o inclinadas, obtendrás resultados borrosos y de baja calidad.
Datos reales de pruebas comparativas (de OpenBenchmarking y ExpertBeacon 2025):
| Motor | Precisión general | Precio |
|---|---|---|
| Google Cloud Vision | 96.7% | Pago por llamada |
| Amazon Textract | 95.8% | Pago por llamada |
| Microsoft Azure | 93.5% | Pago por llamada |
| Tesseract (código abierto) | ~90% | Gratis, se ejecuta en local |
Ten en cuenta que ese ~90% es la cifra para “entrada ideal”. Si le metes una foto de pantalla hecha con el móvil o una imagen de baja resolución extraída de un PDF, es normal que la precisión caiga al 60–70%.
Esta guía explica cómo subir ese 60% hasta el 95% — cinco pasos de preprocesamiento, cada uno con umbrales concretos de “qué hacer y hasta dónde llegar”, más un flujo de trabajo solo en el frontend (Compresor de Imágenes + Recortador de Imágenes + OCR por Lotes).
Paso 1: Resolución — el DPI debe ser 300 o más
Los modelos OCR están entrenados con escaneos a 300 DPI. Si les das una captura de 800×600 no podrán leer el texto pequeño; si les das un original de 4000×3000 trabajarán lentos y desperdiciando cómputo.
Umbrales empíricos:
- Texto impreso corrido: lado largo de al menos 2000 px (~A4 a 300 DPI)
- Tablas, recibos, tickets: lado largo de al menos 2400 px (más detalle)
- Escritura a mano: lado largo de 3000+ px (mucha variación, necesita más contexto)
- Fotos con móvil: lado largo de al menos 2500 px y mantener la página plana
Por debajo de estos umbrales, ningún motor podrá salvarte. Las apps dedicadas de escaneo de documentos (Adobe Scan, Microsoft Lens) detectan bordes, corrigen la perspectiva y escalan a la resolución adecuada automáticamente — recomendamos instalar una.
Pero si tu fuente ya es un escaneo de baja resolución, no amplíes con interpolación — quedará aún más borroso. La única solución es volver a escanear.
Paso 2: Contraste — negro suficiente, blanco suficiente
Los modelos OCR dependen del delta de escala de grises entre píxeles para separar el texto del fondo. El texto con el máximo contraste es el más fácil de leer.
Qué hacer:
- Texto negro sobre fondo blanco es lo mejor. Texto de color, gris sobre gris o texto invertido (blanco sobre negro) reducen significativamente la precisión.
- Si el original tiene fondo azul claro con texto gris, baja la saturación a 0 y sube el contraste a +50 en cualquier editor de imágenes — la precisión del OCR puede subir entre 10 y 20 puntos porcentuales.
- Los documentos antiguos escaneados cogen un tono amarillento — empuja la temperatura de color hacia el frío (para quitar el amarillo) o conviértelo directamente a escala de grises. Los modelos OCR manejan mejor la escala de grises.
Comprobación rápida: amplía al 100%. ¿Puedes leer cada carácter en menos de un segundo? Si no, probablemente el OCR tampoco pueda.
Paso 3: Eliminación de ruido — Moiré, artefactos de compresión, marcas de agua
Tres tipos de ruido son los que más arruinan el OCR:
| Tipo de ruido | Origen | Solución |
|---|---|---|
| Patrones de Moiré | Re-fotografía de pantalla | Usa una app dedicada (Adobe Scan) o vuelve a fotografiar desde otro ángulo |
| Artefactos de compresión JPEG | JPGs guardados una y otra vez | Convierte a PNG primero, luego aplica OCR |
| Marcas de agua, sellos, anotaciones | Incluidos en el original | Recorta las zonas sin texto con el Recortador de Imágenes |
En la práctica, las facturas con marcas de agua semitransparentes hacen que el OCR lea el texto de la marca de agua junto con el cuerpo, mezclándolo todo en una salida inservible.
Enfoque más fiable: antes del OCR, pasa la imagen por el Compresor de Imágenes para recodificar el formato (PNG → JPG o viceversa). Así se eliminan los artefactos de compresión antiguos y se controla el tamaño final al mismo tiempo.
Paso 4: Enderezar — a partir de 3 grados, la precisión cae
Tesseract es muy sensible al ángulo de inclinación. Entre 0 y 3 grados apenas importa; a partir de 5 grados la precisión cae en picado; pasado los 10 grados es prácticamente inservible.
Corrección manual:
- Rota en cualquier editor, ajustando en incrementos de 0.5 grados, hasta que las líneas de texto estén perfectamente horizontales
- O usa
HoughLinesPde OpenCV para detectar el ángulo de inclinación automáticamente
Opción automatizada: apps como Adobe Scan, Microsoft Lens y Baidu Netdisk Scan tienen detección automática de bordes + enderezar integradas — tomas la foto y obtienes una imagen limpia y cuadrada lista para el OCR.
Si la fuente se exporta desde un PDF, la función de rotación del lector de PDF suele ser suficiente.
Paso 5: Elige el motor y los parámetros adecuados
Una vez firmes los cuatro pasos de preprocesamiento anteriores, el último paso es la elección del motor y los parámetros.
Selección de motor:
| Escenario | Motor recomendado |
|---|---|
| Impreso en inglés | Tesseract eng (código abierto, gratis, local) |
| Impreso en chino | Tesseract chi_sim + eng (combinado) |
| Tablas, tickets | Reconocimiento estructurado dedicado (PaddleOCR, Amazon Textract) |
| Escritura a mano | Servicios en la nube (Google ML Kit, reconocimiento de escritura de Baidu) |
Parámetros clave de Tesseract:
--psm 6: asume un bloque uniforme de texto (la mayoría de documentos)--psm 11: texto disperso (menús, recibos, letreros)--psm 12: combinado con OSD (Orientation and Script Detection) para detectar la orientación automáticamentepreserve_interword_spaces=1: conserva los espacios entre palabras (no activar para chino)
Antes de lanzar procesos por lotes, dedica 5 minutos a probar con una sola imagen para afinar los parámetros. En los trabajos por lotes, unos parámetros equivocados se traducen en decenas de minutos perdidos.
Práctica: un flujo de tres herramientas solo en el frontend
¿No quieres instalar software ni subir archivos a la nube (privacidad)? Las tres herramientas de Piick se ejecutan íntegramente en tu navegador, en local — las imágenes nunca salen de tu ordenador.
Flujo de trabajo
- Recortador de Imágenes: recorta las áreas irrelevantes (marcas de agua, firmas, sellos, márgenes sobrantes), dejando solo la región central con texto.
- Compresor de Imágenes: recodifica la imagen (Calidad 80, ancho máximo 1920 px) para eliminar artefactos de compresión antiguos y controlar el tamaño.
- Imagen a Texto por Lotes: sube un
.zipo arrastra varias imágenes. Cada una se reconoce individualmente y se empaqueta para descargar — un.txtpor imagen, más un archivo de texto combinado y un índice CSV.
Por qué funciona esta combinación
- El recorte elimina distracciones — marcas de agua, sellos y márgenes sobrantes nunca entran al reconocimiento
- La compresión elimina artefactos — el ruido JPEG antiguo queda sobreescrito por la nueva codificación
- OCR por lotes en local — Tesseract.js se ejecuta en el navegador, sin subir datos. Ideal para facturas, documentos de identidad, documentos internos
Adecuado para
- Digitalizar contratos en papel / facturas: procesa por lotes decenas de escaneos
- Citas de libros / artículos: convierte fragmentos de capturas en texto editable
- Fotos de pizarras, capturas de diapositivas: convierte por lotes en actas de reuniones
No es adecuado para
- Escritura a mano (precisión baja, necesita servicios en la nube)
- Tablas complejas (filas y columnas se mezclan, necesita una herramienta de reconocimiento estructurado dedicada)
- Fórmulas, capturas de código (reconocimiento por debajo del 50%, OCR no recomendado)
Convertir imagen a texto es 80% preprocesamiento, 20% ajustar el motor. Aplica bien los cinco pasos anteriores (resolución, contraste, eliminación de ruido, enderezar, selección de parámetros) e incluso el Tesseract de código abierto alcanzará más del 95% de precisión.
¿Necesitas procesar escaneos por lotes? Abre la herramienta Piick de Imagen a Texto por Lotes, sube un .zip o arrastra unas cuantas docenas de imágenes — para cuando te tomes un café, tus archivos de texto combinados estarán listos.