OCR de PDF en línea gratis
Reconoce y extrae texto de documentos PDF escaneados usando OCR en tu navegador.
Arrastra archivos aquí o haz clic para subir
Max 100 MB
El OCR (Reconocimiento Óptico de Caracteres) convierte las imágenes de texto dentro de un PDF en texto real, seleccionable y buscable. Los documentos escaneados, las fotos de recibos con el móvil y los PDF antiguos cargados de imágenes se benefician por igual: tras el OCR puedes copiar texto, buscar dentro del archivo y pasarlo por otras herramientas como PDF a Word. Lo más difícil del OCR es la cobertura de idiomas: reconocer inglés es muy distinto a reconocer chino, japonés o escritura árabe. Esta herramienta soporta más de 100 idiomas a través de Tesseract.js, aunque los paquetes de idioma más grandes (como los CJK) descargan datos adicionales del modelo la primera vez que se usan. El OCR corre completamente en tu navegador. El motor WASM de Tesseract procesa cada página, añade una capa de texto al PDF manteniendo visible la imagen original y entrega una salida buscable. Nada sale de tu dispositivo.
Última revisión: Julio 2026
¿Qué es esto?
El OCR ocurre en tres etapas. Primero, el preprocesamiento de imagen normaliza la página: la binarización convierte el color en blanco y negro, la corrección de inclinación endereza los escaneos torcidos y la eliminación de ruido limpia las manchas. Segundo, el análisis de layout segmenta la página en zonas de texto y zonas no textuales (imágenes, líneas, tablas), y dentro de las zonas de texto identifica líneas y palabras individuales. Tercero, el reconocimiento de caracteres usa una red neuronal LSTM (Long Short-Term Memory) para convertir las imágenes de palabras en secuencias de caracteres. El OCR moderno es notablemente preciso con escaneos limpios y de alto DPI de texto impreso, a menudo por encima del 99% para inglés. La escritura a mano, las imágenes de baja resolución y los layouts complejos reducen la precisión de forma significativa.
Cómo usar esta herramienta
- 1Elige un PDF con páginas escaneadas o basadas en imagen. Si tu PDF ya tiene texto seleccionable, el OCR no es necesario: usa la herramienta 'Extraer texto' para ahorrar tiempo de procesamiento.
- 2Selecciona los idiomas presentes en el PDF. Elige solo los que realmente aparecen: incluir idiomas no usados ralentiza el procesamiento sin mejorar la precisión. En documentos multilingües, selecciona el idioma principal.
- 3Haz clic en Procesar. La herramienta carga el modelo de idioma (la primera ejecución puede tardar 10-30 segundos en descargar el modelo de ~10MB) y luego procesa cada página. Espera de 2 a 5 segundos por página en escaneos típicos.
- 4Descarga el PDF con OCR. La salida se ve idéntica a la entrada, pero ahora puedes seleccionar, copiar y buscar texto en todo el documento. Prueba Ctrl+F para verificar que el texto se ha reconocido correctamente.
Consejos y buenas prácticas
- La precisión del OCR depende mucho de la calidad del escaneo. Los escaneos de 300 DPI de texto impreso rinden un 98-99% de precisión. A 150 DPI baja a 85-90%. Las fotos con el móvil varían mucho: 90-95% con buena luz, 70-80% con luz pobre.
- La primera ejecución descarga el motor WASM de Tesseract (~15MB) más los modelos de idioma (5-15MB cada uno). Una vez descargados, los modelos se almacenan en caché y las siguientes ejecuciones son mucho más rápidas.
- Para los idiomas CJK (chino, japonés, coreano), el paquete de idioma es notablemente más grande (~15-25MB por idioma). La primera ejecución tarda más que con idiomas latinos.
- El reconocimiento de escritura a mano no es el fuerte de esta herramienta. Tesseract maneja bien el texto impreso pero le cuesta la letra cursiva. La precisión baja al 30-60% con manuscritos.
- El OCR añade una capa de texto oculta debajo de la imagen visible. Si el PDF de salida parece igual, es lo esperado: prueba a seleccionar texto para confirmar que el OCR funcionó.
Usos comunes
- Un bibliotecario que digitaliza una estantería de informes impresos antiguos en un archivo buscable sin volver a teclearlos.
- Un abogado que aplica OCR a expedientes judiciales escaneados para poder buscar referencias de casos concretos en el texto completo.
- Un investigador que procesa PDF antiguos de revistas (escaneos solo de imagen) para extraer citas para una revisión bibliográfica.
- Un equipo financiero que hace OCR a facturas escaneadas antes de archivarlas en una carpeta buscable para futuras auditorías.
- Un traductor que prepara documentos escaneados haciéndoles OCR primero, y luego alimenta el texto extraído a un software de traducción.
- Un periodista que trabaja con PDF de documentos filtrados (a menudo imágenes escaneadas) para buscar nombres y fechas clave en cientos de páginas.
Notas técnicas
- La herramienta usa Tesseract.js 7.x (build WebAssembly) ejecutándose dentro de un Web Worker para que el OCR no congele la pestaña del navegador.
- Los modelos de idioma se descargan en el primer uso y se cachean en el navegador. Los idiomas latinos ocupan ~5-8MB; los CJK ~15-25MB cada uno.
- La velocidad de procesamiento de OCR es de 2-5 segundos por página en escaneos impresos típicos a 300 DPI en CPU de escritorio modernas.
- El PDF de salida se crea con una capa de texto oculta superpuesta a las imágenes de página originales. El texto es invisible visualmente pero seleccionable y buscable.
- La herramienta soporta más de 100 idiomas, incluidos inglés, francés, alemán, español, chino (simplificado y tradicional), japonés, coreano, árabe, hebreo y ruso.
- Las páginas multilingües están soportadas: selecciona varios idiomas y Tesseract ejecuta pasadas de reconocimiento para cada uno. La precisión en páginas realmente mixtas es menor que en las de un solo idioma.
Privado por diseño
Esta herramienta se ejecuta en tu navegador. El archivo no se sube a nuestro servidor mientras la usas.
Limitaciones
- La escritura a mano no se reconoce bien. Tesseract está optimizado para texto impreso: espera un 30-60% de precisión en manuscritos, frente al 98%+ en inglés impreso limpio.
- Los escaneos con DPI muy bajo (por debajo de 150 DPI) producen resultados de OCR pobres. Vuelve a escanear a 300 DPI para una precisión de calidad de archivo.
- Los layouts complejos (texto a varias columnas, tablas con mucho formato, barras laterales) pueden producir texto extraído en un orden de lectura inesperado.
- La descarga inicial (~15MB de motor + modelo de idioma) puede ser lenta con conexiones limitadas. Una vez descargados, los modelos se cachean en el navegador.
- Los PDF protegidos con contraseña no pueden procesarse. Retira la contraseña con la herramienta 'Proteger' primero.
- Los PDF muy grandes (más de 200 páginas) pueden agotar la memoria del navegador durante el procesamiento. Divide en lotes de 50 páginas si tienes problemas.
Preguntas Frecuentes
¿Qué es el OCR?
OCR (Reconocimiento Óptico de Caracteres) convierte imágenes de texto en texto real seleccionable. Los PDF escaneados y las fotos con el móvil contienen píxeles, no caracteres: el OCR mira esos píxeles e infiere qué letras representan, luego añade una capa de texto para que el contenido sea buscable.
¿Qué idiomas están soportados?
Más de 100 idiomas a través de Tesseract.js. Los habituales incluyen inglés, francés, alemán, español, chino (simplificado/tradicional), japonés, coreano, árabe, hebreo y ruso. Selecciona los idiomas de tu documento en el menú desplegable antes de procesar.
¿Por qué la primera ejecución de OCR es tan lenta?
El motor Tesseract (~15MB) y el modelo de idioma (~5-25MB según el idioma) se descargan en el primer uso. Se almacenan en caché en el navegador, por lo que las ejecuciones siguientes saltan la descarga y empiezan de inmediato.
¿Qué precisión tiene el OCR?
Para texto impreso limpio a 300 DPI: 98-99% para inglés, 95-97% para otros idiomas latinos, 90-95% para idiomas CJK. Las fotos con móvil y los escaneos de baja resolución reducen la precisión entre 5 y 15 puntos porcentuales según la calidad.
¿Reconoce escritura a mano?
Poco. Tesseract está optimizado para texto impreso. El reconocimiento de manuscritos varía del 30% (cursiva) al 60% (mayúsculas de imprenta cuidadas). Para documentos con mucha letra manuscrita, esta no es la herramienta adecuada.
¿Qué pasa con las imágenes originales del PDF?
Siguen visibles. El OCR añade una capa de texto oculta debajo, por lo que el PDF se ve idéntico pero ahora es buscable. Puedes copiar texto, usar Ctrl+F para encontrar palabras y pasar el PDF con OCR por otras herramientas como PDF a Word.
¿Puedo hacer OCR solo a algunas páginas?
Sí. Usa el campo de rango de páginas para seleccionar páginas específicas (como '1-10' o '5, 8, 12'). Solo esas se procesan, ahorrando tiempo en documentos grandes donde la mayoría de páginas ya tienen texto.
¿El OCR funciona con documentos en varios idiomas?
Sí. Selecciona todos los idiomas presentes en el documento. Tesseract ejecuta el reconocimiento para cada uno. La precisión en páginas multilingües es menor que en páginas de un solo idioma, pero suele ser utilizable.
¿Se sube mi PDF a un servidor para el OCR?
No. Todo corre en tu navegador con Tesseract.js (WebAssembly). Incluso los modelos de idioma se descargan una vez y se almacenan localmente. Sin dependencia de la nube, sin subidas.