Cómo extraer texto de un PDF (digital y escaneado)
Dos enfoques para dos tipos de PDFs: extracción directa de texto para PDFs digitales y OCR para documentos escaneados. Incluye herramientas en el navegador y problemas comunes.
Dos tipos de PDF
Antes de intentar extraer texto, debes entender qué tipo de PDF tienes. Esto determina qué método funciona — y cuál no.
- PDF basados en texto. Creados por Word, Google Docs, LaTeX, InDesign o cualquier aplicación que «imprima» texto digital en PDF. El texto se almacena como datos de caracteres dentro del archivo. Puedes seleccionarlo, copiarlo y buscarlo. La extracción es rápida y precisa.
- PDF escaneados / basados en imagen. Creados al escanear documentos en papel. Cada página es una fotografía — el PDF contiene imágenes de píxeles, no datos de caracteres. No puedes seleccionar ni buscar el texto. Extraerlo requiere OCR (Reconocimiento Óptico de Caracteres).
Prueba rápida: abre el PDF e intenta seleccionar una palabra con el cursor. Si puedes resaltar palabras individuales, es un PDF de texto. Si toda la página se resalta como un bloque (o nada se resalta), es una imagen escaneada.
Extracción de texto de PDF basados en texto
1. Copiar y pegar
El método más simple. Abre el PDF en cualquier visor, selecciona el texto, copia y pega en tu aplicación de destino. Funciona para pasajes cortos pero es tedioso para documentos largos, y suele perder el formato — las columnas se mezclan, los encabezados se fusionan con el cuerpo del texto y las tablas se convierten en una mezcla confusa.
2. Extracción en el navegador
FileKit Extractor de Texto PDF lee la capa de texto interna del PDF y produce texto plano limpio. Procesa el documento completo de una vez, maneja archivos de varias páginas y preserva los saltos de línea básicos. Todo se ejecuta en tu navegador — el archivo permanece en tu dispositivo.
Ideal para: extraer el texto completo del documento para edición, análisis o migración a otro formato.
3. Línea de comandos (pdftotext)
# pdftotext de Poppler
pdftotext entrada.pdf salida.txt
# Con preservación de diseño
pdftotext -layout entrada.pdf salida.txtIdeal para: procesamiento en lote, scripting, preservación del diseño espacial.
Extracción de texto de PDF escaneados (OCR)
Si el PDF es una imagen escaneada, necesitas OCR para reconocer el texto en las fotografías.
1. OCR en el navegador
FileKit OCR usa Tesseract.js para reconocer texto en documentos escaneados e imágenes. Admite inglés, chino, japonés y español. Como todas las herramientas de FileKit, el procesamiento ocurre en tu navegador.
2. Adobe Acrobat
Acrobat Pro puede «Reconocer texto» (herramienta Escanear y OCR) y añadir una capa de texto buscable encima de las imágenes escaneadas. El resultado es un PDF híbrido que tiene el mismo aspecto pero ahora es buscable y seleccionable.
3. Tesseract (línea de comandos)
# OCR básico en español
tesseract entrada.png salida -l spa
# OCR de un PDF (con pdf2image primero)
pdftoppm entrada.pdf pagina -png
tesseract pagina-1.png salida -l spaProblemas comunes de extracción
| Problema | Causa | Solución |
|---|---|---|
| Caracteres garbled (p. ej. «fi» → símbolo extraño) | Codificación de fuente personalizada sin mapa ToUnicode | Usa OCR en lugar de extracción de texto |
| Espacios faltantes entre palabras | El PDF posiciona cada glifo individualmente | Usa una herramienta que infiera los límites de palabras (FileKit lo hace) |
| Columnas mezcladas en un solo flujo | La extracción de texto lee de izquierda a derecha en toda la página | Usa pdftotext -layout o extrae columna por columna |
| Las tablas se convierten en texto desorganizado | Las tablas en PDF no están marcadas semánticamente | Usa Tabula o Camelot para extracción de tablas estructuradas |
Consejos para mejores resultados
- Para documentos escaneados, una resolución de escaneo más alta (300 DPI o más) mejora drásticamente la precisión del OCR. 150 DPI es el mínimo para texto en inglés o español; 300 DPI es recomendable para caracteres CJK.
- Si los resultados del OCR son deficientes, intenta preprocesar la imagen: convierte a escala de grises, aumenta el contraste y corrige las páginas rotadas.
- Para datos estructurados (tablas, formularios), considera herramientas de extracción de tablas específicas en lugar de extracción de texto general.
- Siempre revisa la salida del OCR. Incluso los mejores motores cometen errores con fuentes inusuales, escritura a mano o escaneos de baja calidad.