Convierte PDF a Markdown localmente: extrae la capa de texto o usa OCR en páginas seleccionadas sin texto. Revisa y edita antes de copiar o descargar.
¿Qué es PDF to Markdown?
PDF to Markdown es una herramienta en línea gratuita que extrae el texto de un PDF a Markdown editable en tu navegador. Lee la capa de texto del archivo página por página, muestra el resultado para que lo corrijas y te dice qué páginas no tienen texto.
Qué admite
- Extracción de la capa de texto de PDF y OCR local opcional en páginas seleccionadas sin capa de texto, en inglés, portugués o español.
- Texto extraído página por página, como Markdown editable, en orden de lectura aproximado.
- Copia el resultado o descárgalo como archivo MD.
Conviene saber
- El orden de lectura es aproximado, y los títulos, las columnas y las tablas no se reconstruyen de forma fiable, así que espera editar el resultado.
- Sin capa de texto puede significar un escaneo o una página en blanco; no demuestra que esté escaneada. El OCR es opcional y aproximado. Sustituye el Markdown generado, incluidas las ediciones manuales, así que ejecútalo antes de corregir el resultado.
- Los scripts y las acciones del PDF no se ejecutan.
¿Cómo se usa PDF to Markdown?
- Usa Abrir archivo o suelta un PDF en Archivo PDF. La extracción de texto empieza automáticamente.
- En las páginas marcadas Sin capa de texto, selecciona hasta 10, elige Idioma del reconocimiento y pulsa Ejecutar OCR en estas páginas. Revisa el progreso o usa Cancelar.
- Edita el Markdown y luego copia o descarga.
Ejemplo
Una página de PDF con texto seleccionable.
[PDF page with a text layer]
Quarterly report
Revenue grew 8% in March.El texto de la página sale como Markdown para editar. Los títulos y el diseño no se reconstruyen, y una página sin texto se señalaría.
Límites y privacidad
Límites
- Archivo: hasta 20.000.000 bytes (unos 20 MB). Los archivos mayores o ilegibles se rechazan, y el texto extraído de un archivo también está limitado a 2.000.000 bytes.
- PDF: hasta 100 páginas. Un PDF más largo se rechaza.
- OCR: selecciona de 1 a 10 páginas sin capa de texto por ejecución. Cada página renderizada está limitada a 16.000.000 píxeles y 16.384 píxeles por lado. El reconocimiento se detiene tras 120 segundos.
¿Se envía mi contenido a un servidor?
No. Tu contenido y tus archivos se procesan en el navegador y nunca se suben. El OCR y la lectura de PDF descargan archivos de procesamiento, incluidos datos de idioma del OCR y el worker de PDF, de este mismo sitio solo cuando se ejecutan esas herramientas; ningún contenido va a terceros. Las vistas previas Markdown muestran imágenes externas como texto alternativo, sin cargarlas.
Copiar pone un resultado en el portapapeles y descargar lo guarda como archivo, pero solo cuando pulsas el botón. El archivo se crea en tu navegador, así que no se sube nada.
Para conocer todos los detalles, consulta la Política de privacidad
Herramientas y páginas relacionadas
Convierte desde o hacia otros formatos, o trabaja con el mismo contenido en estas herramientas.