Converta PDF em Markdown localmente: extraia a camada de texto ou faça OCR em páginas selecionadas sem texto. Revise e edite antes de copiar ou baixar.
O que é PDF to Markdown?
O PDF to Markdown é uma ferramenta online gratuita que extrai o texto de um PDF para Markdown editável no seu navegador. Ele lê a camada de texto do arquivo página por página, mostra o resultado para você corrigir e avisa quais páginas não têm texto.
O que ela aceita
- Extração da camada de texto de PDF e OCR local opcional em páginas selecionadas sem camada de texto, em inglês, português ou espanhol.
- Texto extraído página por página, como Markdown editável, em ordem de leitura aproximada.
- Copie o resultado ou baixe como arquivo MD.
Bom saber
- A ordem de leitura é aproximada, e títulos, colunas e tabelas não são reconstruídos de forma confiável, então espere editar o resultado.
- Sem camada de texto pode significar uma digitalização ou uma página em branco; não comprova que seja digitalizada. O OCR é opcional e aproximado. Substitui o Markdown gerado, incluindo edições manuais, então execute-o antes de corrigir o resultado.
- Scripts e ações do PDF não são executados.
Como usar PDF to Markdown?
- Use Abrir arquivo ou solte um PDF em Arquivo PDF. A extração de texto começa automaticamente.
- Nas páginas marcadas Sem camada de texto, selecione até 10, escolha Idioma do reconhecimento e pressione Executar OCR nestas páginas. Confira o progresso ou use Cancelar.
- Edite o Markdown e depois copie ou baixe.
Exemplo
Uma página de PDF com texto selecionável.
[PDF page with a text layer]
Quarterly report
Revenue grew 8% in March.O texto da página sai como Markdown para editar. Títulos e layout não são reconstruídos, e uma página sem texto seria sinalizada.
Limites e privacidade
Limites
- Arquivo: até 20.000.000 bytes (cerca de 20 MB). Arquivos maiores ou ilegíveis são recusados, e o texto extraído de um arquivo também é limitado a 2.000.000 bytes.
- PDF: até 100 páginas. Um PDF mais longo é recusado.
- OCR: selecione de 1 a 10 páginas sem camada de texto por execução. Cada página renderizada é limitada a 16.000.000 pixels e 16.384 pixels por lado. O reconhecimento para após 120 segundos.
Meu conteúdo é enviado para um servidor?
Não. Seu conteúdo e seus arquivos são processados no navegador e nunca enviados. O OCR e a leitura de PDF baixam arquivos de processamento, incluindo dados de idioma do OCR e o worker de PDF, deste mesmo site apenas quando essas ferramentas rodam; nenhum conteúdo vai para terceiros. Prévias Markdown mostram imagens externas como texto alternativo, sem carregá-las.
Copiar coloca um resultado na área de transferência e baixar o salva como arquivo, mas só quando você aperta o botão. O arquivo é criado no seu navegador, então nada é enviado.
Para ver os detalhes completos, consulte a Política de Privacidade
Ferramentas e páginas relacionadas
Converta de ou para outros formatos, ou trabalhe com o mesmo conteúdo nestas ferramentas.