PDF para texto

Extraia as palavras de um PDF como algo que você pode copiar, citar e editar. Páginas que já contêm texto são lidas instantaneamente, e páginas digitalizadas são reconhecidas com OCR, tudo dentro do seu navegador.

Adicione seu PDF

Somente PDF

Solte um PDF aqui ou clique para selecionar

Funciona em PDFs digitais e em digitalizações de páginas de papel

PDF

Texto extraído

Adicione um PDF para começar

O texto do seu documento aparecerá aqui

Páginas digitalizadas passam pelo reconhecimento, então espere alguns segundos por página e confira o resultado em busca de palavras lidas errado. Texto digital é copiado literalmente.

Como extrair texto de um PDF

Adicione seu PDF

Solte o documento. Ele é aberto e renderizado localmente, nada é enviado.

Inicie a extração

Páginas com camada de texto retornam instantaneamente. Páginas digitalizadas são reconhecidas uma por uma.

Copie ou baixe o texto

Corrija o que foi lido errado, depois copie o texto ou salve-o como um arquivo .txt.

Por que usar o PDF para texto da Aihangsoft

Instantâneo em PDFs digitais

Se o documento já contém texto real, ele é extraído diretamente sem reconhecimento e sem suposições.

Digitalizações nunca saem da sua máquina

Contratos, faturas e documentos de identidade digitalizados são renderizados e lidos localmente, então nada sensível é enviado a lugar nenhum.

Grátis, sem limite de páginas

Sem cadastro e sem limite de número de páginas, seja uma fatura de uma página ou um relatório inteiro.

Dois mecanismos atrás de um botão

Extração de camada de texto

A maioria dos PDFs exportados de um processador de texto, um navegador ou uma ferramenta de design carrega uma camada de texto real. Esse texto é copiado exatamente como foi escrito, incluindo pontuação e acentos.

Caso de uso: relatórios, contratos, faturas exportadas

Recurso de OCR para digitalizações

Uma página que na verdade é só uma fotografia é renderizada em resolução dupla e passa pelo reconhecimento, então um documento de papel digitalizado se torna texto pesquisável.

Caso de uso: documentos digitalizados, arquivos antigos, páginas fotografadas

Relatório por página

O resumo informa quantas páginas vieram de uma camada de texto e quantas precisaram de reconhecimento, então você sabe quais páginas merecem uma segunda olhada.

Caso de uso: documentos mistos, metade digitais e metade digitalizados

Marcadores de página na saída

Cada página é prefixada com um marcador para você rastrear uma citação de volta à sua página, o que importa quando a fonte é um relatório longo.

Caso de uso: pesquisa, citações, revisão jurídica

Como funciona e para onde vai seu arquivo

Mecanismo
PDF.js 4.10.38 lê a camada de texto já presente no arquivo. Páginas sem uma são passadas para Tesseract.js 7.0.0 para OCR.
Local dos dados
Tudo roda nesta aba do navegador. O arquivo nunca é enviado para um servidor.
Verifique você mesmo
Inicie uma tarefa aqui e observe o painel de rede do navegador: nenhuma requisição carrega seu arquivo. Como verificar qualquer ferramenta online.

Perguntas frequentes sobre PDF para texto

Sim, essa é a principal razão pela qual a ferramenta existe. Se uma página é apenas uma imagem de uma página, ela é renderizada e lida com OCR. Se o PDF já contém texto real, esse texto é extraído diretamente, o que é ao mesmo tempo mais rápido e perfeitamente preciso.
O resumo ao lado do resultado mostra quantas páginas foram lidas de uma camada de texto existente e quantas precisaram de OCR, então você sabe qual parte da saída merece uma revisão mais atenta.
Não. O arquivo é aberto e renderizado dentro do seu navegador. Nem o documento nem o texto extraído são enviados a um servidor.
Cada página digitalizada precisa ser renderizada em imagem e depois reconhecida, o que leva alguns segundos por página em um notebook normal. Um PDF com camada de texto real retorna quase instantaneamente porque nenhum reconhecimento é necessário.
Ele não consegue abrir um documento que pede senha. Use a ferramenta Desbloquear PDF primeiro com a senha que você conhece, baixe a cópia desbloqueada e depois leia o texto desse arquivo.
O inglês é incorporado, e mais onze idiomas, incluindo chinês, japonês, coreano, alemão, francês e espanhol, podem ser selecionados. Os dados de idioma são baixados uma vez no primeiro uso e depois armazenados em cache.

Extraia o texto do seu PDF

Grátis, privado e ilimitado. Não precisa de conta.

Enviar um PDF