Parágrafo de texto contínuo
- Entrada
- Foto de uma página com frases completas
- Saída esperada
- Modo parágrafo, PSM 6 (bloco uniforme)
A segmentação em bloco único é a mais rápida quando o texto já vem em linhas regulares, como um documento escaneado.
como funciona o OCR
OCR não "lê" uma imagem como uma pessoa: ele segmenta a página, testa hipóteses de caractere contra uma rede neural treinada por idioma e devolve um texto com um índice de confiança. Essa ferramenta roda o motor Tesseract inteiro dentro do navegador via WebAssembly, e o modo de conteúdo escolhido decide como a imagem é segmentada antes do reconhecimento.
A segmentação em bloco único é a mais rápida quando o texto já vem em linhas regulares, como um documento escaneado.
Forçar uma única linha evita que o motor tente quebrar o texto em parágrafos que não existem.
Sem dicionário o motor para de "corrigir" caracteres válidos para a palavra mais parecida do idioma, o que atrapalharia um código.
Não. O reconhecimento acontece no seu navegador via WebAssembly; a imagem nunca sai do seu dispositivo. Apenas os arquivos do motor de OCR e do idioma escolhido são baixados de um CDN na primeira vez, e depois ficam em cache.
Funciona nas duas, mas a precisão cai em foto de celular por causa de ângulo, sombra e foco. O pré-processamento (escala de cinza, esticamento de contraste no percentil 1-99, upscale) compensa parte disso, e o modo auto retenta com outra segmentação quando a confiança fica abaixo de 55.
Porque no modo esparso o dicionário fica desligado de propósito (para não "corrigir" um código para a palavra mais parecida), e sem dicionário o motor decide caractere a caractere só pela forma do glifo, onde 0/O e 1/l/I são visualmente quase idênticos.
Tecnicamente quantos quiser, mas mais de 2 idiomas ao mesmo tempo deixa cada passada de reconhecimento visivelmente mais lenta, porque o motor testa o texto contra o dicionário de cada idioma marcado, além de baixar de 11 a 13 MB por pacote na primeira vez.
Sim: o núcleo WebAssembly do Tesseract e o pacote do idioma são baixados uma vez e ficam em cache no navegador, então passadas seguintes rodam localmente sem precisar buscar nada de novo na rede.
Na primeira execução, o navegador baixa os dados do idioma (~11 MB no total) de um CDN. Depois disso, ficam em cache.
Use “Disperso/Código” para placas, números de série, códigos ou textos curtos sem frases (como código Morse). No modo Automático, a ferramenta já tenta esse modo sozinha quando o resultado inicial tem confiança baixa.
O reconhecimento roda inteiramente no seu navegador (WebAssembly). A imagem nunca é enviada a servidores; apenas os arquivos do motor de OCR e dos idiomas são baixados de um CDN na primeira vez.