← voltar pro feed UP23LABS · ARTIGO
§

LlamaIndex reescreve LiteParse em Rust e ganha 100x em PDF

/
Imagem destacada: LlamaIndex reescreve LiteParse em Rust e ganha 100x em PDF

A LlamaIndex publicou em 27 de maio a versao 2.0 do LiteParse, seu extrator de PDF agora reescrito em Rust com ganho de ate 100x em velocidade comparado a versao anterior. A nova versao vem como pacote nativo em Rust, Node.js, Python e WebAssembly — a aposta declarada e ser o extrator de PDF que roda em qualquer lugar, do servidor ao navegador.

O que mudou no LiteParse

A versao 1 do LiteParse era um extrator escrito em Python, parte da stack da LlamaIndex que alimenta pipelines de RAG (retrieval-augmented generation). Funcionava bem para o uso interno da framework, mas tinha o teto de performance esperado de Python puro em workload CPU-bound.

A versao 2 reescreve o nucleo em Rust. Segundo a LlamaIndex, o resultado e ate 100x mais rapido em parsing de PDF — a empresa nao detalhou o benchmark ou os tipos de documento testados, entao o numero vale como teto de marketing, nao como garantia para qualquer PDF.

Onde isso ajuda devs de RAG

Em pipeline de RAG, a etapa de extracao de PDF costuma ser o gargalo. Modelos de embedding e bancos vetoriais escalam bem; parsing de PDF, nao. PDFs heterogeneos — relatorio scanneado, formulario, contrato com tabela, slide — exigem combinacoes de OCR e estrutura de layout que custam segundos por pagina.

Cortar esse custo em uma ordem de grandeza muda a economia do pipeline. Tarefas que antes precisavam rodar em batch overnight passam a caber em request sincrono. Tarefas que rodavam em fila distribuida passam a caber em um worker so.

Quatro pacotes pra quatro ambientes

A LlamaIndex liberou o LiteParse v2.0 em quatro alvos:

  • Rust nativo, para quem ja constroi tooling em Rust e quer integrar direto.
  • Node.js, para times que rodam o backend em TypeScript e nao querem inter-processo com Python.
  • Python, mantendo compatibilidade com a base atual de usuarios da framework.
  • WebAssembly (WASM), para rodar o parsing no navegador do usuario ou em edge functions sem servidor dedicado.

O caso WASM e o mais novo. Permite que aplicacoes web facam upload de PDF e processem o documento client-side, sem mandar o arquivo para um servidor. Para casos onde o documento e sensivel — contrato, prontuario, ficha financeira — isso reduz superficie de exposicao.

ParseBench acompanha o lancamento

Junto com o release, a LlamaIndex anunciou um webinar sobre o ParseBench, ferramenta de avaliacao de OCR de documentos especificamente para agentes de IA. A ideia e medir qualidade de extracao em cenarios onde um agente vai ler o documento e tomar decisao — diferente de avaliar OCR puro pelo numero de caracteres acertados.

ParseBench olha para coisas como: o agente conseguiu localizar o valor correto em uma tabela? Conseguiu separar header e body? Conseguiu identificar campos de formulario versus texto livre? Essas metricas tendem a divergir bastante das tradicionais de OCR.

O que vale testar primeiro

Quem ja usa LiteParse no pipeline de RAG tem o caminho mais natural: rodar a v2 em paralelo com a v1 em um conjunto representativo de documentos, medir qualidade de extracao (nao so velocidade) e comparar. O ganho de performance e claro; o que precisa ser verificado e se a reescrita em Rust mantem ou melhora a qualidade de saida.

Quem usa outro extrator de PDF — pdfplumber, unstructured, Tika — tem motivo para considerar a troca, mas a substituicao envolve revisao do pipeline downstream. Bibliotecas diferentes representam estrutura de documento de forma diferente, e quem consome o output costuma ter regra colada nesse formato.

O ponto que ainda precisa ser provado

A LlamaIndex nao publicou benchmark detalhado nem o conjunto de PDFs usado para medir os 100x. Numero solto pega bem em headline, mas time pragmatico precisa ver o teste replicavel antes de confiar em melhoria de ordem de grandeza. Caso a LlamaIndex publique os detalhes nas proximas semanas, o material vai indicar se o ganho de performance se aplica a tipos de PDF reais.


Reportado originalmente por LlamaIndex Blog em 2026-05-27.

§ FONTE / SOURCE /

Fonte no corpo do artigo

Esse post foi reescrito a partir da fonte original. Leia o artigo completo no link acima.

Descubra mais sobre up23labs

Assine agora mesmo para continuar lendo e ter acesso ao arquivo completo.

Continuar lendo