Skip to content
Roberto J. Oliveira

Roberto J. Oliveira

Mentoria, Dados , Automação e IA para todos

Primary Menu
  • Início
  • Produtos
    • Aceleradores n8n
    • Mentoria
    • Templates para projetos
  • Livros
    • Business intelligence: ferramentas e métodos FGV
    • Guia do Estudante de Data Science
    • Dashboards Incríveis
    • Conceitos Gerais de Business Intelligence
    • Fases do Projeto de BI
    • Data Discovery
    • Minimum Viable Data
  • Recomendo!
    • Mentoria_
    • Curso de Web Scraping
    • ABRACD CLUB
    • Curso de Pentaho (ETL)
  • Social
    • Youtube
    • Instagram
    • Linkedin
    • Fale Comigo
  • WhatsApp
  • Receba as novidades
Assine minha Newsletter
  • Home
  • 2026
  • agosto
  • 5
  • AnyDoc: a biblioteca Rust que converte qualquer documento em Markdown em menos de 5ms
  • Geral

AnyDoc: a biblioteca Rust que converte qualquer documento em Markdown em menos de 5ms

Cris 05/08/2026
artigo_1785963545786

O ecossistema de ferramentas para agentes de inteligência artificial acaba de ganhar uma peça que promete mudar a forma como pipelines de dados lidam com documentos corporativos. O AnyDoc, lançado pela equipe do Firecrawl como projeto open source, é uma biblioteca escrita em Rust capaz de converter Word, PowerPoint, Excel, PDF, EPUB, RTF, CSV e OpenDocument em Markdown estruturado em tempo médio de 4,4 milissegundos por arquivo. O número não é marketing: é o resultado de um benchmark público contra seis concorrentes estabelecidos, rodando em hardware real.

Para quem trabalha com construção de agentes, LLMOps ou pipelines de dados corporativos, a promessa é direta: uma entrada consistente, independentemente do formato que chega pelo outro lado. Isso resolve um dos problemas mais silenciosos e mais caros da operação com IA generativa — a fragmentação no pré-processamento de documentos.

O problema que o AnyDoc resolve

Qualquer time que já tentou alimentar um LLM com documentos reais de uma organização conhece o calvário. Um arquivo vem como DOCX, outro como PDF escaneado, um terceiro como apresentação PPTX com tabelas embutidas. Cada formato exige um parser diferente, e cada parser tem seu próprio conjunto de bugs, inconsistências de encoding e comportamentos inesperados com arquivos mais antigos, como os .doc e .xls do Office 2003.

A solução convencional costuma ser empilhar ferramentas: LibreOffice para conversão, Pandoc para estruturação, Unstructured para PDFs, markitdown para casos simples. O resultado é um zoo de dependências com latências que vão de 50ms a mais de um segundo por documento, e qualidade de saída que varia radicalmente entre formatos. Não é exagero dizer que o pré-processamento de documentos consome uma fração desproporcional do tempo de engenharia em projetos de IA corporativa.

O AnyDoc ataca esse problema pela raiz. Em vez de orquestrar ferramentas externas, ele implementa parsers nativos em Rust para cada formato, todos alimentando um modelo de documento unificado. Esse modelo intermediário é então serializado por um único renderizador de Markdown GitHub-Flavored (GFM). O efeito prático é que uma correção no tratamento de tabelas ou notas de rodapé beneficia automaticamente todos os formatos suportados, e não apenas aquele que motivou o fix.

O que o benchmark revela

Os números do benchmark oficial são o ponto mais revelador do projeto. A equipe do Firecrawl testou o AnyDoc contra LibreOffice, Unstructured, markitdown, Pandoc, Docling e Mammoth em 100 documentos reais cobrindo 14 formatos. O critério de qualidade foi avaliado por um juiz LLM (Claude Sonnet 5) comparando as saídas de cada ferramenta contra o ground truth visual dos documentos, em rodadas duplas com outputs embaralhados para eliminar viés de posição.

O AnyDoc foi o único a cobrir todos os 14 formatos avaliados. Sua mediana de conversão foi 4,4ms contra 52,5ms do Mammoth (segundo mais rápido), 102ms do Pandoc e 1.129ms do LibreOffice. Em qualidade agregada, atingiu score 81 contra 69 do Mammoth (que cobre apenas DOCX) e 64 do markitdown. Em formatos específicos como RTF, DOC legado e DOCM, a vantagem é ainda mais pronunciada, já que a maioria dos concorrentes simplesmente não suporta esses formatos.

Para operações em lote, o impacto é imediato: 500 arquivos DOCX convertidos em 1,7 segundo. Em pipelines de ingestão contínua de documentos corporativos, essa diferença de ordem de magnitude entre o AnyDoc e o LibreOffice (que precisaria de quase dez minutos para o mesmo volume) muda completamente a arquitetura viável da solução. A diferença entre processar em tempo real e processar em batch deixa de ser uma escolha de design e passa a ser uma consequência direta da ferramenta utilizada.

Arquitetura: por que Rust importa aqui

A escolha de Rust não é acidental e vai além da performance bruta. A linguagem garante segurança de memória sem garbage collector, o que é crítico quando se está parseando arquivos de origem desconhecida, possivelmente malformados ou deliberadamente adversariais. O AnyDoc implementa limites de segurança explícitos contra ataques de descompressão (zip bombs), profundidade de aninhamento e contagem de nós, com erros tipados via variantes de ConvertError.

A detecção de formato é feita por leitura de bytes, não por extensão de arquivo. O cabeçalho PDF, o grupo de abertura RTF, os nomes de streams OLE para formatos .doc/.xls legados, o mimetype do pacote ZIP para DOCX/PPTX/XLSX e os arquivos OpenDocument, tudo é lido diretamente do conteúdo. Isso significa que arquivos renomeados incorretamente ainda convertem de forma correta, o que é mais comum do que parece em ambientes corporativos reais.

O modelo de documento intermediário captura não apenas o texto, mas headings com âncoras, tabelas com células mescladas e linhas de cabeçalho, listas aninhadas com numeração original, notas de rodapé e notas de apresentação (speaker notes), código inline e blocos de código, links internos e cross-references, e assets embutidos como imagens com seus bytes originais e tipo de mídia. Para aplicações de RAG (Retrieval-Augmented Generation) que precisam preservar estrutura semântica, esse nível de fidelidade é significativo. A diferença entre um chunk de texto plano e um chunk que preserva a hierarquia de headings pode ser determinante na qualidade da recuperação.

Integração com agentes: o Agent Skill

Um dos diferenciais mais práticos do AnyDoc para quem trabalha com desenvolvimento assistido por IA e agentes autônomos é o suporte nativo ao modelo de Agent Skill. Com um único comando npx skills add firecrawl/anydoc, agentes compatíveis com Claude Code, Codex, Cursor e OpenCode adquirem a capacidade de ler qualquer documento de escritório que encontrarem durante a execução de tarefas.

Isso elimina um ponto de fricção recorrente em automações que envolvem documentação técnica, relatórios em PDF, planilhas de dados e apresentações corporativas. O agente deixa de precisar de instruções específicas sobre como lidar com cada formato e passa a tratar documentos como cidadãos de primeira classe no seu contexto de trabalho.

O projeto também expõe o endpoint /parse do Firecrawl como alternativa hospedada para quem não quer operar a biblioteca localmente. Nesse caso, a conversão local via AnyDoc é complementada por modelos de OCR para PDFs baseados em imagem, que a biblioteca por si só não cobre, por design: o foco é em documentos baseados em texto, sem dependência de ML ou serviços externos.

Bindings para Node.js, Python e WebAssembly

A biblioteca principal em Rust é acompanhada de bindings oficiais para três ambientes. No Node.js, a conversão roda no thread pool do libuv e nunca bloqueia o event loop, com tipos TypeScript incluídos. Em Python, o GIL é liberado durante a conversão para não penalizar threads concorrentes, com stubs de tipo para autocompletar. A versão WebAssembly permite converter documentos diretamente no navegador, sem upload para servidor, o que tem implicações óbvias para aplicações que lidam com dados sensíveis.

Para times que trabalham com estratégia de governança de dados e arquitetura de sistemas, a possibilidade de converter documentos localmente no cliente antes de enviar apenas o Markdown processado para um LLM representa uma redução significativa de superfície de exposição de dados. Em vez de enviar o arquivo original, o sistema envia apenas o conteúdo extraído, o que pode ser relevante para conformidade com a LGPD em cenários de processamento de contratos e documentos internos.

Impacto nos pipelines de IA corporativa

O AnyDoc chega num momento em que a eficiência operacional dos pipelines de IA saiu do papel e virou pressão de custo real. Organizações que operam com ingestão contínua de documentos, sejam bases de conhecimento, repositórios de contratos, acervos de políticas internas ou catálogos técnicos, enfrentam o dilema entre qualidade de parsing e custo computacional.

A combinação de latência abaixo de 5ms por documento, cobertura de 14 formatos e saída Markdown consistente posiciona o AnyDoc como componente de infraestrutura para pipelines de RAG, sistemas de busca semântica e agentes com acesso a bases documentais. Não substitui OCR para documentos escaneados, mas para o universo de arquivos de escritório digitalmente criados, cobre o caso de uso com uma eficiência que as alternativas atuais não atingem.

A Associação Brasileira de Ciência de Dados e IA tem monitorado de perto o surgimento de ferramentas de infraestrutura para LLMs que priorizam eficiência e privacidade. O AnyDoc representa exatamente o tipo de evolução que a comunidade de dados precisa: open source, auditável, sem dependência de serviços externos e com performance que permite uso em produção sem overhead proibitivo.

O repositório está disponível em github.com/firecrawl/anydoc sob licença MIT. Para quem trabalha com desenvolvimento moderno assistido por IA, vale explorar tanto a integração direta via Rust quanto os bindings para Node.js e Python, dependendo do stack existente. O benchmark completo, incluindo o harness de teste, está na pasta bench/ do repositório para quem quiser reproduzir ou adaptar para seus próprios cenários de uso.

Continue Reading

Previous: O Fim da Janela Gratuita: Como a Nova Cobrança do WhatsApp Business vai Impactar os Orçamentos Corporativos em Outubro

Related News

artigo_1785604304735
  • Geral

O Fim da Janela Gratuita: Como a Nova Cobrança do WhatsApp Business vai Impactar os Orçamentos Corporativos em Outubro

Cris 01/08/2026
artigo_1785603087236
  • Geral

Kimi K3 vs Claude Opus vs Claude Fable: qual modelo de IA vale mais por token em 2026?

Cris 01/08/2026
  • Geral

De Agulhas Negras ao Vibe Coding – Parte 2: IA, Estratégia e o Futuro do Trabalho Humano

Cris 01/08/2026
ABRACD SQUARE

Artigos

  • AnyDoc: a biblioteca Rust que converte qualquer documento em Markdown em menos de 5ms
  • O Fim da Janela Gratuita: Como a Nova Cobrança do WhatsApp Business vai Impactar os Orçamentos Corporativos em Outubro
  • Kimi K3 vs Claude Opus vs Claude Fable: qual modelo de IA vale mais por token em 2026?
  • De Agulhas Negras ao Vibe Coding – Parte 2: IA, Estratégia e o Futuro do Trabalho Humano
  • De Agulhas Negras ao Vibe Coding: uma conversa franca com Roberto J. Oliveira sobre IA, disciplina e o futuro do trabalho humano
  • Guerra de Modelos, Queda de Preços e o Fim do SaaS Tradicional: o que está acontecendo com a IA agora
  • Gemini Spark: o agente de IA pessoal do Google disponível 24 horas por dia, 7 dias por semana
  • Vender no Mercado Livre com inteligência de dados: Gustavo Pires, CEO da ML Analise, explica como transformar anúncios em resultados
  • Cantina Escolar sem Dinheiro Fisico: Gustavo Pires, CEO da Minepay, explica como a tecnologia esta transformando a gestao das escolas brasileiras
  • Suas conversas com o Claude e o ChatGPT podem estar no Google: o que aconteceu e o que isso revela sobre privacidade na era da IA
  • O Fim do Custo Marginal Zero: Como a IA Está Reescrevendo a Economia do Software
  • CTO as a Service e Inteligência Artificial: o Futuro da Tomada de Decisão Estratégica
  • Replit está ocupando o lugar que foi do Bubble: o fim silencioso da era no-code
  • Modelos da OpenAI saíram do controle durante testes de segurança e invadiram a Hugging Face
  • OpenAI Codex Micro: o teclado físico de US$ 230 que controla agentes de IA
  • Sua empresa não tem um problema de IA. Tem um problema de IA que ninguém está vendo.
  • Antes de construir com Claude Code Agents, entenda o que um subagente realmente é
  • Antes de construir com Claude Code Agents, entenda o que um subagente realmente é
  • Quanto custa um CTO no Brasil?
  • A Diplomacia da IA: Quando o Governo Controla o Lançamento dos Modelos

não perca

artigo_1785963545786
  • Geral

AnyDoc: a biblioteca Rust que converte qualquer documento em Markdown em menos de 5ms

Cris 05/08/2026
artigo_1785604304735
  • Geral

O Fim da Janela Gratuita: Como a Nova Cobrança do WhatsApp Business vai Impactar os Orçamentos Corporativos em Outubro

Cris 01/08/2026
artigo_1785603087236
  • Geral

Kimi K3 vs Claude Opus vs Claude Fable: qual modelo de IA vale mais por token em 2026?

Cris 01/08/2026
  • Geral

De Agulhas Negras ao Vibe Coding – Parte 2: IA, Estratégia e o Futuro do Trabalho Humano

Cris 01/08/2026
Copyright - CAPPEI TREINAMENTOS© All rights reserved. | MoreNews by AF themes.
Utilizamos cookies essenciais de acordo com a nossa Política de Privacidade.
Aceitar
Manage consent

Privacy Overview

This website uses cookies to improve your experience while you navigate through the website. Out of these, the cookies that are categorized as necessary are stored on your browser as they are essential for the working of basic functionalities of the website. We also use third-party cookies that help us analyze and understand how you use this website. These cookies will be stored in your browser only with your consent. You also have the option to opt-out of these cookies. But opting out of some of these cookies may affect your browsing experience.
Necessary
Sempre ativado
Necessary cookies are absolutely essential for the website to function properly. These cookies ensure basic functionalities and security features of the website, anonymously.
CookieDuraçãoDescrição
cookielawinfo-checkbox-analytics11 monthsThis cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Analytics".
cookielawinfo-checkbox-functional11 monthsThe cookie is set by GDPR cookie consent to record the user consent for the cookies in the category "Functional".
cookielawinfo-checkbox-necessary11 monthsThis cookie is set by GDPR Cookie Consent plugin. The cookies is used to store the user consent for the cookies in the category "Necessary".
cookielawinfo-checkbox-others11 monthsThis cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Other.
cookielawinfo-checkbox-performance11 monthsThis cookie is set by GDPR Cookie Consent plugin. The cookie is used to store the user consent for the cookies in the category "Performance".
viewed_cookie_policy11 monthsThe cookie is set by the GDPR Cookie Consent plugin and is used to store whether or not user has consented to the use of cookies. It does not store any personal data.
Functional
Functional cookies help to perform certain functionalities like sharing the content of the website on social media platforms, collect feedbacks, and other third-party features.
Performance
Performance cookies are used to understand and analyze the key performance indexes of the website which helps in delivering a better user experience for the visitors.
Analytics
Analytical cookies are used to understand how visitors interact with the website. These cookies help provide information on metrics the number of visitors, bounce rate, traffic source, etc.
Advertisement
Advertisement cookies are used to provide visitors with relevant ads and marketing campaigns. These cookies track visitors across websites and collect information to provide customized ads.
Others
Other uncategorized cookies are those that are being analyzed and have not been classified into a category as yet.
SALVAR E ACEITAR