Ir para o conteúdo principal

Assistente de PDF local

Um assistente que lê o seu documento sem que ele nunca saia do seu dispositivo.

Seus arquivos nunca saem do seu dispositivo

Como consultar um PDF com o assistente, passo a passo

O assistente executa um pequeno modelo de linguagem diretamente na placa de vídeo do seu dispositivo, para resumir, responder a perguntas, extrair ou traduzir um trecho de um PDF.

  1. Envie o PDF

    O texto de cada página é extraído no seu navegador, como na ferramenta de extração de texto. Se pouquíssimas páginas tiverem texto, o documento é tratado como uma digitalização e o assistente fica indisponível.

  2. Escolha e baixe um modelo

    Se o seu navegador oferecer WebGPU, escolha entre o modelo «Padrão» (≈ 850 MB) e «Mais preciso» (≈ 2,2 GB, oferecido só se a placa de vídeo tiver memória suficiente); o download mostra o progresso e depois fica no cache do navegador.

  3. Escolha uma função

    São oferecidas quatro abas: Resumir, Fazer uma pergunta, Datas e valores, Traduzir.

  4. Inicie e leia a resposta

    O texto da resposta é exibido à medida que é gerado; um botão «Parar» interrompe a geração em curso a qualquer momento.

  5. Exclua o modelo, se necessário

    «Excluir o modelo deste dispositivo» retira o arquivo baixado do cache do navegador.

Um PDF protegido por senha é recusado, como em qualquer outro lugar do Vellum. Na extração de datas e valores, todo elemento proposto pelo modelo, mas não encontrado palavra por palavra no documento, é descartado automaticamente antes de ser exibido.

Perguntas frequentes

O conteúdo do meu PDF é enviado a um servidor para que o assistente responda?

Não. O modelo de linguagem é executado no seu navegador, na placa de vídeo do seu dispositivo, depois de baixado. O indicador de rede exibido sob cada resposta comprova isso: 0 byte enviado enquanto o assistente responde. Só o download inicial do modelo, anunciado antes do seu clique, vem de outro lugar (huggingface.co).

Por que é preciso baixar algo antes de começar?

O modelo de linguagem em si (cerca de 850 MB por padrão, ou 2,2 GB para a opção «Mais preciso») não está incluído no Vellum: ele é baixado uma vez, com o seu clique, e depois fica no cache do seu navegador. Um botão «Excluir o modelo deste dispositivo» o apaga quando você quiser.

O que acontece se o meu navegador não for compatível com WebGPU?

O painel explica isso e não oferece nenhum botão de carregamento: não há recurso a um servidor. O WebGPU está disponível nas versões recentes do Chrome, do Edge e do Firefox, e no Safari a partir da versão 26.

Os resumos e as respostas do assistente são 100 % confiáveis?

Não, e a interface lembra isso o tempo todo: é um modelo pequeno executado no seu dispositivo, capaz de um resumo fiel, mas não de um parecer jurídico. Confira sempre os elementos importantes no próprio documento, em especial os valores e as datas extraídos.

Como o assistente trata um documento longo demais para uma única solicitação?

O texto é dividido por páginas em trechos de cerca de 2400 tokens. Um resumo que abranja mais de um trecho é feito em duas passagens — resumo de cada parte, depois resumo desses resumos — e a interface indica isso em uma frase. Para uma pergunta, o modelo, no seu dispositivo, só lê os dois trechos mais pertinentes.