Ir al contenido principal

Asistente PDF local

Un asistente que lee su documento sin que salga nunca de su dispositivo.

Sus archivos nunca salen de su dispositivo

Cómo consultar un PDF con el asistente, paso a paso

El asistente ejecuta un pequeño modelo de lenguaje directamente en la tarjeta gráfica de su dispositivo, para resumir, responder preguntas, extraer o traducir un pasaje de un PDF.

  1. Suba el PDF

    El texto de cada página se extrae en su navegador, igual que en la herramienta de extracción de texto. Si muy pocas páginas contienen texto, el documento se trata como un escaneo y el asistente permanece no disponible.

  2. Elija y descargue un modelo

    Si su navegador expone WebGPU, elija entre el modelo «Estándar» (≈ 850 MB) y «Más preciso» (≈ 2,2 GB, propuesto solo si la tarjeta gráfica dispone de memoria suficiente); la descarga muestra su progreso y luego permanece en la caché del navegador.

  3. Elija una función

    Se proponen cuatro pestañas: Resumir, Hacer una pregunta, Fechas e importes, Traducir.

  4. Inicie y lea la respuesta

    El texto de la respuesta se muestra a medida que se genera; un botón «Detener» interrumpe la generación en curso en cualquier momento.

  5. Elimine el modelo si es necesario

    «Eliminar el modelo de este dispositivo» retira el archivo descargado de la caché del navegador.

Un PDF protegido con contraseña se rechaza, como en cualquier otro lugar de Vellum. Para la extracción de fechas e importes, todo elemento propuesto por el modelo pero no encontrado palabra por palabra en el documento se descarta automáticamente antes de mostrarse.

Preguntas frecuentes

¿El contenido de mi PDF se envía a un servidor para que el asistente responda?

No. El modelo de lenguaje se ejecuta en su navegador, en la tarjeta gráfica de su dispositivo, una vez descargado. El testigo de red que aparece bajo cada respuesta lo demuestra: 0 bytes enviados mientras el asistente responde. Solo la descarga inicial del modelo, anunciada antes de su clic, proviene de otro sitio (huggingface.co).

¿Por qué hay que descargar algo antes de empezar?

El modelo de lenguaje en sí (unos 850 MB por defecto, o 2,2 GB para la opción «más preciso») no está incluido en Vellum: se descarga una vez, con su clic, y luego permanece en la caché de su navegador. Un botón «Eliminar el modelo de este dispositivo» lo borra cuando lo desee.

¿Qué ocurre si mi navegador no admite WebGPU?

El panel lo explica y no ofrece ningún botón de carga: no hay repliegue a un servidor. WebGPU está disponible en las versiones recientes de Chrome, Edge y Firefox, y en Safari a partir de la versión 26.

¿Son los resúmenes y las respuestas del asistente fiables al 100 %?

No, y la interfaz lo recuerda constantemente: es un modelo pequeño que se ejecuta en su dispositivo, capaz de un resumen fiel pero no de una opinión jurídica. Verifique siempre los elementos importantes en el propio documento, en particular los importes y las fechas extraídos.

¿Cómo trata el asistente un documento demasiado largo para una sola solicitud?

El texto se divide por páginas en fragmentos de unos 2400 tokens. Un resumen que abarque más de un fragmento se hace en dos pasadas — resumen de cada parte, luego resumen de esos resúmenes — y la interfaz lo indica en una frase. Para una pregunta, el modelo, en su dispositivo, solo lee los dos fragmentos más pertinentes.