Facturas con distintos formatos
Extrae proveedores, conceptos e importes de diseños distintos. Conserva las relaciones entre encabezados, líneas y totales para validar la factura.
Casos de uso / Imagen y vídeo
Extracción visual de documentos
Convierte facturas, formularios y documentos escaneados en campos y tablas que tu sistema pueda utilizar. Los modelos multimodales interpretan el texto y su disposición para relacionar etiquetas, valores y registros.
Con QDivZero puedes ejecutar modelos de comprensión visual de documentos por API. Prepara las páginas, define la información que necesitas y conecta los resultados validados con tu proceso de gestión documental.
Más allá del OCR
Procesa documentos donde también importa la distribución visual. Convierte tablas, formularios y páginas escaneadas en información estructurada.
Extrae proveedores, conceptos e importes de diseños distintos. Conserva las relaciones entre encabezados, líneas y totales para validar la factura.
Relaciona etiquetas y valores en documentos que llegan como imagen. Señala campos vacíos o ilegibles en lugar de completar datos con suposiciones.
Convierte tablas de PDF en filas y columnas. Comprueba encabezados, celdas y continuidad entre páginas antes de almacenar los datos.
Recupera información de columnas, imágenes y diseños complejos. Conserva referencias a las páginas para revisar el origen de cada resultado.
Cómo construirlo con QDivZero
Procesa páginas con un modelo que interprete su estructura visual. Define campos y tablas de salida; tu aplicación valida los datos y conserva referencias al documento original.
Recibe el PDF, la imagen o el documento escaneado.
Convierte las páginas en entradas que admita el modelo.
El modelo relaciona texto, campos y estructura del documento.
Comprueba los datos extraídos y conserva sus referencias.
Envía los campos y tablas a tu sistema de destino.
Open-weight / Hugging Face
Compara modelos de visión con facturas, tablas y formularios de tu entorno. Valora cómo relacionan etiquetas y valores, la resolución de entrada y el formato de salida; conserva referencias a la página para revisar los datos extraídos. Compara modelos con documentos completos y campos conocidos. La capacidad de leer texto, relacionar columnas y conservar estructura debe evaluarse por separado, especialmente cuando una tabla continúa en otras páginas.
Texto y visión
Para combinar conversación, comprensión visual y trabajo con herramientas.
Ver modelo en Hugging FaceTexto y visión
Para conversación, código y tareas que combinan texto, imágenes y contexto propio.
Ver modelo en Hugging FaceRazonamiento multimodal
Para probar razonamiento y comprensión de texto e imágenes en tareas de varios pasos.
Ver modelo en Hugging FaceExtracción visual de documentos
La extracción visual de documentos utiliza modelos multimodales para identificar información en páginas, imágenes y archivos escaneados. Combina comprensión del texto y de la distribución de los elementos para obtener campos, tablas y relaciones que puedas utilizar en tus sistemas.
Prepara las páginas como imágenes o como entradas compatibles con el modelo. Indica los campos que necesitas, como proveedor, fecha e importe, y define la estructura de salida. Tu aplicación valida los datos extraídos y conserva la referencia a cada documento.
El OCR convierte una imagen de texto en caracteres. Un modelo multimodal puede utilizar también la estructura visual para interpretar campos y relacionar información. Puedes combinar OCR y comprensión visual según el documento, la calidad del escaneo y los datos que necesites extraer.
Sí. Describe las columnas, los tipos de datos y la estructura JSON esperada. Prepara las páginas para un modelo compatible y solicita la extracción. Comprueba las filas, los importes y la continuidad de las tablas cuando un documento tenga varias páginas.
Puedes utilizar un modelo multimodal para identificar los campos a partir de instrucciones, sin crear una plantilla fija para cada diseño. La precisión depende de los documentos y el modelo. Evalúa formatos reales y añade ejemplos cuando necesites orientar la extracción.
Conecta un modelo multimodal compatible desplegado en QDivZero con tu proceso documental. Tu aplicación prepara los archivos, solicita la extracción, valida los resultados y envía los datos al sistema de gestión. Organiza los lotes según el volumen y la capacidad que hayas desplegado.
Prepara las páginas según las entradas y los límites del modelo. Tu aplicación puede repartir el trabajo, conservar el número de página y reunir los campos extraídos en un único registro. Comprueba la coherencia entre páginas cuando una tabla, un concepto o un importe continúe en otra parte del documento.
Define los campos, los tipos y la estructura de cada fila. Comprueba totales, impuestos, fechas y referencias con reglas de validación de tu aplicación, y deriva los casos dudosos a revisión. Evalúa el modelo con los formatos y la calidad de escaneo que realmente recibe tu negocio.
Automatiza la extracción visual de facturas, formularios y documentos escaneados. Despliega un modelo compatible en QDivZero, define los campos y tablas que necesitas e integra los resultados validados con tu aplicación.