Ir al contenido
Ivan Pupkin
Variety logo

Digitalización del archivo impreso de Variety

Un pipeline de IA automatizado para Variety (Penske Media), como consultor en Mission Cloud (2025): OCR y comprensión de documentos sobre un siglo de ediciones impresas, extracción de entidades y almacenamiento en formato estructurado, para posterior uso como archivo consultable.

SoftwaresoftwareIA generativaaws

Variety cubre la industria del entretenimiento desde 1905 y forma parte de Penske Media desde 2012. Su tirada impresa abarca décadas de ediciones que existen como fotos de cada página. Eso implica que sean legibles por una persona con acceso a cada captura, pero invisibles en la práctica para cualquiera que quiera buscar contenido específico. Como consultor a través de Mission Cloud, diseñé e implementé el primer pipeline que convierte esas páginas en un archivo que realmente se puede consultar.

El OCR es la mitad fácil de describir pero difícil de hacer bien. Las páginas de prensa especializada antigua son formatos densos, con varias columnas, tamaños de tipografía mezclados, avisos envueltos alrededor del contenido editorial y una calidad de impresión y escaneo que varía número a número. Correr OCR crudo sobre una página así devuelve una sopa de columnas entremezcladas. Por eso el pipeline primero hace comprensión del documento —segmentando cada página en artículos, avisos y listados— y recién después lee cada región en su propio orden de lectura, que es lo que hace que la salida sea un conjunto de artículos y no un muro de texto. Sobre eso se apoya la extracción de entidades: las personas, títulos, empresas y fechas de las que trata una nota, para que un artículo pase a ser un conjunto de cosas y no solo una cadena de texto.