Volver al Diario Tecnológico (Radar 21)
DESARROLLO DE SOFTWARE & IA11 de octubre de 2026

DeepSeek publica el framework Janus-Pro para razonamiento multimodal unificado sin pérdida de resolución

DeepSeek publica el framework Janus-Pro para razonamiento multimodal unificado sin pérdida de resolución
Revolución en Inteligencia Artificial Abierta: DeepSeek Rompe el Paradigma Multimodal con el Lanzamiento de Janus-Pro

En un avance científico que redefine el estado del arte en modelos de visión y lenguaje, el laboratorio de código abierto DeepSeek AI Research ha presentado formalmente su arquitectura Janus-Pro, documentada extensamente en las publicaciones de Hugging Face Daily Papers. Janus-Pro es un framework fundacional multimodal unificado que resuelve uno de los dilemas históricos del deep learning: desacoplar las vías de codificación visual para permitir, en una única red autorregresiva, tanto la comprensión y análisis de imágenes de ultra alta resolución como la generación visual sintética de alta fidelidad, todo ello con pesos abiertos y costos de inferencia significativamente inferiores a las soluciones comerciales propietarias. El equipo de Siglo 21 Soluciones analiza esta innovación disruptiva.

1. Anatomía y Contexto de la Noticia: La Superación del Conflicto de Representación Multimodal

Hasta la fecha, los modelos de lenguaje visual (VLM) se encontraban fragmentados en dos escuelas incompatibles: modelos diseñados exclusivamente para la comprensión y respuesta a preguntas visuales (como CLIP, LLaVA o GPT-4V), y modelos generativos optimizados para síntesis de imágenes a partir de texto (como Stable Diffusion, Midjourney o DALL-E). Cuando los investigadores intentaban unificar ambas tareas en un solo modelo autorregresiva, surgía el denominado "conflicto de gradiente de representación visual": los tokens necesarios para discernir detalles finos en diagramas complejos degradaban la capacidad del modelo para generar texturas artísticas fluidas, y viceversa.

Janus-Pro supera este obstáculo mediante un diseño arquitectónico sumamente elegante que desacopla la codificación visual en dos vías independientes dentro del transformador, al tiempo que mantiene un modelo de lenguaje unificado como planificador y procesador central. Este esquema permite que un modelo de apenas 1B o 7B parámetros alcance rendimientos comparables e incluso superiores en benchmarks estándar de visión (como MMMU, MathVista y POPE) frente a gigantes comerciales cerrados que multiplican por diez su tamaño en memoria.

La publicación de los pesos bajo licencias permisivas para investigación y uso comercial sacude el mercado global de IA generativa, permitiendo que organizaciones de cualquier tamaño implementen agentes multimodales capaces de inspeccionar planos técnicos, leer capturas de pantallas de sistemas legados y generar interfaces visuales sin depender de costosas llamadas de API externas.

"Al disociar la codificación de comprensión de la codificación de generación, Janus-Pro demuestra que no necesitamos modelos monstruosos para lograr una inteligencia multimodal armónica. La arquitectura adecuada supera a la fuerza bruta computacional."
— Liang Wenfeng, Investigador Principal en DeepSeek AI

2. Arquitectura Técnica Profunda y Estándares de Rendimiento

El núcleo de Janus-Pro se articula sobre tres innovaciones estructurales fundamentales en el diseño de redes neuronales:

  • Vía Dual de Codificación Visual Desacoplada: Para la comprensión de imágenes, Janus-Pro emplea un codificador tipo SigLIP optimizado para extraer semántica densa a escala de parches (patches); para la generación visual, utiliza un tokenizador vectorial cuantizado (VQ-Tokenizer) que mapea el espacio de píxeles en tokens discretos continuos sin compresión con pérdida.
  • Procesamiento Autorregresivo Unificado: Tanto el texto como los tokens visuales se procesan en la misma secuencia autorregresiva estándar. El modelo predice tokens de texto para responder consultas y tokens visuales continuos cuando se le solicita generar o editar una imagen, eliminando la necesidad de incorporar complejos módulos de difusión externa.
  • Estrategia de Entrenamiento en Tres Fases: Pre-entrenamiento en alineación de modalidades con miles de millones de pares imagen-texto, ajuste fino en razonamiento lógico con cadenas de pensamiento (CoT) visual y optimización por refuerzo directo (Direct Preference Optimization - DPO) para estética y seguridad.
  • Manejo Dinámico de Resoluciones Nativas: El modelo procesa imágenes de proporciones arbitrarias dividiéndolas en cuadrículas adaptativas, lo que previene la deformación de texto y símbolos en documentos escaneados o esquemas de ingeniería.

Benchmarks Comparativos de Precisión e Inferencia

En las evaluaciones estandarizadas, Janus-Pro-7B exhibe resultados sobresalientes:

  • Benchmark MMMU (Razonamiento Multidisciplinar Universitario): Supera al 82% de los modelos abiertos contemporáneos, empatando con GPT-4o-mini en tareas de comprensión de tablas y diagramas científicos.
  • Benchmark GenEval (Fidelidad en Alineación de Prompts de Generación): Logra una puntuación superior a Stable Diffusion XL en seguimiento de instrucciones espaciales complejas.
  • Eficiencia de memoria: Permite inferencia completa en cuantización FP8 o INT4 dentro de una única tarjeta gráfica de consumo de 16 GB de VRAM (como una NVIDIA RTX 4080 o RTX 3090).

3. Análisis Financiero y FinOps Cuantitativo: Democratización del Costo de Inferencia

La adopción de modelos multimodales abiertos de alta eficiencia transforma la ecuación financiera corporativa:

  • Comparativa CapEx de infraestructura vs. OpEx de API: Procesar 1.000.000 de consultas multimodales mensuales en APIs comerciales propietarias representa un gasto recurrente de USD 12.000 a USD 25.000 mensuales. Un clúster local con GPUs dedicadas se amortiza en menos de 6 meses, reduciendo el costo marginal por consulta en más del 85%.
  • Optimización FinOps en la Nube: Gracias a su huella de memoria contenida, Janus-Pro puede ejecutarse en instancias spot de bajo costo a menos de USD 0,40 por hora, maximizando el rendimiento por dólar.
  • Eliminación de tarifas por transferencia de salida (Egress Fees): Procesar video y material gráfico dentro de la red corporativa elimina costos masivos por tráfico hacia nubes públicas.

4. Implicancias y Oportunidades para Empresas y PyMEs en Argentina y América Latina

Para sectores productivos de Argentina y América Latina, Janus-Pro abre oportunidades prácticas inmediatas:

  • Digitalización documental en salud y finanzas: Bancos y centros médicos que procesan formularios escaneados, contratos y recetas pueden extraer información localmente sin infringir regulaciones de confidencialidad de datos.
  • Aplicaciones Agtech y monitoreo satelital: El sector agropecuario puede desplegar el modelo en computadoras de borde instaladas en maquinaria agrícola para detectar malezas o anomalías en cultivos sin requerir conexión a Internet.
  • Soberanía tecnológica para el sector público: Organismos estatales pueden automatizar trámites ciudadanos basados en imágenes asegurando la custodia interna de la información sensible.

5. Hoja de Ruta Técnica: Checklist de Implementación en 4 Pasos

Para implementar Janus-Pro en entornos de producción, se sugiere el siguiente esquema técnico:

  1. Preparación del entorno con librerías optimizadas: Configurar un entorno con PyTorch 2.4+, FlashAttention-2 y frameworks de inferencia acelerada como vLLM o TensorRT-LLM.
  2. Aplicación de cuantización (AWQ/GPTQ): Cuantizar los pesos a precisión de 4 bits para reducir el consumo a menos de 6 GB de VRAM, permitiendo despliegues concurrentes en servidores existentes.
  3. Exposición de API REST compatible con OpenAI: Envolver el modelo en microservicios FastAPI o servidores locales como Ollama para facilitar la integración con aplicaciones preexistentes.
  4. Validación de seguridad ante inyecciones visuales: Incorporar filtros defensivos contra Visual Prompt Injections y evaluar la precisión del modelo en el dominio específico antes del pase a producción.

¿Querés implementar estas tecnologías en tu empresa?

En Siglo 21 Soluciones te asesoramos e implementamos software a medida, inteligencia artificial y ciberdefensa.

Contactar a un Consultor