En 2020, Computer Vision era OpenCV y algo de CNN si te animabas. En 2026, el campo cambió de fondo: los transformers de visión son el estándar académico, YOLO lleva ya su undécima versión, y los LLMs multimodales pueden describir, clasificar y razonar sobre imágenes sin que configures un pipeline de entrenamiento. Si nunca has tocado Computer Vision o lo dejaste hace un par de años, vale la pena revisitar lo que existe hoy.
OpenCV: sigue siendo tu primer paso
OpenCV no va a ningún lado. Para captura de cámara, preprocesamiento de frames, operaciones morfológicas y pipelines en tiempo real, es el estándar de facto desde hace más de dos décadas. La versión 5.x mejoró el soporte para CUDA y optimizaciones en chips ARM, lo que importa cuando deployás en dispositivos edge — Raspberry Pi, Jetson Nano o similar.
Lo que sí cambió: ya no necesitas OpenCV para clasificación ni detección de objetos. Para eso hay opciones mucho mejores. OpenCV hoy cumple su rol en la capa de entrada — leer video, ajustar brillo, recortar regiones de interés — y en la capa de salida — dibujar bounding boxes, escribir resultados. El modelo de visión va en el medio.
YOLO en 2026: qué cambió con YOLOv11
YOLOv11, la versión actual de la librería ultralytics, superó a YOLOv8 en benchmarks de COCO con latencia comparable. Las mejoras que más importan en proyectos reales:
- ▸Detección orientada (OBB — Oriented Bounding Boxes) nativa: muy útil para imágenes satelitales, análisis de documentos y manufactura donde los objetos no están alineados con el eje
- ▸Knowledge distillation integrado: genera versiones más pequeñas del modelo sin perder precisión de forma significativa — clave para deployar en edge
- ▸Exportación directa a TensorRT, ONNX y CoreML: el deploy en producción dejó de ser un proceso aparte con scripts manuales
Para detección en tiempo real con cámara o video, YOLOv11 sigue siendo la primera opción. Con una GPU mediana, entrenas un modelo personalizado en horas con tus propias imágenes.
Modelos multimodales de visión: el cambio más grande de los últimos dos años
Lo que más cambió Computer Vision en 2025-2026 no es YOLO — son los LLMs con capacidades de visión. GPT-4o, Gemini Flash y Claude Vision pueden recibir imágenes y hacer cosas que antes requerían pipelines complejos de fine-tuning:
- ▸Clasificación sin etiquetas ni entrenamiento: "¿hay una factura dañada en esta foto?" funciona con un prompt bien escrito
- ▸OCR conversacional: extrae texto estructurado de PDFs escaneados o fotos de documentos con un solo llamado a API, sin configurar Tesseract ni entrenamiento
- ▸Análisis de escenas complejas: razonar sobre el contenido de una imagen, relacionarlo con contexto textual y generar descripciones o decisiones
Lo que nadie te dice: los modelos multimodales no reemplazan a YOLO para detección en tiempo real. Son caros por imagen, lentos para procesar video en streaming y no los puedes deployar en edge sin conexión a internet. YOLO gana cuando necesitas velocidad y costo predecible. Los multimodales ganan cuando necesitas comprensión semántica con datos limitados.
El stack de Computer Vision en 2026
Captura y preprocesamiento: OpenCV 5.x, Pillow, albumentations para augmentation.
Detección de objetos: YOLOv11 (ultralytics), RT-DETR para detección con transformers.
Clasificación y segmentación: PyTorch + torchvision, timm para modelos pre-entrenados de visión.
Visión con LLMs: OpenAI Vision API (GPT-4o), Gemini Flash multimodal, Claude Vision — para tareas de comprensión semántica donde no necesitas velocidad en tiempo real.
Deploy en edge: TensorRT para GPU NVIDIA, ONNX Runtime para hardware variado, CoreML para dispositivos Apple.
Datasets y etiquetado: Roboflow y Label Studio son las opciones más adoptadas para proyectos que necesitan datasets propios.
Casos de uso reales que funcionan ahora
No todo es automatización de fábricas. Los proyectos que he visto funcionar bien en 2026:
- ▸Control de calidad en manufactura: detección de defectos con YOLOv11 en línea de producción, sin operador frente a la pantalla las 24 horas
- ▸Procesamiento de documentos: extracción de campos de facturas, formularios y DNIs con visión multimodal — lo que antes tomaba días de configuración de OCR ahora es una llamada a API
- ▸Seguridad perimetral: cámaras con detección de intrusos en tiempo real, deployadas en Raspberry Pi con YOLO nano — costo bajo, latencia aceptable
- ▸Agro: conteo de cultivos y detección de plagas por imágenes de dron — alta demanda en LATAM donde el monitoreo manual es el cuello de botella
Cómo aprender Computer Vision con Python en 2026
Computer Vision tiene una curva real. Entender los conceptos básicos — convoluciones, anchors, IoU, non-maximum suppression — te da ventaja antes de usar las librerías de alto nivel. En el curso de Fundamentos de Computer Vision de DataPath cubres OpenCV, preprocesamiento de imágenes, detección de objetos y los modelos modernos con Python — sin asumir conocimiento previo de deep learning.
Si tu objetivo es ser AI Engineer y Computer Vision es una pieza del puzzle más amplio, la ruta AI Engineer te da el contexto completo: LLMs, visión artificial, deployment y las herramientas que el mercado pide hoy, dentro de un programa estructurado para developers.
Si quieres traer un proyecto real de visión artificial y trabajarlo con otros que están en lo mismo, en la Comunidad AI Builders hacemos talleres en vivo cada semana donde llevas tu caso, lo revisamos en grupo y avanzas con feedback directo. Desde 19 USD/mes.


