
DETALLE DEL PROYECTO
YOLO Training & Inference Orchestration Architecture
YOLO Training & Inference Orchestration Architecture es la documentación de arquitectura, anonimizada y apta para publicación, de una plataforma interna de visión por computador orientada a producción. Documenta cómo se mantiene separada la capa web de las cargas de trabajo intensivas en GPU, y por qué.
Es solo documentación: no incluye código ejecutable, datasets privados, pesos de modelos, credenciales, métricas reales ni archivos de despliegue de producción.
Qué documenta:
- Separación en microservicios: una capa web y de administración en Django, separada de una capa de procesamiento de IA en FastAPI.
- Ejecución de IA sobre GPU: entrenamiento, validación e inferencia YOLO, e inferencia por tiles con SAHI sobre imágenes de alta resolución, ejecutadas a través de un servicio de cómputo dedicado.
- Flexibilidad del entorno de entrenamiento: estrategias de una y varias GPU, incluido soporte de DataParallel y patrones DDP evaluados.
- Gestión de la configuración de datasets: configuración respaldada en base de datos, metadatos de etiquetas y clases, y generación de configuración compatible con YOLO.
- Fundamentos de MLOps: seguimiento de experimentos, registro de métricas, linaje de artefactos y gestión de referencias a modelos.
- Análisis de riesgos operativos: discusión explícita de la ejecución síncrona, el acoplamiento por almacenamiento compartido, la contención de GPU, la gobernanza de artefactos y los disparadores de escalado.
- Planificación de evolución ajustada al propósito: una hoja de ruta centrada en fiabilidad y trazabilidad internas antes que en infraestructura distribuida prematura.
Una decisión documentada, como muestra del nivel de detalle: se eligió Ubuntu como entorno de ejecución para el entrenamiento sobre GPU porque PyTorch, CUDA, los drivers de NVIDIA y el entrenamiento multi-GPU son muy sensibles al sistema operativo y a la compatibilidad entre driver y runtime de CUDA. Windows resolvía bien la ejecución con una sola GPU, pero los flujos multi-GPU y orientados a DDP introducían una complejidad operativa que Ubuntu evitaba.
Los cuatro diagramas que se muestran aquí están renderizados desde las fuentes Mermaid versionadas en el repositorio: vista general de la arquitectura, flujo de entrenamiento, flujo de inferencia con SAHI y entrenamiento incremental (CI).
Framework: AI / Platform Architecture
Stack tecnológico:
Python, Django, FastAPI, PostgreSQL, REST APIs, PyTorch, CUDA, YOLO, SAHI, OpenCV, SAM (Segment Anything), Pillow, NumPy, ClearML, YAML, JSON, COCO annotation format, YOLO dataset format, CVAT, Roboflow, Docker, Docker Compose, Linux, Ubuntu, Jupyter, shared storage for artifact exchange
Equipo
Company / Institution: Anonymized Internal AI Vision Platform — Architecture Case Study
Desarrollador: Marco Parra
Repositorio solo documental: problema, método, arquitectura y límites. No se publica código fuente ni datos de clientes.

Imágenes del proyecto
