La inferencia YOLO estándar pierde objetos pequeños de forma silenciosa cuando las imágenes de dron de alta resolución se reducen al tamaño de entrada del modelo. Este post recorre cómo el pipeline AgriDrone Vision usa inferencia por rebanadas con SAHI y una capa de evaluación COCO para hacer medible ese trade-off — y por qué el entregable real es un mapa georreferenciado, no un bounding box.
By admin on Aug, 11 2026
Este post está basado en el case study AgriDrone Vision Evaluation Pipeline — una versión pública, anonimizada y solo de documentación de un sistema de visión computacional para agricultura de precisión. No incluye datos de clientes, coordenadas reales ni resultados experimentales sin publicar; los ejemplos son ilustrativos.
La falla que nadie ve a 640 píxeles
Los drones agrícolas capturan datos hermosos: ortofotos de 4K o más donde cada planta del campo es visible. Los objetos que realmente importan — plántulas, malezas, plantas individuales — suelen ocupar apenas unas decenas de píxeles de ese encuadre.
Aquí está la trampa. Los detectores de la familia YOLO redimensionan la imagen de entrada al tamaño de trabajo del modelo, típicamente 640 píxeles. Si le entregas un frame de dron de 3840×2160, la imagen se reduce unas seis veces: un objeto que medía 30 píxeles de ancho ahora mide unos 5 — por debajo de lo que los feature maps de la red pueden representar de forma útil. Las detecciones de objetos pequeños simplemente desaparecen.
Lo que hace peligrosa esta falla es que es silenciosa. El ciclo estándar de entrenamiento y validación evalúa sobre imágenes procesadas de la misma manera, así que las métricas se ven razonables. Solo al evaluar a la resolución nativa del campo se hace visible la brecha entre el "mAP de validación" y "lo que el agrónomo ve en las imágenes reales". Ese efecto de escalado de resolución, y el desplazamiento en la distribución de tamaños de objeto que lo acompaña, es exactamente lo que este pipeline fue construido para exponer.
Inferencia por rebanadas con SAHI
SAHI (Slicing Aided Hyper Inference) ataca el problema negándose a reducir la imagen. En vez de redimensionar el frame completo:
- corta la imagen en tiles solapados a resolución nativa (o cercana),
- ejecuta el detector de forma independiente sobre cada tile,
- proyecta las detecciones de cada tile de vuelta a las coordenadas de la imagen completa, y
- fusiona los duplicados en las zonas de solape.
El objeto pequeño nunca se encoge, así que el detector lo ve a la densidad de píxeles con la que fue entrenado. Pero nada es gratis: el costo de inferencia se multiplica por el número de tiles, los objetos cortados por el borde de un tile exigen una fusión cuidadosa, y la proporción de solape se convierte en un hiperparámetro más que ajustar. Si SAHI vale la pena para un cultivo, una cámara y una altura de vuelo dados es una pregunta empírica — y eso significa que necesitas un montaje de evaluación capaz de responderla.
Una capa de evaluación que mantiene honesta la comparación
La decisión de diseño central del pipeline es que la inferencia YOLO directa y la inferencia por rebanadas con SAHI se evalúan por exactamente el mismo camino de código. Las anotaciones de ground truth y las predicciones de ambos modos se convierten del formato YOLO a JSON compatible con COCO, y las métricas se calculan con pycocotools:
- AP@[.50:.95] y AP50 globales, más métricas por clase — porque en agricultura la clase rara suele ser justo la que importa;
- AP estratificado por tamaño (small / medium / large) — ahí es donde las dos estrategias de inferencia realmente divergen, y esa estratificación es lo que convierte "con SAHI se ve mejor" en un número;
- reportes exportados como JSON, CSV y gráficos, para que cada corrida sea reproducible y comparable con la anterior.
Suena obvio, pero la alternativa es común: comparar los números de validación de un modelo contra la salida por consola de otra herramienta, con umbrales de IoU distintos y manejos distintos del ground truth. Un contrato de evaluación compartido es lo que convierte dos modos de inferencia en un solo experimento.
De bounding boxes a mapas
En agricultura de precisión, un bounding box no es el entregable — lo es un mapa georreferenciado. El pipeline extrae metadatos EXIF/GPS de cada frame, transforma coordenadas con pyproj y exporta las detecciones como GeoJSON, Shapefile y CSV compatible con QGIS. El usuario final nunca ve un tensor: abre una capa en QGIS y ve cada detección posicionada sobre el ortomosaico de su propio campo.
Esta última milla es fácil de subestimar. También es donde un ejercicio de visión computacional se convierte en una herramienta agronómica.
Qué es — y qué no es
El case study público es deliberadamente explícito sobre su madurez: esto es un pipeline batch de nivel investigación, no una plataforma MLOps productizada. La orquestación se basa en scripts, los módulos están acoplados por convenciones del sistema de archivos, y la cobertura de tests automatizados sigue pendiente. La documentación incluye la hoja de ruta para cambiar eso — una capa de configuración, una abstracción de almacenamiento, orquestación formal — pero no afirma que ya esté hecho.
Considero esa honestidad parte de la ingeniería: conocer la frontera precisa entre "funciona de forma reproducible en condiciones de investigación" y "listo para producción desatendida" es, en sí mismo, un resultado técnico.
Conclusiones
- Si tus objetos son pequeños en relación al encuadre, el redimensionado de entrada de tu detector es probablemente tu mayor pérdida silenciosa de exactitud — mídela antes de comprar un modelo más grande.
- La inferencia por rebanadas cambia cómputo por recall en objetos pequeños; si el intercambio vale la pena es una pregunta empírica para cada dataset.
- Las comparaciones valen lo que vale su contrato de evaluación: un solo ground truth, una sola implementación de métricas, un solo camino de código para todos los modos de inferencia.
- Entrega la salida en el sistema de coordenadas del usuario — en agricultura, eso significa formatos GIS, no blobs JSON.
La arquitectura completa, la metodología y las limitaciones están documentadas en el repositorio público del case study.
Also available in English: Small Objects, Big Images: Evaluating YOLO and SAHI on 4K Drone Imagery.
Comments
No comments.