Showing posts with label computer vision. Show all posts
Showing posts with label computer vision. Show all posts

Friday, February 13, 2026

Residual Depth

The publication of Deep Residual Learning for Image Recognition by Kaiming He, Xiangyu Zhang, Shaoqing Ren and Jian Sun at IEEE Conference on Computer Vision and Pattern Recognition 2016 constituted a decisive epistemic rupture in the evolution of deep learning. Their central innovation—the formulation of residual learning through identity-based skip connections—addressed the degradation problem that had hitherto constrained the effective training of very deep convolutional neural networks. Rather than compelling stacked layers to approximate a direct mapping, the architecture reparameterised the objective as the learning of a residual function, succinctly expressed as F(x) + x, thereby stabilising gradient propagation and enabling networks exceeding one hundred layers to converge reliably. Empirically validated on ImageNet, the proposed ResNet achieved unprecedented accuracy while exhibiting remarkable optimisation efficiency, rapidly becoming a foundational scaffold for subsequent architectures across vision, language, and multimodal systems. A compelling case study of its intellectual diffusion is observable in applied domains such as Asian food classification, where hybridised ResNet variants incorporating attention mechanisms and data augmentation strategies demonstrably elevate top-1 accuracy. Thus, the ResNet paradigm exemplifies how a mathematically economical reformulation can precipitate a paradigmatic transformation, rendering it one of the most cited and structurally generative contributions in contemporary artificial intelligence scholarship. He, K., Zhang, X., Ren, S. and Sun, J. (2016) ‘Deep Residual Learning for Image Recognition’, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, 27–30 June, pp. 770–778. https://doi.org/10.1109/CVPR.2016.90

Wednesday, January 14, 2026

BackUp * TWINS


TWINS: Una estética de la repetición mínima como espejo de la percepción automatizada – La lógica visual de los pares casi idénticos como arquitectura del aprendizaje maquínico. En formato bifocal de imágenes naturales y cotidianas, emerge una estructura formal basada en la duplicación sutil, donde cada par —rosas, hojas, muros erosionados, cielos ocres o fuentes en movimiento— funciona como una microvariación que subraya el matiz entre lo idéntico y lo apenas diferente, configurando un patrón visual que evoca el modo en que los algoritmos de visión por computadora detectan, agrupan y comprenden similitudes dentro de un espacio latente, pues la organización cromática de las escenas —desde los verdes vegetales hasta los bloques de color naranja o rosa— revela un criterio de orden implícito, una lógica algorítmica que prioriza la textura, el tono y la forma como ejes de clasificación perceptual y no el contenido narrativo de las escenas, lo que transforma la contemplación de estas imágenes en un ejercicio de lectura del modelo que las organiza más que de los objetos mismos, estableciendo así una coreografía visual que reproduce la manera en que redes neuronales convolucionales realizan procesos de deduplicación, clustering o evaluación de similitud métrica, un método observable en las ligeras variaciones de luz, foco o encuadre entre las parejas de imágenes que actúan como ejemplos frontera, es decir, casos limítrofes que permiten entrenar la capacidad discriminativa de un sistema de reconocimiento visual, y es justamente esta capacidad para generar diferencia en la mínima alteración la que permite a estos mosaicos funcionar como una ventana técnica hacia la sensibilidad artificial