El roofline se invierte: por qué optimizar modelos pequeños es otro partido de rendimiento9 jun. 2026
El jefe que canta cada comanda: SMs, CUDA streams y CUDA graphs, o por qué la GPU se aburre generando tokens7 jun. 2026