Claves virtuales, presupuestos y límites en LiteLLM: la capa que decide quién consume la GPU, y las cuatro cosas que la documentación cuenta mal8 sept. 2026
LiteLLM en día 2: un worker por pod, seis mil segundos de timeout y las otras cinco cosas que hay que cambiar antes de abrir tráfico8 sept. 2026
LiteLLM y Langfuse: el par operativo, y los cuatro sitios donde la traza se pierde entre el gateway y el panel7 sept. 2026
Knative y scale-to-zero para inferencia LLM: cuándo apagar la GPU ahorra y cuándo te cuesta el SLO31 ago. 2026