El mapa del blog: de la acometida eléctrica al token servido

Este blog empezó en marzo de 2026 con un puñado de artículos sobre Kubernetes y networking, y a estas alturas acumula más de 150 piezas que, vistas de una en una, parecen temas sueltos: PagedAttention, generadores diésel, OpenCost, SPIFFE, refrigeración por inmersión, RAGAS. No lo son. Todas describen el mismo objeto desde alturas distintas: una factoría de inferencia soberana, es decir, la máquina completa que convierte megavatios de la red eléctrica en tokens servidos a un usuario, con la propiedad y el control del dato dentro de casa.

Este artículo es el índice de esa máquina. Ordena lo publicado en diez capas, de abajo arriba, y en cada una enlaza lo que hay escrito. Sirve para tres cosas: encontrar un tema concreto, ver qué capas están cubiertas a fondo y cuáles quedan a medias, y elegir un recorrido de lectura según el problema que se tenga delante.

El mapa

De la acometida al token: las diez capas de una factoría de inferencia10 · Coste, rendimiento y energíaFinOps · benchmarking · Wh por token · TCO · el caso on-premise con datos289 · Seguridad y cumplimientoguardrails · aislamiento · firma · ENS, 42001, AI Act138 · Observabilidad y evalsOTel GenAI · Langfuse · DCGM · RAGAS · runbooks147 · Plano de control y entregagateway y router L7 · KServe y OIP · registro OCI · GitOps · canary y shadow116 · Datos y RAGingesta · embeddings · reranker · vector store · CDC · caché semántica175 · El modelocuantización · poda · destilación · MoE · LoRA · decodificado especulativo204 · Motor de inferenciavLLM por dentro · KV cache · prefill y decode · batching · scheduler223 · ClusterKubernetes · reparto de GPU · colas y cuotas · autoscaling · operators132 · Almacenamientopesos, corpus y checkpoints · cold start71 · NodoPCIe · NUMA · NVLink · HBM · CPU80 · Infraestructura físicaacometida · generadores · conmutación · SAI · aire · líquido · inmersión8cada capa solo existesi la de abajo la sostieneMapas maestrospipeline LLMOps de 6 etapaslas 7 capas del stackanatomía de una petición5 niveles de madurez7 fases de despliegueVertical de redEVPN-VXLAN HuaweiMikroTik RouterOS 7UniFi y HCIA-DatacomLa capa 10 no se apoya en ninguna: las atraviesa todas, porque mide lo que cuestan las nueve de abajo.Las capas 0 a 3 son propiedad del operador de infraestructura; las 4 a 7, de la plataforma; las 8 y 9, de todos.

La lectura del mapa es de abajo arriba, y el criterio para ordenarlo es la dependencia física: no hay motor de inferencia sin GPU alimentada y refrigerada, no hay RAG sin motor que sirva embeddings, no hay cumplimiento normativo demostrable sin observabilidad que registre lo que pasó. La capa 10 es la excepción y por eso aparece atravesándolo todo: coste, rendimiento y energía no son un piso del edificio, son la medida del edificio entero.

Capa 0 · Infraestructura física

La vertical más reciente, y la que cierra el círculo: el camino del vatio desde la acometida hasta el chip, y el camino del calor desde el chip hasta la atmósfera.

Capa 1 · El nodo

Dentro de la máquina, antes de que exista ningún proceso: los buses, la memoria y la topología que deciden cuánto rendimiento acaba llegando al modelo.

Capa 2 · Almacenamiento

Capa 3 · El cluster

Capa 4 · El motor de inferencia

El bloque más denso del blog: vLLM abierto en canal, pieza a pieza.

Capa 5 · El modelo

Todo lo que se le hace al modelo antes de servirlo, o mientras se sirve.

Capa 6 · Datos y RAG

Capa 7 · Plano de control y entrega

Capa 8 · Observabilidad y evaluación

Capa 9 · Seguridad, confianza y cumplimiento

Capa 10 · Coste, rendimiento y energía

El track de datos, escrito con un formato distinto al resto del blog: tablas, cifras y fuente verificable, sin analogías. Son los artículos que sostienen una decisión de inversión.

FinOps: modelo de coste y estado del arte, OpenCost a fondo, Kubecost frente a OpenCost, del GPU-hora al coste por token, chargeback y showback, el coste del GPU idle, cloud GPU y neoclouds, TCO completo on-premise y FinOps multi-tenancy con LiteLLM.

Benchmarking: frameworks y métricas, catálogo de herramientas, GuideLLM y el SLO bajo carga, GenAI-Perf a fondo, cómo leer MLPerf Inference, sesgo de medición y reproducibilidad, benchmarks de calidad y la frontera de Pareto entre motores.

Energía: medir la potencia de la GPU, energía por token en España, frameworks de benchmarking energético, medir en producción con Kepler y DCGM, MLPerf Power, leaderboards de Wh por token, del vatio al carbono, palancas de eficiencia y la energía en el TCO y en la regulación.

Síntesis: los tres ejes y la identidad que los une, on-premise soberano frente a hyperscalers, con datos, del SLO al número de GPUs y el harness reproducible.

A esa lista se suman dos piezas de coste que no son de GPU: el coste de los agentes con durable execution y el coste por petición del gateway.

Los mapas maestros

Cinco artículos anteriores hacen de plano general y siguen siendo la mejor puerta de entrada para quien llega nuevo:

Cuatro recorridos

Voy a montar la primera plataforma. Panorama y pipeline de seis etapas, siete capas del stack, siete fases de despliegue, capacity planning, vLLM en Kubernetes, gateway, observabilidad con OTel y Langfuse, y guardrails antes de abrir la puerta.

Tengo el cluster y no me llega el rendimiento. Anatomía de una petición, KV cache y PagedAttention, prefill y decode, prefix cache, batch sizing, GuideLLM para encontrar el punto de saturación, sesgo de medición para no engañarte con los números, y la frontera de Pareto entre motores.

Tengo que justificar la inversión ante dirección. Los tres ejes, TCO on-premise, coste por token, GPU idle, on-premise frente a hyperscalers, dimensionar y justificar, y el harness reproducible para que las cifras aguanten una auditoría.

Me toca la sala, no el software. La cadena de energía, los generadores, el reto térmico, el aire y sus límites, el líquido directo al chip, la inmersión, y de ahí a almacenamiento y a la topología del nodo.

Lo que falta

El mapa también sirve para ver los huecos, y hay seis identificados:

  • Portal interno y autoservicio: Backstage y la experiencia de desarrollador sobre la plataforma.
  • Comparativa de bases vectoriales: Milvus, Qdrant, pgvector y OpenSearch con datos, más allá de las menciones sueltas.
  • Kubeflow a fondo, que aparece citado pero nunca desarrollado.
  • Lakehouse para RAG: Iceberg y Trino como sustrato del corpus.
  • Knative y scale-to-zero para inferencia intermitente.
  • Gestión fuera de banda: OpenBMC, Redfish y DCIM, que es justo el puente entre la capa 0 y la capa 3.

Ver también