Cero gasto en servidores: Cómo Cloudflare liberó 100 TB de memoria

Cero gasto en servidores: Cómo Cloudflare liberó 100 TB de memoria

Optimización de SistemasControl de Costos

Fuentes:Cloudflare Blog

El costoso “solo un byte”

En el mundo tecnológico de 2026, todas las empresas están comprando servidores frenéticamente para obtener potencia de cálculo y memoria. Pero en los centros de datos del gigante de la infraestructura de red Cloudflare, los ingenieros detuvieron la expansión y, en su lugar, se fijaron en el código de bajo nivel para buscar esos bytes desperdiciados.

El sistema DNS de Cloudflare, “Big Pineapple”, procesa un volumen masivo de solicitudes de red globales todos los días. Sus entradas de caché superan los 250 mil millones. Ante este número astronómico, desperdiciar solo 1 byte significa que todo el clúster consumirá 250 GB adicionales de memoria.

Imagen de cabecera del blog de Cloudflare Imagen: Distribución de nodos de servicio de Cloudflare. Fuente: Cloudflare Blog

Frente a los modelos de IA que exigen terabytes de VRAM, unos cientos de gigabytes pueden parecer triviales. Sin embargo, para los sistemas de bajo nivel que requieren respuestas ultrarrápidas, la memoria inflada no solo genera costosas facturas de hardware, sino que también provoca una latencia inaceptable.

Exprimir a nivel de píxel

Frente al desperdicio de recursos, adoptaron la solución más extrema: una optimización extrema del diseño de memoria a nivel del lenguaje Rust. Esto es como reorganizar la estructura de las estanterías en un almacén repleto de productos para liberar a la fuerza un gran espacio vacío.

La práctica convencional es utilizar arreglos dinámicos (Vec) o cadenas (String) para almacenar datos. Este método viene con un campo de “capacidad” (capacity), reservando espacio para una futura expansión. Los ingenieros de Cloudflare los reemplazaron todos por Box<[T]> y Box<str> de longitud fija, cortando directamente el desperdicio del espacio reservado.

Diagrama de optimización de la estructura de caché Imagen: Comparación de la estructura de memoria antes y después de eliminar el campo de capacidad de los arreglos dinámicos. Fuente: Cloudflare Blog

También refactorizaron la estructura de datos, fusionando múltiples listas originalmente dispersas en una sola y utilizando desplazamientos (offsets) para un posicionamiento preciso. Si el nombre de dominio consultado es el mismo que el del propietario del registro, el sistema elimina directamente el campo del propietario. A través de esta combinación de medidas, la huella de memoria por cada entrada de caché se redujo en más del 50%.

Una situación en la que todos ganan: rendimiento y costo

La tacañería extrema produjo beneficios asombrosos. Cinco optimizaciones consecutivas liberaron acumulativamente alrededor de 100 TB de memoria. Esto equivale a la memoria total de 130 servidores Gen 13.

Esto no solo ahorró una enorme cantidad en costos de adquisición de servidores, sino que el rendimiento general del sistema también mejoró significativamente. Estructuras de datos más compactas condujeron a tasas más altas de aciertos de caché de la CPU, lo que finalmente aumentó el rendimiento de inserción del sistema en un 43% y redujo la latencia de consulta en un 19%.

La optimización de sistemas parece haberse convertido en un oficio de nicho en esta era. Sin embargo, los hechos demuestran que una energía inmensa todavía se esconde dentro de esos detalles de bajo nivel que a menudo se pasan por alto.

La palanca olvidada

100 TB de memoria fueron exprimidos línea por línea por ingenieros. En esta era de apilar hardware locamente, Cloudflare ha dado a todos una vieja lección.

Todos están acostumbrados a resolver los cuellos de botella de potencia de cálculo con dinero, y la calidad del código más básica se deja de lado fácilmente. Cuando hablamos de modelos de cientos de miles de millones de parámetros y clústeres de decenas de miles de GPU, tal vez deberíamos mirar hacia abajo a esos bytes inválidos que duermen en la memoria.

Los datos intuitivos del evento de liberación de 100 TB de memoria de Cloudflare demuestran un hecho. En una era donde todos queman dinero en IA, la optimización clásica de sistemas sigue siendo la mayor palanca de costos, y la más ignorada. En lugar de apilar hardware a ciegas, es mejor reexaminar la infraestructura bajo nuestros pies. El autor cree que esta es la respuesta más contundente que los ingenieros de sistemas pueden dar en esta época.

Referencias:

  • Cloudflare Blog