Ir al contenido

Ciclo de vida, rotación y retirada

Por

Madurezreviewed
Última revisión
Publicado
Última actualización

El ciclo de vida comienza antes del aprovisionamiento y termina cuando se ha verificado la retirada o transferencia de DNS, certificados, nodos, cuentas y datos. Cada recurso debe tener una persona responsable, un estado conocido y un procedimiento de limpieza.

Este playbook aplica el modelo canónico de infraestructura ofensiva. Conserva los identificadores y las fronteras definidas allí durante cada transición.

planned -> provisioned -> staged -> validated -> active
| |
v v
failed rotating
| |
+-> retired <-+
|
v
verified

provisioned significa que el recurso existe. validated exige pruebas positivas, negativas y de recuperación. active permite tráfico operativo. retired todavía necesita una comprobación final.

Define:

  • función y frontera de confianza
  • proveedor, región y cuenta
  • identidad administrativa
  • nombres, direcciones y puertos
  • imagen y versión
  • configuración como código o manifiesto
  • secretos y distribución
  • registros y retención
  • comprobaciones de salud
  • copia de seguridad y restauración
  • rotación y retirada
  • coste y fecha de renovación

Utiliza una configuración base mínima y versionada. Registra los hashes de imágenes, paquetes y archivos de configuración. Un runbook permanente no debe descargar y ejecutar instaladores mediante curl | sh sin fijar el origen y revisar antes el contenido.

Secuencia:

  1. crear recurso y etiquetas
  2. registrar ID del proveedor
  3. configurar el plano de recuperación
  4. aplicar identidad y claves nominales
  5. actualizar y reducir servicios
  6. aplicar reglas de firewall por plano
  7. instalar función
  8. configurar el registro y la sincronización horaria
  9. crear una copia de seguridad inicial
  10. pasar a preproducción

Prueba:

  • acceso administrativo y cuenta de emergencia (break-glass)
  • resolución A, AAAA y TTL
  • TLS, SNI y renovación
  • reglas de firewall en casos permitidos y denegados
  • rutas admitidas y rechazadas
  • conexión con el servicio de origen (upstream)
  • protocolo completo con simulador
  • registros por componente
  • alertas de salud
  • restauración
  • pérdida deliberada de un nodo de preproducción

Registra versión, hora, origen y output. Un socket abierto solo confirma que un proceso acepta la conexión. No demuestra que el listener pueda completar el protocolo, autenticar al cliente ni alcanzar el servicio de origen.

Durante actividad:

  • monitoriza disponibilidad, certificados, disco, cola y tiempo
  • registra cambios y responsables
  • separa las comprobaciones de salud del tráfico procedente del objetivo
  • revisa accesos administrativos
  • conserva configuración efectiva
  • prepara capacidad de reemplazo
  • limita datos en frontales

No actualices todos los nodos a la vez. Valida en preproducción, despliega por función y conserva una ruta de reversión.

Rota cuando:

  • IP o dominio queda bloqueado
  • certificado o clave se expone
  • el proveedor suspende el recurso o degrada el servicio
  • configuración cambia de forma incompatible
  • un nodo pierde integridad
  • la fase o objetivo exige separación
  • termina la ventana de uso

Cambiar únicamente DNS puede conservar la dirección IP, el certificado, el servicio de origen y el patrón de tráfico. El inventario de indicadores determina qué conjunto debe rotarse.

  1. congelar estado conocido
  2. aprovisionar reemplazo con nuevo infra_id
  3. validar sin generar tráfico desde un sistema objetivo
  4. desplegar certificado y reglas
  5. autorizar el nuevo frontal en el servicio de origen
  6. probar protocolo extremo a extremo
  7. cambiar DNS, perfil o distribución
  8. observar ambas rutas
  9. retirar el antiguo tras propagación
  10. comparar registros y cerrar dependencias

No sobrescribas el registro antiguo. Conserva una relación explícita con el recurso que lo sustituye, por ejemplo mediante el campo replaces.

Inventario de retirada:

  • DNS y zonas
  • certificados, claves y ACME
  • VPS, discos, instantáneas e imágenes
  • balanceadores de carga y firewalls
  • cuentas, tokens de API y claves SSH
  • buckets y copias de seguridad
  • team server, listeners y agentes
  • pipelines y repositorios
  • registros y exportaciones
  • dominios, renovaciones y métodos de pago

Elimina datos según retención y conserva solo los artefactos acordados. Verifica desde fuera:

  • nombres ya no resuelven o apuntan al estado de parking decidido
  • la dirección IP ya no presenta el certificado ni responde como listener
  • el servicio de origen rechaza el frontal antiguo
  • los tokens revocados ya no permiten autenticarse
  • el proveedor no conserva instantáneas activas
  • facturación y renovación están cerradas

Un runbook de recuperación incluye:

  • acceso a consola
  • copia de seguridad compatible
  • secretos necesarios para restaurarla
  • versión exacta
  • orden de servicios
  • migraciones
  • comprobaciones de salud
  • criterio para volver al estado active

Ensáyalo en preproducción. Una exportación que nunca se ha restaurado no demuestra que exista una vía de recuperación.