Ir al contenido

Reconocimiento web

Por

Madurezreviewed
Última revisión
Publicado
Última actualización

El reconocimiento web empieza cuando ya existe un nombre o endpoint HTTP con el que trabajar. Su tarea es explicar qué aplicación responde, cómo llega una petición hasta ella, qué superficie expone y qué evidencias permiten ampliar el mapa. No sustituye la enumeración de dominios ni la de puertos. Consume sus resultados y añade la perspectiva de HTTP, TLS y la aplicación.

Los ejemplos de esta rama usan DOMAIN para el dominio raíz, FQDN para un nombre completo, BASE_URL para una URL con esquema y TARGET_IP para una dirección ya atribuida.

Una aplicación puede depender de varias capas:

nombre → DNS → dirección y ruta → TLS/SNI → autoridad HTTP → aplicación → recursos

Dos nombres que resuelven a la misma IP pueden seleccionar certificados, hosts virtuales y aplicaciones diferentes. Una CDN puede entregar respuestas distintas según el origen geográfico. Una redirección puede cambiar de esquema, hostname o puerto y llevar a otro sistema. Por eso, el inventario conserva la URL y el nombre utilizados, no solo la dirección final.

Para cada endpoint registra al menos:

Campo Evidencia necesaria
Origen Esquema, hostname y puerto.
Resolución A, AAAA, CNAME, resolutor y momento de la consulta.
Transporte Dirección contactada, TLS, SNI, certificado y protocolos negociados.
HTTP Redirecciones, código, cabeceras, cookies y tamaño aproximado.
Aplicación Título, tecnologías probables, rutas y puntos de entrada.
Procedencia Interacción directa, fuente pública, archivo histórico o inferencia.
Estado Confirmado, histórico, descartado o pendiente de validación.

Esta separación evita conclusiones como «el servidor es Apache» cuando la cabecera procede de un proxy inverso, o «el subdominio está activo» cuando solo aparece en un certificado antiguo.

El trabajo avanza por preguntas. Una respuesta nueva puede obligar a volver a una etapa anterior.

  1. Identificar nombres y endpoints. La información de dominios reúne registro, DNS, Certificate Transparency y proveedores. Nmap localiza servicios HTTP y HTTPS en puertos estándar y no estándar.
  2. Reproducir la petición. La interacción manual con HTTP y TLS separa resolución, conexión, SNI, autoridad, destino de la petición, redirecciones y sesión.
  3. Resolver el enrutamiento de la petición. Se comprueban redirecciones, SNI, cabecera Host o pseudo-cabecera :authority, reverse proxies y hosts virtuales.
  4. Construir un fingerprint. Certificado, cabeceras, cookies, HTML, archivos estáticos y errores forman una hipótesis sobre servidor, framework, CMS, WAF y componentes.
  5. Recorrer lo enlazado. El crawling descubre rutas, parámetros, formularios, scripts y relaciones siguiendo referencias observadas.
  6. Consultar archivos de metadatos y endpoints normalizados. robots.txt, sitemaps y /.well-known/ publican rutas o metadatos con semántica propia.
  7. Buscar contenido no enlazado. El descubrimiento de contenido utiliza wordlists, extensiones justificadas y respuestas de referencia para localizar rutas y archivos predecibles.
  8. Añadir evidencia externa e histórica. Motores de búsqueda y archivos web recuperan recursos que no aparecen en el estado actual.
  9. Automatizar preguntas ya comprendidas. La automatización normaliza y correlaciona resultados. Los hallazgos que cambian el mapa se validan manualmente.

La automatización del reconocimiento web conserva procedencia, normaliza candidatos y explica cómo comparar resultados sin convertir una cadena de herramientas en la metodología.

El proceso vuelve atrás cuando aparece una discrepancia. Si la detección de versiones contradice el escaneo de puertos, se aísla ese puerto. Si un host deja de responder, se comparan el origen, la ruta, los tiempos y la petición antes de ampliar el escaneo.

Observación activa, fuentes pasivas y OSINT

Sección titulada «Observación activa, fuentes pasivas y OSINT»

Una petición directa a BASE_URL es observación activa aunque solo recupere una cabecera. Consultar un registro de Certificate Transparency, un índice de buscador o una captura de Internet Archive no contacta con la infraestructura web actual y proporciona una vista externa. Una consulta DNS puede llegar al servidor autoritativo o quedar respondida por la caché de un resolutor, por lo que su perspectiva debe registrarse.

OSINT no es sinónimo de toda recopilación pasiva. Es una disciplina más amplia basada en fuentes abiertas. En este recorrido se utilizan algunas de sus fuentes, pero la rama se centra en convertirlas en hipótesis técnicas sobre la superficie web.

Un resultado útil relaciona activos y evidencia:

portal.DOMAIN
├── resuelve mediante CDN
├── redirige de HTTP a HTTPS
├── presenta certificado para portal.DOMAIN
├── selecciona una aplicación mediante SNI y Host
├── expone /robots.txt y /sitemap.xml
└── carga una API desde api.DOMAIN

La API amplía el inventario. El sitemap aporta rutas para el rastreo. Una tecnología probable abre preguntas de fingerprinting, pero no demuestra una vulnerabilidad. Cada transición debe conservar qué se observó, qué se infirió y qué falta por comprobar.

La checklist de reconocimiento web controla la cobertura por origen y vista. La cheatsheet recupera las primeras peticiones y herramientas sin sustituir el razonamiento de las páginas canónicas.

El laboratorio de herramientas web compara los mismos casos positivos y negativos con cURL, Gobuster, ffuf, Feroxbuster, HTTPX y Katana.