Buscadores y archivos históricos
Una aplicación solo muestra su estado presente desde la vista que se consulta. Los índices y archivos añaden observaciones tomadas por terceros en otros momentos: una ruta que fue pública, un documento que recibió enlaces o un hostname que aparecía antes de una migración. Esa memoria externa puede explicar convenciones y dependencias que el despliegue actual ya no anuncia.
La procedencia determina lo que puede concluirse. Un resultado de buscador demuestra que su índice asocia cierta información con una URL. Una captura demuestra que el archivo almacenó una respuesta en una fecha. Ninguno confirma que el recurso siga activo ni que el índice haya cubierto todo el sitio.
Formular preguntas al índice
Sección titulada «Formular preguntas al índice»Google documenta site: para limitar resultados a un dominio o prefijo de URL y filetype: para seleccionar formatos. Las comillas buscan una frase y el signo menos excluye un término. Empieza con preguntas concretas:
site:DOMAINsite:DOMAIN filetype:pdfsite:DOMAIN filetype:xlsxsite:DOMAIN "api"site:DOMAIN "login" -wwwsite:DOMAIN ayuda a reunir rutas y subdominios visibles en el índice. filetype:pdf o filetype:xlsx localiza formatos que pueden contener autores, nombres internos, enlaces y metadatos. Una frase reduce resultados a páginas cuyo contenido indexado coincide. La exclusión -www puede destacar otros nombres.
Los operadores no convierten el índice en un inventario. Google advierte que site: no devuelve necesariamente todas las URLs indexadas y que los resultados sin otro término no tienen un orden exhaustivo. La sintaxis y disponibilidad de operadores cambia. Verifica en la documentación del motor los que vayas a utilizar en lugar de mantener una tabla histórica.
Si una consulta no devuelve resultados, reduce la pregunta antes de concluir que el dato nunca fue público. Prueba el dominio sin subdominio, el hostname exacto, una frase observada y otro índice. Un límite de consulta, una desindexación o una variante regional pueden producir el mismo vacío.
Registra la consulta, el motor, la fecha, la URL resultante y el fragmento visible. El fragmento puede proceder de una versión anterior de la página.
Buscar relaciones en código y documentos
Sección titulada «Buscar relaciones en código y documentos»Los repositorios públicos, package registries y documentación técnica pueden contener:
- dominios y endpoints de API
- nombres de buckets, tenants y proyectos
- ejemplos de configuración
- rutas de callback y esquemas de autenticación
- direcciones de correo y convenciones de nombres
- ficheros que deberían haber sido retirados
Una coincidencia en un fork o en el historial de Git conserva procedencia distinta de la rama actual. Antes de tratar un valor como secreto, comprueba si es una clave pública, un identificador, un ejemplo o una credencial revocada. No copies valores sensibles a la documentación canónica. Registra su ubicación y estado de validación en el artefacto de la investigación.
Consultar la Wayback Machine
Sección titulada «Consultar la Wayback Machine»La interfaz de Wayback Machine permite elegir capturas por URL y fecha. Para trabajar con conjuntos grandes, la API CDX devuelve el índice de capturas. curl -G construye una petición GET y cada --data-urlencode añade un parámetro codificado:
curl -sS -G 'https://web.archive.org/cdx/search/cdx' \ --data-urlencode 'url=*.DOMAIN/*' \ --data-urlencode 'output=json' \ --data-urlencode 'fl=timestamp,original,statuscode,mimetype,digest' \ --data-urlencode 'filter=statuscode:200' \ --data-urlencode 'collapse=urlkey' \ > wayback-cdx.jsonurl=*.DOMAIN/* incluye hostnames bajo el dominio y sus rutas. fl elige los campos. filter=statuscode:200 conserva capturas cuyo código archivado fue 200. collapse=urlkey reduce repeticiones de la misma clave normalizada. El JSON se guarda para no depender de una salida truncada en la terminal.
La primera fila contiene los nombres de campo. jq puede convertir las siguientes filas en objetos y extraer URL únicas:
jq -r ' .[0] as $headers | .[1:][] | [[$headers, .] | transpose[] | {(.[0]): .[1]}] | add | .original' wayback-cdx.json | sort -u > historical-urls.txtEl filtro de jq toma la cabecera, combina cada fila con sus nombres y muestra original. sort -u elimina duplicados. Mantén el timestamp cuando necesites explicar cuándo se observó una ruta.
Interpretar una captura
Sección titulada «Interpretar una captura»Una captura puede:
- conservar una ruta retirada
- mostrar un hostname o proveedor antiguo
- revelar cambios de framework y estructura
- enlazar documentos o scripts que el sitio actual ya no referencia
- fallar al reproducir recursos cargados desde otros orígenes
La reproducción no equivale al estado histórico exacto. JavaScript, APIs y recursos externos pueden no haberse archivado. Un código 200 en CDX describe la respuesta capturada, no la disponibilidad actual.
Clasifica cada resultado como histórico hasta validarlo. Si una URL responde hoy, pasa al inventario activo con una observación nueva. Si ya no responde, puede seguir explicando convenciones, dependencias o rutas que merece la pena correlacionar con otras fuentes.
Unir presente e historia
Sección titulada «Unir presente e historia»Compara conjuntos, no páginas aisladas:
URLs actuales del crawl∪ URLs indexadas∪ URLs históricas− duplicados normalizadosConserva la procedencia de cada elemento después de la unión. Una ruta presente en las tres fuentes tiene evidencia distinta de otra que solo aparece en una captura de 2019. Los hostnames nuevos vuelven a información de dominios. Las rutas actuales alimentan el crawling y el análisis manual.
Cuando una URL histórica falla hoy, distingue NXDOMAIN, certificado inválido, redirección, 404, 403 y timeout. Cada señal cuenta una parte diferente de la retirada. La comparación sirve también para detectar cambios de proveedor o de arquitectura, aunque el contenido original ya no pueda reproducirse.