---
title: "Internet Archive vs Common Crawl vs web archive"
slug: internet-archive-vs-common-crawl-vs-web-archive
date: 2026-08-23T07:17:12+00:00
modified: 2026-09-06T16:33:18+00:00
permalink: https://brightdata.es/blog/datos-web/internet-archive-vs-common-crawl-vs-web-archive
type: blog
---

[ Blog ](https://brightdata.es/blog "Blog") / [Datos web](https://brightdata.es/blog/datos-web)







 [Datos web](https://brightdata.es/blog/datos-web)

# Internet Archive vs Common Crawl vs web archive

Lo que almacenan Internet Archive y Common Crawl, el coste de una consulta y cuándo la recopilación en tiempo real de Bright Data es la mejor opción.

 26 min de lectura





 [ ![Satyam Tripathi](https://media.brightdata.es/2024/09/Satyam-Tripathi-50x50.png) ](https://brightdata.com/blog/authors/satyam-tripathi)

 [Satyam Tripathi

Technical Writer

 ](https://brightdata.com/blog/authors/satyam-tripathi)





 ![Internet Archive vs Common Crawl vs Web archive](https://media.brightdata.es/2026/08/Internet-Archive-vs-Common-Crawl-vs-Web-archive.png)





Consultamos el índice de Common Crawl `CC-MAIN-2026-30` para `theguardian.com` y obtuvimos 185 registros. Ninguno es un artículo. Cada registro es el propio `robots.txt` del sitio o una redirección hacia él, y ese archivo prohíbe el acceso a CCBot. La verificación de permisos es lo único que conservó el rastreo.

La Wayback Machine de Internet Archive y Common Crawl conservan copias de páginas que ya no existen, y responden preguntas distintas. La Wayback Machine reproduce una URL específica tal como lucía en la fecha que elijas. Common Crawl te entrega miles de millones de páginas como texto en bloque, sin reproducción. Un archivo web es la categoría a la que pertenecen ambos, no un tercer producto. En esa misma categoría se incluyen archivos web nacionales, servicios de suscripción como Archive-It, sitios de captura bajo demanda como archive.today y archivos WARC que tú mismo generas. Ambos servicios responden preguntas sobre el pasado; ninguno recopila un conjunto definido de sitios de forma continua.

## TL;DR

- CCBot no ejecuta JavaScript. Una página renderizada en el cliente llega como su esqueleto.
- Consulta primero Common Crawl para trabajo en bloque y Wayback para los faltantes; inviértelo si tienes una lista de URLs conocidas.
- Un `digest` CDX es el SHA-1 del payload, así que usa `collapse=digest` y `collapse=timestamp` para comparar en el índice antes de descargar. Common Crawl ignora `collapse`.
- Diseña un cliente CDX de Wayback a 24 solicitudes por minuto, el 80% del grupo compartido de 30/min.
- Ninguno publica una garantía de cobertura ni un SLA, y ningún servicio recopila un conjunto definido de sitios de forma continua. Mide tus dominios primero.

## What the Internet Archive and Common Crawl each store

Una captura de Wayback es accesible como `web.archive.org/web/<timestamp>/<url>`, y la misma URL puede tener miles de capturas a lo largo de tres décadas. La reproducción predeterminada reescribe los enlaces e inyecta una barra de herramientas para que la página se muestre en un navegador.

Cada rastreo mensual de Common Crawl es un conjunto de archivos WARC más archivos de texto y metadatos derivados, publicados en un bucket público. Un índice indica en qué rango de bytes de qué archivo se encuentra una URL determinada.

Wayback MachineCommon CrawlAlmacenacapturas de URLs individuales a lo largo del tiemporastreos mensuales completos, WARC más texto derivadoRespondeuna URL en múltiples fechasmuchas URLs de una fecha de rastreoReproducciónsí, con enlaces reescritos y una barra de herramientas inyectadaningunaBúsqueda de texto completoningunaninguna, pero los archivos WET te dan el texto para indexarExportación en bloqueninguna, acceso por APIel rastreo completo, gratis en un bucket públicoLímite de velocidad30 solicitudes por minuto, CDX y timemap compartidos, no publicado por Internet Archiveninguno publicado, “fuertemente limitado”Garantía de coberturaningunaninguna, y muestreado por rango de dominio[`CC-MAIN-2026-30`](https://commoncrawl.org/blog/july-2026-crawl-archive-now-available) se anuncia con 2.140 millones de páginas y 364 TiB de contenido sin comprimir en 40,5 millones de hosts, rastreados en 18 días. Common Crawl sitúa el corpus completo en más de 300.000 millones de páginas y describe la tasa en 3 a 5 mil millones de páginas nuevas al mes, aunque los últimos 18 rastreos publicados han quedado todos por debajo de los 3.000 millones. Dimensiona un trabajo a partir de un único rastreo.

Las preguntas frecuentes de Common Crawl indican: “Actualmente, JavaScript no se ejecuta y no se usan cookies”. CCBot almacena la respuesta HTTP sin procesar, por lo que una página renderizada en el cliente llega como su esqueleto. Si las páginas que te interesan generan su contenido en el navegador, verifica una captura antes de planificar con Common Crawl.

Cada rastreo incluye cinco conjuntos de archivos paralelos de 100.000 archivos cada uno. WARC lleva la respuesta completa, WAT lleva metadatos y enlaces extraídos, WET lleva solo texto plano, y otros dos llevan las capturas de `robots.txt` y las respuestas que no son 200. Un trabajo de grafo de enlaces que lee WARC mueve muchos más bytes de los necesarios.

Common Crawl no garantiza que revisite ninguna página, por lo que muchas URLs en muchas fechas es una pregunta que ningún servicio responde.

![Matriz dos por dos. Eje vertical de una fecha a muchas fechas, horizontal de una URL a muchas URLs. La Wayback Machine ocupa una URL en muchas fechas; Common Crawl muchas URLs de una fecha de rastreo; una URL en una fecha es trivial para ambos. El cuadrante restante, muchas URLs en muchas fechas, no lo cubre ninguno.](https://media.brightdata.com/2026/08/Hyu7W0SUGe.png)Las [preguntas frecuentes](https://commoncrawl.org/faq) de Common Crawl establecen la política de muestreo: el conjunto de datos “es una muestra de la web, y generalmente no archivamos ningún sitio web completo, sino un subconjunto seleccionado aleatoriamente”. El mecanismo está documentado en una [charla de ingeniería de Common Crawl](https://indico.cern.ch/event/1006978/contributions/4539477/attachments/2325769/3962907/ossym2021-sn-web-graphs-crawling.pdf) más que en las FAQ: la centralidad armónica a nivel de dominio define un presupuesto de cuántas URLs obtiene cada dominio, por lo que los dominios bien enlazados tienen un presupuesto mayor y los de bajo rango pueden no tener ninguno.

La Wayback Machine no tiene búsqueda de texto completo del contenido archivado. Su propia [página de ayuda](https://help.archive.org/help/using-the-wayback-machine/) indica que Internet Archive espera “implementar un motor de búsqueda de texto completo en algún momento futuro”. La búsqueda del sitio coincide con metadatos del sitio, no con el texto dentro de las páginas archivadas. Common Crawl te da el texto pero sin reproducción, por lo que una página reconstruida desde un archivo WET no lucirá como el original.

## What a domain lookup returns

Ejecutamos la misma consulta contra cinco dominios, con coincidencia de prefijo.

Dominio consultadoRegistros del índiceRegistros de `robots.txt`Páginas de contenido`nytimes.com/*`110`cnn.com/*`110`bbc.com/*`220`theguardian.com/*`1851850`github.blog/*`4.700494.651Los 185 registros de The Guardian se reducen a solo dos URLs: el `robots.txt` y su redirección `http`, recuperados a lo largo del rastreo. Un script que cuente registros del índice consideraría los cinco cubiertos y estaría equivocado en cuatro. De los 4.651 registros de contenido de `github.blog`, 3.647 respondieron con 200.

El tipo de coincidencia cambia el resultado. La canonicalización SURT incorpora `www.` al host base, pero una coincidencia de prefijo `domain/*` no alcanza ningún otro subdominio: `cnn.com/*` devolvió 1 registro mientras que `*.cnn.com` devolvió 11, y `nytimes.com/*` devolvió 1 frente a 2 para `*.nytimes.com`. Cada registro era una solicitud de `robots.txt` en ambos casos, pero los recuentos son una propiedad de la consulta tanto como del rastreo. Indica siempre tu tipo de coincidencia cuando reportes un número así.

La misma consulta fecha aproximadamente el bloqueo si la ejecutas contra IDs de rastreos más antiguos. La consulta tiene un punto ciego: ve lo que un editor escribió en `robots.txt`, no un bloqueo aplicado en el perímetro de red ni una exclusión posterior, por lo que se lee como un mínimo más que como un recuento. Nuestra [guía de robots.txt para scraping](/blog/how-tos/robots-txt-for-web-scraping-guide) explica cómo se resuelven los grupos de agentes.

El tamaño por rastreo también ha ido cayendo. Las [estadísticas de tamaño de rastreo publicadas](https://commoncrawl.github.io/cc-crawl-statistics/plots/crawlsize/monthly.csv) por Common Crawl muestran que el recuento mensual de páginas bajó de 3.031 millones en `CC-MAIN-2025-05` a 2.149 millones en `CC-MAIN-2026-30`, una caída del 29,1%. En los 29 rastreos desde `CC-MAIN-2024-10` hasta `CC-MAIN-2026-30`, los 10 rastreos de 2024 promedian 2.690 millones de páginas, los 12 de 2025 promedian 2.530 millones, y los 7 publicados en 2026 hasta julio promedian 2.150 millones.

![Gráfico de líneas de páginas por rastreo de Common Crawl que cae de 3.100 a unos 2.100 millones, con medias anuales punteadas en 2.690M para 2024, 2.530M para 2025 y 2.150M para los siete rastreos de 2026 hasta julio.](https://media.brightdata.com/2026/08/BkLVWAB8zx.png)Nada aquí identifica una causa: el tamaño del rastreo varía según la infraestructura, el presupuesto y la planificación interna de Common Crawl tanto como por lo que hagan los editores. La caída sí significa que un corpus dimensionado a partir de un rastreo de 2024 sobreestima uno de 2026 en aproximadamente un cuarto, y que los recuentos por rastreo no son acumulables. Los rastreos consecutivos vuelven a obtener gran parte del mismo conjunto de URLs, por lo que sumarlos sin deduplicar en `urlkey` y `digest` infla nuevamente la estimación.

### Check your own domains

El script cuenta registros de contenido frente a solicitudes de `robots.txt` para el rastreo publicado más reciente, usando la misma coincidencia de prefijo `domain/*` que la tabla. Recorre el índice página a página, rechaza una página cuyo truncamiento divide un registro en lugar de contar parte de uno, y continúa cuando un dominio nunca responde de forma limpia. Los dos dominios que aparecen a continuación tardan unos 70 segundos, casi todo en las pausas deliberadas:

```none
import http.client, json, time, urllib.error, urllib.parse, urllib.request

DOMAINS = ["theguardian.com", "github.blog"]
# Use your own contact address. One shared UA string arriving from many callers
# is the string an operator blocks.
UA = {"User-Agent": "coverage-check/1.0 (<a class="__cf_email__" data-cfemail="cab3a5bf8aafb2aba7baa6afe4a9a5a7" href="/cdn-cgi/l/email-protection">[email protected]</a>)"}

def latest_crawl():
    """Common Crawl ships roughly monthly. Hardcoding an ID measures a stale crawl
    and returns a number that looks current."""
    url = "https://index.commoncrawl.org/collinfo.json"
    info = urllib.request.urlopen(urllib.request.Request(url, headers=UA), timeout=60).read()
    return json.loads(info)[0]["id"]        # newest first

CRAWL = latest_crawl()
INDEX = f"https://index.commoncrawl.org/{CRAWL}-index"
print(f"crawl: {CRAWL}")

def fetch(params, tries=3):
    url = f"{INDEX}?{urllib.parse.urlencode(params)}"
    for attempt in range(tries):
        wait = None
        try:
            return urllib.request.urlopen(
                urllib.request.Request(url, headers=UA), timeout=120).read()
        except urllib.error.HTTPError as e:
            if e.code == 404:
                return None               # this crawl never captured the domain
            if e.code not in (429, 500, 502, 503, 504):
                raise
            wait = e.headers.get("Retry-After")   # the server's own number beats ours
        except (urllib.error.URLError, http.client.IncompleteRead, TimeoutError):
            pass                          # dropped connection
        time.sleep(int(wait) if wait and wait.isdigit() else 5 * 2 ** attempt)
    return b""

def coverage(domain):
    """(robots, content) for one domain, or None if the index never answered cleanly."""
    query = {"url": f"{domain}/*", "output": "json", "pageSize": 1}
    head = fetch({**query, "showNumPages": "true"})
    if head is None:
        return 0, 0
    if not head:
        return None
    robots = content = 0
    for page in range(json.loads(head)["pages"]):
        body = fetch({**query, "page": page})
        if not body:
            return None
        # CDXJ is one JSON object per line. Use split, not splitlines(): splitlines()
        # breaks on several characters that are not newlines, which cuts records in half.
        for line in body.split(b"\n"):
            if not line.strip():
                continue
            try:
                record = json.loads(line)
            except json.JSONDecodeError:
                return None               # the page arrived incomplete
            if record.get("url", "").rstrip("/").endswith("/robots.txt"):
                robots += 1
            else:
                content += 1
        time.sleep(5)
    return robots, content

for domain in DOMAINS:
    result = coverage(domain)
    if result is None:
        print(f"{domain}: no clean response")
    else:
        robots, content = result
        print(f"{domain}: {robots + content} records, {robots} robots.txt, {content} content")
    time.sleep(20)
```

Imprime:

```none
crawl: CC-MAIN-2026-30
theguardian.com: 185 records, 185 robots.txt, 0 content
github.blog: 4700 records, 49 robots.txt, 4651 content
```

Contra `CC-MAIN-2026-30` las dos líneas de dominio reproducen la tabla anterior. Un rastreo más reciente devuelve recuentos distintos; lo que debería mantenerse es la forma: solo robots para `theguardian.com` y con contenido para `github.blog`. Los registros sin páginas de contenido significan que el rastreo no conserva ningún contenido de página de ese dominio.

## How to query each source, and what the round trip costs

Ambos servicios exponen un índice CDX, pero los formatos de respuesta difieren: el servidor CDX de Wayback devuelve un array JSON de arrays, mientras que `output=json` de Common Crawl devuelve CDXJ, un objeto JSON por línea.

**El servidor CDX de Wayback devuelve una fila por captura**, y filtrar en el servidor mantiene la respuesta lo suficientemente pequeña para paginar:

```none
curl "https://web.archive.org/cdx/search/cdx?url=example.com&output=json&from=2026&limit=3&fl=timestamp,original,statuscode"
```

Eso devuelve:

```none
[["timestamp","original","statuscode"],
["20260101000936","http://www.example.com/","200"],
["20260101002937","https://example.com/","200"],
["20260101004445","https://example.com/","200"]]
```

Para analizar una página archivada en lugar de renderizarla, solicita la captura sin procesar. Añadir `id_` después del timestamp devuelve los bytes originales, sin barra de herramientas ni enlaces reescritos:

```none
curl -sL "https://web.archive.org/web/2026id_/https://example.com/" -o raw.html
curl -sL "https://web.archive.org/web/2026/https://example.com/"    -o rewritten.html
```

La copia reescrita lleva referencias inyectadas a `web.archive.org`, lo que puede romper selectores anclados en la estructura del DOM.

Más allá del tipo de coincidencia, dos campos en una fila CDX y un parámetro de consulta determinan qué coincide una consulta, si puedes detectar cambios y cuánto cuesta.

`urlkey` es la forma SURT de la URL. `https://github.blog/` se indexa como `blog,github)/`: host invertido, luego ruta. Las consultas de prefijo y rango operan sobre esa clave en lugar de la URL que escribiste, por eso el manejo de `www.` y el orden de los parámetros de consulta determinan si una consulta coincide con algo.

`digest` es el SHA-1 del payload, codificado en base32, y es el valor que el registro WARC lleva como `WARC-Payload-Digest`. Un digest hexadecimal no coincidirá con él. La detección de cambios es, por tanto, una operación de índice: dos filas que comparten un digest tienen los mismos bytes de payload.

`collapse` convierte eso en la consulta que realmente necesitas. Pedirle al servidor CDX de Wayback todas las capturas de `example.com` en el año 2024 devuelve 130.115 filas. La misma consulta con `collapse=timestamp:8` devuelve 366, una por día: los timestamps son `YYYYMMDDhhmmss`, así que truncar a ocho dígitos colapsa por fecha. Con `collapse=digest` devuelve 17.448, uno por cambio entre capturas adyacentes. El índice de Common Crawl acepta el parámetro y lo ignora, devolviendo las mismas filas de todas formas.

**La paginación mediante `page` y `pageSize` cuenta bloques del índice, no filas de resultados**, y el tamaño de bloque varía: dos bloques adyacentes en una consulta devolvieron 2.032 y 4.726 registros. Consultar el servidor CDX de Wayback para `bbc.com` con `matchType=domain` y `pageSize=1` reportó 28.257 páginas.

Una página puede volver vacía simplemente porque tus filtros no coincidieron con nada en esos bloques, lo que no significa que el conjunto de resultados haya terminado. El `pageSize` predeterminado es 1, y la documentación no indica un máximo.

El índice de Common Crawl pagina de la misma manera, con tres diferencias: `showNumPages` devuelve JSON en lugar de un número simple, el `pageSize` predeterminado es 5 en lugar de 1, y sus bloques tienen un tamaño diferente. Dimensiona un bucle a partir de `showNumPages` en lugar de un tamaño de bloque asumido, y solicita el recuento de páginas con el `pageSize` que vayas a usar, porque el recuento cambia con él.

Hay dos formas de iterar. La predeterminada es el modo límite, donde `limit` y una clave de reanudación recorren el conjunto de resultados; el modo paginado usa `page` y `pageSize` en su lugar. El modo paginado existe para que el recuento de páginas sea conocido de antemano y el trabajo se distribuya entre trabajadores. El modo límite generalmente hace menos solicitudes en total, pero en una URL raramente capturada en un rango de fechas amplio puede escanear lo suficiente como para agotar el tiempo.

**Common Crawl invierte el paso de obtención**, y la ventaja es que obtener una página cuesta una sola solicitud de rango en lugar de descargar un archivo. El índice te da un nombre de archivo, un offset de bytes y una longitud, por lo que una solicitud HTTP de rango devuelve un solo registro. Como CDXJ pone un objeto por línea, el código siguiente lee una línea en lugar de analizar todo el cuerpo:

```none
import gzip, json, urllib.error, urllib.parse, urllib.request

url = "https://example.com/"
crawl = "CC-MAIN-2026-30"
q = urllib.parse.quote(url, safe="")

# Common Crawl asks API clients for a properly formed UserAgent. Use your own.
ua = {"User-Agent": "coverage-check/1.0 (<a class="__cf_email__" data-cfemail="daa3b5af9abfa2bbb7aab6bff4b9b5b7" href="/cdn-cgi/l/email-protection">[email protected]</a>)"}

# Step 1: ask the index which WARC file and byte range holds this page.
index = f"https://index.commoncrawl.org/{crawl}-index?url={q}&output=json&limit=1"
try:
    req = urllib.request.Request(index, headers=ua)
    rec = json.loads(urllib.request.urlopen(req, timeout=60).read().split(b"\n")[0])
except urllib.error.HTTPError as e:
    if e.code != 404:
        # 502, 503 and 504 all mean try again later, not "not captured".
        # Treating them as a miss under-reports coverage.
        raise
    # A URL this crawl never captured returns 404. That is the normal case for a
    # blocked domain, not an error in your code.
    raise SystemExit(f"{url} is not in {crawl}")

# Step 2: fetch only those bytes.
offset, length = int(rec["offset"]), int(rec["length"])
warc = "https://data.commoncrawl.org/" + rec["filename"]
req = urllib.request.Request(warc, headers={**ua, "Range": f"bytes={offset}-{offset + length - 1}"})
record = gzip.decompress(urllib.request.urlopen(req, timeout=60).read())

print(record.decode("utf-8", "replace")[:400])
```

Eso devuelve un registro WARC comprimido con gzip que lleva las cabeceras de respuesta y el HTML de la página. En 29 registros de contenido que muestreamos, el tamaño comprimido fue de 7 a 45 KiB, por lo que la solicitud de rango mueve kilobytes de un archivo de aproximadamente 900 MiB. El mismo proceso funciona contra cualquier rastreo que liste el servidor de índice.

Para trabajo a escala de corpus, el [URL Index](https://commoncrawl.org/url-index) de Common Crawl distribuye el mismo índice como Parquet con columnas adicionales, publicado en `s3://commoncrawl/cc-index/table/cc-main/warc/` y consultable con DuckDB localmente o Athena en AWS. Common Crawl sitúa el índice columnar en aproximadamente 300 GB por rastreo mensual y un escaneo completo de Athena en unos $1,50 a partir de septiembre de 2025, por lo que la mayoría de las consultas filtradas cuestan menos. El acceso a los datos en sí es gratuito a través del programa AWS Open Data, y `data.commoncrawl.org` no requiere cuenta de AWS, aunque el egress de tu propio proveedor de nube sigue siendo tu responsabilidad.

## Rate limits and quotas you will hit

Las preguntas frecuentes de Common Crawl indican que el endpoint CDX “es frecuentemente abusado y por tanto está fuertemente limitado”. Un HTTP 503 significa que debes reducir la velocidad, y una IP temporalmente bloqueada debe esperar 24 horas. La guía también pide que duermas entre llamadas, evites múltiples hilos desde una IP, evites redes de Proxy y envíes un `User-Agent` correctamente formado, que sus FAQ vinculan al RFC 9110. La cláusula sobre Proxy es la que merece más atención. Las instrucciones de bloqueo y de hilos de las FAQ están dirigidas a la IP, por lo que distribuir un trabajo entre más direcciones sortea el límite en lugar de respetarlo, y la escalada es un bloqueo de la dirección en lugar de más respuestas 503.

Internet Archive publica cuotas para Save Page Now y prácticamente nada para las APIs de lectura. La [especificación de Save Page Now 2](https://docs.google.com/document/d/1Nsv52MvSjbLb2PCpHlat0gkzw0EvtSgpKHu4mk0MnrA/) establece estos límites:

LímiteAutenticadoAnónimoCapturas por minuto73Capturas por día30.000200Bytes archivados por día5 GB2 GBCapturas de la misma URL por día55La especificación no menciona ningún nivel de pago por encima de estos números y dirige a los usuarios con mayor demanda a contactar a Internet Archive por correo electrónico. La especificación da la cifra anónima tanto como 2 GB como 500 MB, y su registro de cambios redujo la cifra autenticada a 4 GiB mientras la tabla aún dice 5 GB.

Para las APIs de lectura, las cifras provienen de fuera de Internet Archive. El mantenedor del cliente Python `wayback` [documentó una conversación](https://github.com/edgi-govdata-archiving/wayback/issues/205) con el personal de Internet Archive y codificó el resultado como los valores predeterminados de la biblioteca. El documento no es una publicación de Internet Archive.

Los endpoints `/cdx/search/cdx` y `/web/timemap/` son ahora un solo servicio en los mismos servidores, diferenciándose solo en cómo leen el parámetro `output`, y comparten un único grupo de límite de velocidad. Ese grupo es de 30 solicitudes por minuto entre ambos. El documento no indica si el contador está vinculado a una dirección o a una cuenta, por lo que un trabajo distribuido entre trabajadores no puede asumir que el presupuesto se multiplica. El endpoint de memento sirve la reproducción y utiliza un grupo separado.

La biblioteca codifica esos límites como sus valores predeterminados, `0.8 * 30 / 60` para CDX y `0.8 * 600 / 60` para reproducción, tras pedir el personal de Internet Archive que los clientes se sitúen al 80% de los límites máximos. Eso es 24 solicitudes por minuto en lugar de 30, y 480 para reproducción. Diseña con esos valores, no con los máximos.

El endpoint de disponibilidad en `archive.org/wayback/available` es un tercer servicio sin límite publicado propio, así que trátalo como limitado en lugar de libre. Respeta `Retry-After` cuando la respuesta lo incluya. Cuando no lo incluya, el cliente `wayback` pausa 60 segundos antes de intentarlo de nuevo.

## Why archive.today captures cannot be verified on their own

archive.today renderiza páginas en un navegador en el momento de la captura e ignora `robots.txt`, por lo que contiene páginas que la Wayback Machine no tiene. Los flujos de trabajo de citación adoptaron archive.today por esa cobertura.

archive.today almacena HTML mutable en lugar de WARC, por lo que no hay digest del payload ni nada dentro de la captura para verificarlo. Se presentaron evidencias de que sus operadores alteraron páginas archivadas, y Wikipedia deprecó el sitio y lo añadió a la lista negra de spam. La [declaración final](https://en.wikipedia.org/wiki/Wikipedia:Archive.today_guidance) se basa en un fundamento diferente: indica que el sitio incrustó código que convirtió los navegadores de los visitantes en un ataque de denegación de servicio contra un blog, y trata las instantáneas alteradas como algo adicional.

Verifica nuevamente cualquier cosa que ya cites de archive.today contra una segunda fuente. El mismo registro indica que el código seguía presente en junio de 2026 con una tasa de llamadas reducida, y recomienda a quienes necesiten el sitio que lo carguen detrás de un bloqueador de contenido.

## National archives, formats, and replay tools

**Arquivo.pt:** el archivo web nacional portugués tiene una API de búsqueda de texto completo que la Wayback Machine no posee. Un `GET` a [`arquivo.pt/textsearch`](https://github.com/arquivo/pwa-technologies/wiki/APIs) devuelve JSON con un `linkToExtractedText` por resultado, así que omites el parseo de HTML por completo. La API es gratuita y no requiere clave, y el límite documentado es de 250 solicitudes por 60 segundos desde una IP, compartido entre búsqueda de texto completo y búsqueda de URL sin presupuesto separado. Superar ese límite está documentado como motivo de bloqueo permanente, mientras que el bloqueo de Common Crawl es temporal. La cobertura está centrada en Portugal, y la latencia es variable, de menos de 3 segundos a 18 en tres consultas de un solo resultado, así que configura el timeout del cliente en 30 segundos.

**WARC y WACZ:** WARC es el contenedor de archivo, estandarizado como [ISO 28500:2017](https://www.iso.org/standard/68004.html), que cubre WARC 1.1. No existe WARC 1.2. [WACZ](https://specs.webrecorder.net/wacz/1.1.1/) empaqueta registros WARC con un índice CDX para que un navegador pueda reproducirlos sin servidor. Hay un borrador 1.2.0 disponible, pero `wacz/latest` aún sirve 1.1.1, así que implementa contra 1.1.1.

**Browsertrix:** cuando necesitas capturas que controles tú mismo, el crawler de Webrecorder produce archivos WACZ que se reproducen en un navegador a través de ReplayWeb.page sin servidor. Los planes alojados comienzan en $30 al mes para el plan básico, y el crawler es de código abierto si prefieres ejecutarlo tú mismo.

## How to choose

Comienza por la forma de la pregunta: URLs específicas, texto en bloque, o una propiedad que ningún servicio ofrece.

**Usa la Wayback Machine cuando la URL y la fecha son el punto central.** Recuperar una página eliminada, demostrar lo que un sitio decía antes de una edición, rastrear una página de producto a lo largo del tiempo, o reconstruir un conjunto de documentación desaparecido. Ninguna otra opción de propósito general iguala su profundidad temporal en URLs individuales, aunque un archivo nacional puede igualarlo dentro de su propio ámbito.

Si el uso es probatorio, presupuesta más que la captura. Los tribunales de EE. UU. han admitido capturas de Wayback, pero una impresión sola rara vez es suficiente, porque las capturas no se autentican por sí mismas. Una declaración de Internet Archive es la vía que los tribunales han aceptado, y a las tarifas publicadas a principios de 2025 cuesta $250 por solicitud más $20 por cada URL, o $30 para URLs que contengan un archivo descargable como un PDF.

**Usa Common Crawl cuando quieras muchas páginas y no importe cuáles.** Corpus de idiomas, preentrenamiento de modelos, análisis de grafo de enlaces, investigación de seguridad en muchos hosts, y cualquier medición donde una muestra sesgada por rango sea aceptable. La mayoría de los grandes corpus de preentrenamiento abiertos se basan en él, incluyendo C4, RefinedWeb, FineWeb y Dolma. Si quieres un corpus en lugar del rastreo sin procesar, esos derivados y sus licencias merecen leerse primero, y nuestra [revisión de fuentes de datos de entrenamiento para LLM](/blog/web-data/llm-training-data) es un punto de partida. No lo uses para garantizar cobertura de un sitio específico, porque la política de muestreo hace la cobertura impredecible.

Un [estudio](https://arxiv.org/abs/2605.00087) de Sichang Steven He y colegas clasificó unos 100.000 sitios en Common Crawl y encontró que el 6,0% de ellos estaba dominado por texto generado con poca participación humana. Entre los sitios vistos por primera vez en la primera mitad de 2025, la proporción era del 29,4%, frente al 2,1% entre los sitios vistos por primera vez a finales de 2022.

Lee el 6,0% y el 29,4% como probables subestimaciones. Los autores reportan una fuerte correlación negativa entre la precisión de su clasificador y la puntuación de referencia del modelo que generó un sitio, por lo que la proporción que el clasificador no detecta crece a medida que los generadores mejoran.

**Usa un archivo nacional o propio cuando necesites una propiedad que ningún servicio ofrece.** Búsqueda de texto completo sobre contenido archivado, capturas que controles de principio a fin, o páginas renderizadas en el cliente que se reproducen mal en otros lugares.

archive.today queda excluido por un motivo diferente: una captura que puede cambiar después del hecho no puede sostenerse por sí sola como evidencia.

Para trabajo en bloque en muchos hosts, consulta primero Common Crawl por amplitud y coste, luego recurre a la Wayback Machine para lo que el rastreo no capturó. Para una lista de URLs conocidas, hazlo al revés: la mayoría de las búsquedas en Common Crawl no encontrarán nada, y cada búsqueda gasta una solicitud contra un índice cuya penalización documentada por uso excesivo es un bloqueo de 24 horas. Y cuando un dominio es importante para tu trabajo a largo plazo, ejecuta tus propias capturas con un crawler que produzca WARC en paralelo, porque esa es una copia cuya disponibilidad controlas tú.

Ejecutar tu propio crawler implica costes de almacenamiento, infraestructura de reproducción y una carga de mantenimiento que ningún servicio público te cobra, así que ejecútalo tú mismo donde perder el acceso rompería algo, y apóyate en los archivos públicos o en la colección comprada para el resto.

## When you need collection instead of an archive

Ningún servicio está diseñado para recopilar un conjunto definido de sitios según un calendario. Save Page Now sí recopila bajo demanda, y funciona a 7 capturas por minuto cuando está autenticado, 3 cuando no lo está.

Los cuatro dominios de noticias que consultamos no tenían páginas de contenido en `CC-MAIN-2026-30`. Ninguno publica una garantía de cobertura, un SLA ni un compromiso de soporte contra el que puedas escalar.

Cuando necesitas sitios específicos recopilados según un calendario, con la cobertura que tú defines, eso es un producto de recopilación y no un archivo. El rastreo descubre lo que hay disponible; la recopilación dirigida devuelve páginas conocidas bajo demanda. Nuestra [guía de rastreo vs scraping](/blog/leadership/web-crawling-vs-web-scraping) explica la diferencia en detalle.

Pagar por la recopilación no compra una exención del bloqueo. Los editores restringen los crawlers comerciales igual que los de archivo; un proveedor cambia quién asume el mantenimiento cuando un sitio cambia sus defensas.

Bright Data vende recopilación dirigida: la [Web Scraper API](/products/web-scraper) a $1 por 1.000 registros, con los primeros 5.000 de cada mes gratuitos, y [conjuntos de datos](/products/datasets) listos desde $0,0025 por registro con un mínimo de $250. Ambos cubren sitios compatibles de forma continua. Ninguno reemplaza a la Wayback Machine, y la razón es un rango de fechas: los datos precopilados se remontan días o meses, no a 1996, por lo que una pregunta sobre lo que decía una página en 2014 sigue siendo para el archivo.

## Next steps

Ejecuta el script de cobertura en los dominios que te interesan, luego verifica los mismos dominios en el servidor CDX de Wayback para la densidad de capturas.

Los registros de contenido indican si el trabajo en bloque es posible; la densidad de capturas indica si el historial a nivel de URL es posible. Un recuento saludable es una lectura, no un compromiso: la política de muestreo no garantiza ningún mínimo, y los totales por rastreo han caído aproximadamente un cuarto desde 2024, así que vuelve a ejecutar la verificación antes de depender de ella.

Captura lo que importa ahora donde perder el acceso rompería algo, compra la recopilación para el resto, guarda lo que captures en WARC para que sea portable, y trata ambos archivos públicos como fuentes que consultas en lugar de almacenamiento del que dependes.

## Frequently asked questions

### ¿Puedo usar Common Crawl comercialmente?

Los términos de uso lo permiten y colocan el riesgo en ti. Common Crawl limita su responsabilidad total a $100 y te exige indemnizarlo por reclamaciones derivadas del uso de contenido rastreado para desarrollar, entrenar o implementar sistemas de IA. Common Crawl recomienda asesoramiento legal antes de cualquier uso comercial.

### ¿Se pueden descargar todos los datos de la Wayback Machine?

No en bloque. Internet Archive no publica ninguna exportación masiva del archivo web general, y el acceso se realiza a través de APIs con límite de velocidad. Para análisis a escala de investigación, Internet Archive ofrece ARCH, su plataforma de cómputo, que es solo por cotización y no tiene precios publicados.

### ¿A qué velocidad debo diseñar un cliente CDX de Wayback?

Diseña contra 24 solicitudes por minuto. El límite es de 30 por minuto, que Internet Archive no publica, compartido entre los endpoints CDX y timemap desde que se convirtieron en un solo servicio, y el cliente `wayback` incluye el 80% de eso como valor predeterminado. La reproducción es un grupo separado de 600 por minuto, así que diseña contra 480 allí.

### ¿Por qué una búsqueda de dominio en Common Crawl devuelve registros pero sin contenido?

Porque esos registros son solicitudes de `robots.txt`. CCBot solicita `robots.txt` de cada host que toca, y cuando un sitio lo prohíbe, esa solicitud y cualquier redirección a ella son todo lo que el rastreo conserva. Clasifica las URLs devueltas antes de concluir que un dominio está cubierto, e indica tu tipo de coincidencia, porque una consulta de prefijo y una de dominio pueden devolver recuentos diferentes.



Contactar ventasPrueba gratuita![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Tabla de Contenidos













 [ ](https://news.ycombinator.com/submitlink?t=Internet+Archive+vs+Common+Crawl+vs+web+archive&u=https://brightdata.es/blog/datos-web/internet-archive-vs-common-crawl-vs-web-archive) [ ](https://www.linkedin.com/shareArticle?mini=true&title=Internet+Archive+vs+Common+Crawl+vs+web+archive&url=https://brightdata.es/blog/datos-web/internet-archive-vs-common-crawl-vs-web-archive) [ ](http://www.reddit.com/submit?title=Internet+Archive+vs+Common+Crawl+vs+web+archive&url=https://brightdata.es/blog/datos-web/internet-archive-vs-common-crawl-vs-web-archive)







##  Usted también puede estar interesado en

 [ ![OpenHuman with Bright Data](https://media.brightdata.es/2026/09/OpenHuman-with-Bright-Data.png) ](https://brightdata.es/blog/ai/openhuman-with-bright-data "Acceso Web Listo para Producción en OpenHuman a Través de la CLI de Bright Data")

 [AI



 ![Antonello Zanini](https://media.brightdata.es/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Acceso Web Listo para Producción en OpenHuman a Través de la CLI de Bright Data

Integra la CLI de Bright Data con OpenHuman para habilitar acceso web listo para producción y recopilación de datos para agentes de IA.



 09-Sep-2026

 14 min de lectura

 ](https://brightdata.es/blog/ai/openhuman-with-bright-data)

 [ ![Multimodal Web Scraping with MiniMax](https://media.brightdata.es/2026/09/Multimodal-Web-Scraping-with-MiniMax.png) ](https://brightdata.es/blog/datos-web/multimodal-web-scraping-with-minimax "Scraping Web Multimodal con MiniMax")

 [Datos web



 ![Antonello Zanini](https://media.brightdata.es/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Scraping Web Multimodal con MiniMax

Combina Bright Data Web Unlocker con la visión de MiniMax M3 para extraer datos estructurados de imágenes y capturas de pantalla de páginas web.



 09-Sep-2026

 5 min de lectura

 ](https://brightdata.es/blog/datos-web/multimodal-web-scraping-with-minimax)

 [ ![The 10 Best CLI Tools for Codex in 2026](https://media.brightdata.es/2026/08/The-10-Best-CLI-Tools-for-Codex-in-2026.png) ](https://brightdata.es/blog/ai/best-cli-tools-for-codex "Las 10 mejores herramientas CLI para Codex en 2026 – Probadas y clasificadas")

 [AI



 ![Daniel Shashko](https://media.brightdata.es/2022/04/Daniel-Shashko-2-50x50.png)

Daniel Shashko

Web Data &amp; AI Expert





### Las 10 mejores herramientas CLI para Codex en 2026 – Probadas y clasificadas

Las 10 herramientas CLI que hacen a Codex más rápido y capaz, comenzando con la Bright Data CLI para acceso web real desde dentro del sandbox.



 06-Sep-2026

 24 min de lectura

 ](https://brightdata.es/blog/ai/best-cli-tools-for-codex)
