ArchiveBoxArchivo web

Archivo web autohospedado de código abierto

Preservar la web.En la infraestructura usted controla.

ArchiveBox guarda sitios web, marcadores, fuentes RSS, publicaciones sociales, medios, código fuente y material de investigación en archivos duraderos como HTML, PDF, PNG, TXT, JSON, WARC, MP4 y SQLite.

Ver capturas de pantalla ↗   ·   Ver demostración ↗




Insignia del MIT de código abierto Insignia de desarrollo activo Insignia de estrellas de GitHub Docker saca la insignia Insignia de instalaciones de PyPI Insignia de usuarios de la tienda Chrome
# Docker Compose es la configuración recomendada
$ mkdir -p ~/archivebox/data && cd ~/archivebox
$ curl -fsSL 'https://docker-compose.archivebox.io' > docker-compose.yml
$ ventana acoplable componer -d --esperar
-> inicializado ./data/index.sqlite3
ok escuchando en http://127.0.0.1:5797
$ 
Interfaz de usuario web de ArchiveBox que muestra páginas guardadas con miniaturas y formatos de captura ArchiveBox en iPhone, con su colección, etiquetas y conexión al servidor dentro de un marco de iPhone

Navega y guarda desde cualquier dispositivo.
Gratis, autohospedado, 0 análisis.

Snapshots grid — desktopSnapshot View (header collapsed) — desktopAI agent — desktopArchive results — desktopAdd URLs — desktopSnapshots table — desktopLogin — desktopPublic snapshot list — desktopSnapshot View (capture in progress) — desktopAdmin dashboard — desktopSnapshot admin detail — desktopSnapshot files — desktopArchive result detail — desktopTags — desktopTag detail — desktopUsers — desktopUser detail — desktopCrawls — desktopCrawl detail — desktopCrawl schedules — desktopCrawl schedule detail — desktopPersonas — desktopPersona detail — desktopMachines — desktopMachine detail — desktopNetwork interfaces — desktopNetwork interface detail — desktopBinaries — desktopBinary detail — desktopProcesses — desktopProcess detail — desktopAPI tokens — desktopAPI token detail — desktopWebhooks — desktopWebhook detail — desktopEnvironment — desktopConfiguration — desktopConfiguration detail — desktopDependencies — desktopDependency detail — desktopPlugins — desktopWorkers — desktopWorker detail — desktopLogs — desktopLog detail — desktopSnapshot View (singlefile) — desktopSnapshot View (screenshot) — desktopSnapshot View (wget) — desktopSnapshot View (dom) — desktopSnapshot View (pdf) — desktopSnapshot View (readability) — desktopSnapshot View (ytdlp) — desktopSnapshot View (responses) — desktopSnapshot View (chrome_mhtml) — desktopSnapshot View (defuddle) — desktopSnapshot View (mercury) — desktopSnapshot View (archivewebpage) — desktopSnapshot View (chrome) — desktopSnapshot View (consolelog) — desktopSnapshot View (dns) — desktopSnapshot View (sslcerts) — desktopSnapshot View (redirects) — desktopSnapshot View (headers) — desktopSnapshot View (seo) — desktopSnapshot View (accessibility) — desktopSnapshot View (htmltotext) — desktopSnapshot View (trafilatura) — desktopSnapshot View (liteparse) — desktopSnapshot View (parse_html_urls) — desktopSnapshot View (parse_txt_urls) — desktopSnapshot View (parse_dom_outlinks) — desktopSnapshot View (hashes) — desktopArchiveBox snapshot detail with a verified TLSNotary receipt and archived response
CLI Interfaz de usuario web REST API Ganchos web Extensión del navegador Acceso al sistema de archivos

Por qué ArchiveBox

Diseñado para hacer que sus datos archivados sean útiles hoy.

Guarda pestañas en segundos, las almacena durante décadas

Recopile marcadores para leer más tarde o conserve pruebas para casos legales con capturas verificables de nuestra Complemento de firma TLSNotary.

Etiqueta y busca millones de capturas al instante

Organice su colección con etiquetas y encuentre lo que necesita con la búsqueda de texto completo impulsada por sonic y ripgrep.

Extraer automáticamente medios incrustados a formatos estándar

Extraiga automáticamente audio, vídeo, archivos git, publicaciones en foros, metadatos de SEO y más en archivos ordinarios Puedes abrir y reutilizar.

Conéctese con otros sistemas fácilmente

Dile a tu IA que inspeccione una página con abx-dl, generar un feed RSS cada 24 horas u organizar rastreos complejos a través de MCP y el REST API.

para quien es

Potentes funciones para particulares, profesionales e instituciones.

Archiveros personales y autohospedadores

Guarde marcadores, historial del navegador, fuentes RSS, redes sociales, contenido de formularios, vídeos, podcasts, música, fotografías y colecciones de conocimientos personales.

  • Sea dueño de sus datos y guárdelos en un almacenamiento local o remoto que usted controle.
  • Utilice la extensión del navegador, la CLI, la interfaz de usuario web y las importaciones programadas juntas.
  • Exporte HTML estático o explore el sistema de archivos directamente.
Hoja para compartir de iPhone que confirma que se guardó una URL con etiquetas Hoja para compartir de Android que muestra un guardado exitoso, etiquetas sugeridas y confirmación de que las etiquetas se guardaron

abogados y periodistas

Guarde copias de artículos, material fuente y registros públicos, incluso después de que las páginas originales cambien o desaparezcan.

  • Almacene capturas de pantalla, archivos PDF, encabezados, archivos WARC y extracción de texto.
  • Etiqueta y revisa fuentes a través de la interfaz web autohospedada.
  • Utilice pruebas ZK con TLSNotario para demostrar la autenticidad del contenido.
Salida de TLSNotary que verifica una respuesta archivada en la página de detalles de la instantánea

Investigadores e instituciones

Apoye a OSINT, la investigación de redes sociales, los agentes de investigación impulsados ​​por IA, las bibliotecas, los gobiernos y los equipos de creación de colecciones.

  • Automatice las importaciones a través de CLI, API REST, webhooks y programaciones.
  • Mantenga metadatos legibles por máquina en JSON y SQLite.
  • Amplíe los canales de extracción a través del ecosistema ArchiveBox.
Opciones de profundidad de archivo, alcance de dominio y subruta, lista de direcciones URL permitidas y lista de direcciones URL denegadas en la página Agregar

Obtener ArchiveBox

Inicio rápido

Elija cómo desea ejecutar su archivo. Se recomienda Docker Compose para la mayoría de las instalaciones.

ArchiveBox — Inicio rápido
ArchiveBox en iPhone mostrando sus herramientas de colección y servidor
ArchiveBox para iPhone y iPad
1

Instalar ArchiveBox para iOS

Obtenga ArchiveBox.app para iOS

Abra el enlace TestFlight en su iPhone o iPad para instalar ArchiveBox.

2

Conecte su servidor

La guía de primera ejecución le ayuda a elegir un servidor o seleccionar ya tengo un servidor. Escanee el código QR de conexión desde ArchiveBox Server.app en su Mac, o ingrese la URL de su servidor y la clave API.

3

Guarda tu primer enlace

En Safari u otra aplicación, elija Compartir → ArchiveBox. Su servidor guarda la página para que pueda explorarla desde su teléfono.

Guía de configuración de iOS ↗

ArchiveBox en Android muestra su pantalla de inicio, servidor conectado y herramientas de recopilación
ArchiveBox para Android
1

Instalar ArchiveBox para Android

Obtenga ArchiveBox para Android

Los APK beta de Android aparecerán aquí cuando se publiquen. Abra el APK y permita la instalación desde su navegador si Android lo solicita.

2

Conecte su servidor

Utilice la guía de primera ejecución para elegir un servidor o seleccione ya tengo un servidor. En Configuración de conexión, ingrese la URL de su servidor y la clave API, luego verifique la conexión.

3

Guarda tu primer enlace

Elegir Compartir → ArchiveBox desde su navegador u otra aplicación, agregue etiquetas y guarde. Mantenga su servidor accesible para guardar y explorar páginas.

Guía de configuración de Android ↗

ArchiveBox.app
Aplicaciones
Configuración de conexión de ArchiveBox.app con un servidor local verificado
macOS 26+ · Apple Silicio
1

Descarga y abre la aplicación.

Obtenga ArchiveBox.app para macOS

Muévelo a Aplicaciones y ábrelo.

2

Siga la guía de configuración

Elegir Configurar en esta Mac en la guía de configuración, luego descargue y abra ArchiveBox Server.app. ¿Ya tienes un servidor? Conéctese con su URL y clave API.

3

Conecta tus aplicaciones

Utilice el Interfaz de usuario web, REST API, o CLI. Conecte el aplicación móvil, extensión del navegadory otros clientes que utilizan la URL de su servidor y la clave API.

Windows
ArchiveBox
Escritorio ArchiveBox para Windows
1

Instalar el escritorio Docker

Descargar Docker de escritorio e inícielo en su computadora. Mantenga Docker en ejecución mientras usa ArchiveBox.

2

Descargar ArchiveBox para Windows

Abra el instalador, inicie ArchiveBox y cree su cuenta de administrador. El primer lanzamiento prepara tu colección local.

3

Empezar a guardar

Agregue una URL en la aplicación para archivar su primera página.

Guía de aplicaciones de escritorio ↗

Docker Desktop
ArchiveBox Desktop en Linux muestra su colección de páginas guardadas, capturadas desde la aplicación empaquetada en CI
Escritorio ArchiveBox · Aplicación Real Linux
1

Instalar el escritorio Docker

Descargar Docker de escritorio e inícielo en su computadora. Mantenga Docker en ejecución mientras usa ArchiveBox.

2

Descargar ArchiveBox para Linux

Abra el instalador, inicie ArchiveBox y cree su cuenta de administrador. El primer lanzamiento prepara tu colección local.

3

Empezar a guardar

Agregue una URL en la aplicación para archivar su primera página.

Guía de aplicaciones de escritorio ↗

Docker Compose
ArchiveBox
Interfaz web de ArchiveBoxdocker-compose.yml
Recomendado
1

Docker Compose Recomendado

Compose mantiene su configuración en un solo archivo y facilita las actualizaciones. Instalar ventana acoplable, luego cree un directorio y obtenga la configuración.

mkdir -p ~/archivebox/data && cd ~/archivebox
curl -fsSL 'https://docker-compose.archivebox.io' > docker-compose.yml
2

Iniciar ArchiveBox

docker compose pull
docker compose up -d --wait

Una nueva colección se inicializa automáticamente.

3

Finalice la configuración y archive su primera página

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

docker compose exec archivebox archivebox add 'https://example.com'
Utilice Docker sin formato en su lugar docker run

¿Tiene un archivo de redacción? Conviértelo a docker run comandos con Descomponerizar.

1

Crea una colección e inicia el servidor.

Instalar ventana acoplable primero.

mkdir -p ~/archivebox/data && cd ~/archivebox/data
docker run -d --name archivebox -v "$PWD:/data" -p 5797:5797 archivebox/archivebox:dev
2

Finalizar la configuración

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

3

Archiva tu primera página

docker exec archivebox archivebox add 'https://example.com'
pip / uv
ArchiveBox
HTMLPDFPNGWARC
Paquete de Python
1

Instalar el paquete Python

instalar ultravioleta primero.

uv tool install --python 3.13 --prerelease explicit --upgrade 'archivebox>=0.9.0rc0,<0.10'
archivebox version
2

Crea una colección e inicia el servidor.

mkdir -p ~/archivebox/data && cd ~/archivebox/data
archivebox init
archivebox install
archivebox server 0.0.0.0:5797
3

Finalizar la configuración

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

O usar pip en lugar de uv
1

Instalar con pip

Con Python 3.13 instalado, cree un entorno virtual e instale ArchiveBox:

python3.13 -m venv ~/.venvs/archivebox
source ~/.venvs/archivebox/bin/activate
python -m pip install --upgrade 'archivebox>=0.9.0rc0,<0.10'
archivebox version

Luego siga los pasos 2 y 3 anteriores. En cada nueva terminal, ejecute source ~/.venvs/archivebox/bin/activate antes de usar archivebox.

apt
ArchiveBox
HTMLPDFPNGWARC
Ubuntu / Debian
1

Agregue el repositorio e instale

echo 'deb [trusted=yes] https://archivebox.github.io/debian-archivebox dev main' | sudo tee /etc/apt/sources.list.d/archivebox.list
sudo apt update
sudo apt install archivebox
(cd /tmp && archivebox version)
2

Crea una colección e inicia el servidor.

mkdir -p ~/archivebox/data && cd ~/archivebox/data
archivebox init
sudo archivebox install
archivebox server 0.0.0.0:5797
3

Finalizar la configuración

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

Homebrew
ArchiveBox
HTMLPDFPNGWARC
macOS / Linux
1

Instalar desde el grifo de ArchiveBox

Instalar cerveza casera primero. Ejecute estos comandos como su usuario normal, sin sudo.

brew tap archivebox/archivebox
brew trust archivebox/archivebox
brew install archivebox
archivebox version
2

Crea una colección e inicia el servidor.

mkdir -p ~/archivebox/data && cd ~/archivebox/data
archivebox init
archivebox install
archivebox server 0.0.0.0:5797
3

Finalizar la configuración

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

Arch Linux
FreeBSD
Nada
ArchiveBox
Paquetes comunitarios
1

Elige tu plataforma

Los paquetes comunitarios pueden ir por detrás de las versiones de Docker y Python.

Arch Linux (AUR)

yay -S archivebox

FreeBSD (atajo uv)

curl -fsSL 'https://get.archivebox.io' | bash

Nada

nix-env --install archivebox

Guix

guix install archivebox
2

Configura tu colección

Siga las instrucciones de configuración de su paquete, luego use el Guía de uso de CLI para inicializar y administrar su archivo.

$curl get.archivebox.io
| sh
ArchiveBox
Un comando para comenzar
1

Ejecute el script de configuración

curl -fsSL 'https://get.archivebox.io' | bash

Puede lee el guión antes de ejecutarlo.

2

Siga las indicaciones y finalice la configuración.

Siga las instrucciones del instalador para comenzar a utilizar su colección.

Abierto la interfaz de usuario del administrador para crear su primera cuenta de administrador y finalizar el asistente de configuración. En un servidor remoto, abra /admin/ en su nombre de host o IP.

ArchiveBox
NASServidor doméstico
En tu propio hardware
1

Elige tu plataforma

Las integraciones comunitarias pueden ir por detrás de las versiones de Docker y Python.

2

Instalar y abrir ArchiveBox

Siga la guía de instalación de la plataforma, configure el almacenamiento persistente y luego abra la aplicación para finalizar la configuración.

Para TrueNAS, consulte la Notas de la plataforma README antes de elegir una integración.

ArchiveBox
Tu servidorEn cualquier lugar
Alojamiento en la nube/VPS
1

Elige un proveedor

Consulte los planes actuales del proveedor, las versiones compatibles y las opciones de almacenamiento.

2

Implementar y finalizar la configuración

Utilice el flujo de implementación de ArchiveBox del proveedor, luego abra su instancia para crear una cuenta de administrador. Para un VPS no administrado, siga el inicio rápido de Docker Compose en su servidor.

URL guardadas de la extensión del navegador ArchiveBox
Guardar desde tu navegador
Chrome · Firefox · Edge · Safari
1

Instalar la extensión del navegador

2

Conecte su servidor ArchiveBox

Abra la página de configuración de la extensión, ingrese la URL de su servidor y la clave API, luego pruebe la conexión. Utilice una de las pestañas de instalación del servidor si aún no tiene un servidor.

3

guardar una página

Abra una página, haga clic en la extensión ArchiveBox y agregue sus etiquetas. También puedes importar marcadores e historial desde las opciones de la extensión.

Guía de extensión ↗

Configuración

Más de 50 complementos y opciones de configuración flexibles.

Explorar complementos y extractores ↗

ArchiveBox se puede configurar a través de la interfaz de usuario de administración, CLI, ArchiveBox.conf, o importando configuraciones y cookies desde Chrome u otros navegadores. El mismo modelo de configuración funciona en Docker, Docker Compose, instalaciones básicas, trabajos programados y ejecuciones CLI únicas.

Ajustar cómo se capturan las páginas

Usar TIMEOUT para redes lentas, CHECK_SSL_VALIDITY para sitios con certificados rotos, PUBLIC_INDEX, PUBLIC_SNAPSHOTS, y PUBLIC_ADD_VIEW para la política de publicación y la configuración del agente de usuario del navegador para sitios que bloquean bots obvios.

archivebox config
$ configuración de caja de archivo                         # ver configuración completa
$ configuración de archivebox --obtener CHROME_BINARY
$ configuración de archivebox --establecer TIMEOUT = 240
$ configuración de archivebox --set PUBLIC_INDEX=False
$ env CHROME_BINARY=archivo de cromo agregar 'https://example.com'

Dependencias y extractores.

ArchiveBox utiliza herramientas estándar como Chrome o Chromium, wget, curl, yt-dlp, git, SingleFile, Readability y analizadores de artículos. Docker agrupa estas dependencias para facilitar las actualizaciones y mejorar el aislamiento; Se pueden ejecutar instalaciones que no sean de Docker archivebox install y archivebox --version para comprobar lo que hay disponible.

Entradas y salidas

Integre con herramientas que ya utiliza.

Agregar URL a ArchiveBox

Importa URL desde cualquier lugar

Archivo una URL a la vez o programar importaciones de marcadores, historial del navegador, RSS, JSON, CSV, TXT, SQL, HTML, Markdown, Pocket, Pinboard, Instapaper, Shaarli, Wallabag, y más.

Guardar enlaces con nuestro extensión del navegador, o usar Mac y iPhone comparten menús, Siri y atajos.

Capturar cambios a lo largo del tiempo

Importaciones de archivos programadas

Importe nuevas URL y capture instantáneas según una programacióny luego compare instantáneas para ver cómo han cambiado los sitios.

Página guardada con múltiples formatos de captura.

Salidas

Capture cada página en varios formatos reutilizables:

Explorar un archivo en la interfaz de usuario web

Acceso

Utilice la misma colección dondequiera que trabaje:

Diseño, exportación y seguridad del disco

Explora tus capturas como archivos normales sin necesidad de ArchiveBox.

Sus capturas son HTML, imágenes, PDF y archivos multimedia normales. Ábrelos desde Finder, búscalos con cualquier herramienta de búsqueda del sistema de archivos, deja que los agentes de IA los exploren directamente y haz una copia de seguridad de ellos como archivos normales.

Diseñado para durar más de 100 años

Cada instantánea tiene una carpeta para cada método de captura. HTML vive en carpetas como dom/ y singlefile/; Las imágenes, los archivos PDF y los medios también tienen sus propias carpetas.

Los metadatos se almacenan en SQLite y JSON, con metadatos instantáneos junto con las salidas. La base de datos y la configuración de su colección se encuentran fuera de las carpetas de instantáneas y sus archivos siguen siendo legibles sin un servicio alojado.

Finder de macOS con las carpetas de fecha, news.ycombinator.com y instantáneas expandidas hasta dom/output.html, con el archivo HTML guardado seleccionado

Exportaciones estáticas y publicación.

Puede exportar el índice del archivo como HTML estático, JSON o CSV con archivebox list para que las colecciones se puedan revisar sin ejecutar el servidor web. Mantenga las exportaciones generadas junto al archive/ carpeta para que las rutas relativas de instantáneas sigan funcionando.

$ lista de cuadros de archivo --html --con-encabezados > index.html
$ lista de cuadros de archivo --json --con-encabezados > index.json
$ lista de cuadros de archivo --csv=marca de tiempo,url,título > index.csv
Página archivada renderizada a partir de HTML guardado

JavaScript archivado

ArchiveBox utiliza un Navegador Chrome durante el archivado para ejecutar JavaScript y capturar la página renderizada.

ArchiveWeb.page registra páginas para su reproducción, incluidos sus guiones y respuestas de la red. Reproduzca páginas capturadas con JavaScript usando ReplayWeb.page, visor de archivos de Webrecorder.

Detalles de la instantánea y tamaño del archivo guardado

Requisitos de almacenamiento

ArchiveBox puede utilizar aproximadamente de 1 GB a 50 GB por cada 1000 instantáneas, según la configuración de medios, vídeo, audio y extractor. Melodía YTDLP_ENABLED y YTDLP_MAX_SIZE para colecciones con muchos medios.

Mantener index.sqlite3 en almacenamiento local o SSD cuando sea posible. Grande archive/ Las carpetas pueden vivir NFS, SMB, FUSE, Respaldado por S3, o Almacenamiento en disco duro, pero es posible que sea necesario configurar Docker y archivos compartidos. ajustes de propiedad y calabazas de raíz. Evite sistemas de archivos más antiguos como EXT3 o FAT para archivos muy grandes.

Plan para archivos grandes

Antecedentes y motivación

Guarde una copia de la web que le interesa.

ArchiveBox existe porque la descomposición de los enlaces, la rotación de plataformas, la censura y la desaparición de los medios borran de forma rutinaria el conocimiento útil. El proyecto tiene como objetivo hacer que el contenido web que le interesa sea visible con software común dentro de 50 a 100 años, sin necesidad de ArchiveBox o un servicio de reproducción alojado para comprender sus archivos.

Panel de ArchiveBox autohospedado

Sea dueño de todos sus datos

Los archivos públicos centralizados son esenciales, pero no todas las páginas pertenecen a un servicio público global. ArchiveBox permite a individuos y organizaciones guardar material público o privado al que puedan acceder, conservarlo localmente o dentro de su institución y decidir qué publicar caso por caso.

Ejecútelo como una aplicación web Docker, use comandos CLI únicos o automatice con API mientras mantiene los datos públicos y privados claramente separados. Utilice archivos normales para copias de seguridad y exportaciones.

Contexto ético y legal

El archivado responsable depende de su jurisdicción, su caso de uso y su política de publicación. ArchiveBox es una herramienta; Los operadores siguen siendo responsables del manejo de datos privados, derechos de autor, solicitudes de DMCA o GDPR y requisitos legales locales.

Las instancias públicas deben publicar información de contacto y eliminación, evitar monetizar el contenido copiado y revisar la documentación de seguridad y publicación antes de exponer instantáneas a espectadores anónimos.

Comunidades y herramientas de archivo web relacionadas

¿Busca una gestión especializada de rastreo, reproducción o marcadores? Explore estos otros proyectos de archivo web.