AI

Acceso a Datos Web Empresariales en DeerFlow con Bright Data

Integra Bright Data en DeerFlow para acceso web empresarial, permitiendo a los agentes de IA buscar y recuperar datos web a escala de forma fiable.
16 min de lectura
DeerFlow with Bright Data

En este artículo, aprenderás:

  • Qué es DeerFlow y qué ofrece como plataforma para tareas de largo alcance.
  • Por qué Bright Data es una excelente opción para las capacidades de búsqueda y recuperación web.
  • Cómo integrar Bright Data en DeerFlow a través del Bright Data MCP.

¡Comencemos!

¿Qué es DeerFlow?

DeerFlow

DeerFlow es una plataforma de agentes de IA de código abierto desarrollada por ByteDance. Orquesta subagentes, memoria, habilidades, herramientas y entornos de prueba para ayudarte a gestionar tareas complejas con IA.

Puedes interactuar con DeerFlow directamente a través de su aplicación web o mediante plataformas de mensajería como Telegram y WeChat a través de su pasarela de mensajería.

DeerFlow está especializado en cargas de trabajo de largo alcance. Admite casos de uso como investigación profunda, programación, pipelines de datos, generación de informes y creación de contenido. El proyecto es completamente de código abierto y cuenta con más de 79k estrellas en GitHub.

Características Principales

Las capacidades principales que admite DeerFlow son:

  • Habilidades y herramientas: Capacidades extensibles para investigación, informes, diapositivas, páginas web, generación de imágenes y más.
  • Subagentes: Genera agentes especializados con contextos, herramientas y condiciones de terminación aislados para tareas complejas.
  • Ejecución en sandbox: Proporciona a los agentes entornos aislados para leer, escribir, editar y ejecutar archivos y comandos.
  • Navegador agéntico: Permite a los agentes navegar por sitios web, hacer clic, escribir, enviar formularios e interactuar con páginas dinámicas.
  • Acceso web: Proporciona herramientas de búsqueda web, recuperación y captura de páginas renderizadas.
  • Memoria a largo plazo: Almacena preferencias de usuario, perfiles y conocimiento acumulado entre sesiones.
  • Ingeniería de contexto: Resume el trabajo completado y descarga resultados intermedios para mantener el contexto de manera eficiente.
  • Soporte MCP: Conecta servidores MCP externos para ampliar las herramientas y capacidades del agente.
  • Tareas programadas: Ejecuta tareas recurrentes o únicas automáticamente mediante programaciones basadas en cron.
  • Canales de mensajería: Permite a los usuarios interactuar con agentes a través de Telegram, Slack, Discord, Feishu, DingTalk, WeChat y más.
  • Observabilidad: Se integra con LangSmith, Langfuse y Monocle para rastrear ejecuciones de agentes, herramientas y llamadas a LLM.
  • Cliente integrado: Proporciona un cliente Python para integrar DeerFlow directamente en aplicaciones.

Más información en la documentación oficial.

Bright Data como Motor de Búsqueda y Recuperación Web de DeerFlow

Entre las múltiples funcionalidades de DeerFlow, encontrarás herramientas integradas de búsqueda y recuperación web. Estas herramientas permiten al agente de IA interno buscar nuevas fuentes en línea y acceder a su contenido para el anclaje web.

Esto es esencial para superar el límite de conocimiento de los LLMs. También permite al agente de IA realizar tareas utilizando datos web actualizados para obtener respuestas más precisas. Para proporcionar las herramientas de búsqueda y recuperación web, DeerFlow se integra con algunas soluciones de API SERP y búsqueda web como Firecrawl, Brave y DuckDuckGo.

Sin embargo, estos proveedores pueden no estar siempre listos para uso empresarial. Pueden carecer de soporte para búsquedas multilingües, múltiples motores de búsqueda, o acceso fiable a sitios web sin ser bloqueados. Algunos también pueden carecer de resolución de CAPTCHA y una amplia red de Proxy de IPs.

¡Es exactamente aquí donde Bright Data puede ayudar!

Bright Data se diferencia de los proveedores web integrados de DeerFlow gracias a su infraestructura global, que incluye más de 400 millones de IPs residenciales. Esta arquitectura proporciona la escalabilidad, las capacidades anti-bot y el rendimiento necesarios para flujos de trabajo de datos web reales. Admite concurrencia ilimitada, ofrece un tiempo de actividad del 99,99% y logra una tasa de éxito del 99,95%.

Bright Data MCP como la Solución

La forma más sencilla de conectar DeerFlow a las herramientas web de Bright Data es a través del Bright Data MCP.

El Bright Data MCP proporciona más de 70 herramientas, cada una impulsada por los productos basados en API de Bright Data. Incluso en el modo Rapid (nivel gratuito con 5.000 solicitudes por mes), obtienes herramientas útiles para búsqueda web, scraping y descubrimiento de fuentes:

Herramienta Descripción
search_engine + versión especial para solicitudes paralelas (search_engine) Recupera resultados de motores de búsqueda como Google, Bing, Yandex y más.
scrape_as_markdown + versión especial para solicitudes paralelas (scrape_batch) Convierte páginas web en Markdown limpio mientras gestiona la protección anti-bot.
discover Realiza búsquedas impulsadas por IA y devuelve resultados web relevantes y clasificados.

Para acceder a las más de 70 herramientas, debes activar el modo Pro. Esto desbloquea herramientas de extracción de datos estructurados para plataformas como Amazon, LinkedIn, Instagram, YouTube, Zillow y Google Maps, además de más de 40 otros sitios web. También incluye herramientas de automatización de navegador impulsadas por la API de Navegador de Bright Data.

Cómo Integrar el Bright Data MCP en DeerFlow

En esta sección paso a paso, aprenderás cómo configurar el Bright Data MCP en DeerFlow.

La integración de Bright Data otorga a los agentes de IA de DeerFlow la capacidad de buscar en la web, descubrir nuevas fuentes, hacer scraping de páginas web e interactuar con contenido web sin preocuparse por los bloqueos anti-bot.

¡Sigue los pasos a continuación!

Requisitos Previos

Para seguir esta sección del tutorial, asegúrate de tener:

Aunque no es estrictamente necesario, también se recomienda tener:

Paso #1: Instalar DeerFlow

Crea una carpeta para tu instalación de DeerFlow, inicia una sesión local del agente de programación dentro de ella y ejecuta el siguiente prompt:

Help me clone DeerFlow if needed, then bootstrap it for local development by following https://raw.githubusercontent.com/bytedance/deer-flow/main/Install.md

Esta es la forma más sencilla de instalar DeerFlow.

El agente de IA de programación descargará el archivo Markdown que contiene las instrucciones de instalación del repositorio de DeerFlow. Luego, las seguirá para instalar y configurar DeerFlow localmente.

Si te faltan requisitos previos, el agente te proporcionará los comandos necesarios para instalarlos. Ejecuta esos comandos en otra ventana de terminal y luego continúa la conversación con tu agente de IA.

Al final del proceso, deberías ver una salida similar a esta:

La salida producida por el agente de IA tras la instalación de DeerFlow

Tu carpeta de instalación debería contener ahora un proyecto DeerFlow con una estructura similar a:

<your_deerflow_installation_folder>
├── backend/
├── contracts/
├── deploy/
├── docker/
├── docs/
├── frontend/
├── logs/
├── plans/
├── pr-build/
├── scripts/
├── skills/
├── temp/
├── tests/
├── AGENTS.md
├── CHANGELOG.md
├── CHANGELOG_zh.md
├── CLAUDE.md
├── CODE_OF_CONDUCT.md
├── CONTRIBUTING.md
├── Install.md
├── LICENSE
├── Makefile
├── README.md
├── README_fr.md
├── README_ja.md
├── README_ru.md
├── README_zh.md
├── RELEASING.md
├── SECURITY.md
├── config.example.yaml
├── deer-flow.code-workspace
└── extensions_config.example.json

Dos archivos especialmente importantes son:

  • extensions_config.example.json: Un archivo JSON de muestra para configurar las extensiones de DeerFlow a través de servidores MCP o habilidades.
  • config.example.yaml: Un archivo de configuración de muestra para configurar integraciones LLM, directorios de habilidades y muchas otras opciones que permiten personalizar el comportamiento del agente de IA de DeerFlow.

¡Bien hecho! DeerFlow ya está instalado localmente.

Paso #2: Configurar DeerFlow

Ahora, en la carpeta de instalación de DeerFlow, ejecuta el siguiente comando para configurar la plataforma:

make setup
Iniciando la configuración de DeerFlow

Esto inicia un asistente de configuración CLI interactivo que te guía a través de varios pasos de configuración. El primero es elegir un proveedor LLM.

Nota: DeerFlow recomienda encarecidamente usar Doubao-Seed-2.0-Code, DeepSeek V3.2 y Kimi 2.5.

Sin embargo, aquí verás cómo integrar DeerFlow con OpenAI. Comienza seleccionando “OpenAI” como proveedor LLM objetivo:

Seleccionar un proveedor OpenAI

Continúa eligiendo un modelo (p. ej., gpt-5-mini). Luego, introduce tu clave API de OpenAI. DeerFlow empleará entonces el modelo OpenAI seleccionado para impulsar su agente de IA.

A continuación, se te preguntará si deseas configurar opcionalmente una de las herramientas integradas de búsqueda y recuperación web:

Omitir la configuración de búsqueda y recuperación web

En ambos casos, selecciona la opción “Skip for now”, ya que el Bright Data MCP proporcionará esta funcionalidad.

Continúa seleccionando una política de ejecución y seguridad. También puedes integrar opcionalmente un canal de mensajería. Al final, el proceso de configuración generará un archivo config.yaml mínimo necesario para iniciar DeerFlow y almacenará tus claves API en .env.

¡Excelente! Ya estás listo para lanzar DeerFlow.

Paso #3: Iniciar el Frontend de DeerFlow

En la carpeta de instalación de DeerFlow, ejecuta el siguiente comando para instalar las dependencias del frontend y del backend:

make install

Luego, inicia un servidor de desarrollo local con:

make dev

Deberías obtener una salida similar a esta:

La salida del comando

DeerFlow se ejecutará ahora localmente con:

  • Gateway: El backend de la aplicación, ejecutándose en el puerto 8001
  • Frontend: Ejecutándose en el puerto 3000, con un proxy inverso gestionado por Nginx en el puerto 2026.

Para acceder al frontend de DeerFlow, abre la siguiente URL en tu navegador:

http://localhost:2026

Deberías ver:

La vista de

Ten en cuenta que el frontend local comparte la misma interfaz de usuario que el sitio web oficial de DeerFlow.

Haz clic en “Get Started with 2.0” para acceder a tu espacio de trabajo de DeerFlow. La primera vez que accedas al espacio de trabajo, se te pedirá que crees una cuenta de administrador.

Completa el formulario de registro para crear tu cuenta local:

El formulario para crear una cuenta local de DeerFlow

A continuación, inicia sesión para acceder al espacio de trabajo de DeerFlow:

El frontend de DeerFlow

Desde aquí, puedes interactuar con el agente DeerFlow y explorar los servidores MCP configurados, habilidades, canales de mensajería y otras configuraciones. ¡Increíble!

Paso #4: Familiarizarse con el Bright Data MCP

Antes de conectar el Bright Data MCP a DeerFlow, verifica que el servidor MCP se ejecuta en tu máquina.

Comienza instalando el paquete Bright Data MCP de forma global a través del paquete npm @brightdata/mcp:

npm install -g @brightdata/mcp

Verifica que el servidor MCP se inicia correctamente con:

API_TOKEN="<YOUR_BRIGHT_DATA_API>" npx -y @brightdata/mcp

Reemplaza <YOUR_BRIGHT_DATA_API> con tu clave API de Bright Data. Esto establece la variable de entorno API_TOKEN requerida e inicia el servidor Bright Data MCP localmente. Para más detalles, consulta la documentación del Bright Data MCP.

Si todo está configurado correctamente, deberías ver registros de inicio similares a estos:

Registros de inicio del Bright Data MCP

Ten en cuenta que, en su primera ejecución, el paquete @brightdata/mcp crea automáticamente dos APIs en tu cuenta de Bright Data:

  • mcp_unlocker: Se conecta a la API Web Unlocker de Bright Data (y a la API SERP).
  • mcp_browser: Se conecta a la API de Navegador de Bright Data.

Estas APIs impulsan las más de 70 herramientas disponibles a través del Bright Data MCP. También puedes configurar APIs personalizadas, como se describe en el repositorio oficial.

Para confirmar que las APIs predeterminadas se crearon correctamente, abre “Web Access > Web Access API” en el panel de control de Bright Data. Ambas APIs deberían aparecer en la tabla “My APIs”:

Nota las APIs

Por defecto, el Bright Data MCP se inicia en modo Rapid (nivel gratuito), que proporciona acceso a una selección limitada de herramientas. Para habilitar las más de 70 herramientas, cambia al modo Pro estableciendo la variable de entorno PRO_MODE=true:

API_TOKEN="<YOUR_BRIGHT_DATA_API>" PRO_MODE="true" npx -y @brightdata/mcp

Nota: El modo Pro [genera cargos adicionales](https://github.com/brightdata/brightdata-mcp?tab=readme-ov-file#-pricing, modes).

¡Estupendo! Ahora sabes que el Bright Data MCP funciona localmente. A continuación, conéctalo a DeerFlow.

Paso #5: Configurar el Bright Data MCP en DeerFlow

Puedes configurar una conexión de servidor MCP en DeerFlow a través del archivo extensions_config.json.

Comienza creando una copia del archivo de configuración de ejemplo incluido en tu instalación:

cp extensions_config.example.json extensions_config.json

El archivo de ejemplo contiene configuraciones para los servidores MCP de GitHub y PostgreSQL. Elimínalos y asegúrate de que la sección mcpServers contenga lo siguiente:

{
  // ...
  "mcpServers": {
    "bright-data-web-mcp": {
      "enabled": true,
      "command": "npx",
      "args": [
        "@brightdata/mcp"
      ],
      "env": {
        "API_TOKEN": "<YOUR_BRIGHT_DATA_API_KEY>",
        "PRO_MODE": "true"
      }
    }
  },
  // ...
}

Esto le indica a DeerFlow cómo conectarse a una instancia local del servidor Bright Data MCP (llamada bright-data-web-mcp). En detalle, le indica que use el comando npx -y @brightdata/mcp junto con estas dos variables de entorno:

  • API_TOKEN (obligatorio): Establécelo con tu clave API de Bright Data.
  • PRO_MODE (opcional): Establécelo en true para habilitar el modo Pro. Establécelo en false o elimina PRO_MODE=true para configurar una conexión del Bright Data MCP en modo Rapid.

Ten en cuenta la configuración "enabled": true para habilitar la conexión del servidor MCP.

Guarda extensions_config.json. DeerFlow ahora tiene todo lo necesario para iniciar el servidor Bright Data MCP localmente y conectarse a él. ¡Genial!

Paso #6: Verificar que la Conexión Funciona

Termina el proceso actual de DeerFlow y vuelve a iniciarlo con:

make dev

En la aplicación web del espacio de trabajo, haz clic en “Settings and more” en la esquina inferior izquierda y selecciona “Settings”:

Seleccionando la opción Settings””/>

Aparecerá el modal “Settings”. Ve a la sección “Tools”, donde verás el servidor bright-data-web-mcp configurado:

Nota el servidor MCP

Tal como está configurado, la conexión del Bright Data MCP ya está habilitada.

DeerFlow actualmente no ofrece una forma de ver las herramientas disponibles desde un servidor MCP. Por lo tanto, inicia un nuevo chat e introduce un prompt como:

Which Bright Data MCP tools do you have access to? 

Si configuraste el Bright Data MCP en modo Pro, obtendrás una respuesta similar a esta:

Nota las herramientas disponibles del Bright Data MCP

Observa cómo se listan todas las más de 70 herramientas expuestas por el Bright Data MCP. Si estás usando el modo Rapid, el agente de IA devolverá solo las herramientas disponibles en ese modo.

¡Fantástico! Esto confirma que el agente de IA de DeerFlow puede acceder a las herramientas del Bright Data MCP.

Paso #7: Probar la Integración

Es momento de verificar que las capacidades proporcionadas por Bright Data a través de su Bright Data MCP están correctamente integradas y son accesibles en DeerFlow. Para ello, debes darle al agente de IA una tarea que requiera descubrimiento web y scraping.

Por ejemplo, supón que deseas descubrir algunos artículos sobre un tema específico (el propio MCP, en este caso) y dejar que el agente de IA de DeerFlow los analice.

No olvides que DeerFlow incluye una habilidad integrada academic-paper-review para el análisis de artículos científicos:

Nota la habilidad

Veamos si el agente de IA puede usar las herramientas del Bright Data MCP para obtener y acceder a artículos desde la web.

Para comprobarlo, intenta pedirle al agente que realice una tarea como esta:

Search the web for the most recent papers (last 12 months) on arXiv related to MCP (Model Context Protocol). Select the 5 most relevant papers and scrape their Markdown content from their HTML pages. Review and summarize the papers using the /academic-paper-review skill, then produce a final report highlighting the most interesting insights, findings, and criticisms.

Esto es lo que debería ocurrir:

Ejecución del prompt

Inicialmente, el agente de IA mostró un formulario pidiéndote que proporcionaras:

  • La palabra clave a buscar (recomendado: “MCP” y “Model Context Protocol”).
  • El rango de tiempo (recomendado: “12 meses”).
  • Las fuentes de donde obtener los artículos (recomendado: “arXiv”).
  • El número de artículos (recomendado: “5”).

Una vez que completes el formulario y envíes los datos, el agente de IA iniciará la tarea. ¡Fantástico!

Paso #8: Analizar la Ejecución y Salida del Agente

Para comprender mejor lo que hizo el agente de IA de DeerFlow, despliega el menú de pasos:

Los pasos realizados por el agente de IA de DeerFlow para completar la tarea

Durante la ejecución, el agente de IA:

  1. Cargó la habilidad academic-paper-review.
  2. Usó la herramienta discover del Bright Data MCP para buscar artículos sobre “MCP” y “Model Context Protocol”.
  3. Recuperó la URL de la página HTML de cada artículo de arXiv.
  4. Hizo scraping de los cinco artículos usando la herramienta scrape_as_markdown a través de la API Web Unlocker de Bright Data.
  5. Revisó los artículos usando la habilidad cargada y consolidó el análisis en un informe final en Markdown.

Desplázate por el informe producido y verás:

El informe producido por el agente de IA de DeerFlow

Observa cómo, para cada artículo, el agente de IA de DeerFlow produjo un resumen, contribuciones principales, fortalezas, debilidades, evaluación metodológica, preguntas para los autores y recomendaciones. El informe también está respaldado por enlaces directos a los artículos e incluye un análisis exhaustivo con puntuaciones derivadas de la habilidad academic-paper-review de DeerFlow.

¡Et voilà! Esto demuestra que Bright Data está correctamente integrado con DeerFlow y puede servir como fuente para búsqueda web, descubrimiento, scraping y muchas otras capacidades basadas en la web.

Conclusión

En esta publicación del blog, aprendiste qué es DeerFlow y cómo permite a los agentes de IA manejar tareas de largo alcance. En particular, exploraste cómo conectarlo al Bright Data MCP como fuente de herramientas de nivel empresarial para el acceso web.

Como se demostró aquí, la integración de Bright Data puede reemplazar completamente las opciones integradas de búsqueda y recuperación web de DeerFlow. Esto proporciona herramientas de nivel productivo, escalables y altamente fiables para acceder a páginas web e interactuar con ellas sin ser bloqueado.

Regístrate hoy de forma gratuita en Bright Data y ¡explora nuestros productos web listos para IA!