---
title: "Los VLA y los modelos de mundo necesitan datos a escala web. Solo que no los mismos datos"
slug: vlas-and-world-models-need-web-scale-data
date: 2026-06-22T09:08:57+00:00
modified: 2026-09-02T12:44:53+00:00
permalink: https://brightdata.es/blog/liderazgo/vlas-and-world-models-need-web-scale-data
type: blog
---

[ Blog ](https://brightdata.es/blog "Blog") / [Liderazgo](https://brightdata.es/blog/liderazgo)







 [Liderazgo](https://brightdata.es/blog/liderazgo)

# Los VLA y los modelos de mundo necesitan datos a escala web. Solo que no los mismos datos

Cinco conclusiones de nuestro panel de VLA: por qué el preentrenamiento a escala web, la velocidad de curación y la procedencia de los datos definen ahora la carrera para construir robots en el mundo real.

 11 min de lectura





 [ ![](https://media.brightdata.es/2026/06/image-40-50x50.png) ](https://brightdata.com/blog/authors/adam-chan)

 [Adam Chan

Founder &amp; Builder @Hackersquad

 ](https://brightdata.com/blog/authors/adam-chan)





 ![](https://media.brightdata.es/2026/06/2_VLAs-and-World-Models-Need-Web-Scale-Data.-Just-Not-the-Same-Data.png)





Un resumen de la noche de VLA en el Web Data Loft.

Reunimos a ingenieros de Agility Robotics, Tesla, Prometheus y Distill Labs en el [Web Data Loft de Bright Data](https://brightdata.com/) en San Francisco para debatir una pregunta:

**¿Qué se necesita realmente para pasar de un modelo de lenguaje a un robot que funcione en el mundo real?**

La respuesta fue más concreta de lo que sugiere el hype. El cuello de botella no es solo la arquitectura del modelo. Es el corpus de entrenamiento: qué recopilas, cómo lo combinas, de dónde proviene y si puedes curar a una escala que ningún equipo manual puede igualar.

En el panel participaron Sri y Ahmed de Agility Robotics, Ankur, ingeniero de ML en robótica que habló a título personal, Daniel de Prometheus, anteriormente en 1X y Waymo, y Jacek, cofundador de Distill Labs. La conversación fue moderada por Adam de HackerSquad y el Builders Collective.

A continuación, los cinco puntos clave que importan si estás construyendo un modelo Vision-Language-Action, un modelo de mundo o el pipeline de datos detrás de uno.

## 1. Un VLA es un VLM con una cabeza de acción, y su generalización proviene del preentrenamiento a escala web

La definición de trabajo del panel era simple: un VLA comienza como un modelo visión-lenguaje entrenado con texto e imágenes a escala de internet, en tareas como subtitulado, segmentación y comprensión de objetos. Luego se añade un componente de acción y se ajusta con datos robóticos.

Esa distinción importa. Los datos del robot enseñan la ejecución. El preentrenamiento a escala web enseña al modelo cómo es el mundo.

Por eso un VLA a veces puede recoger un objeto para el que nunca fue entrenado explícitamente. La generalización no proviene únicamente de un pequeño conjunto de demostraciones de robot teleoperado. Proviene de una amplia exposición visual y semántica antes de que el robot entre en el bucle.

Si tu [corpus de preentrenamiento](https://brightdata.com/use-cases/training-data) es limitado, ninguna cantidad de datos costosos de teleoperación recupera completamente la generalización que omitiste.

> *“Está entrenado con datos a escala de internet de texto e imágenes… luego ajustas el VLM con datos robóticos y obtienes un modelo visión-lenguaje-acción. Lo bueno es que tiene mejor generalización: si lo entrenas para recoger un objeto, puedes pedirle que recoja uno diferente, porque ha visto cosas similares.”*
> — **Ankur**, ingeniero de ML en robótica, hablando a título personal. [Ver en 9:59 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=599s)

📖 *Lectura relacionada:* [¿Qué es un modelo Vision-Language (VLA)?](https://brightdata.com/ai/video-data/vla) · [Las mejores bibliotecas de IA para robótica](https://brightdata.com/blog/ai/best-robotics-ai-libraries) · [Modelos fundacionales explicados](https://brightdata.com/glossary/foundation-model)

## 2. Visión, lenguaje y acción convergen en un único espacio de tokens

Los VLA modernos se parecen cada vez más a los LLM en un aspecto importante: predicen el siguiente token.

Ese token puede ser una palabra, un parche de imagen o un comando de control en el espacio articular. Como explicó Jacek, cofundador de Distill Labs, la conexión con los agentes de software es directa. Un LLM llama a herramientas mediante API. Un VLA llama a herramientas físicas. El marco cambia de “llamar a un endpoint” a “agarrar la taza”, pero el patrón subyacente es similar.

La implicación es poderosa: cada modalidad que puede tokenizarse puede formar parte del mismo espacio de entrenamiento. Video web, metraje egocéntrico, demostraciones humanas, teleoperación y datos de robot on-policy pueden contribuir a una representación compartida.

La restricción entonces pasa de “¿puede el modelo usar esto?” a “¿podemos obtener los ejemplos correctos a la escala correcta?”

> *“Puedes pensar en tu espacio de acción como llamadas a funciones para LLM… lo desglosas así y no es diferente de lo que la gente construye para el mundo no físico, agentes que lanzan subagentes en un marco que expone herramientas. Ahora el marco es más físico. Eso es lo que lo hace poderoso, porque puedes apoyarte en datos de entrenamiento web para obtener un buen punto de partida.”*
> — **Jacek**, cofundador, Distill Labs. [Ver en 15:14 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=914s)

📖 *Lectura relacionada:* [Tokenización explicada](https://brightdata.com/glossary/tokenization) · [Dentro del stack tecnológico de agentes de IA](https://brightdata.com/blog/ai/ai-agent-tech-stack) · [Cómo construir agentes de IA: hoja de ruta completa](https://brightdata.com/blog/ai/ai-agents-roadmap)

## 3. Los VLA y los modelos de mundo necesitan datos diferentes; confundirlos es costoso

Una de las distinciones más agudas de la noche fue entre el entrenamiento de VLA y el de modelos de mundo.

Como planteó Ankur, un VLA es fundamentalmente un **problema de aprendizaje por imitación**. Quieres trayectorias limpias, exitosas y de alta calidad. Las malas demostraciones pueden perjudicar.

Un **modelo de mundo** es diferente. Necesita predecir qué ocurre a continuación dada una acción, lo que significa que debe entender no solo los resultados exitosos, sino también los errores, los casos límite y los fallos. Si quieres usar un modelo de mundo para planificación o como simulador aprendido para [aprendizaje por refuerzo](https://brightdata.com/glossary/reinforcement-learning), debe representar el rango completo de futuros posibles.

Daniel, ingeniero en Prometheus que anteriormente lideró el trabajo de modelos de mundo en 1X, explicó por qué esto es difícil. Muchos modelos de mundo actuales están sesgados hacia resultados exitosos. Cuando se les muestra una trayectoria que está a punto de fallar, pueden alucinar una recuperación en lugar de modelar el error. En robótica, eso es especialmente peligroso. El modelo debe ser controlable por acciones precisamente en los momentos donde el contacto, el agarre y el fallo son más probables.

La conclusión: “datos de robótica” no es un único cubo genérico. Las políticas de imitación y los modelos de mundo requieren corpus deliberadamente diferentes.

> *“Realmente quieres un modelo de mundo que sea muy controlable por acciones… el momento decisivo cuando estás agarrando un objeto. Si tienes lagunas ahí, es una señal muy mala.”*
> — **Daniel**, Prometheus, anteriormente en 1X. [Ver en 35:36 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=2136s)

📖 *Lectura relacionada:* [¿Qué es el entrenamiento de modelos de IA?](https://brightdata.com/blog/ai/what-is-ai-model-training) · [Alucinación de IA explicada](https://brightdata.com/glossary/ai-hallucination) · [Conjuntos de datos de robótica](https://brightdata.com/products/datasets/robotics)

## 4. La jerarquía de datos es real: los datos web dan amplitud, los datos de robot dan control

Ahmed, ingeniero en Agility Robotics, estableció una jerarquía clara de señales.

Los datos de teleoperación contienen la información de control más sólida porque incluyen el estado completo del robot. Las demostraciones humanas y el video egocéntrico llevan menos señal de control directa. El video web lleva la menor señal a nivel de control de bajo nivel.

Pero eso no hace que los [datos web](https://brightdata.com/products/datasets) sean menos importantes. Hace que su rol sea diferente.

El video a escala web enseña semántica, contexto, estructura de tareas, diversidad de objetos y conocimiento general del mundo. Ayuda al modelo a entender cómo son las habitaciones, herramientas, personas, objetos y metas a través de una enorme variación. Lo que no enseña bien es la física detallada de un cuerpo robótico específico ejecutando una acción específica.

Ankur ofreció la analogía más clara: puedes ver todos los videos de Messi o Ronaldo jamás grabados y entender el fútbol profundamente, pero aún no puedes jugar sin practicar. Los datos web enseñan el juego. Los datos on-robot enseñan al cuerpo.

La clave práctica sobre el presupuesto de datos surgió del mismo intercambio: **una hora de datos web puede aportar aproximadamente el valor transferible de cinco minutos de datos de teleoperación**. Los datos web no reemplazan la teleoperación, pero un sólido preentrenamiento a escala web puede reducir la cantidad de costosos datos de robot que necesitas.

> *“Podemos ver muchos videos de fútbol de Messi o Ronaldo, pero hasta que no practiquemos nosotros mismos no podremos jugar realmente. El entendimiento de la tarea lo obtenemos de los datos web. Para ejecutarla realmente, necesitamos datos on-robot… quizás una hora de datos web equivale a cinco minutos de datos de teleoperación.”*
> — **Ankur**, ingeniero de ML en robótica, hablando a título personal. [Ver en 1:01:09 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3669s)

📖 *Lectura relacionada:* [Datos para IA en video](https://brightdata.com/ai/video-data) · [Conjunto de datos de videos de YouTube](https://brightdata.com/products/datasets/youtube/videos) · [Conjuntos de datos de audio para IA](https://brightdata.com/products/datasets/audio) · [Conjuntos de datos de imágenes](https://brightdata.com/products/datasets/image)

## 5. Aún no existen leyes de escala fiables, por lo que la velocidad de curación se convierte en la ventaja

Para los LLM, la industria cuenta con las leyes de escala de Kaplan y Chinchilla. Para los VLA y los modelos de mundo, Daniel fue directo: la robótica aún no ha llegado ahí.

Los equipos todavía no pueden predecir de forma fiable el rendimiento del robot como función clara de tokens web, horas de teleoperación, datos de despliegue, cómputo o tamaño del modelo. Parte del desafío es que el aprendizaje por imitación y el modelado de mundo usan señales de supervisión diferentes. Otra parte es que la métrica que importa es el éxito en la tarea final, no la pérdida de preentrenamiento.

Daniel también trazó un contraste útil con la simulación de vehículos autónomos. En conducción autónoma, la simulación a menudo se detiene cuando ocurre el contacto. En robótica, el contacto es donde comienza la verdadera complejidad. Agarrar, empujar, deslizar, deformar, colisionar y recuperarse no son casos límite. Son la tarea.

Hasta que emerjan mejores leyes de escala, la ventaja va a los equipos que pueden encontrar y curar los ejemplos correctos más rápido: escenas específicas, familias de tareas, interacciones con objetos, fallos y momentos ricos en contacto. Ese no es solo un desafío de modelado. Es un desafío de descubrimiento y [pipeline de datos](https://brightdata.com/blog/proxy-101/data-pipeline-architecture).

> *“Responder a las leyes de escala respecto a conteos de flops o tokens ya es común para los LLM, Kaplan et al., las leyes de escala de Chinchilla. Hoy no estamos realmente formulando esas preguntas para comparar científicamente los VLA y los modelos de mundo… creo que la respuesta es que aún no hemos llegado ahí, y realmente deberíamos llegar.”*
> — **Daniel**, Prometheus, anteriormente en 1X y Waymo. [Ver en 54:35 →](https://www.youtube.com/watch?v=8w446Aa6FWM&t=3275s)

📖 *Lectura relacionada:* [Descubrimiento de datos](https://brightdata.com/blog/web-data/data-discovery) · [Mejores proveedores de datos de entrenamiento para IA](https://brightdata.com/blog/ai/best-ai-training-data-providers) · [Datos de entrenamiento para LLM](https://brightdata.com/blog/web-data/llm-training-data)

## Qué significa esto para tu estrategia de datos en robótica

El panel convergió en una conclusión clara:

> **Los datos a escala web dan a los robots una comprensión amplia del mundo. Los datos on-robot les enseñan cómo actuar en él. Cuanto mejor sea tu corpus de preentrenamiento, menos costosos datos de robot necesitas para alcanzar una ejecución fiable.**

Actuar en consecuencia requiere tres capacidades que la mayoría de los equipos subestima:

### 🌐 Extracción a escala web

Recopilación de video, imagen y audio a escala de petabytes desde la web abierta, no solo conjuntos de datos académicos congelados con taxonomías desactualizadas. Consulta la [infraestructura de recopilación de datos a escala web de Bright Data](https://brightdata.com/products/web-scraper) y las [soluciones de datos personalizadas](https://brightdata.com/products/data-solutions).

### 🔍 Descubrimiento visual más allá de la búsqueda por palabras clave

La diversidad de tareas más valiosa a menudo aparece en escenas que nunca se describen en un título, etiqueta o subtítulo. La búsqueda por palabras clave pierde gran parte de la cola larga.

### ⚖️ Procedencia defendible

Los modelos de texto se entrenan con billones de tokens. Los VLA se entrenan con billones de fotogramas. Cada fotograma puede plantear una pregunta de licencia y procedencia, y el despliegue de robots en el mundo real eleva las apuestas. Aprende más en nuestro [Centro de confianza](https://brightdata.com/trustcenter) y nuestras [directrices de recopilación ética de datos](https://brightdata.com/trustcenter/privacy-ethical-data-collection-guidelines).

Los modelos están convergiendo. El diferenciador se está convirtiendo en el corpus: **cuán amplio es, cuán relevante es y si puedes defender de dónde proviene.**

### ¿Construyendo un VLA o un modelo de mundo?

[**Habla con nuestro equipo →**](https://brightdata.com/contact) sobre el descubrimiento y la obtención de video de entrenamiento a escala web.

Aprende más sobre [Bright Data para IA](https://brightdata.com/ai), explora nuestra [oferta de datos de video para VLA](https://brightdata.com/ai/video-data/vla) o navega por nuestros [conjuntos de datos listos para usar](https://brightdata.com/products/datasets) para robótica, visión por computadora y entrenamiento multimodal.



Contactar ventasPrueba gratuita![google social icon](/wp-content/themes/brightdata/assets/images/ic_google.svg)









 Tabla de Contenidos













 [ ](https://news.ycombinator.com/submitlink?t=Los+VLA+y+los+modelos+de+mundo+necesitan+datos+a+escala+web.+Solo+que+no+los+mismos+datos&u=https://brightdata.es/blog/liderazgo/vlas-and-world-models-need-web-scale-data) [ ](https://www.linkedin.com/shareArticle?mini=true&title=Los+VLA+y+los+modelos+de+mundo+necesitan+datos+a+escala+web.+Solo+que+no+los+mismos+datos&url=https://brightdata.es/blog/liderazgo/vlas-and-world-models-need-web-scale-data) [ ](http://www.reddit.com/submit?title=Los+VLA+y+los+modelos+de+mundo+necesitan+datos+a+escala+web.+Solo+que+no+los+mismos+datos&url=https://brightdata.es/blog/liderazgo/vlas-and-world-models-need-web-scale-data)







##  Usted también puede estar interesado en

 [ ![Best LLM Scrapers blog image](https://media.brightdata.es/2026/02/Best-LLM-Scrapers.png) ](https://brightdata.es/blog/ai/best-llm-scrapers "Los mejores scrapers LLM en 2026: la comparación definitiva de herramientas")

 [AI



 ![Antonello Zanini](https://media.brightdata.es/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Los mejores scrapers LLM en 2026: la comparación definitiva de herramientas

Una comparación paralela de los seis mejores Scrapers LLM en 2026, que abarca los modelos compatibles, los precios y las características clave para ayudarle a elegir la herramienta adecuada.



 24-Feb-2026

 20 min de lectura

 ](https://brightdata.es/blog/ai/best-llm-scrapers)

 [ ![Best Robotics AI Libraries](https://media.brightdata.es/2026/02/Best-Robotics-AI-Libraries.png) ](https://brightdata.es/blog/ai/best-robotics-ai-libraries "Las mejores bibliotecas de IA para robótica en 2026: las 10 mejores opciones")

 [AI



 ![Antonello Zanini](https://media.brightdata.es/2022/12/Antonello-Zanini-2-50x50.jpg)

Antonello Zanini

Technical Writer





### Las mejores bibliotecas de IA para robótica en 2026: las 10 mejores opciones

Explore las mejores bibliotecas de IA robótica de 2026, desde NVIDIA Isaac hasta LeRobot, con comparaciones detalladas que le ayudarán a elegir la solución adecuada.



 11-Feb-2026

 22 min de lectura

 ](https://brightdata.es/blog/ai/best-robotics-ai-libraries)

 [ ![Building AI-Ready Vector Datasets for LLMs blog image](https://media.brightdata.es/2025/05/Building-AI-Ready-Vector-Datasets-for-LLMs.svg) ](https://brightdata.es/blog/ai/ai-ready-vector-datasets "Creación de conjuntos de datos vectoriales listos para la IA para LLM: Guía con Bright Data, Google Gemini y Pinecone")

 [AI



 ![Satyam Tripathi](https://media.brightdata.es/2024/09/Satyam-Tripathi-50x50.png)

Satyam Tripathi

Technical Writer





### Creación de conjuntos de datos vectoriales listos para la IA para LLM: Guía con Bright Data, Google Gemini y Pinecone

Los grandes modelos lingüísticos (LLM) están transformando la forma en que accedemos a la información y creamos aplicaciones inteligentes. Para aprovechar todo su potencial, especialmente con conocimientos específicos del dominio o datos propios, es fundamental crear conjuntos de datos vectoriales estructurados de alta calidad. El rendimiento y la precisión de un LLM están directamente relacionados […]



 14-May-2025

 23 min de lectura

 ](https://brightdata.es/blog/ai/ai-ready-vector-datasets)
