Los robots han podido soldar un coche o mover un palet durante décadas. Lo que todavía no pueden hacer de forma fiable es lo que un niño pequeño hace sin pensar: coger un objeto desconocido, girarlo con una mano y usarlo. Esa habilidad es la destreza robótica, y se ha convertido en la frontera más financiada de la robótica. Lo sorprendente, una vez que lo examinas de cerca, es que el problema difícil ya no es la mano. Son los datos.
Esta guía explica la destreza robótica de la manera en que un lector técnico necesita entenderla: qué es, cómo se construyen los sistemas líderes, qué avances llevaron al campo hasta aquí y por qué la restricción principal ha pasado silenciosamente del hardware y los algoritmos a los datos de entrenamiento. Ese último punto es donde los datos web entran en la historia.
En este artículo:
- Qué es la destreza robótica y por qué es mucho más difícil de lo que parece
- La arquitectura de doble sistema detrás de los robots diestros modernos
- Los avances en modelos que llevaron al campo del movimiento programado a la habilidad aprendida
- Por qué los datos, no la computación o el hardware, son ahora el cuello de botella
- Dónde encajan los datos a escala web y cómo los equipos los recopilan en la práctica
Qué significa realmente la destreza robótica
La destreza robótica es la capacidad de un robot para manipular objetos con habilidad, de la manera en que lo hace una mano humana. La distinción más útil es entre el simple pick-and-place, donde un gripper mueve un objeto conocido de A a B, y la manipulación diestra, donde el robot reorienta un objeto dentro de su agarre, ajusta la fuerza sobre la marcha y maneja formas y materiales para los que nunca fue programado explícitamente. La reorientación en mano, no el levantamiento, es lo que separa un verdadero sistema diestro de un brazo industrial.
Tres cosas hacen que esto sea genuinamente difícil.
Grados de libertad. La mano humana tiene 27 grados de libertad. Una mano robótica de grado investigación como la Shadow Hand tiene alrededor de 24 articulaciones accionadas. Coordinar tantas articulaciones en tiempo real, bajo contacto, es un problema de control de alta dimensión que crece considerablemente con cada dedo y articulación añadidos.
La brecha táctil. Los humanos manipulan objetos principalmente por tacto. Hay aproximadamente 17.000 mecanorreceptores táctiles en la piel de una sola mano humana, que proporcionan retroalimentación densa y de alta frecuencia sobre deslizamiento, presión y textura. La mayoría de los robots todavía operan con sensores táctiles escasos o inexistentes, razón por la cual un robot puede aplastar un huevo o dejar caer una copa de vino mientras parece tener un agarre perfecto.
Generalización bajo contacto y oclusión. Durante la manipulación, el objeto suele estar parcialmente oculto por la propia mano, y pequeñas diferencias en fricción, peso o forma cambian completamente la acción correcta. Un sistema que funciona con las tazas exactas con las que fue entrenado puede fallar con una taza con un asa ligeramente diferente. Generalizar a objetos no vistos es el verdadero premio, y el más difícil.
Por eso la destreza es tanto un problema de software y aprendizaje como mecánico. Las mejores manos ayudan, pero la diferencia entre un robot que agarra y uno que manipula tiene que ver principalmente con la percepción, el razonamiento y el control aprendido. Para un recorrido por el lado del software, el resumen de bibliotecas de IA para robótica es un buen complemento a este artículo.
Cómo funciona: la arquitectura de doble sistema
Los robots diestros modernos se construyen cada vez más sobre modelos Vision-Language-Action (VLA): un único sistema aprendido que recibe imágenes de cámara e instrucciones en lenguaje natural y genera acciones motoras. El patrón de diseño dominante, utilizado en diversas formas por Physical Intelligence, NVIDIA, Google DeepMind y Figure, es una arquitectura de doble sistema que toma prestada vagamente la idea del pensamiento rápido y lento.

La pila de doble sistema. Los datos a escala web preentrenan el cerebro de razonamiento del Sistema 2, mientras que la teleoperación y la simulación entrenan la política motora del Sistema 1. La percepción, la detección, el control y la mano forman un bucle cerrado.
Las piezas, de entrada a acción:
- Percepción sensorial. Cámaras RGB-D, encoders de articulaciones para propiocepción y, cada vez más, sensores táctiles alimentan el estado bruto al sistema.
- Percepción visual. Un encoder de visión preentrenado, a menudo algo como SigLIP o DINOv2, convierte los píxeles en características sobre las que el resto del modelo puede razonar. Estos encoders se entrenan a su vez en enormes colecciones de imágenes.
- Sistema 2, el cerebro. Un modelo de visión-lenguaje realiza el trabajo semántico lento: entender la escena, interpretar la instrucción y decidir qué hacer. Este componente se preentrenan con datos de imágenes y texto a escala de internet, lo que le da al robot conocimiento de sentido común sobre objetos que nunca ha tocado físicamente.
- Sistema 1, el experto en acción. Una política rápida, a menudo un modelo de difusión o de coincidencia de flujo, convierte la intención del cerebro en comandos motores suaves y de alta frecuencia. Esta es la parte entrenada con demostraciones reales del robot.
- Controlador y mano. Un controlador de bajo nivel ejecuta un bucle de impedancia o PD a cientos de hercios para ejecutar el movimiento en la mano y el brazo físicos, con retroalimentación del sensor cerrando el bucle.
La división importa porque los dos sistemas tienen dietas de datos completamente diferentes. El Sistema 1 necesita datos de acción reales, que son escasos y costosos. El Sistema 2 se preentrenan con el tipo de datos de imágenes, texto y video a escala web que ya existe en abundancia. Tener en cuenta esa distinción hace que el resto del campo sea comprensible. Ejemplos de este patrón en la práctica incluyen pi-0 de Physical Intelligence, GR00T N1 de NVIDIA, Gemini Robotics de Google DeepMind y Helix de Figure.
Los avances que llevaron al campo hasta aquí
La destreza pasó de programada a aprendida a lo largo de una serie corta y densa de resultados.
El aprendizaje por imitación mejoró. El Action Chunking Transformer (ACT) y luego Diffusion Policy demostraron que los robots podían aprender manipulación fina directamente de demostraciones humanas. Diffusion Policy, presentado en RSS en 2023, reportó una mejora promedio del 46,9% sobre el estado del arte anterior en 15 tareas al tratar la generación de acciones como un proceso de eliminación de ruido, lo que maneja la naturaleza multimodal y ambigua de la manipulación real mucho mejor que los métodos anteriores.
Llegaron las políticas generalistas. Pi-0 de Physical Intelligence, lanzado a finales de 2024, fue un VLA basado en flujo entrenado en muchos tipos de robots que demostró tareas de largo horizonte con rico contacto, como doblar ropa de una cesta, una tarea que combina percepción, manejo de objetos deformables y planificación sostenida.
Los datos sintéticos escalaron. GR00T N1 de NVIDIA, anunciado en marzo de 2025, se apoyó en la simulación para fabricar datos de entrenamiento: su pipeline generó 780.000 trayectorias sintéticas, el equivalente a unos nueve meses de demostraciones humanas, en aproximadamente 11 horas, y combinar esos datos sintéticos con datos reales mejoró el rendimiento en alrededor del 40% respecto a los datos reales solos.
El aprendizaje en dispositivo se volvió eficiente en muestras. Gemini Robotics On-Device de Google DeepMind, presentado en 2025, podía adaptarse a una nueva tarea con tan solo 50 a 100 demostraciones, una señal de cuánto el cerebro preentrenado reduce la cantidad de datos específicos del robot que cada nueva habilidad requiere.
El tacto también está mejorando, con sensores táctiles densos como la línea DIGIT de Meta que aportan la retroalimentación basada en el tacto que la visión pura no puede captar. Pero nótese el patrón en cada uno de estos avances: la palanca casi siempre son mejores o más datos, no un gripper fundamentalmente nuevo.
Por qué los datos, no el hardware, son el cuello de botella
He aquí la afirmación que reenmarca todo el campo. Según un análisis de 2025 de Epoch AI, los modelos de manipulación robótica más grandes se entrenan con apenas el 1% de la computación utilizada para los modelos de lenguaje de frontera, y la restricción principal no es la computación ni el tamaño del modelo, sino la escasez de datos de entrenamiento. La robótica sufre una falta de datos de una manera en que el lenguaje y la visión ya no lo hacen.
La razón es brutal en su simplicidad. Los modelos de lenguaje tuvieron internet: billones de palabras disponibles públicamente, listas para ser recopiladas. La manipulación diestra no tiene equivalente. Como los autores del conjunto de datos EgoDex de Apple lo expresaron claramente, no existe un corpus de datos a escala de internet para la manipulación diestra. Los datos deben crearse, y cada fuente tiene un inconveniente:
- La teleoperación produce datos de acción de máxima calidad, un humano controlando el robot, pero es lenta y costosa. No escala a los millones de horas que demanda el preentrenamiento de un cerebro.
- La simulación es barata y paralelizable, pero sufre la brecha sim-to-real: una política que funciona en simulación a menudo falla en un robot real porque la física, la fricción y el ruido del sensor nunca coinciden exactamente.
- El video humano es abundante y rico, pero carece de acciones del robot y etiquetas de fuerza, por lo que enseña qué hacer mucho mejor que exactamente cómo mover un manipulador específico.
- Las imágenes y el texto a escala web son la única entrada que ya existe a la escala que necesita un modelo de fundación, y es lo que preentrenan las capas de percepción y razonamiento.
Esa taxonomía es el mapa estratégico del campo. Si deseas el contexto más amplio sobre cómo estas entradas se convierten en un modelo, el artículo explicativo sobre cómo se entrenan los modelos de IA y el análisis en profundidad sobre datos de entrenamiento para LLM se traducen directamente al contexto de la robótica. La razón por la que los datos web siguen apareciendo es que, como argumenta un creciente cuerpo de investigación, los datos web son la piedra angular de la infraestructura moderna de IA, incluida la robótica.
Dónde encajan los datos a escala web
Los datos web no enseñan a un robot cómo mover sus dedos. Hacen algo que podría decirse que es más importante: le enseñan al robot sobre el mundo antes de que jamás recoja nada. Hay tres contribuciones concretas, todas respaldadas por resultados publicados.
Anclaje semántico. RT-2 de DeepMind demostró que el co-entrenamiento de una política robótica con datos de imagen-texto a escala web, junto con datos de robot, aproximadamente duplicó su capacidad de generalizar a objetos y fondos nuevos, y desbloqueó comportamientos emergentes como coger el objeto que es una herramienta improvisada o identificar una categoría que solo había visto en internet. El conocimiento web se transfiere a la acción física. Esta es la misma lógica de aprendizaje por transferencia detrás del ajuste fino de un modelo con datos web, aplicada a un robot.
Diversidad de objetos. Un estudio de 2025 sobre las leyes de escala de datos en el aprendizaje por imitación robótica encontró que la generalización mejora como una ley de potencia con la diversidad de objetos y entornos en el conjunto de entrenamiento, no simplemente con el número de demostraciones. Los autores encontraron que recopilar datos de aproximadamente 32 objetos diversos era suficiente para alcanzar alrededor del 90% de éxito en objetos completamente no vistos. La diversidad de objetos es, en la práctica, un problema de imágenes a escala web: los catálogos de productos, los mercados en línea y la búsqueda de imágenes son donde vive esa variedad, que es exactamente lo que abordan las guías sobre recopilación de datos de imágenes a escala.
Priors de manipulación a partir de video humano. El video egocéntrico de personas usando sus manos es lo más cercano a un corpus natural de manipulación. Ego4D de Meta reunió 3.670 horas del mismo, y EgoDex de Apple añadió 829 horas a través de 338.000 episodios y más de 90 millones de fotogramas específicamente para tareas de destreza. Este es el material en bruto que los investigadores utilizan para enseñar a los robots estrategias de manipulación similares a las humanas, incluso sin etiquetas de acción.
En conjunto, estas tres entradas, pares imagen-texto, imágenes de objetos diversas y video instructivo humano, son lo que llena el cerebro del Sistema 2. Todos son datos web públicos, y ensamblarlos de manera confiable a escala es un problema de recopilación de datos. La versión estratégica de esta idea, donde mejores datos se acumulan en un mejor modelo que genera mejores datos, es el volante de datos que los equipos de IA más sólidos ahora construyen deliberadamente.
Construyendo la capa de datos en la práctica
Recopilar este tipo de datos parece sencillo hasta que lo intentas a escala. Las fuentes de imágenes y video que importan son exactamente las que están más protegidas: los mercados en línea, los motores de búsqueda y las grandes plataformas de medios limitan la velocidad, restringen geográficamente y bloquean activamente la recopilación automatizada, y presentan gran parte de su contenido con JavaScript. Ensamblar un corpus limpio, diverso y multirregional es un problema de infraestructura antes de ser un problema de aprendizaje automático.
Aquí es donde Bright Data encaja como la capa de datos web debajo de una pila de entrenamiento de robótica. Es la infraestructura de recopilación que convierte la web abierta en datos estructurados y listos para el modelo, la entrada upstream al cerebro del Sistema 2 en el diagrama anterior.
- La API Web Scraper convierte fuentes de imágenes y productos en endpoints estructurados, con scrapers prediseñados que manejan los sistemas anti-bot automáticamente, para que un corpus de diversidad de objetos pueda extraerse sin construir y mantener recopiladores manualmente.
- Una red de proxies residenciales de más de 400M de IPs de origen ético en todo el mundo es lo que hace que la diversidad geográfica y visual sea alcanzable: el mismo producto o escena recopilado en muchas regiones, que los resultados de las leyes de escala de datos indican que importa más que el volumen bruto.
- El Navegador de scraping renderiza páginas de medios y catálogos con mucho JavaScript que la recopilación estática pasaría por alto, que es donde vive una gran parte de las imágenes de objetos del mundo real.
- Los conjuntos de datos de IA y LLM prediseñados y personalizados entregan corpus estructurados y precompilados directamente, exportados como JSON, CSV o Parquet, para que un equipo pueda alimentar un pipeline de preentrenamiento sin necesidad de configurar la recopilación.
La fiabilidad es la parte que separa un corpus utilizable de uno contaminado, porque un fallo silencioso en la recopilación sesga silenciosamente el conjunto de datos. Bright Data reporta una tasa de éxito promedio del 98,44% en un benchmark independiente de once proveedores, y mantiene el cumplimiento de GDPR, CCPA, SOC 2 e ISO 27001 mientras recopila únicamente datos disponibles públicamente, el tipo de procedencia que importa cuando el conjunto de datos entrenará un sistema físico. Si estás evaluando cómo obtener estos datos, las comparaciones de conjuntos de datos frente a APIs de scraping web y el resumen de proveedores de datos de entrenamiento para IA presentan las opciones, y los artículos introductorios sobre qué es un conjunto de datos y datos estructurados y no estructurados cubren los fundamentos. Los mismos datos web recopilados también impulsan técnicas adyacentes como los embeddings, los conjuntos de datos vectoriales listos para IA y la decisión de RAG frente a ajuste fino una vez que se completa la extracción de datos en bruto.
Los límites honestos
Es importante ser preciso sobre lo que los datos web hacen y no hacen, porque exagerar aquí es fácil y equivocado.
Los datos web preentrenan el cerebro, no las habilidades motoras. Le dan a un robot comprensión semántica, conocimiento de objetos y priors visuales. No contienen las trayectorias de acción, las fuerzas de contacto ni las etiquetas de interacción 3D que el Sistema 1 necesita para mover realmente una mano. Esos siguen viniendo de la teleoperación, la simulación y el aprendizaje en el robot. Los datos web elevan el techo de lo que un robot puede entender y generalizar; no reemplazan la práctica física que produce movimiento habilidoso.
La brecha táctil también es real y no se resuelve con ninguna cantidad de imágenes. El roboticista Rodney Brooks argumentó en 2025 que los humanoides actuales no aprenderán verdadera destreza solo a partir de demostraciones de movimiento y video, porque carecen de la rica percepción táctil de alto ancho de banda de la que depende la manipulación humana. Esa crítica es un contrapeso útil: los mejores datos de percepción son necesarios pero no suficientes, y el campo todavía necesita avances en hardware táctil y transferencia sim-to-real. La manera correcta de leer todo esto es que los datos son el cuello de botella actual, no el único.
Hacia dónde se dirige esto
La trayectoria es clara aunque el cronograma no lo sea. La manipulación diestra está convergiendo hacia modelos grandes, preentrenados y multimodales, la misma receta que funcionó para el lenguaje y la visión, y el campo en sí ahora señala mejores datos, especialmente el video y el preentrenamiento a escala web, como el camino para salir de la restricción de datos. A medida que las manos, los sensores táctiles y los métodos sim-to-real mejoran en paralelo, el diferenciador entre equipos será cada vez más la calidad y diversidad de los datos que pueden ensamblar.
Esa es la conclusión silenciosa detrás de todos los anuncios de financiación de humanoides. Los robots que aprendan a manipular el mundo serán los entrenados con la mejor imagen del mismo, y la mayor parte de esa imagen son datos web públicos. Bright Data es la capa que convierte esa web abierta en datos fiables, estructurados y listos para el modelo. ¿Listo para construir la capa de datos para tus sistemas de IA? Inicia una prueba gratuita y comprueba con qué rapidez la web abierta puede convertirse en datos de entrenamiento.
Preguntas frecuentes
P: ¿Qué es la destreza robótica?
La destreza robótica es la capacidad de un robot para manipular objetos con habilidad, de la manera en que lo hace una mano humana, incluyendo reorientar un objeto dentro de su agarre, ajustar la fuerza en tiempo real y manejar formas y materiales para los que no fue programado explícitamente. Va mucho más allá del simple pick-and-place, donde un gripper mueve un objeto conocido entre puntos fijos. La capacidad definitoria es la manipulación en mano de objetos desconocidos.
P: ¿Por qué la manipulación diestra es tan difícil para los robots?
Por tres razones. Primero, los altos grados de libertad: una mano humana tiene 27 y una mano robótica de investigación alrededor de 24 articulaciones accionadas, lo que es un difícil problema de control en tiempo real. Segundo, la brecha táctil: los humanos dependen de aproximadamente 17.000 receptores táctiles por mano para obtener retroalimentación densa, mientras que la mayoría de los robots tienen poca o ninguna percepción táctil. Tercero, la generalización: durante la manipulación el objeto a menudo está oculto por la mano, y pequeños cambios en la forma o la fricción cambian la acción correcta, por lo que transferir habilidades a objetos no vistos es muy difícil.
P: ¿Qué es un modelo Vision-Language-Action (VLA)?
Un modelo VLA es un único sistema aprendido que recibe imágenes de cámara e instrucciones en lenguaje natural y genera acciones motoras del robot. Los robots diestros modernos suelen usar una versión de doble sistema: un cerebro lento de visión-lenguaje que entiende la escena y planifica, preentrenado con datos de imágenes y texto a escala de internet, emparejado con un experto en acción rápido, a menudo una política de difusión o de coincidencia de flujo, que convierte ese plan en comandos motores de alta frecuencia entrenados con demostraciones reales del robot.
P: ¿Por qué los datos son el cuello de botella para la destreza robótica en lugar del hardware?
Un análisis de Epoch AI en 2025 encontró que los modelos de manipulación robótica más grandes usan solo alrededor del 1% de la computación de los modelos de lenguaje de frontera, y que el factor limitante es la escasez de datos de entrenamiento en lugar de la computación o el tamaño del modelo. A diferencia del lenguaje, la manipulación diestra no tiene un conjunto de datos a escala de internet del que aprender, por lo que los datos de acción deben crearse mediante teleoperación costosa o simulación imperfecta, mientras que las capas de percepción y razonamiento se preentrenan con datos de imágenes y texto a escala web.
P: ¿Cómo ayudan los datos web a entrenar un robot diestro?
Los datos web preentrenan el cerebro de percepción y razonamiento del robot en lugar de su control motor. Contribuyen de tres maneras: anclaje semántico, donde el preentrenamiento con imagen-texto web aproximadamente duplicó la generalización en el trabajo RT-2 de DeepMind; diversidad de objetos, donde los estudios sobre las leyes de escala de datos muestran que la generalización mejora con la variedad de objetos y escenas, lo que es un problema de imágenes a escala web; y priors de manipulación a partir de video humano como Ego4D y EgoDex. No reemplaza los datos de acción y fuerza que proporciona la práctica física.
P: ¿Puede un robot aprender destreza solo a partir de datos web y video?
No. Los datos web y el video le dan a un robot comprensión semántica y priors visuales, pero no contienen las trayectorias de acción, las fuerzas de contacto y las etiquetas de interacción 3D necesarias para controlar una mano. Esas provienen de la teleoperación, la simulación y el aprendizaje en el robot. Críticos como Rodney Brooks también argumentan que la verdadera destreza necesita una rica percepción táctil que los humanoides actuales en gran medida carecen. Los datos web elevan lo que un robot puede entender y generalizar, pero la práctica física y mejores sensores táctiles siguen siendo necesarios.