AI

Encontrando los momentos de entrenamiento robótico ocultos en videos públicos de la web

Investigación: la API de búsqueda de video de Bright Data descubrió 10× más momentos de acción física buscando lo que muestran los videos en lugar de depender de títulos, descripciones y etiquetas.
23 min de lectura
Finding the web’s hidden robot training moments in public web video data

Los datos de video pueden ayudar a entrenar robots, incluidos los humanoides, a comprender y realizar tareas físicas. Esto abarca los modelos VLA, que conectan observaciones visuales e instrucciones en lenguaje con acciones, y los modelos de mundo, que aprenden cómo cambia un entorno con el tiempo. La web pública alberga millones de videos de personas realizando ese trabajo, y encontrar una acción específica dentro de ellos es difícil, porque un título describe el tema general de un video mientras deja las acciones del metraje sin nombre. Las descripciones y etiquetas generalmente no son mejores.

Para este estudio utilizamos la API de búsqueda de video de Bright Data. La API de búsqueda de video es una herramienta que permite buscar visualmente momentos dentro de videos de la web.

Se le proporciona una descripción en lenguaje natural de una acción, busca en el contenido visual de los videos públicos en lugar del texto adjunto a ellos, y devuelve videos candidatos junto con marcas de tiempo de dónde puede aparecer la acción. La búsqueda convencional por palabras clave funciona al revés, comparando tus palabras con el título, la descripción y las etiquetas de un video, por lo que ambos enfoques terminan alcanzando metrajes muy diferentes.

Le enviamos 141 acciones físicas y obtuvimos 10.828 momentos en 7.549 videos. Para cada momento retenido, verificamos si alguna palabra del nombre de la acción aparecía en el título, la descripción o las etiquetas del video. En el 90,8% de los casos, ninguna lo hacía.

Si recopilas metraje de entrenamiento por palabras clave, ese 90,8% es el dato que pierdes, y hace que la cosecha de la API sea 10× mayor que lo que la búsqueda de texto podría alcanzar. Esos momentos adicionales muestran las mismas acciones que solicitaste, dentro de videos cuyos títulos hablan de otra cosa, y permanecen invisibles para un pipeline de texto sin importar cuántas consultas ejecutes en estos campos.

Comparamos subcadenas literales con el título, la descripción y las etiquetas, y contamos dentro del corpus que la propia API devolvió, por lo que la proporción se mantiene bajo esas dos condiciones. La búsqueda semántica, la búsqueda multilingüe, la búsqueda en transcripciones y el propio ranking de YouTube están fuera de lo que probamos.


El resultado en tres cifras

10,9× más momentos que la coincidencia literal la búsqueda de contenido devolvió 10.828; 992 llevan alguna palabra del nombre de la acción en sus metadatos
90,8% no nombrado en ningún lugar 9.836 de 10.828 momentos no llevan ninguna mención de la acción en su título, descripción o etiquetas
56,1% sin pista alguna en el título una prueba menos estricta que la búsqueda. Preguntamos a google/gemini-2.5-flash si algo en el título se relaciona con la acción de alguna manera, por muy tenue que sea, incluyendo pistas demasiado vagas para buscar. No encontró nada en 6.071 de 10.828
De dónde provienen estas tres cifras

Las dos primeras son la misma división: 9.836 de 10.828 momentos no llevan ninguna palabra de la acción en ningún campo, y los 992 que sí lo hacen son lo que alcanza un comparador literal, 10.828 ÷ 992 = 10,9. Los cuatro grupos (título, descripción, etiquetas, ninguno) son mutuamente excluyentes y suman el total verificado. Ambos se cuentan por fila de coincidencia; si se colapsan a los 8.849 video-segundos distintos, la proporción resulta en 8,9×.

El tercero cuenta los títulos que el modelo calificó como no relacionados: 6.071 de 10.828, una fila por momento en 7.549 videos distintos.

Las marcas de tiempo tienen una segunda consecuencia. Si se permite que cada momento tenga como máximo 10 segundos de acción, las 5.066,5 h de video fuente en las que se encuentran estas coincidencias se convierten en 24,58 h de clip, lo que reduce lo que debe moverse, almacenarse y revisarse en 206,1×.

Lo que la recuperación realmente devolvió. Que la recuperación sea confiable no es lo mismo que ser correcta, así que extrajimos un fotograma real de casi cada coincidencia y tuvimos un modelo de visión para calificarlos a todos. La sección 3.5 tiene las tasas. Esta auditoría presenta metraje candidato para descubrimiento y curación, y ninguna política, modelo de mundo o robot fue entrenado con él.

Muestra de seis videos y sus títulos en YouTube

Lo que vio un modelo de visión al mostrarle la imagen sin el título, frente al título propio del video, traducido al español cuando se indica un idioma fuente. Un juez de IA leyó cada título del corpus en busca de cualquier indicio de su acción, y calificó estos seis como no relacionados: una fecha simple, un versículo del Corán, un boletín de noticias económicas. Confirmamos cada fotograma visualmente y cada video está activo. Haz clic en un fotograma para reproducir el video en ese segundo.

El momento Lo que muestra el fotograma Cómo se llama el video
Persona palando cemento en cubeta de mezcla
mix_cement
Persona palando cemento en cubeta de mezcla Surah Tawbah versículo 26. “Pero (aun así) ¿a dónde vas?” (del tr)
Mano insertando boquilla de combustible en el depósito del coche
refuel
Mano insertando boquilla de combustible en el depósito del coche Desafíos de reforma económica de Bangladesh y mensaje del FMI | Economía de Bangladesh | FMI (del bn)
Dos manos doblando papel verde por la mitad
fold
Dos manos doblando papel verde por la mitad 24 de diciembre de 2023 (del zh)
Mano cortando aguacate en tabla de cortar
cut_knife
Mano cortando aguacate en tabla de cortar Comida cultivada en tierra lunar… ¿Los científicos se asustaron? (del hi)
Mano golpeando botón rojo de parada de emergencia tipo seta
emergency_stop
Mano golpeando botón rojo de parada de emergencia tipo seta (Cheongju City/Línea Principal) Woojin Sanjeon Apollo 1100 Modelo eléctrico ultra-bajo-suelo PEV estándar edición junio 2024 2027 Dongil Transportation 712 (del ko)
Mano guiando cincel en talla de madera
chisel_carve
Mano guiando cincel en talla de madera adapt and overcome 🌱

El 90,8% de los momentos recuperados no están nombrados en ningún lugar de sus metadatos

Esa proporción es la brecha entre lo que la recuperación de contenido alcanzó en este corpus y lo que habría alcanzado la coincidencia literal de metadatos.

La objeción obvia es el idioma, ya que probamos palabras de acción en inglés contra títulos que a menudo no están en inglés. Restringir a títulos en inglés confirmados por el modelo aún deja la cifra en el 85,8%; la sección 3.3 muestra cada segmento.

Dónde se nombra la acción, en los 10.828 momentos recuperados

Gráfico de waffle: 100 cuadrados, uno por punto porcentual de los 10.828 momentos coincidentes; 91 no están nombrados en ningún lugar
Formato de tabla
Grupo Momentos Proporción Qué significa para un pipeline de texto
nombrado en el título 386 3,6% el comparador literal lo encuentra
solo en la descripción 531 4,9% solo si lees las descripciones
solo en etiquetas 75 0,7% solo si lees las etiquetas
no nombrado en ningún lugar 9.836 90,8% el comparador literal no lo encuentra

Un momento real de cada grupo, porque “531 momentos solo se nombran en la descripción” es una afirmación y un título real con la palabra coincidente marcada es evidencia:

Grupo Acción Título del video (se abre en el segundo coincidente) Coincidencia
nombrado en el título pour Teaching a beginner how to pour latte art patterns (Expert Barista Guide) coincidencia en “pour”
solo en la descripción take GENTLE SOY SAUCE SOUP RAMEN (SHOYU RAMEN) | A Real Japanese Dad Cooks | Japanese cooking coincidencia en “take”
solo en etiquetas fold ورقة واحدة .. طيّات قليلة .. بدون لاصق.. وعالمٌ هرميٌ كامل! coincidencia en “fold”
no nombrado en ningún lugar take # viral video in social media # viral koriyaan # sad story of koriyan romance ninguna palabra de “take” aparece en ningún lugar de sus metadatos

Proporción invisible, por dominio

Los momentos de cada dominio divididos en no nombrado en ningún lugar (rosa) vs nombrado en título, descripción o etiquetas (azul)
Cifras en formato de tabla
Dominio No nombrado en ningún lugar Momentos verificados
Sobremesa (DROID) 98,1% 1.836
Exterior 95,9% 217
Cuerpo completo 95,4% 866
Hogar 92,0% 402
Construcción 91,1% 987
Industrial 89,6% 4.612
Automotriz 83,8% 1.908

Cada video coincidente en cada dominio llevaba metadatos extraídos, por lo que cada n es el conjunto completo recuperado de ese dominio. Nadie titula un video “poniendo un bloque en un tazón”; los videos de reparación sí anuncian lo que arreglan, razón por la cual el automotriz es el único dominio al que un comparador literal llega parcialmente.


1 Lo que elimina una marca de tiempo del pipeline

Supongamos que quieres diez segundos de alguien soldando una unión. La ruta habitual lleva cinco pasos, y cada uno de ellos se ejecuta sobre un archivo de video completo: encontrar un video por su título, extraer todo, buscar en tu propia copia el momento, recortar ese momento y luego etiquetar lo que muestra.

El primer paso pasa por alto el 90,8% de estos momentos directamente. Buscar en el metraje en su lugar devuelve el video y el segundo dentro de él, y uno de los cinco pasos deja de existir. No hay nada que buscar dentro del video extraído, ya que ya sabes dónde está el momento. El recorte aún debe realizarse, ya que la API de Datos de Medios entrega videos completos, audio, subtítulos y storyboards sin tomar una marca de tiempo, pero recortas contra un desplazamiento conocido en lugar de buscarlo. Cinco pasos se convierten en cuatro.

Los pipelines de recopilación offline comúnmente dividen ese trabajo en varios sistemas: mover video al almacenamiento en la nube, anotarlo fotograma a fotograma ya sea manualmente o semi-automáticamente, y convertir entre formatos de robótica como ROS o MCAP y formatos de video de uso general. Cada transferencia es un lugar donde se pierde rendimiento y donde la alineación temporal entre las transmisiones de cámara y los comandos del motor puede desviarse. No medimos nada de eso aquí. Es el contexto que hace que una marca de tiempo devuelta valga la pena.

Ruta convencional (cinco pasos, pagados sobre videos completos):

  1. Encontrar videos · búsqueda por palabras clave en títulos
  2. Extraer · 5.066,5 h de video fuente (el paso costoso, medido a partir de la duración extraída de cada video coincidente)
  3. Ejecutar una búsqueda · una segunda herramienta, sobre tu propia copia
  4. Recortar · recortar cada clip al momento
  5. Etiquetar · anotar lo que recortaste

Con recuperación de momentos (cuatro pasos, pagados por segundos):

  1. Encontrar escenas · la búsqueda de contenido devuelve el segundo
  2. Recuperar · ~24,58 h alrededor de los desplazamientos devueltos (est.: asume que cada momento es como máximo 10 segundos de acción)
  3. Recortar · recortar localmente, contra un desplazamiento conocido
  4. Etiquetar · un fotograma por momento
Metraje movido, a escala: dos barras en un eje

2 Método

Escribimos una oración describiendo cada una de las 141 acciones y las enviamos a la API de búsqueda de video. La de soldadura decía:

una de las 141 oraciones que enviamos

primer plano de una mano sosteniendo un soldador en una unión de placa de circuito mientras alimenta hilo de soldadura con la otra mano, iluminación de lámpara de banco

Luego extrajimos el título, la descripción y las etiquetas de cada video que regresó. Bright Data documenta el índice como coincidente en fotogramas muestreados en lugar de en título, descripción o etiquetas, por lo que los campos que calificamos no deberían ser los que encontraron el metraje. No lo probamos de forma independiente.

Tomamos 22 nombres de acciones de las cadenas de tareas de DROID, que leímos por frecuencia de verbos, y añadimos las 119 restantes como acciones de autoría propia para ampliar la auditoría más allá de la cobertura de DROID.


3 Resultados

3.1 Cuánto cuesta cada ruta

Todo aquí está en horas sobre este corpus, con duraciones sumadas del scraper, por lo que la cifra fuente es un recuento en lugar de una estimación. No extrajimos ningún video, por lo que no reclamamos ningún recuento de bytes.

Dos recuentos están detrás del 206,1×. Las 5.066,5 h son una suma real sobre 7.549 videos. La cifra de clips cuenta cada (video, segundo) una vez, sobre 8.849 segundos distintos, y multiplica por la ventana de 10 segundos.

La proporción descansa en dos elecciones, cuán largo es un clip y si la cola larga cuenta, y la cola larga es la palanca más grande de las dos: 483 videos de tres horas o más son ~6% del conjunto y llevan ~60% de las horas. La tabla de sensibilidad completa:

Factor de reducción bajo cada límite de duración de video
Cifras en formato de tabla
Eliminar videos más largos de Videos Horas del corpus Segundos distintos Horas de clip (10 s) Reducción
1 h 6.554 1.113,5 7.605 21,12 52,7×
2 h 6.873 1.563,8 8.017 22,27 70,2×
3 h 7.066 2.031,3 8.247 22,91 88,7×
6 h 7.364 3.272,8 8.609 23,91 136,9×
12 h 7.546 5.012,3 8.846 24,57 204,0×
conservar todos (publicados) 7.549 5.066,5 8.849 24,58 206,1×

El mismo corpus, obtenido de cualquier manera: 10.828 filas de coincidencias que caen en 8.849 video-segundos distintos. Contar cada coincidencia en lugar de cada segundo distinto daría 30,08 horas de clip y una reducción de 168,4×. La misma proporción se aplica al tiempo de revisión solo si la alternativa revisa cada video fuente completo, el tiempo de revisión escala linealmente con la duración, y recorrer 8.849 clips separados no conlleva ningún costo por clip.

3.2 La regla de coincidencia y qué hace al endurecerla

Para cada momento candidato retenido, verificamos el título, la descripción y las etiquetas del video, los principales campos de metadatos disponibles en esta auditoría.

Un momento se cuenta como nombrado si alguna palabra del nombre de la acción de más de dos caracteres aparece como una subcadena insensible a mayúsculas y minúsculas, por lo que “change” solo marca change_tire_wrench y “car” se encuentra dentro de “carpet”. Esa es la regla más permisiva que podríamos haber elegido, lo que convierte el titular en un mínimo. Endurecerla y sube:

Momentos que alcanza un comparador de texto bajo cuatro reglas cada vez más estrictas: 992, 868, 597, 206 de 10.828

Cada regla más estricta que la publicada mueve la cifra hacia arriba, lo que hace que el 90,8% sea un mínimo en lugar de un mejor caso: 395 de los 992 momentos que la regla publicada cuenta como nombrados lo deben a un fragmento dentro de una palabra más larga. Cada valor está medido, cuatro pasadas reales sobre el corpus (supply_gap.py _variants()).

3.3 Gran parte está titulado en otro idioma

Leímos el idioma del título para cada uno de los 10.828 momentos coincidentes, por lo que este es el corpus completo en lugar de una muestra. De ellos, 4.863 (~45%) están en un video titulado en uno de 77 idiomas no ingleses nombrados, más un título que el modelo no pudo identificar. Las mismas descripciones de acciones en inglés devolvieron 423 momentos de videos con título en hindi y 509 de videos con título en portugués. No se recopiló ningún campo geográfico, por lo que esto no dice nada sobre dónde se hicieron los videos.

Idioma del título de cada momento coincidente, franja proporcional

Idioma del título de cada momento coincidente, en los 79 idiomas encontrados.

Esa mezcla es por qué segmentamos el corpus hacia el inglés antes de confiar en el número principal. Restringir a títulos que sabemos que están en inglés mueve la cifra unos pocos puntos y deja la mayor parte en pie, por lo que parte de la brecha es una discrepancia de idioma y el resto es un fallo de descripción que sobrevive después de eliminar la discrepancia:

Proporción no nombrada en ningún lugar cuando el corpus se segmenta hacia el inglés: 90,8% todo, 87,6% ASCII, 85,8% títulos en inglés, 95,0% audio en inglés
Los mismos números como tabla
Segmento No nombrado en ningún lugar n
todos los momentos 90,8% 10.828
títulos solo ASCII 87,6% 5.560
títulos en inglés confirmados por el modelo 85,8% 5.965
audio en inglés confirmado 95,0% 317 (demasiado pocos para apoyarse en ellos)

3.4 Por acción

Ordenado por la proporción sin ningún término de acción literal en los metadatos disponibles. 17 acciones no tienen ningún momento retenido cuyos metadatos nombren la acción objetivo. En las 141 acciones con al menos 8 momentos verificados, la proporción va del 50,0% al 100,0%, mediana 94,1%. Las 12 menos ocultas:

Las 12 acciones menos ocultas: cada barra son momentos encontrados, divididos en nombrado en su propio texto (azul) vs no nombrado en ningún lugar (rosa)
Cifras en formato de tabla
Acción Dominio Encontrados Lo dice en su texto No nombrado en ningún lugar
wash_car Automotriz 72 36 50,0%
wash_car_panel Automotriz 78 36 53,8%
car_door_open Automotriz 92 38 58,7%
car_door_close Automotriz 91 36 60,4%
car_door Automotriz 93 36 61,3%
pack_box Industrial 73 28 61,6%
grinder_use Industrial 69 23 66,7%
hand_saw_cut Industrial 77 25 67,5%
jack_up_car Automotriz 78 24 69,2%
tape_box Industrial 75 23 69,3%
sit_stand Cuerpo completo 28 8 71,4%
impact_driver Industrial 70 19 72,9%
Las 141 acciones · encontrados / lo-dice / no-nombrado-en-ningún-lugar, más la extrapolación para todo el índice por acción
Acción Dominio Encontrados Lo dice No nombrado en ningún lugar Momentos est. en todo el índice Tasa utilizable Base de la tasa
climb_ladder Cuerpo completo 93 0 100,0% 188.790 26,1% acción
crane_hook Industrial 84 0 100,0% 170.436 9,5% acción
flip Sobremesa (DROID) 87 0 100,0% 176.523 26,7% acción
lift Sobremesa (DROID) 89 0 100,0% 180.581 24,7% acción
load_cart Industrial 82 0 100,0% 166.460 9,8% acción
pick_up Sobremesa (DROID) 72 0 100,0% 146.088 47,9% acción
push Sobremesa (DROID) 91 0 100,0% 184.639 23,3% acción
push_heavy_cart Cuerpo completo 70 0 100,0% 142.100 24,3% acción
push_trolley Industrial 65 0 100,0% 131.950 20,0% acción
refuel Automotriz 91 0 100,0% 184.639 26,4% acción
refuel_nozzle Automotriz 88 0 100,0% 178.552 27,6% acción
seatbelt_buckle Automotriz 87 0 100,0% 176.523 29,9% acción
slide Sobremesa (DROID) 82 0 100,0% 166.378 32,1% acción
sort_parcel Industrial 82 0 100,0% 166.460 37,8% acción
stack Sobremesa (DROID) 65 0 100,0% 136.958 21,9% acción
unfold Sobremesa (DROID) 79 0 100,0% 160.291 57,0% acción
ziptie_bundle Industrial 82 0 100,0% 166.460 48,8% acción
carry_upstairs Cuerpo completo 87 1 98,9% 176.610 25,6% acción
hang Sobremesa (DROID) 92 1 98,9% 181.596 12,1% acción
pull Sobremesa (DROID) 87 1 98,9% 176.523 18,4% acción
pull_trolley Cuerpo completo 92 1 98,9% 186.760 22,8% acción
close Sobremesa (DROID) 83 1 98,8% 168.407 41,5% acción
emergency_stop Industrial 85 1 98,8% 172.465 22,6% acción
handbrake_pull Automotriz 82 1 98,8% 166.378 31,7% acción
place Sobremesa (DROID) 84 1 98,8% 170.436 39,3% acción
remove Sobremesa (DROID) 86 1 98,8% 174.494 48,8% acción
turn_on Sobremesa (DROID) 85 1 98,8% 172.465 29,4% acción
count_stock Industrial 76 1 98,7% 154.280 32,4% acción
reach_overhead Cuerpo completo 79 1 98,7% 160.370 46,8% acción
wipe Sobremesa (DROID) 77 1 98,7% 180.581 28,0% acción
crouch_down Cuerpo completo 65 1 98,5% 131.950 34,9% acción
seat_chip Industrial 65 1 98,5% 131.950 46,9% acción
plaster_wall Construcción 88 2 97,7% 178.552 25,3% acción
plug_in Hogar 87 2 97,7% 176.523 36,5% acción
turn Sobremesa (DROID) 86 2 97,7% 174.494 27,9% acción
unplug_cable Industrial 88 2 97,7% 178.640 42,5% acción
label_parcel Industrial 85 2 97,6% 172.550 45,9% acción
move Sobremesa (DROID) 82 2 97,6% 166.378 34,2% acción
press Sobremesa (DROID) 83 2 97,6% 168.407 42,2% acción
spirit_level Industrial 83 2 97,6% 168.407 12,5% acción
conveyor_pick Industrial 79 2 97,5% 160.291 35,4% acción
grout_joint Construcción 81 2 97,5% 164.349 28,4% acción
open_hood Automotriz 80 2 97,5% 162.320 53,8% acción
trowel_mortar Construcción 79 2 97,5% 160.291 28,2% acción
balance_load Cuerpo completo 77 2 97,4% 156.310 21,1% acción
shovel_load Exterior 74 2 97,3% 150.220 31,5% acción
scan_barcode Industrial 71 2 97,2% 144.059 27,1% acción
desolder_remove Industrial 63 2 96,8% 127.890 51,6% acción
pull_wire Construcción 61 2 96,7% 123.769 30,0% acción
take Sobremesa (DROID) 90 3 96,7% 182.610 37,8% acción
forklift_controls Industrial 59 2 96,6% 119.711 27,1% acción
open_gate Cuerpo completo 88 3 96,6% 178.640 21,6% acción
pour Sobremesa (DROID) 89 3 96,6% 183.624 56,2% acción
plug_in_socket Industrial 85 3 96,5% 172.550 36,5% acción
shrink_wrap Industrial 81 3 96,3% 164.430 22,5% acción
wipe_windshield Automotriz 82 3 96,3% 166.378 34,6% acción
control_dial Industrial 72 3 95,8% 146.088 31,9% acción
steering Automotriz 72 3 95,8% 146.088 59,7% acción
open_carton Industrial 69 3 95,7% 140.070 31,9% acción
put Sobremesa (DROID) 91 4 95,6% 184.639 41,8% acción
plant_seed Exterior 67 3 95,5% 136.010 28,8% acción
steering_turn Automotriz 43 2 95,3% 87.247 60,5% acción
pipe_fitting Industrial 83 4 95,2% 168.407 44,6% acción
open Sobremesa (DROID) 79 4 94,9% 173.987 44,2% acción
dig_soil Exterior 76 4 94,7% 154.280 44,6% acción
sweep Hogar 75 4 94,7% 152.175 29,3% acción
route_cable Industrial 74 4 94,6% 150.220 43,8% acción
gear_shift Automotriz 73 4 94,5% 148.117 37,0% acción
stack_pallet Industrial 70 4 94,3% 142.100 12,9% acción
thermal_paste Industrial 69 4 94,2% 140.070 19,1% acción
ev_charge_plug Automotriz 85 5 94,1% 172.465 26,2% acción
carry_box Hogar 84 5 94,0% 170.436 25,0% acción
open_trunk Automotriz 84 5 94,0% 170.436 28,6% acción
socket_ratchet Industrial 82 5 93,9% 166.378 31,7% acción
top_up_fluid Automotriz 82 5 93,9% 166.378 37,0% acción
press_machine_button Industrial 79 5 93,7% 160.291 31,6% acción
valve_turn Industrial 79 5 93,7% 160.291 19,0% acción
insert_usb Industrial 78 5 93,6% 158.340 46,0% acción
caulk_gun Industrial 86 6 93,0% 174.494 34,1% acción
adjust_mirror Automotriz 85 6 92,9% 172.465 20,0% acción
sand_surface Industrial 85 6 92,9% 172.465 55,3% acción
cut_pipe Construcción 68 5 92,6% 137.972 41,8% acción
machine_unload Industrial 68 5 92,6% 137.972 30,9% acción
unload_truck Industrial 68 5 92,6% 138.040 35,3% acción
machine_lever Industrial 80 6 92,5% 162.320 21,2% acción
assemble_snap_fit Industrial 77 6 92,2% 156.310 51,3% acción
measure_tape Industrial 76 6 92,1% 154.204 42,1% acción
chisel_carve Industrial 49 4 91,8% 99.421 42,9% acción
wrench_bolt Industrial 85 7 91,8% 172.465 34,1% acción
hammer_nail Industrial 84 7 91,7% 170.436 20,2% acción
solder_pipe Construcción 70 6 91,4% 142.030 37,1% acción
step_over Cuerpo completo 70 6 91,4% 142.100 28,6% acción
gauge_read Industrial 78 7 91,0% 158.262 35,9% acción
fold Sobremesa (DROID) 77 7 90,9% 158.769 57,1% acción
tile_place Construcción 83 8 90,4% 168.407 30,1% acción
solder Industrial 55 6 89,1% 111.595 45,5% acción
screwdriver Industrial 72 8 88,9% 146.088 43,1% acción
bend_lift Cuerpo completo 62 7 88,7% 125.860 32,3% acción
power_drill_hole Industrial 70 8 88,6% 142.030 40,9% acción
solder_joint Industrial 61 7 88,5% 123.830 55,7% acción
mix_cement Construcción 68 8 88,2% 137.972 43,3% acción
nail_gun Construcción 68 8 88,2% 137.972 29,8% acción
drywall_screw Construcción 72 9 87,5% 146.088 28,2% acción
lay_brick Construcción 80 10 87,5% 162.320 27,5% acción
clamp_workpiece Industrial 62 8 87,1% 125.798 35,5% acción
machine_load Industrial 62 8 87,1% 125.798 19,4% acción
cut_vegetable Hogar 83 11 86,7% 168.407 42,2% acción
torque_wrench Industrial 83 11 86,7% 168.407 31,3% acción
cut_knife Hogar 73 10 86,3% 148.117 34,2% acción
tire_pressure Automotriz 73 10 86,3% 148.117 47,9% acción
weld_seam Industrial 87 12 86,2% 176.523 31,4% acción
pliers_grip Industrial 72 10 86,1% 146.088 50,7% acción
paint_brush Construcción 90 13 85,6% 182.610 22,2% acción
wire_cut Industrial 76 11 85,5% 154.204 34,2% acción
paint_roller Construcción 79 13 83,5% 160.291 15,2% acción
breadboard_wire Industrial 65 11 83,1% 131.950 44,6% acción
change_tire Automotriz 69 12 82,6% 140.001 50,0% acción
kneel_work Cuerpo completo 55 10 81,8% 111.650 45,5% acción
change_tire_wrench Automotriz 71 13 81,7% 144.059 46,4% acción
assemble_part Industrial 70 13 81,4% 142.030 64,3% acción
check_oil_dipstick Automotriz 80 15 81,2% 162.320 43,8% acción
screw_panel Industrial 81 16 80,2% 164.430 37,5% acción
lathe_operate Industrial 51 11 78,4% 103.479 31,4% acción
engine_bay Automotriz 77 17 77,9% 156.233 56,6% acción
probe_test Industrial 63 14 77,8% 127.890 54,8% acción
machine_control Industrial 78 18 76,9% 158.262 36,4% acción
screwdriver_drive Industrial 78 20 74,4% 158.262 39,5% acción
weld Industrial 86 22 74,4% 174.494 31,4% acción
power_drill Industrial 70 18 74,3% 142.030 48,6% acción
impact_driver Industrial 70 19 72,9% 142.030 35,3% acción
sit_stand Cuerpo completo 28 8 71,4% 56.840 35,7% acción
tape_box Industrial 75 23 69,3% 152.250 26,4% acción
jack_up_car Automotriz 78 24 69,2% 158.262 27,3% acción
hand_saw_cut Industrial 77 25 67,5% 156.233 32,9% acción
grinder_use Industrial 69 23 66,7% 140.001 42,6% acción
pack_box Industrial 73 28 61,6% 148.117 50,0% acción
car_door Automotriz 93 36 61,3% 188.697 20,4% acción
car_door_close Automotriz 91 36 60,4% 184.639 26,4% acción
car_door_open Automotriz 92 38 58,7% 186.668 22,8% acción
wash_car_panel Automotriz 78 36 53,8% 158.262 41,6% acción
wash_car Automotriz 72 36 50,0% 146.088 45,1% acción

Localizabilidad por acción. “Lo dice” cuenta los momentos cuyo propio título, descripción o etiquetas llevan alguna palabra del nombre de la acción bajo la regla de subcadena publicada. Las columnas de extrapolación multiplican el rendimiento por fragmento medido de cada acción por el número de fragmentos del índice y dividen por la superposición medida entre acciones; “base de la tasa” indica si la tasa utilizable fue medida en los fotogramas propios de esa acción, heredada de su dominio o heredada de la tasa a nivel de corpus.

3.5 Obtención de los fotogramas

Para verificar que la recuperación era correcta, extrajimos un fotograma real de cada video coincidente y lo examinamos. Lo que YouTube expone sin extraer el video es el storyboard, una hoja de sprites de miniaturas cuyo intervalo de muestreo se amplía con el tiempo de ejecución: medimos 1 s en videos de hasta 109 s, 2 s de 175 s a 275 s, 5 s de 454 s a 892 s, y 10 s desde 1.366 s en adelante. Los límites de paso entre esas bandas no se resolvieron con los 12 videos que sondeamos. La imagen que juzgamos es la muestra más cercana en o antes del segundo coincidente, por lo que puede estar hasta un intervalo antes, 10 s en el peor caso y 5 s o 10 s para poco más de la mitad de los fotogramas. Medido por storyboard_probe.py; las especificaciones por video están en data/storyboard_spec.json.

Un modelo de visión juzgó los 10.750 de 10.828 fotogramas que obtuvimos, por lo que cada tasa aquí se mide en el 99,3% del corpus en lugar de en una muestra. El 93,8% son metraje real en lugar de animación, un juego o una grabación de pantalla; el 25,7% captó la acción visiblemente en curso y el 57,4% la mostró en curso o preparada; el 34,5% obtuvo una puntuación de 3 o superior en una escala de usabilidad de 0 a 5. Esa última cifra es un juicio sobre un proceso de entrenamiento posterior que el modelo no puede observar, y se comporta como tal: en una muestra de 60 fotogramas, cuatro ejecuciones de la configuración idéntica abarcaron 3,4 puntos, y reformular el criterio lo movió 20. La proporción de acción visible se movió 1,7 en ese mismo cambio de criterio, lo que la convierte en la cifra a comparar entre ejecuciones.

Adquisición de fotogramas:

Resultados de extracción de fotogramas sobre todos los momentos intentados
Cifras en formato de tabla
Resultado Momentos Proporción
Fotogramas obtenidos 10.750 / 10.828 99%
Sin storyboard analizable 75 0,7%
Fallo en la obtención del sprite 3 0,03%

Adquisición de fotogramas. Obtuvimos los storyboards directamente y encontramos limitación de velocidad en 863 de los 10.828 momentos, 856 de los cuales una pasada posterior recuperó, por lo que ninguno de los 78 momentos perdidos terminó con un 429; la API de Datos de Medios es la ruta compatible para este paso y devuelve storyboards directamente. Esta auditoría no realizó ninguna llamada a ella. Esos momentos están en 7.549 videos, y un video cuesta una obtención de página de visualización más al menos una hoja de sprites, almacenada en caché por video.


4 Los momentos, reproducibles

Las coincidencias se muestran frente al fotograma del storyboard más cercano en o antes del segundo en que fueron coincidentes. El ranking no está curado. 10.750 de los 10.828 momentos tienen un fotograma propio, y la galería completa tiene 10.761 filas porque 11 más comparten una imagen con otra acción coincidente en el mismo segundo. Esas filas descansan en 8.792 imágenes distintas, porque el nombre del archivo nombra un video y un segundo en lugar de una acción.

A continuación se muestran los momentos coincidentes con mayor puntuación, uno por acción, directamente del ranking. Haz clic en cualquier fotograma para reproducir el video fuente en el segundo coincidente.

Mano usando cinta métrica en tabla de madera Manos sosteniendo cortador de tubo de cobre Manos con guantes rosas ordenando pequeñas piezas metálicas blancas
measure_tape · 0,391 · útil 4/5
Mano usando cinta métrica en tabla de madera
Shootout review and a work story!
cut_pipe · 0,388 · útil 2/5
Manos sosteniendo cortador de tubo de cobre
How Raw Copper Turns into a Masterpiece with Artistic Hammer Strikes⚒️🔥🇮🇷
machine_load · 0,386 · útil 2/5
Manos con guantes rosas ordenando pequeñas piezas metálicas blancas
THK rail | Installation guide | THK rail | Rail removal and installation | 0363.
Manos en controles de carretilla elevadora y volante Manos cerca de placa de circuito, configuración de soldadura poco clara Ambas manos agarrando el volante, girando
forklift_controls · 0,383 · útil 5/5
Manos en controles de carretilla elevadora y volante
JUST DRIVE : Forklift #38
solder · 0,382 · útil 3/5
Manos cerca de placa de circuito, configuración de soldadura poco clara
⚡ Simple DIY Repair Old Bike Battery And Install Separate USB Charging Port For
steering_turn · 0,378 · útil 5/5
Ambas manos agarrando el volante, girando
1995 Volvo 850 T5-R Wagon – POV Driving Impressions
Mano cerca de rollos de cinta y materiales de embalaje Manos manipulando tela blanca sobre superficie Manos con guantes cerca de configuración de máquina industrial
tape_box · 0,376 · útil 1/5
Mano cerca de rollos de cinta y materiales de embalaje
Cell 32140 high discharge line – battery pack accessories 0824457979
wipe · 0,374 · útil 3/5
Manos manipulando tela blanca sobre superficie
Washed Notebook ASMR 📘✨ Radiator‑Dried Pages With Intense Crinkles
machine_unload · 0,373 · útil 1/5
Manos con guantes cerca de configuración de máquina industrial
Transmission Assembly – 1929 Ford Model A
Manos posicionando pistola de clavos en armazón de madera Persona levantándose de la silla usando apoyabrazos Mano escribiendo en cuaderno cerca de portapapeles
nail_gun · 0,371 · útil 4/5
Manos posicionando pistola de clavos en armazón de madera
Building a deck for garden raised bed – Part 1
sit_stand · 0,371 · útil 5/5
Persona levantándose de la silla usando apoyabrazos
Flexibility and Mobility Senior Chair Exercise
count_stock · 0,371 · útil 2/5
Mano escribiendo en cuaderno cerca de portapapeles
[26.4.16.Thu.] Study with me | Studying together | Thursday meet-up! | Firefight
Dos manos sosteniendo sondas de multímetro en circuito Manos sosteniendo botellas cerca de apertura de caja, sin cortar Persona boca abajo en el suelo en posición de trabajo
probe_test · 0,371 · útil 5/5
Dos manos sosteniendo sondas de multímetro en circuito
How to Measure Electronic Components with a Multimeter (Complete Guide)
open_carton · 0,369 · útil 2/5
Manos sosteniendo botellas cerca de apertura de caja, sin cortar
Oddly Satisfying Video-How to Cutting New Wooden Fruits and Vegetables ASMR – Cu
kneel_work · 0,369 · útil 3/5
Persona boca abajo en el suelo en posición de trabajo
Lupimorphie, animal-performance by Régis Moulu, Capsule 114, dance
Persona empujando carrito pesado con ambas manos Mano guiando cincel en talla de madera Mano girando volante de carro transversal de torno con pieza giratoria
push_heavy_cart · 0,367 · útil 4/5
Persona empujando carrito pesado con ambas manos
2321FI”2-Step Multi-Functional Aluminum Alloy Step Trolley: Comprehensive Usage
chisel_carve · 0,366 · útil 5/5
Mano guiando cincel en talla de madera
adapt and overcome 🌱
lathe_operate · 0,362 · útil 5/5
Mano girando volante de carro transversal de torno con pieza giratoria
Unbelievable Damage! Caterpillar Cylindrical Roller Bearing Destroyed 😱

Cada celda: la acción para la que fue coincidente y su puntuación de relevancia, luego lo que el modelo de visión vio en el fotograma (mostrado la imagen sin el título), luego el título propio del video en español. Las marcas de tiempo se abren dos segundos antes para que el momento entre en vista.


Recuperar un momento por descripción es una tarea establecida: anclaje temporal en Charades-STA, detección de momentos destacados en QVHighlights, consultas en lenguaje natural en Ego4D. No introducimos ningún método nuevo aquí.

La construcción tiene precedentes. TVR (2020) etiquetó sus 108.965 consultas según si el video, los subtítulos o ambos las respondían, reportando un 74,2% solo en video. Lo que difiere es el corpus y el propósito: video web abierto en lugar de seis programas de televisión, acciones físicas, una submuestra verificada y una proporción de costo. El formato de publicación sigue a AVA y HowTo100M: identificador, marca de tiempo y etiqueta, sin redistribuir ningún video. La recuperación a lo largo del proceso es la API de búsqueda de video. Los fotogramas aquí se obtuvieron analizando el storyboard de YouTube de la página de visualización; no se extrajo ningún clip en ningún momento. Para una ejecución en producción, la ruta compatible es la API de Datos de Medios.

Lo que establece la auditoría es más limitado que un reemplazo de las demostraciones robóticas. La web alberga una capa grande y mal indexada de metraje de acciones físicas, y la búsqueda visual con marcas de tiempo hace que esa capa sea considerablemente más fácil de alcanzar. Si el metraje curado de esta manera mejora de manera medible un sistema de robótica o de modelo de mundo es la siguiente pregunta, y responderla necesita un experimento de entrenamiento que esta auditoría no realizó.


6 Cita

@misc{webmoments2026,
  title        = {Finding the Web's Hidden Robot Training Moments in
                  Public Web Video Data},
  author       = {Bright Data},
  year         = {2026},
  howpublished = {Technical report},
  note         = {141 physical actions, 10,828 retrieved match rows over
                  8,849 distinct video-second moments, and
                  10,750 frames reviewed by a vision model}
}