Los datos de video pueden ayudar a entrenar robots, incluidos los humanoides, a comprender y realizar tareas físicas. Esto abarca los modelos VLA, que conectan observaciones visuales e instrucciones en lenguaje con acciones, y los modelos de mundo, que aprenden cómo cambia un entorno con el tiempo. La web pública alberga millones de videos de personas realizando ese trabajo, y encontrar una acción específica dentro de ellos es difícil, porque un título describe el tema general de un video mientras deja las acciones del metraje sin nombre. Las descripciones y etiquetas generalmente no son mejores.
Para este estudio utilizamos la API de búsqueda de video de Bright Data. La API de búsqueda de video es una herramienta que permite buscar visualmente momentos dentro de videos de la web.
Se le proporciona una descripción en lenguaje natural de una acción, busca en el contenido visual de los videos públicos en lugar del texto adjunto a ellos, y devuelve videos candidatos junto con marcas de tiempo de dónde puede aparecer la acción. La búsqueda convencional por palabras clave funciona al revés, comparando tus palabras con el título, la descripción y las etiquetas de un video, por lo que ambos enfoques terminan alcanzando metrajes muy diferentes.
Le enviamos 141 acciones físicas y obtuvimos 10.828 momentos en 7.549 videos. Para cada momento retenido, verificamos si alguna palabra del nombre de la acción aparecía en el título, la descripción o las etiquetas del video. En el 90,8% de los casos, ninguna lo hacía.
Si recopilas metraje de entrenamiento por palabras clave, ese 90,8% es el dato que pierdes, y hace que la cosecha de la API sea 10× mayor que lo que la búsqueda de texto podría alcanzar. Esos momentos adicionales muestran las mismas acciones que solicitaste, dentro de videos cuyos títulos hablan de otra cosa, y permanecen invisibles para un pipeline de texto sin importar cuántas consultas ejecutes en estos campos.
Comparamos subcadenas literales con el título, la descripción y las etiquetas, y contamos dentro del corpus que la propia API devolvió, por lo que la proporción se mantiene bajo esas dos condiciones. La búsqueda semántica, la búsqueda multilingüe, la búsqueda en transcripciones y el propio ranking de YouTube están fuera de lo que probamos.
El resultado en tres cifras
| 10,9× | más momentos que la coincidencia literal | la búsqueda de contenido devolvió 10.828; 992 llevan alguna palabra del nombre de la acción en sus metadatos |
| 90,8% | no nombrado en ningún lugar | 9.836 de 10.828 momentos no llevan ninguna mención de la acción en su título, descripción o etiquetas |
| 56,1% | sin pista alguna en el título | una prueba menos estricta que la búsqueda. Preguntamos a google/gemini-2.5-flash si algo en el título se relaciona con la acción de alguna manera, por muy tenue que sea, incluyendo pistas demasiado vagas para buscar. No encontró nada en 6.071 de 10.828 |
De dónde provienen estas tres cifras
Las dos primeras son la misma división: 9.836 de 10.828 momentos no llevan ninguna palabra de la acción en ningún campo, y los 992 que sí lo hacen son lo que alcanza un comparador literal, 10.828 ÷ 992 = 10,9. Los cuatro grupos (título, descripción, etiquetas, ninguno) son mutuamente excluyentes y suman el total verificado. Ambos se cuentan por fila de coincidencia; si se colapsan a los 8.849 video-segundos distintos, la proporción resulta en 8,9×.
El tercero cuenta los títulos que el modelo calificó como no relacionados: 6.071 de 10.828, una fila por momento en 7.549 videos distintos.
Las marcas de tiempo tienen una segunda consecuencia. Si se permite que cada momento tenga como máximo 10 segundos de acción, las 5.066,5 h de video fuente en las que se encuentran estas coincidencias se convierten en 24,58 h de clip, lo que reduce lo que debe moverse, almacenarse y revisarse en 206,1×.
Lo que la recuperación realmente devolvió. Que la recuperación sea confiable no es lo mismo que ser correcta, así que extrajimos un fotograma real de casi cada coincidencia y tuvimos un modelo de visión para calificarlos a todos. La sección 3.5 tiene las tasas. Esta auditoría presenta metraje candidato para descubrimiento y curación, y ninguna política, modelo de mundo o robot fue entrenado con él.
Muestra de seis videos y sus títulos en YouTube
Lo que vio un modelo de visión al mostrarle la imagen sin el título, frente al título propio del video, traducido al español cuando se indica un idioma fuente. Un juez de IA leyó cada título del corpus en busca de cualquier indicio de su acción, y calificó estos seis como no relacionados: una fecha simple, un versículo del Corán, un boletín de noticias económicas. Confirmamos cada fotograma visualmente y cada video está activo. Haz clic en un fotograma para reproducir el video en ese segundo.
El 90,8% de los momentos recuperados no están nombrados en ningún lugar de sus metadatos
Esa proporción es la brecha entre lo que la recuperación de contenido alcanzó en este corpus y lo que habría alcanzado la coincidencia literal de metadatos.
La objeción obvia es el idioma, ya que probamos palabras de acción en inglés contra títulos que a menudo no están en inglés. Restringir a títulos en inglés confirmados por el modelo aún deja la cifra en el 85,8%; la sección 3.3 muestra cada segmento.
Dónde se nombra la acción, en los 10.828 momentos recuperados
Formato de tabla
| Grupo | Momentos | Proporción | Qué significa para un pipeline de texto |
|---|---|---|---|
| nombrado en el título | 386 | 3,6% | el comparador literal lo encuentra |
| solo en la descripción | 531 | 4,9% | solo si lees las descripciones |
| solo en etiquetas | 75 | 0,7% | solo si lees las etiquetas |
| no nombrado en ningún lugar | 9.836 | 90,8% | el comparador literal no lo encuentra |
Un momento real de cada grupo, porque “531 momentos solo se nombran en la descripción” es una afirmación y un título real con la palabra coincidente marcada es evidencia:
| Grupo | Acción | Título del video (se abre en el segundo coincidente) | Coincidencia |
|---|---|---|---|
| nombrado en el título | pour |
Teaching a beginner how to pour latte art patterns (Expert Barista Guide) | coincidencia en “pour” |
| solo en la descripción | take |
GENTLE SOY SAUCE SOUP RAMEN (SHOYU RAMEN) | A Real Japanese Dad Cooks | Japanese cooking | coincidencia en “take” |
| solo en etiquetas | fold |
ورقة واحدة .. طيّات قليلة .. بدون لاصق.. وعالمٌ هرميٌ كامل! | coincidencia en “fold” |
| no nombrado en ningún lugar | take |
# viral video in social media # viral koriyaan # sad story of koriyan romance | ninguna palabra de “take” aparece en ningún lugar de sus metadatos |
Proporción invisible, por dominio
Cifras en formato de tabla
| Dominio | No nombrado en ningún lugar | Momentos verificados |
|---|---|---|
| Sobremesa (DROID) | 98,1% | 1.836 |
| Exterior | 95,9% | 217 |
| Cuerpo completo | 95,4% | 866 |
| Hogar | 92,0% | 402 |
| Construcción | 91,1% | 987 |
| Industrial | 89,6% | 4.612 |
| Automotriz | 83,8% | 1.908 |
Cada video coincidente en cada dominio llevaba metadatos extraídos, por lo que cada n es el conjunto completo recuperado de ese dominio. Nadie titula un video “poniendo un bloque en un tazón”; los videos de reparación sí anuncian lo que arreglan, razón por la cual el automotriz es el único dominio al que un comparador literal llega parcialmente.
1 Lo que elimina una marca de tiempo del pipeline
Supongamos que quieres diez segundos de alguien soldando una unión. La ruta habitual lleva cinco pasos, y cada uno de ellos se ejecuta sobre un archivo de video completo: encontrar un video por su título, extraer todo, buscar en tu propia copia el momento, recortar ese momento y luego etiquetar lo que muestra.
El primer paso pasa por alto el 90,8% de estos momentos directamente. Buscar en el metraje en su lugar devuelve el video y el segundo dentro de él, y uno de los cinco pasos deja de existir. No hay nada que buscar dentro del video extraído, ya que ya sabes dónde está el momento. El recorte aún debe realizarse, ya que la API de Datos de Medios entrega videos completos, audio, subtítulos y storyboards sin tomar una marca de tiempo, pero recortas contra un desplazamiento conocido en lugar de buscarlo. Cinco pasos se convierten en cuatro.
Los pipelines de recopilación offline comúnmente dividen ese trabajo en varios sistemas: mover video al almacenamiento en la nube, anotarlo fotograma a fotograma ya sea manualmente o semi-automáticamente, y convertir entre formatos de robótica como ROS o MCAP y formatos de video de uso general. Cada transferencia es un lugar donde se pierde rendimiento y donde la alineación temporal entre las transmisiones de cámara y los comandos del motor puede desviarse. No medimos nada de eso aquí. Es el contexto que hace que una marca de tiempo devuelta valga la pena.
Ruta convencional (cinco pasos, pagados sobre videos completos):
- Encontrar videos · búsqueda por palabras clave en títulos
- Extraer · 5.066,5 h de video fuente (el paso costoso, medido a partir de la duración extraída de cada video coincidente)
- Ejecutar una búsqueda · una segunda herramienta, sobre tu propia copia
- Recortar · recortar cada clip al momento
- Etiquetar · anotar lo que recortaste
Con recuperación de momentos (cuatro pasos, pagados por segundos):
- Encontrar escenas · la búsqueda de contenido devuelve el segundo
- Recuperar · ~24,58 h alrededor de los desplazamientos devueltos (est.: asume que cada momento es como máximo 10 segundos de acción)
- Recortar · recortar localmente, contra un desplazamiento conocido
- Etiquetar · un fotograma por momento
2 Método
Escribimos una oración describiendo cada una de las 141 acciones y las enviamos a la API de búsqueda de video. La de soldadura decía:
una de las 141 oraciones que enviamos
primer plano de una mano sosteniendo un soldador en una unión de placa de circuito mientras alimenta hilo de soldadura con la otra mano, iluminación de lámpara de banco
Luego extrajimos el título, la descripción y las etiquetas de cada video que regresó. Bright Data documenta el índice como coincidente en fotogramas muestreados en lugar de en título, descripción o etiquetas, por lo que los campos que calificamos no deberían ser los que encontraron el metraje. No lo probamos de forma independiente.
Tomamos 22 nombres de acciones de las cadenas de tareas de DROID, que leímos por frecuencia de verbos, y añadimos las 119 restantes como acciones de autoría propia para ampliar la auditoría más allá de la cobertura de DROID.
3 Resultados
3.1 Cuánto cuesta cada ruta
Todo aquí está en horas sobre este corpus, con duraciones sumadas del scraper, por lo que la cifra fuente es un recuento en lugar de una estimación. No extrajimos ningún video, por lo que no reclamamos ningún recuento de bytes.
Dos recuentos están detrás del 206,1×. Las 5.066,5 h son una suma real sobre 7.549 videos. La cifra de clips cuenta cada (video, segundo) una vez, sobre 8.849 segundos distintos, y multiplica por la ventana de 10 segundos.
La proporción descansa en dos elecciones, cuán largo es un clip y si la cola larga cuenta, y la cola larga es la palanca más grande de las dos: 483 videos de tres horas o más son ~6% del conjunto y llevan ~60% de las horas. La tabla de sensibilidad completa:
Cifras en formato de tabla
| Eliminar videos más largos de | Videos | Horas del corpus | Segundos distintos | Horas de clip (10 s) | Reducción |
|---|---|---|---|---|---|
| 1 h | 6.554 | 1.113,5 | 7.605 | 21,12 | 52,7× |
| 2 h | 6.873 | 1.563,8 | 8.017 | 22,27 | 70,2× |
| 3 h | 7.066 | 2.031,3 | 8.247 | 22,91 | 88,7× |
| 6 h | 7.364 | 3.272,8 | 8.609 | 23,91 | 136,9× |
| 12 h | 7.546 | 5.012,3 | 8.846 | 24,57 | 204,0× |
| conservar todos (publicados) | 7.549 | 5.066,5 | 8.849 | 24,58 | 206,1× |
El mismo corpus, obtenido de cualquier manera: 10.828 filas de coincidencias que caen en 8.849 video-segundos distintos. Contar cada coincidencia en lugar de cada segundo distinto daría 30,08 horas de clip y una reducción de 168,4×. La misma proporción se aplica al tiempo de revisión solo si la alternativa revisa cada video fuente completo, el tiempo de revisión escala linealmente con la duración, y recorrer 8.849 clips separados no conlleva ningún costo por clip.
3.2 La regla de coincidencia y qué hace al endurecerla
Para cada momento candidato retenido, verificamos el título, la descripción y las etiquetas del video, los principales campos de metadatos disponibles en esta auditoría.
Un momento se cuenta como nombrado si alguna palabra del nombre de la acción de más de dos caracteres aparece como una subcadena insensible a mayúsculas y minúsculas, por lo que “change” solo marca change_tire_wrench y “car” se encuentra dentro de “carpet”. Esa es la regla más permisiva que podríamos haber elegido, lo que convierte el titular en un mínimo. Endurecerla y sube:
Cada regla más estricta que la publicada mueve la cifra hacia arriba, lo que hace que el 90,8% sea un mínimo en lugar de un mejor caso: 395 de los 992 momentos que la regla publicada cuenta como nombrados lo deben a un fragmento dentro de una palabra más larga. Cada valor está medido, cuatro pasadas reales sobre el corpus (supply_gap.py _variants()).
3.3 Gran parte está titulado en otro idioma
Leímos el idioma del título para cada uno de los 10.828 momentos coincidentes, por lo que este es el corpus completo en lugar de una muestra. De ellos, 4.863 (~45%) están en un video titulado en uno de 77 idiomas no ingleses nombrados, más un título que el modelo no pudo identificar. Las mismas descripciones de acciones en inglés devolvieron 423 momentos de videos con título en hindi y 509 de videos con título en portugués. No se recopiló ningún campo geográfico, por lo que esto no dice nada sobre dónde se hicieron los videos.
Idioma del título de cada momento coincidente, en los 79 idiomas encontrados.
Esa mezcla es por qué segmentamos el corpus hacia el inglés antes de confiar en el número principal. Restringir a títulos que sabemos que están en inglés mueve la cifra unos pocos puntos y deja la mayor parte en pie, por lo que parte de la brecha es una discrepancia de idioma y el resto es un fallo de descripción que sobrevive después de eliminar la discrepancia:
Los mismos números como tabla
| Segmento | No nombrado en ningún lugar | n |
|---|---|---|
| todos los momentos | 90,8% | 10.828 |
| títulos solo ASCII | 87,6% | 5.560 |
| títulos en inglés confirmados por el modelo | 85,8% | 5.965 |
| audio en inglés confirmado | 95,0% | 317 (demasiado pocos para apoyarse en ellos) |
3.4 Por acción
Ordenado por la proporción sin ningún término de acción literal en los metadatos disponibles. 17 acciones no tienen ningún momento retenido cuyos metadatos nombren la acción objetivo. En las 141 acciones con al menos 8 momentos verificados, la proporción va del 50,0% al 100,0%, mediana 94,1%. Las 12 menos ocultas:
Cifras en formato de tabla
| Acción | Dominio | Encontrados | Lo dice en su texto | No nombrado en ningún lugar |
|---|---|---|---|---|
wash_car |
Automotriz | 72 | 36 | 50,0% |
wash_car_panel |
Automotriz | 78 | 36 | 53,8% |
car_door_open |
Automotriz | 92 | 38 | 58,7% |
car_door_close |
Automotriz | 91 | 36 | 60,4% |
car_door |
Automotriz | 93 | 36 | 61,3% |
pack_box |
Industrial | 73 | 28 | 61,6% |
grinder_use |
Industrial | 69 | 23 | 66,7% |
hand_saw_cut |
Industrial | 77 | 25 | 67,5% |
jack_up_car |
Automotriz | 78 | 24 | 69,2% |
tape_box |
Industrial | 75 | 23 | 69,3% |
sit_stand |
Cuerpo completo | 28 | 8 | 71,4% |
impact_driver |
Industrial | 70 | 19 | 72,9% |
Las 141 acciones · encontrados / lo-dice / no-nombrado-en-ningún-lugar, más la extrapolación para todo el índice por acción
| Acción | Dominio | Encontrados | Lo dice | No nombrado en ningún lugar | Momentos est. en todo el índice | Tasa utilizable | Base de la tasa |
|---|---|---|---|---|---|---|---|
climb_ladder |
Cuerpo completo | 93 | 0 | 100,0% | 188.790 | 26,1% | acción |
crane_hook |
Industrial | 84 | 0 | 100,0% | 170.436 | 9,5% | acción |
flip |
Sobremesa (DROID) | 87 | 0 | 100,0% | 176.523 | 26,7% | acción |
lift |
Sobremesa (DROID) | 89 | 0 | 100,0% | 180.581 | 24,7% | acción |
load_cart |
Industrial | 82 | 0 | 100,0% | 166.460 | 9,8% | acción |
pick_up |
Sobremesa (DROID) | 72 | 0 | 100,0% | 146.088 | 47,9% | acción |
push |
Sobremesa (DROID) | 91 | 0 | 100,0% | 184.639 | 23,3% | acción |
push_heavy_cart |
Cuerpo completo | 70 | 0 | 100,0% | 142.100 | 24,3% | acción |
push_trolley |
Industrial | 65 | 0 | 100,0% | 131.950 | 20,0% | acción |
refuel |
Automotriz | 91 | 0 | 100,0% | 184.639 | 26,4% | acción |
refuel_nozzle |
Automotriz | 88 | 0 | 100,0% | 178.552 | 27,6% | acción |
seatbelt_buckle |
Automotriz | 87 | 0 | 100,0% | 176.523 | 29,9% | acción |
slide |
Sobremesa (DROID) | 82 | 0 | 100,0% | 166.378 | 32,1% | acción |
sort_parcel |
Industrial | 82 | 0 | 100,0% | 166.460 | 37,8% | acción |
stack |
Sobremesa (DROID) | 65 | 0 | 100,0% | 136.958 | 21,9% | acción |
unfold |
Sobremesa (DROID) | 79 | 0 | 100,0% | 160.291 | 57,0% | acción |
ziptie_bundle |
Industrial | 82 | 0 | 100,0% | 166.460 | 48,8% | acción |
carry_upstairs |
Cuerpo completo | 87 | 1 | 98,9% | 176.610 | 25,6% | acción |
hang |
Sobremesa (DROID) | 92 | 1 | 98,9% | 181.596 | 12,1% | acción |
pull |
Sobremesa (DROID) | 87 | 1 | 98,9% | 176.523 | 18,4% | acción |
pull_trolley |
Cuerpo completo | 92 | 1 | 98,9% | 186.760 | 22,8% | acción |
close |
Sobremesa (DROID) | 83 | 1 | 98,8% | 168.407 | 41,5% | acción |
emergency_stop |
Industrial | 85 | 1 | 98,8% | 172.465 | 22,6% | acción |
handbrake_pull |
Automotriz | 82 | 1 | 98,8% | 166.378 | 31,7% | acción |
place |
Sobremesa (DROID) | 84 | 1 | 98,8% | 170.436 | 39,3% | acción |
remove |
Sobremesa (DROID) | 86 | 1 | 98,8% | 174.494 | 48,8% | acción |
turn_on |
Sobremesa (DROID) | 85 | 1 | 98,8% | 172.465 | 29,4% | acción |
count_stock |
Industrial | 76 | 1 | 98,7% | 154.280 | 32,4% | acción |
reach_overhead |
Cuerpo completo | 79 | 1 | 98,7% | 160.370 | 46,8% | acción |
wipe |
Sobremesa (DROID) | 77 | 1 | 98,7% | 180.581 | 28,0% | acción |
crouch_down |
Cuerpo completo | 65 | 1 | 98,5% | 131.950 | 34,9% | acción |
seat_chip |
Industrial | 65 | 1 | 98,5% | 131.950 | 46,9% | acción |
plaster_wall |
Construcción | 88 | 2 | 97,7% | 178.552 | 25,3% | acción |
plug_in |
Hogar | 87 | 2 | 97,7% | 176.523 | 36,5% | acción |
turn |
Sobremesa (DROID) | 86 | 2 | 97,7% | 174.494 | 27,9% | acción |
unplug_cable |
Industrial | 88 | 2 | 97,7% | 178.640 | 42,5% | acción |
label_parcel |
Industrial | 85 | 2 | 97,6% | 172.550 | 45,9% | acción |
move |
Sobremesa (DROID) | 82 | 2 | 97,6% | 166.378 | 34,2% | acción |
press |
Sobremesa (DROID) | 83 | 2 | 97,6% | 168.407 | 42,2% | acción |
spirit_level |
Industrial | 83 | 2 | 97,6% | 168.407 | 12,5% | acción |
conveyor_pick |
Industrial | 79 | 2 | 97,5% | 160.291 | 35,4% | acción |
grout_joint |
Construcción | 81 | 2 | 97,5% | 164.349 | 28,4% | acción |
open_hood |
Automotriz | 80 | 2 | 97,5% | 162.320 | 53,8% | acción |
trowel_mortar |
Construcción | 79 | 2 | 97,5% | 160.291 | 28,2% | acción |
balance_load |
Cuerpo completo | 77 | 2 | 97,4% | 156.310 | 21,1% | acción |
shovel_load |
Exterior | 74 | 2 | 97,3% | 150.220 | 31,5% | acción |
scan_barcode |
Industrial | 71 | 2 | 97,2% | 144.059 | 27,1% | acción |
desolder_remove |
Industrial | 63 | 2 | 96,8% | 127.890 | 51,6% | acción |
pull_wire |
Construcción | 61 | 2 | 96,7% | 123.769 | 30,0% | acción |
take |
Sobremesa (DROID) | 90 | 3 | 96,7% | 182.610 | 37,8% | acción |
forklift_controls |
Industrial | 59 | 2 | 96,6% | 119.711 | 27,1% | acción |
open_gate |
Cuerpo completo | 88 | 3 | 96,6% | 178.640 | 21,6% | acción |
pour |
Sobremesa (DROID) | 89 | 3 | 96,6% | 183.624 | 56,2% | acción |
plug_in_socket |
Industrial | 85 | 3 | 96,5% | 172.550 | 36,5% | acción |
shrink_wrap |
Industrial | 81 | 3 | 96,3% | 164.430 | 22,5% | acción |
wipe_windshield |
Automotriz | 82 | 3 | 96,3% | 166.378 | 34,6% | acción |
control_dial |
Industrial | 72 | 3 | 95,8% | 146.088 | 31,9% | acción |
steering |
Automotriz | 72 | 3 | 95,8% | 146.088 | 59,7% | acción |
open_carton |
Industrial | 69 | 3 | 95,7% | 140.070 | 31,9% | acción |
put |
Sobremesa (DROID) | 91 | 4 | 95,6% | 184.639 | 41,8% | acción |
plant_seed |
Exterior | 67 | 3 | 95,5% | 136.010 | 28,8% | acción |
steering_turn |
Automotriz | 43 | 2 | 95,3% | 87.247 | 60,5% | acción |
pipe_fitting |
Industrial | 83 | 4 | 95,2% | 168.407 | 44,6% | acción |
open |
Sobremesa (DROID) | 79 | 4 | 94,9% | 173.987 | 44,2% | acción |
dig_soil |
Exterior | 76 | 4 | 94,7% | 154.280 | 44,6% | acción |
sweep |
Hogar | 75 | 4 | 94,7% | 152.175 | 29,3% | acción |
route_cable |
Industrial | 74 | 4 | 94,6% | 150.220 | 43,8% | acción |
gear_shift |
Automotriz | 73 | 4 | 94,5% | 148.117 | 37,0% | acción |
stack_pallet |
Industrial | 70 | 4 | 94,3% | 142.100 | 12,9% | acción |
thermal_paste |
Industrial | 69 | 4 | 94,2% | 140.070 | 19,1% | acción |
ev_charge_plug |
Automotriz | 85 | 5 | 94,1% | 172.465 | 26,2% | acción |
carry_box |
Hogar | 84 | 5 | 94,0% | 170.436 | 25,0% | acción |
open_trunk |
Automotriz | 84 | 5 | 94,0% | 170.436 | 28,6% | acción |
socket_ratchet |
Industrial | 82 | 5 | 93,9% | 166.378 | 31,7% | acción |
top_up_fluid |
Automotriz | 82 | 5 | 93,9% | 166.378 | 37,0% | acción |
press_machine_button |
Industrial | 79 | 5 | 93,7% | 160.291 | 31,6% | acción |
valve_turn |
Industrial | 79 | 5 | 93,7% | 160.291 | 19,0% | acción |
insert_usb |
Industrial | 78 | 5 | 93,6% | 158.340 | 46,0% | acción |
caulk_gun |
Industrial | 86 | 6 | 93,0% | 174.494 | 34,1% | acción |
adjust_mirror |
Automotriz | 85 | 6 | 92,9% | 172.465 | 20,0% | acción |
sand_surface |
Industrial | 85 | 6 | 92,9% | 172.465 | 55,3% | acción |
cut_pipe |
Construcción | 68 | 5 | 92,6% | 137.972 | 41,8% | acción |
machine_unload |
Industrial | 68 | 5 | 92,6% | 137.972 | 30,9% | acción |
unload_truck |
Industrial | 68 | 5 | 92,6% | 138.040 | 35,3% | acción |
machine_lever |
Industrial | 80 | 6 | 92,5% | 162.320 | 21,2% | acción |
assemble_snap_fit |
Industrial | 77 | 6 | 92,2% | 156.310 | 51,3% | acción |
measure_tape |
Industrial | 76 | 6 | 92,1% | 154.204 | 42,1% | acción |
chisel_carve |
Industrial | 49 | 4 | 91,8% | 99.421 | 42,9% | acción |
wrench_bolt |
Industrial | 85 | 7 | 91,8% | 172.465 | 34,1% | acción |
hammer_nail |
Industrial | 84 | 7 | 91,7% | 170.436 | 20,2% | acción |
solder_pipe |
Construcción | 70 | 6 | 91,4% | 142.030 | 37,1% | acción |
step_over |
Cuerpo completo | 70 | 6 | 91,4% | 142.100 | 28,6% | acción |
gauge_read |
Industrial | 78 | 7 | 91,0% | 158.262 | 35,9% | acción |
fold |
Sobremesa (DROID) | 77 | 7 | 90,9% | 158.769 | 57,1% | acción |
tile_place |
Construcción | 83 | 8 | 90,4% | 168.407 | 30,1% | acción |
solder |
Industrial | 55 | 6 | 89,1% | 111.595 | 45,5% | acción |
screwdriver |
Industrial | 72 | 8 | 88,9% | 146.088 | 43,1% | acción |
bend_lift |
Cuerpo completo | 62 | 7 | 88,7% | 125.860 | 32,3% | acción |
power_drill_hole |
Industrial | 70 | 8 | 88,6% | 142.030 | 40,9% | acción |
solder_joint |
Industrial | 61 | 7 | 88,5% | 123.830 | 55,7% | acción |
mix_cement |
Construcción | 68 | 8 | 88,2% | 137.972 | 43,3% | acción |
nail_gun |
Construcción | 68 | 8 | 88,2% | 137.972 | 29,8% | acción |
drywall_screw |
Construcción | 72 | 9 | 87,5% | 146.088 | 28,2% | acción |
lay_brick |
Construcción | 80 | 10 | 87,5% | 162.320 | 27,5% | acción |
clamp_workpiece |
Industrial | 62 | 8 | 87,1% | 125.798 | 35,5% | acción |
machine_load |
Industrial | 62 | 8 | 87,1% | 125.798 | 19,4% | acción |
cut_vegetable |
Hogar | 83 | 11 | 86,7% | 168.407 | 42,2% | acción |
torque_wrench |
Industrial | 83 | 11 | 86,7% | 168.407 | 31,3% | acción |
cut_knife |
Hogar | 73 | 10 | 86,3% | 148.117 | 34,2% | acción |
tire_pressure |
Automotriz | 73 | 10 | 86,3% | 148.117 | 47,9% | acción |
weld_seam |
Industrial | 87 | 12 | 86,2% | 176.523 | 31,4% | acción |
pliers_grip |
Industrial | 72 | 10 | 86,1% | 146.088 | 50,7% | acción |
paint_brush |
Construcción | 90 | 13 | 85,6% | 182.610 | 22,2% | acción |
wire_cut |
Industrial | 76 | 11 | 85,5% | 154.204 | 34,2% | acción |
paint_roller |
Construcción | 79 | 13 | 83,5% | 160.291 | 15,2% | acción |
breadboard_wire |
Industrial | 65 | 11 | 83,1% | 131.950 | 44,6% | acción |
change_tire |
Automotriz | 69 | 12 | 82,6% | 140.001 | 50,0% | acción |
kneel_work |
Cuerpo completo | 55 | 10 | 81,8% | 111.650 | 45,5% | acción |
change_tire_wrench |
Automotriz | 71 | 13 | 81,7% | 144.059 | 46,4% | acción |
assemble_part |
Industrial | 70 | 13 | 81,4% | 142.030 | 64,3% | acción |
check_oil_dipstick |
Automotriz | 80 | 15 | 81,2% | 162.320 | 43,8% | acción |
screw_panel |
Industrial | 81 | 16 | 80,2% | 164.430 | 37,5% | acción |
lathe_operate |
Industrial | 51 | 11 | 78,4% | 103.479 | 31,4% | acción |
engine_bay |
Automotriz | 77 | 17 | 77,9% | 156.233 | 56,6% | acción |
probe_test |
Industrial | 63 | 14 | 77,8% | 127.890 | 54,8% | acción |
machine_control |
Industrial | 78 | 18 | 76,9% | 158.262 | 36,4% | acción |
screwdriver_drive |
Industrial | 78 | 20 | 74,4% | 158.262 | 39,5% | acción |
weld |
Industrial | 86 | 22 | 74,4% | 174.494 | 31,4% | acción |
power_drill |
Industrial | 70 | 18 | 74,3% | 142.030 | 48,6% | acción |
impact_driver |
Industrial | 70 | 19 | 72,9% | 142.030 | 35,3% | acción |
sit_stand |
Cuerpo completo | 28 | 8 | 71,4% | 56.840 | 35,7% | acción |
tape_box |
Industrial | 75 | 23 | 69,3% | 152.250 | 26,4% | acción |
jack_up_car |
Automotriz | 78 | 24 | 69,2% | 158.262 | 27,3% | acción |
hand_saw_cut |
Industrial | 77 | 25 | 67,5% | 156.233 | 32,9% | acción |
grinder_use |
Industrial | 69 | 23 | 66,7% | 140.001 | 42,6% | acción |
pack_box |
Industrial | 73 | 28 | 61,6% | 148.117 | 50,0% | acción |
car_door |
Automotriz | 93 | 36 | 61,3% | 188.697 | 20,4% | acción |
car_door_close |
Automotriz | 91 | 36 | 60,4% | 184.639 | 26,4% | acción |
car_door_open |
Automotriz | 92 | 38 | 58,7% | 186.668 | 22,8% | acción |
wash_car_panel |
Automotriz | 78 | 36 | 53,8% | 158.262 | 41,6% | acción |
wash_car |
Automotriz | 72 | 36 | 50,0% | 146.088 | 45,1% | acción |
Localizabilidad por acción. “Lo dice” cuenta los momentos cuyo propio título, descripción o etiquetas llevan alguna palabra del nombre de la acción bajo la regla de subcadena publicada. Las columnas de extrapolación multiplican el rendimiento por fragmento medido de cada acción por el número de fragmentos del índice y dividen por la superposición medida entre acciones; “base de la tasa” indica si la tasa utilizable fue medida en los fotogramas propios de esa acción, heredada de su dominio o heredada de la tasa a nivel de corpus.
3.5 Obtención de los fotogramas
Para verificar que la recuperación era correcta, extrajimos un fotograma real de cada video coincidente y lo examinamos. Lo que YouTube expone sin extraer el video es el storyboard, una hoja de sprites de miniaturas cuyo intervalo de muestreo se amplía con el tiempo de ejecución: medimos 1 s en videos de hasta 109 s, 2 s de 175 s a 275 s, 5 s de 454 s a 892 s, y 10 s desde 1.366 s en adelante. Los límites de paso entre esas bandas no se resolvieron con los 12 videos que sondeamos. La imagen que juzgamos es la muestra más cercana en o antes del segundo coincidente, por lo que puede estar hasta un intervalo antes, 10 s en el peor caso y 5 s o 10 s para poco más de la mitad de los fotogramas. Medido por storyboard_probe.py; las especificaciones por video están en data/storyboard_spec.json.
Un modelo de visión juzgó los 10.750 de 10.828 fotogramas que obtuvimos, por lo que cada tasa aquí se mide en el 99,3% del corpus en lugar de en una muestra. El 93,8% son metraje real en lugar de animación, un juego o una grabación de pantalla; el 25,7% captó la acción visiblemente en curso y el 57,4% la mostró en curso o preparada; el 34,5% obtuvo una puntuación de 3 o superior en una escala de usabilidad de 0 a 5. Esa última cifra es un juicio sobre un proceso de entrenamiento posterior que el modelo no puede observar, y se comporta como tal: en una muestra de 60 fotogramas, cuatro ejecuciones de la configuración idéntica abarcaron 3,4 puntos, y reformular el criterio lo movió 20. La proporción de acción visible se movió 1,7 en ese mismo cambio de criterio, lo que la convierte en la cifra a comparar entre ejecuciones.
Adquisición de fotogramas:
Cifras en formato de tabla
| Resultado | Momentos | Proporción |
|---|---|---|
| Fotogramas obtenidos | 10.750 / 10.828 | 99% |
| Sin storyboard analizable | 75 | 0,7% |
| Fallo en la obtención del sprite | 3 | 0,03% |
Adquisición de fotogramas. Obtuvimos los storyboards directamente y encontramos limitación de velocidad en 863 de los 10.828 momentos, 856 de los cuales una pasada posterior recuperó, por lo que ninguno de los 78 momentos perdidos terminó con un 429; la API de Datos de Medios es la ruta compatible para este paso y devuelve storyboards directamente. Esta auditoría no realizó ninguna llamada a ella. Esos momentos están en 7.549 videos, y un video cuesta una obtención de página de visualización más al menos una hoja de sprites, almacenada en caché por video.
4 Los momentos, reproducibles
Las coincidencias se muestran frente al fotograma del storyboard más cercano en o antes del segundo en que fueron coincidentes. El ranking no está curado. 10.750 de los 10.828 momentos tienen un fotograma propio, y la galería completa tiene 10.761 filas porque 11 más comparten una imagen con otra acción coincidente en el mismo segundo. Esas filas descansan en 8.792 imágenes distintas, porque el nombre del archivo nombra un video y un segundo en lugar de una acción.
A continuación se muestran los momentos coincidentes con mayor puntuación, uno por acción, directamente del ranking. Haz clic en cualquier fotograma para reproducir el video fuente en el segundo coincidente.
Cada celda: la acción para la que fue coincidente y su puntuación de relevancia, luego lo que el modelo de visión vio en el fotograma (mostrado la imagen sin el título), luego el título propio del video en español. Las marcas de tiempo se abren dos segundos antes para que el momento entre en vista.
5 Trabajos relacionados
Recuperar un momento por descripción es una tarea establecida: anclaje temporal en Charades-STA, detección de momentos destacados en QVHighlights, consultas en lenguaje natural en Ego4D. No introducimos ningún método nuevo aquí.
La construcción tiene precedentes. TVR (2020) etiquetó sus 108.965 consultas según si el video, los subtítulos o ambos las respondían, reportando un 74,2% solo en video. Lo que difiere es el corpus y el propósito: video web abierto en lugar de seis programas de televisión, acciones físicas, una submuestra verificada y una proporción de costo. El formato de publicación sigue a AVA y HowTo100M: identificador, marca de tiempo y etiqueta, sin redistribuir ningún video. La recuperación a lo largo del proceso es la API de búsqueda de video. Los fotogramas aquí se obtuvieron analizando el storyboard de YouTube de la página de visualización; no se extrajo ningún clip en ningún momento. Para una ejecución en producción, la ruta compatible es la API de Datos de Medios.
Lo que establece la auditoría es más limitado que un reemplazo de las demostraciones robóticas. La web alberga una capa grande y mal indexada de metraje de acciones físicas, y la búsqueda visual con marcas de tiempo hace que esa capa sea considerablemente más fácil de alcanzar. Si el metraje curado de esta manera mejora de manera medible un sistema de robótica o de modelo de mundo es la siguiente pregunta, y responderla necesita un experimento de entrenamiento que esta auditoría no realizó.
6 Cita
@misc{webmoments2026,
title = {Finding the Web's Hidden Robot Training Moments in
Public Web Video Data},
author = {Bright Data},
year = {2026},
howpublished = {Technical report},
note = {141 physical actions, 10,828 retrieved match rows over
8,849 distinct video-second moments, and
10,750 frames reviewed by a vision model}
}






















