AI

El único artefacto que no pueden copiar

En 2026, el cómputo, los datos y la receta forman la empresa, y tus pesos son la ventaja competitiva. Los datos de entrenamiento a escala web son la carrera que pocos equipos de IA están observando.
8 min de lectura
Compute + Data + Recipe = Company

En julio de 2026, Together AI e Y Combinator lanzaron el primer clúster de GPU dedicado de YC. Los fundadores de YC ahora pueden asegurar capacidad de cómputo seria en semanas. Los antiguos contratos de dos años ya no son el único camino.

Imagina que lideras IA en una nueva empresa. Estás entrenando un modelo fundacional para IA física, video o búsqueda. Esos modelos necesitan muchos FLOPs y muchos datos de entrenamiento. Ese anuncio debería hacerte sentir dos cosas a la vez. Alivio, porque tu problema de adquisición más difícil acaba de aliviarse. Incomodidad, porque también se alivió para todos los demás.

Este es el patrón de todo este ciclo. Cada insumo por el que luchas está volviéndose disponible para tus competidores en los mismos términos. Lo que obliga a la pregunta que tu junta sigue haciendo. ¿Cuál es, exactamente, tu ventaja competitiva?

Empieza por tachar lo que no lo es

Tu código no es tu ventaja competitiva. La programación agéntica terminó ese debate. Tu infraestructura de entrenamiento, tu stack de serving y tu arnés de evaluación son todos reconstruibles. Un equipo competente con un agente de programación los recrea en semanas. No perfectamente, pero lo suficientemente cerca.

Tu arquitectura no es tu ventaja competitiva. Las arquitecturas se publican, se filtran o se obtienen por ingeniería inversa del comportamiento. DeepSeek demostró que un seguidor rápido puede comprimir una ventaja de varios años en meses. Cualquier variante de atención o truco de espacio de estados que prefieras hoy está a una publicación de blog de ser de todos.

Tus GPUs no son tu ventaja competitiva por sí solas. El cómputo es escaso, pero se está volviendo adquirible. El acuerdo entre Together e YC es la prueba: muchos vendedores, costos de cambio en caída y términos contractuales que avanzan hacia la flexibilidad. El cómputo es una carrera que no debes perder. No es una carrera que puedas ganar.

Tus datos tampoco son tu ventaja competitiva por sí solos. Si tu plan son los mismos conjuntos de datos con licencia y las mismas APIs que todos los demás, tienes un problema. Estás pre-entrenando el mismo modelo que todos los demás, con gran gasto. Entonces, ¿qué queda?

Cómputo + Datos + Receta = Empresa

Este es el marco que llevaría a tu próxima reunión de junta.

En 2026, la ecuación es simple: Cómputo + Datos + Receta = Empresa. Todo lo demás, el código, la infra y la capa de aplicación, un agente puede reconstruirlo. Tus pesos son donde los tres se encuentran, materializados. Esa es la ventaja competitiva.

Diagrama de Venn de Datos, Cómputo y Receta intersectándose en Pesos, etiquetado como la ventaja competitiva
La ventaja competitiva no es ningún insumo individual, porque los insumos se pueden comprar. Es la intersección, compilada en el único artefacto que un agente no puede reimplementar.

Los pesos son el único artefacto en tu empresa que la programación agéntica no puede replicar. No porque sean secretos. Porque son un registro comprimido de decisiones. Cada pasada de filtrado, cada elección de currículo y cada entorno de RL están integrados en los parámetros. También lo está cada decisión de descartar el 40% del corpus porque tus expertos del dominio dijeron que era basura. Dos equipos con clústeres idénticos y datos brutos idénticos aún envían modelos diferentes, porque la receta es el modelo.

Por eso la intersección importa más que cualquier círculo individual.

  • Datos sin cómputo son un disco duro.
  • Cómputo sin datos diferenciados es una forma muy costosa de reproducir Llama.
  • Datos y cómputo sin criterio es cómo quemas una Serie A produciendo una mercancía con forma de benchmark.

Los pesos se ubican donde los tres se superponen. Todo lo demás en tu stack es reemplazable. Ese artefacto no lo es.

Estás en dos carreras a la vez

Todos reconocen la carrera del cómputo, porque tiene un marcador ruidoso. Anuncios de clústeres, mega-rondas y contratos de dos años. Ahora asociaciones estilo YC para acortarlos. La carrera de datos corre en paralelo, ahora mismo, con la misma física y la misma urgencia. Oferta escasa, acceso que se consolida y primeros participantes asegurando términos.

Las señales están en todas partes. Reddit firmó un acuerdo de licencia de 60 millones de dólares al año con Google. Una nube de inferencia pagó 275 millones de dólares para adquirir una capa de acceso web. Los hyperscalers ahora ofrecen acceso a datos como infraestructura propia. Es el mismo patrón de titulares que el cómputo. Solo que aparece en una página más silenciosa.

La carrera de datos tiene una diferencia crucial. No existe un mercado spot para datos que no has recopilado. Pierdes una ventana de cómputo y esperas un trimestre. Pierdes la ventana de datos y el corpus que necesitabas nunca fue recopilado.

Entonces, ¿dónde viven realmente los datos a esa escala? No en instantáneas académicas, que están congeladas. No en catálogos con licencia, que son silos estrechos, un dominio a la vez. No en Common Crawl, que está agotado y nunca tuvo video. La web abierta es la fuente más grande de datos de entrenamiento que existe. Texto, imágenes, PDFs y sobre todo video, actualizados diariamente, en todos los idiomas, en todos los dominios.

Pero la web no se entrega sola. A escala de petabytes, la recopilación es una capacidad industrial. Muros anti-bots, límites de velocidad, renderizado, frescura y procedencia que tu equipo legal puede defender. Los stacks de scraping de código abierto alcanzan alrededor del 60 al 75% de éxito y se rompen a mitad de la ejecución. Por eso tantos laboratorios bien financiados terminan con investigadores cuidando crawlers en lugar de entrenar modelos.

Así como no fabricarías tus propias GPUs, recopilar la web tú mismo es una empresa dentro de tu empresa. Seré directo sobre dónde me ubico, porque esto es lo que hacemos en Bright Data. Recopilamos alrededor de un petabyte de datos web cada semana. Eso se asienta sobre un archivo web de 90 petabytes. Contiene 630 mil millones de páginas en 320 millones de dominios. Operamos con un 99,99% de disponibilidad, con cumplimiento que ha sido probado en tribunales. Hasta donde sé, nadie más opera la recopilación web a la escala que requiere una ejecución de entrenamiento de frontera.

Dos pistas de carrera paralelas, cómputo y datos, convergiendo en Pesos
Misma física, misma urgencia, corriendo en paralelo. Oferta escasa, acceso que se consolida, primeros participantes asegurando términos. La carrera del cómputo solo tiene el marcador más ruidoso.

Traza el paralelo hasta el final. Asegurar cómputo temprano es el mínimo indispensable. Asegurar el suministro de datos a escala web temprano es el movimiento idéntico, en el momento idéntico. La misma dinámica de mercado, ocurriendo ahora mismo, en el carril que menos gente observa.

Lo que esto significa para cómo gastas la ronda

1. Trata el cómputo como una carrera y los datos como un activo. El cómputo lo alquilas en los mejores términos que puedas obtener. El mercado se mueve a tu favor, así que aprovéchalo. Los datos los posees: asegurados, versionados, actualizados y diferentes de lo que tus competidores pueden obtener. Para la mayoría de los equipos, eso significa ir más allá del corpus público agotado. Los investigadores ahora proyectan que el texto público de alta calidad estará agotado entre 2026 y 2032. Si entrenas con lo que todos pueden descargar, has elegido el modelo de tus competidores.

2. Si estás en IA física o video, esto es doblemente cierto. Tu corpus nunca estuvo en Common Crawl. Los modelos del mundo y los VLAs funcionan con video, egocéntrico, rico en tareas y diverso. Los laboratorios que ganan esa carrera son los que industrializan su recopilación ahora, antes de que la categoría se estandarice. Tu pipeline de datos no es infraestructura de soporte. Es la decisión de producto.

3. Pon tu talento senior escaso en la receta, no en la fontanería. Los agentes pueden escribir tus cargadores de datos. No pueden decidir qué necesita ver un robot para aprender a doblar ropa. No pueden decidir qué debe ver un modelo de búsqueda para superar a Google en tu vertical. Ese criterio, el tercer círculo, es donde tus investigadores son irremplazables. Contrata en consecuencia.

4. Díselo claramente a tu junta. Nuestra ventaja competitiva son nuestros pesos: un suministro de datos que los competidores no tienen, nuestra propia receta, en cómputo que aseguramos temprano. Esa es una frase que sobrevive la debida diligencia. Tenemos grandes ingenieros ya no lo es.

El incómodo reloj

Una cosa más que el acuerdo entre Together e YC te dice. Los insumos se están consolidando rápido. El cómputo se está asegurando en clústeres y asociaciones. Los datos se están asegurando en licencias y adquisiciones. La intersección que puedes construir en 2026 es mayor que la que estará disponible en 2027. Los círculos se están reduciendo para los rezagados.

Cómputo + Datos + Receta = Empresa. Las dos carreras corren en paralelo. Solo cuentas como finalista si terminas ambas.