Conjuntos de datos de GitHub
Los conjuntos de datos de GitHub ofrecen una fuente dinámica de datos que impulsa la innovación y permite a las empresas y a los investigadores extraer información valiosa
- Cientos de miles de registros disponibles
- Accede a los principales puntos de datos de Github
- Muestras de datos gratuitas de Github para descargar
Confiado por 20,000+ clientes
Available datasets
Access fresh validated GitHub datasets. Ensure hassle-free data access by using ready-made scrapers.
- Demo data in JSON/CSV
- Fresh records
- Customize, enrich, and format the data
LinkedIn people profiles
Amazon products
LinkedIn company information
Instagram - Profiles
Crunchbase companies information
Linkedin job listings information
Zillow properties listing information
Instagram - Posts
LinkedIn posts
X (formerly Twitter) - Posts
Google Maps full information
TikTok - Profiles
Facebook - Pages Posts by Profile URL
Youtube - Videos posts
Amazon Reviews
TikTok - Posts
Indeed job listings information
Shopee - products
Companies information enriched dataset
Walmart - products
Employees business enriched dataset
TikTok Shop
YouTube - Profiles
Glassdoor companies overview information
IMDB media
Airbnb Properties Information
X (formerly Twitter) - Profiles
Google maps reviews
Google News
Yahoo Finance business information
Reddit- Posts
Instagram - Reels
Booking Hotel Listings
Shein- Products
Glassdoor companies reviews
LinkedIn profiles Jobs Listings
Yelp businesses overview
Facebook - Comments
Instagram - Comments
Zoominfo companies information
pitchbook companies information
Glassdoor job listings information
Otodom Poland
Amazon products global dataset
Amazon sellers info
eBay
Google Shopping
G2 software product overview
Github repository
Amazon best seller products
Facebook - Posts by group URL
Home Depot US
Australia real estate properties
Facebook Marketplace
Facebook - Posts by post URL
Google Play Store
TikTok - Comments
Etsy
Trustpilot business reviews
G2 software - product reviews
Amazon products search
Booking Listings Search
Goodreads books
Yelp businesses reviews
Reddit - Comments
Amazon Walmart
World population
Zara - Products
Zillow price history
Indeed companies info
Target
Zoopla properties listing information
Wikipedia articles
Pinterest - Posts
Lazada - Products
Youtube - Comments
NBA players' stats
Best Buy products
Facebook - Profiles
Facebook Events
Walmart sellers info
Ikea - Products
Realtor international properties listings
Sephora products
BBC news
Lowes.com
OLX Brazil - marketplace ads
Ozon.ru products
Xing social network
Facebook - Reels by profile URL
Google Play Store reviews
Facebook Company Reviews
Myntra products
Creative Commons Images
Google Shopping products search US
Owler companies information
Wayfair products
Slintel 6sense company information
H&M - Products
Naver products
US lawyers directory
Tokopedia Products
Webmotors Brasil - Cars Listings
Digikey - Products
Apple App Store reviews
Facebook - Pages and Profiles
Manta businesses
CNN news
Agoda Properties Listings
Wildberries.ru products
Mouser - Products
Zonaprop Argentina - Properties Listing
Quora posts
Carsales Cars Listings search page information
Pinterest - Profiles
VentureRadar company information
Chileautos Chile - Cars Listings
Zalando products
Inmuebles24 Mexico - Properties Listings
Yapo Chile - marketplace ads
carsales.com.au - Cars Listings
Asos - Products
Trustradius product reviews
Lazada - Reviews
Bluesky - Posts
Hermes- Products
Vimeo - Videos posts
Lego - Products
World zipcodes
Metrocuadrado - Properties Listings
Home Depot CA
Chanel Products
Toctoc - Properties Listings
Lazada products search (GMV)
Dior - Products
mercadolivre.com.br products
Top 500 Bluesky Profiles
Apple App Store
Creative Commons 3D Models
Ashleyfurniture - Products
AE.com - Complete Products
Infocasas Uruguay - Properties Listings
Properati Argentina and Colombia - Properties Listings
Kroger.com
Mango Products
Crawl API
Balenciaga.com - Products
Mediamarkt.de products
Fanatics.com - Products
Toysrus - Products
Zara Home Products
Carters.com - Products
Loewe.com - Products
Twitch - streams dataset
Prada.com - Products
Rona.ca products
Fendi Products
Crateandbarrel - Products
ChatGPT Search
Delvaux - Products
Ysl.com - Products
Massimo Dutti - Products
Bottegaveneta.com - Products
Raymourflanigan.com - Products
Mattressfirm - Products
Sleepnumber.com - Products
llbean.com - Products
Mybobs.com - Products
Celine.com - Products
La-z-boy.com - Products
Berluti.com - Products
Montblanc - Products
Walmart - products zipcodes
Moynat.com - Products
Google SERP - 100 Results
Suumo.jp
Google AI Mode Search
Threads - Posts
Zillow Full Properties Information
Macys.com
Gemini Search
Falabella.com
Agoda Listings Search
Threads - Profiles
Poshmark.com
Overstock.com
Grok Search
Trip Listings Search
Flipkart.com
Perplexity Search
LinkedIn people search
Zillow properties search page
Walmart products search
Bing Copilot Search
Trip Hotel Listings
Snapchat posts
Goodreads reviews
TikTok - Posts by URL Fast API
TikTok - Posts by Profile Fast API
Snapchat profile
Agoda Properties Listings with Pricing
Google Hotel
Reddit - Profiles
TikTok - Posts by Search URL Fast API
Coupang products
TikTok Shop Category Products
Booking Hotel Listings with Pricing
Muestra del conjunto de datos de GitHub
El conjunto de datos del repositorio de GitHub proporciona información esencial sobre el mundo del «software» de código abierto. Con información completa sobre los lenguajes de codificación, los tamaños de los repositorios y las contribuciones de los usuarios, este conjunto de datos permite a los usuarios profundizar en las complejidades del desarrollo de «software».
Precios de Conjuntos de Datos
- Limpio y validado
- Actualización mensual
- JSON/CSV/Parquet
Potencie los agentes de IA al instante
Nuestros conjuntos de datos Github están optimizados para AI/LLM: claramente estructurados, bien documentados, con código y recetas para una fácil integración LLM/chatbot. recetas para una fácil integración LLM/chatbot.
Estructurado y limpio
Datos preprocesados con esquemas coherentes, perfectos para el entrenamiento y la inferencia de modelos de IA.
Ejemplos de códigos
Fragmentos de Python, Node.js, cURL, PHP, Go, Java y Ruby listos para usar que se integran fácilmente en los flujos de trabajo de IA.
Documentación
curl --request GET
--url https://api.brightdata.com/datasets/snapshots/{id}/download
--header 'Autorización: Portador '
importar solicitudes
url = "https://api.brightdata.com/datasets/snapshots/{id}/download"
headers = {"Authorization": "Bearer "}
response = requests.get(url, headers=headers)
print(respuesta.json())
const url = 'https://api.brightdata.com/datasets/snapshots/{id}/download';
const options = {method: 'GET', headers: {Authorization: 'Bearer '}, body: undefined};
try {
const response = await fetch(url, options);
const data = await response.json();
console.log(datos);
} catch (error) {
console.error(error);
}
HttpResponse response = Unirest.get("https://api.brightdata.com/datasets/snapshots/{id}/download")
.header("Authorization", "Portador ")
.asString();
requerir "uri
requiere "net/http
url = URI("https://api.brightdata.com/datasets/snapshots/{id}/download")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Get.new(url)
request["Authorization"] = 'Portador '
response = http.request(request)
puts respuesta.leer_cuerpo
Suscripción de datos
Suscríbase para acceder a los conjuntos de datos a un coste significativamente reducido.
Formatos de archivo
JSON, NDJSON, JSON Lines, CSV, Parquet. Compresión .gz opcional.
Entrega flexible
Snowflake, Amazon S3 bucket, Google Cloud, Azure y SFTP.
Datos escalables
Amplíe sin preocuparse por la infraestructura, los servidores proxy o los bloqueos.
Ahorro de costes
Personaliza cualquier conjunto de datos mediante filtros y opciones de formato.
Mantenimiento del código
Los conjuntos de datos se actualizan en función de los cambios en la estructura del sitio web.
Integraciones simplificadas
Benefíciese de las integraciones con Snowflake y AWS.
Asistencia 24/7
Un equipo especializado de profesionales de datos está aquí para ayudarte.
Líderes en cumplimiento
Los datos se obtienen de forma ética y cumplen todas las leyes de privacidad.
Consigue datos de Github estructurados y fiables
Te facilitamos los datos mientras tú te centras en lo demás
Datos web de gran volumen
Con nuestras funciones de desbloqueo y de rotación de las direcciones IP las 24 horas del día, garantizamos el acceso a todos los puntos de datos de un sitio web.
Datos para uso inmediato
Todos los aspectos del proceso de recopilación de datos se validan a fondo como parte de nuestro potente proceso de validación de datos.
Flujo de datos automatizado
Crea cronogramas personalizados para automatizar la entrega de datos y comprueba cómo los datos fluyen sin problemas hacia su almacenamiento.
Cómo utilizan las empresas los conjuntos de datos de GitHub
Actividad de desarrolladores
Participación de la comunidad
Mejora la participación
Preguntas frecuentes sobre el conjunto de datos de GitHub
¿Qué datos se incluyen en el conjunto de datos de GitHub?
El conjunto de datos de GitHub incluye diferentes puntos de datos que se adaptan a tus necesidades. Algunos de los puntos de datos incluyen: URL, ID, código, lenguaje de código, número de líneas, nombre de usuario, URL de usuario, tamaño, unidad de tamaño, número de tamaño, número de proyectos, número de bifurcaciones, número de estrellas y mucho más.
¿Puedo obtener actualizaciones para el conjunto de datos de GitHub que he comprado?
Sí, puedes obtener actualizaciones diarias, semanales, mensuales o personalizadas de tu conjunto de datos de GitHub.
¿Puedo comprar un subconjunto del conjunto de datos de GitHub?
Sí, puedes comprar un subconjunto de GitHub que incluirá solo los puntos de datos que necesites. Al comprar un subconjunto de datos, el precio se reduce de forma notable.
¿En qué formato recibiré el conjunto de datos de GitHub?
Los formatos de los conjuntos de datos son JSON, NDJSON, JSON Lines, CSV o Parquet. Si lo prefieres, los archivos se pueden comprimir en formato .gz.
¿Puedo raspar por mi cuenta datos públicos de GitHub?
Si no quieres comprar un conjunto de datos, puedes empezar a raspar datos de GitHub utilizando nuestra API de raspado para GitHub.
¿Puedo obtener una muestra de datos?
Sí, puedes solicitar datos de muestra para evaluar la calidad y la relevancia de la información facilitada. Es una buena forma de asegurarte de que satisface tus necesidades antes de decidirte por un conjunto de datos completo.
¿Puedo solicitar puntos de datos específicos del conjunto de datos de GitHub?
Sí, puedes solicitar puntos de datos específicos del conjunto de datos de GitHub adaptados a tus necesidades únicas, asegurándote de que recibes exactamente la información que necesitas para tus proyectos.
¿Es posible integrar el conjunto de datos de GitHub directamente en mis sistemas actuales?
Por supuesto, el conjunto de datos de GitHub ofrece una integración API sin fisuras, lo que te permite integrar sin esfuerzo los datos en tu CRM, herramientas de análisis o cualquier otro sistema que utilices, agilizando tus operaciones.