
Common Crawl
United States"Democratizar el acceso a los datos de la web"
Acerca de
Common Crawl es una organización sin fines de lucro 501(c)(3) que mantiene un repositorio abierto de datos de rastreo web. Desde su fundación en 2008 por el científico informático Gil Elbaz, la organización ha rastreado sistemáticamente internet y ha puesto a disposición de forma gratuita petabytes de texto sin procesar, metadatos y texto extraído. Los datos se alojan en los buckets públicos S3 de Amazon Web Services; los usuarios solo pagan por sus propios costos de cómputo y almacenamiento. El corpus de Common Crawl es el conjunto de datos web abierto más grande, utilizado por investigadores, periodistas, startups y los principales laboratorios de IA. En la década de 2020 se convirtió en la principal fuente de entrenamiento para modelos de lenguaje grandes, incluidos GPT-3, GPT-4 y LLaMA. Una investigación de noviembre de 2025 realizada por The Markup y Wired examinó cómo las empresas de IA utilizan los datos, lo que generó debates sobre el consentimiento y los derechos de autor.
Misión
La misión de Common Crawl es democratizar el acceso a los datos de la web rastreando internet y proporcionando el contenido resultante de forma gratuita a cualquier persona. El objetivo es reducir las barreras para el análisis de datos a escala web, fomentar la innovación y preservar un registro histórico abierto de la web.
Historia
Gil Elbaz comenzó a construir el primer rastreador en 2007, impulsado por la creencia de que los datos abiertos de la web eran esenciales para un internet saludable. El primer conjunto de datos de rastreo público, que contenía aproximadamente 2 mil millones de páginas, se lanzó en 2008. La infraestructura inicial dependía de servidores donados y subvenciones. En 2012, Common Crawl se asoció con Amazon Web Services para alojar los datos en buckets públicos de S3, haciendo que el acceso fuera gratuito y escalable. El conjunto de datos News Crawl se lanzó en 2015, proporcionando un flujo continuo de artículos de noticias. Para 2017, el corpus había crecido a 3.5 mil millones de páginas, el conjunto de datos web público más grande en ese momento. El auge de la IA a principios de la década de 2020 aumentó drásticamente la demanda; Common Crawl se convirtió en el corpus de facto para el entrenamiento de modelos de lenguaje grandes. En respuesta a las preocupaciones sobre derechos de autor y consentimiento planteadas por una investigación de 2025, la organización anunció planes para desarrollar un sistema de exclusión voluntaria y un mejor seguimiento de la procedencia.
Personas destacadas
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
Director ejecutivo · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Hitos
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Departamentos
Información de la organización
- Fundado
- +2008
- Sede
- San Francisco, California, United States
- País
- United States
- Executive Director
- Rich Skrenta
- Tipo
- Non-profit
- Tipo
- Non-profit
- Fundado
- +2008
- País
- Estados Unidos
- Fundador
- Gil Elbaz
- Annual Budget
- $1–2 million
- Empleados
- 5–10
- Data Size
- Petabytes
Finanzas
- Ingresos
- $0.0 billion
- Presupuesto
- $1–2 million
- Empleados
- 5–10
Sitio web oficial
commoncrawl.org/
Únete a la comunidad
fans comentando