Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Democratizar el acceso a los datos de la web"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    Comunidad

    Acerca de

    Common Crawl es una organización sin fines de lucro 501(c)(3) que mantiene un repositorio abierto de datos de rastreo web. Desde su fundación en 2008 por el científico informático Gil Elbaz, la organización ha rastreado sistemáticamente internet y ha puesto a disposición de forma gratuita petabytes de texto sin procesar, metadatos y texto extraído. Los datos se alojan en los buckets públicos S3 de Amazon Web Services; los usuarios solo pagan por sus propios costos de cómputo y almacenamiento. El corpus de Common Crawl es el conjunto de datos web abierto más grande, utilizado por investigadores, periodistas, startups y los principales laboratorios de IA. En la década de 2020 se convirtió en la principal fuente de entrenamiento para modelos de lenguaje grandes, incluidos GPT-3, GPT-4 y LLaMA. Una investigación de noviembre de 2025 realizada por The Markup y Wired examinó cómo las empresas de IA utilizan los datos, lo que generó debates sobre el consentimiento y los derechos de autor.

    Misión

    La misión de Common Crawl es democratizar el acceso a los datos de la web rastreando internet y proporcionando el contenido resultante de forma gratuita a cualquier persona. El objetivo es reducir las barreras para el análisis de datos a escala web, fomentar la innovación y preservar un registro histórico abierto de la web.

    Historia

    Gil Elbaz comenzó a construir el primer rastreador en 2007, impulsado por la creencia de que los datos abiertos de la web eran esenciales para un internet saludable. El primer conjunto de datos de rastreo público, que contenía aproximadamente 2 mil millones de páginas, se lanzó en 2008. La infraestructura inicial dependía de servidores donados y subvenciones. En 2012, Common Crawl se asoció con Amazon Web Services para alojar los datos en buckets públicos de S3, haciendo que el acceso fuera gratuito y escalable. El conjunto de datos News Crawl se lanzó en 2015, proporcionando un flujo continuo de artículos de noticias. Para 2017, el corpus había crecido a 3.5 mil millones de páginas, el conjunto de datos web público más grande en ese momento. El auge de la IA a principios de la década de 2020 aumentó drásticamente la demanda; Common Crawl se convirtió en el corpus de facto para el entrenamiento de modelos de lenguaje grandes. En respuesta a las preocupaciones sobre derechos de autor y consentimiento planteadas por una investigación de 2025, la organización anunció planes para desarrollar un sistema de exclusión voluntaria y un mejor seguimiento de la procedencia.

    Personas destacadas

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    Director ejecutivo · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Hitos

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Departamentos

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Información de la organización

    Fundado
    +2008
    Sede
    San Francisco, California, United States
    País
    United States
    Executive Director
    Rich Skrenta
    Tipo
    Non-profit
    Tipo
    Non-profit
    Fundado
    +2008
    País
    Estados Unidos
    Fundador
    Gil Elbaz
    Annual Budget
    $1–2 million
    Empleados
    5–10
    Data Size
    Petabytes

    Finanzas

    Ingresos
    $0.0 billion
    Presupuesto
    $1–2 million
    Empleados
    5–10

    Sitio web oficial

    commoncrawl.org/

    Únete a la comunidad

    fans comentando