Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "ウェブデータのアクセスを民主化する"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    コミュニティ

    概要

    Common Crawlは、ウェブクロールデータを公開リポジトリとして維持している501(c)(3)非営利団体です。コンピュータ科学者のGil Elbazによって2008年に設立されて以来、同組織は体系的にインターネットをクロールし、ペタバイト級の生のHTML、メタデータ、抽出されたテキストを無料で提供してきました。データはAmazon Web ServicesのパブリックS3バケットにホストされており、ユーザーは自身のコンピューティングおよびストレージ費用のみを負担します。Common Crawlのコーパスは、研究者、ジャーナリスト、スタートアップ、および主要なAIラボによって使用される、最も大規模で自由にアクセス可能なウェブデータセットです。2020年代には、GPT-3、GPT-4、LLaMAを含む大規模言語モデルの主要なトレーニングソースとなりました。2025年11月、The MarkupとWiredの共同調査により、AI企業がどのようにデータを使用しているかが調査され、同意と著作権に関する議論が巻き起こりました。

    ミッション

    Common Crawlの使命は、インターネットをクロールし、その結果得られたコンテンツを誰にでも無料で提供することで、ウェブデータへのアクセスを民主化することです。目標は、ウェブスケールデータ分析の障壁を下げ、イノベーションを促進し、ウェブのオープンな歴史的記録を保存することです。

    歴史

    Gil Elbazは、オープンなウェブデータが健全なインターネットに不可欠であるという信念から、2007年に最初のクローラーの構築を開始しました。約20億ページを含む最初の公開クロールデータセットは2008年にリリースされました。初期のインフラストラクチャは、寄付されたサーバーと助成金に依存していました。2012年、Common CrawlはAmazon Web Servicesと提携し、データをパブリックS3バケットにホストするようになり、アクセスを無料かつスケーラブルにしました。News Crawlデータセットは2015年に開始され、ニュース記事の継続的に更新されるフィードを提供しています。2017年までにコーパスは35億ページに成長し、当時、公開されているウェブデータセットとしては最大のものとなりました。2020年代初頭のAIブームにより需要は劇的に増加し、Common Crawlは大規模言語モデルの事実上のトレーニングコーパスとなりました。2025年の調査によって提起された著作権と同意に関する懸念に対応するため、同組織はオプトアウトシステムとより良い来歴追跡の開発計画を発表しました。

    著名な人物

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    エグゼクティブディレクター · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    節目

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    部門

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    組織情報

    創設
    +2008
    本部
    San Francisco, California, United States
    United States
    Executive Director
    Rich Skrenta
    種類
    Non-profit
    種類
    Non-profit
    創設
    +2008
    アメリカ合衆国
    創設者
    Gil Elbaz
    Annual Budget
    $1–2 million
    従業員
    5–10
    Data Size
    Petabytes

    財務

    売上高
    $0.0 billion
    予算
    $1–2 million
    従業員
    5–10

    公式ウェブサイト

    commoncrawl.org/

    コミュニティに参加

    人のファンが話題に