
Common Crawl
United States"ウェブデータのアクセスを民主化する"
概要
Common Crawlは、ウェブクロールデータを公開リポジトリとして維持している501(c)(3)非営利団体です。コンピュータ科学者のGil Elbazによって2008年に設立されて以来、同組織は体系的にインターネットをクロールし、ペタバイト級の生のHTML、メタデータ、抽出されたテキストを無料で提供してきました。データはAmazon Web ServicesのパブリックS3バケットにホストされており、ユーザーは自身のコンピューティングおよびストレージ費用のみを負担します。Common Crawlのコーパスは、研究者、ジャーナリスト、スタートアップ、および主要なAIラボによって使用される、最も大規模で自由にアクセス可能なウェブデータセットです。2020年代には、GPT-3、GPT-4、LLaMAを含む大規模言語モデルの主要なトレーニングソースとなりました。2025年11月、The MarkupとWiredの共同調査により、AI企業がどのようにデータを使用しているかが調査され、同意と著作権に関する議論が巻き起こりました。
ミッション
Common Crawlの使命は、インターネットをクロールし、その結果得られたコンテンツを誰にでも無料で提供することで、ウェブデータへのアクセスを民主化することです。目標は、ウェブスケールデータ分析の障壁を下げ、イノベーションを促進し、ウェブのオープンな歴史的記録を保存することです。
歴史
Gil Elbazは、オープンなウェブデータが健全なインターネットに不可欠であるという信念から、2007年に最初のクローラーの構築を開始しました。約20億ページを含む最初の公開クロールデータセットは2008年にリリースされました。初期のインフラストラクチャは、寄付されたサーバーと助成金に依存していました。2012年、Common CrawlはAmazon Web Servicesと提携し、データをパブリックS3バケットにホストするようになり、アクセスを無料かつスケーラブルにしました。News Crawlデータセットは2015年に開始され、ニュース記事の継続的に更新されるフィードを提供しています。2017年までにコーパスは35億ページに成長し、当時、公開されているウェブデータセットとしては最大のものとなりました。2020年代初頭のAIブームにより需要は劇的に増加し、Common Crawlは大規模言語モデルの事実上のトレーニングコーパスとなりました。2025年の調査によって提起された著作権と同意に関する懸念に対応するため、同組織はオプトアウトシステムとより良い来歴追跡の開発計画を発表しました。
著名な人物
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
エグゼクティブディレクター · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
節目
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
部門
組織情報
- 創設
- +2008
- 本部
- San Francisco, California, United States
- 国
- United States
- Executive Director
- Rich Skrenta
- 種類
- Non-profit
- 種類
- Non-profit
- 創設
- +2008
- 国
- アメリカ合衆国
- 創設者
- Gil Elbaz
- Annual Budget
- $1–2 million
- 従業員
- 5–10
- Data Size
- Petabytes
財務
- 売上高
- $0.0 billion
- 予算
- $1–2 million
- 従業員
- 5–10
公式ウェブサイト
commoncrawl.org/
コミュニティに参加
人のファンが話題に