CRAWLER REGISTRY

AI Crawler Directory: User-Agents & IP Ranges

A canonical reference of official web crawlers operated by OpenAI, Anthropic, Google, Perplexity, and Apple, including purpose, user-agent tokens, and documentation links.

User-Agent Vendor Purpose Description Reference
OAI-SearchBot OpenAI Real-Time Search Powers web search queries inside ChatGPT Search. Docs ↗
GPTBot OpenAI Model Training Collects public data for future foundational model training. Docs ↗
Claude-SearchBot Anthropic Real-Time Search Retrieves web content for Claude live search answers. Docs ↗
ClaudeBot Anthropic Model Training Crawls public text for Claude training datasets. Docs ↗
PerplexityBot Perplexity Real-Time Search Searches and extracts source citations for Perplexity answers. Docs ↗
Google-Extended Google Training Governance Token used in robots.txt to control Gemini/Vertex training data collection. Docs ↗