Долгое время в индустрии поисковой оптимизации существовало мнение, что ChatGPT не имеет собственной поисковой базы и полностью полагается на выдачу внешних поисковиков вроде Google и Bing. Однако технический анализ внутренней структуры сервиса показывает обратное: OpenAI тайно разработала и развивает собственное семейство поисковых индексов, постепенно сокращая зависимость от сторонних провайдеров.
Семейство вертикальных индексов Labrador
Внутреннее кодовое название поискового индекса OpenAI — Labrador. Это не единая монолитная база данных, а целый комплекс специализированных (вертикальных) индексов, настроенных под конкретные типы контента:
Общий веб (General web)
PDF-документы
YouTube
Новости (News) — с разделением на временные слои: данные за последние 24 часа, за последние 7 дней и архивные материалы
arXiv (академические и научные публикации)
Wikipedia
Локальный поиск (Local)
Финансы (включая обособленный индекс для обработки финансовых PDF-файлов)
Юриспруденция (Legal)
Медицина (Medical)
Товары (Shopping)
Изображения
В индексе Labrador хранится стандартный для поисковых систем набор данных: полные тексты веб-страниц, даты их обхода поисковым роботом и даты публикации материалов.

Таким образом, OpenAI воспроизвела архитектуру, которую Google выстраивал десятилетиями: базовый веб-индекс в сочетании с узкоспециализированными вертикальными базами данных в виде RAG.

Евгений Молдовану
Senior seo специалист, специализация по GEO и AI поиск
Хотя в исходной статье нет об этом информации, на личном опыте также зафиксировал обращение к наборам данных Линкедина и UpWork. Поэтому список использованных наборов может быть намного больше, похоже ChatGPT заключает отдельные договора с крупными сайтами.
Откуда информация о существовании Labrador ?
Существование Labrador подтверждается рядом жестких инфраструктурных и программных факторов:
Серверный след (SSE-данные): В период с 21 мая по 21 июля 2026 года в потоке данных серверных событий (Server-Side Events) ChatGPT открыто передавалось техническое поле
result_source. Оно принимало всего четыре значения: три из них принадлежали сторонним краулерам (Bright, Oxylabs, SERP), а четвертым неизменно значился Labrador — собственный индекс OpenAI.Агрессивный краулинг и кэширование: Живой поиск в реальном времени слишком медленен для масштабов ChatGPT — по статистике, более 58% веб-страниц загружаются дольше 0,8 секунды. Чтобы обеспечить мгновенный отклик, OpenAI кэширует страницы. В рамках независимого эксперимента был запущен тестовый сайт объемом 1 миллиард страниц. Поисковый робот OpenAI мгновенно начал его обход со скоростью 35 000 запросов в час, обработав более 6 миллионов страниц к началу сентября 2026 года.
Проверка режима изоляции (Lockdown Mode): При отключении функции живого поиска в настройках ChatGPT (переходе в автономный режим) модель все равно продолжает выдавать точные копии главных страниц крупнейших профильных изданий. Это доказывает, что данные извлекаются напрямую из внутреннего кэша OpenAI.
Эксабайтный масштаб в вакансиях: В описаниях вакансий OpenAI для инженеров поисковых систем прямо указываются требования по работе с базами данных эксабайтного масштаба (10^18 байт) в распределенных облачных средах. Также от специалистов требуют опыта в гибридном поиске — объединении традиционного текстового поиска (алгоритм BM25) и векторного поиска по плотным эмбеддингам.
Когда начал проектироваться внутренний поиск
Разработка Labrador началась не сегодня. В рамках антимонопольного судебного процесса над Google в 2024 году руководитель направления ChatGPT Ник Терли дал показания под присягой, раскрывающие историю проекта:
OpenAI начала проектировать свой поисковый индекс еще в 2023 году.
Первоначальный план был сверхагрессивным: компания рассчитывала закрывать силами собственного индекса 80% поисковых запросов пользователей уже к концу 2023 года.
Разработка ускорилась из-за проблем с качеством данных от сторонних партнеров. OpenAI пыталась договориться о покупке данных у Google, но получила отказ.
По оценке Терли, даже при идеальных условиях OpenAI потребуется не менее 5 лет совместной работы с крупным поисковиком, чтобы просто оценить, способна ли компания полностью отказаться от внешних источников данных.
Товарный поиск как полигон для A/B-тестов
Наиболее активно собственный индекс тестируется в товарной вертикали (Shopping). В середине августа 2026 года в коде ответов ChatGPT был зафиксирован масштабный A/B-тест под названием prefer-index-over-serp-v3 (предпочтение собственного индекса внешней выдаче). Этот эксперимент затронул 8% всех чатов пользователей.
Технологический стек товарного поиска ChatGPT устроен следующим образом:
BM25 (лексический поиск): Отбирает и фильтрует стартовые 10 источников.
rerank400 и prod400: Формируют пул из 400 товаров-кандидатов и проводят их глубокое повторное ранжирование.
ann4096 и ann12288: Модели векторного поиска (Approximate Nearest Neighbor), работающие на размерностях векторов 4 096 и 12 288.
На начало сентября 2026 года в ChatGPT параллельно работали минимум 5 экспериментов по товарному поиску (включая prefer-index-over-serp-v3, chatgpt-shopping-noamazon и shopping-index-q2qb), тестирующих различные конфигурации собственного индекса.
ChatGPT использует 8 внешних провайдеров
Несмотря на успехи Labrador, OpenAI пока не может полностью отказаться от внешней помощи. ChatGPT собирает поисковые ответы, комбинируя данные из 8 различных каналов:
Собственный краулер OpenAI, сканирующий веб автономно.
Bright Data (Bright): Используется для парсинга поисковой выдачи Google и сервиса Google Maps.
Oxylabs: Отвечает за парсинг и доставку контента из новостной вертикали Google.
Канал «serp»: Альтернативный поток для сбора новостей и локальных результатов.
Yelp: Официальный лицензионный партнер для предоставления данных о локальном бизнесе.
TripAdvisor: Лицензионный партнер для рекомендаций в сфере туризма и отдыха.
Технические шлюзы b1 и b3: Внутренние каналы интеграции (b1 извлекает данные с бизнес-сайтов и страниц Facebook, b3 направляет запросы к картам Google Maps).
Web IQ от Microsoft: Облачная платформа заземления (grounding), которая обеспечивает выдачу результатов с задержкой менее 165 миллисекунд и снабжает данными ChatGPT, Copilot и корпоративных клиентов вроде Nasdaq.
Что это значит для GEO специалистов
Bing больше не является главным ориентиром: Хорошие позиции вашего сайта в поисковой системе Bing не гарантируют автоматическое попадание в ответы ChatGPT. Алгоритмы отбора информации в ChatGPT строятся на базе собственной платформы Web IQ и индекса Labrador, чьи критерии ранжирования отличаются от стандартных поисковиков.
Приоритет на Yelp и TripAdvisor: Поскольку эти платформы являются официальными лицензионными донорами ChatGPT, локальному бизнесу критически важно иметь там максимально заполненные, актуальные и оптимизированные профили.
Контроль товарного присутствия: Владельцам интернет-магазинов необходимо регулярно проверять, как их товары отображаются в ChatGPT. Из-за постоянных A/B-тестов товарного индекса позиции продуктов могут часто меняться.
Проверка индексации через Lockdown: Используйте режим строгой изоляции в настройках ChatGPT, чтобы узнать, какие именно страницы вашего сайта уже сохранены во внутреннем кэше OpenAI и доступны пользователям даже без обращения к живому интернету.
Наличие внутреннего индекса сильно изменит ранжирование в ChatGPT, так что GEO специалистам придется менять стратегии. Еще недавно к примеру Reddit очень часто использовался для выдачи как источника ответа, но сейчас с каждый апдейтом его цитирование падает. Нечто подобное будет происходить и с другими источниками когда будет набрана критическая масса статей и фактов.

