Обновить
128K+

Поисковые технологии *

От AltaVista до Яндекса

70,02
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Почему сайт невидим для роботов: проблемы вайб-кодинга

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели4.1K

Вайб-кодинг уронил порог входа до плинтуса: Lovable, Bolt или v0 соберут лендинг за вечер. А потом сайт неделями болтается на дне выдачи, и даже ChatGPT про него не знает. Спрашиваешь у нейронки, почему SEO хромает, — она валит на «непродающие тексты». Причина обычно глубже: для поисковых роботов ваш сайт буквально пустая страница.

Внутри: почему нейронки по умолчанию лепят SPA, как на JavaScript смотрят Google и Яндекс, почему GPTBot и ClaudeBot скачивают ваши скрипты, но никогда их не запускают, работает ли llms. txt и какая одна строчка в промпте все чинит.

Читать далее

Новости

Manticore Search 28.4.4: быстрый рескоринг KNN, более гибкий диалоговый поиск, упрощённая установка и улучшенные фасеты

Время на прочтение5 мин
Охват и читатели7.2K

Мы выпустили Manticore Search 28.4.4 . В этом релизе ресоринг KNN стал быстрее, диалоговый поиск — гибче, установка и обновление — проще, фасеты получили дополнительные параметры, появились настройки релевантности по умолчанию на уровне таблицы, а также исправления в аутентификации, репликации, совместимости SQL, распределённых запросах и внутренних механизмах columnar/KNN.

В этом посте собраны изменения, вышедшие с 27.2.0 по 28.4.4.

Читать далее

DuckDuckGo: поиск без слежки как бизнес-модель

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.9K

DuckDuckGo — один из немногих поисковиков, который сделал приватность не маркетинговым лозунгом, а основой бизнеса. Сервис не хранит историю запросов, не создает профили пользователей и не раскрывает их данные. Несмотря на это, компания остается прибыльной и независимой. 

Рассказываем, как один человек превратил нишевую идею в устойчивый бизнес с сотнями сотрудников и выручкой от рекламы, которая работает без слежки.

Читать далее

Turbopuffer vs Manticore Search: бенчмарк на недорогих VPS

Время на прочтение17 мин
Охват и читатели7K

Векторные базы данных в serverless-модели обычно обещают простую вещь: не требуется развёртывание и настройка, а провайдер берёт на себя управление хранилищем, масштабирование и обеспечение доступности. turbopuffer - один из лучших примеров этого класса: быстрый движок векторного поиска, использующий object storage в качестве хранилища, которым пользуются Cursor, Notion, Linear и другие.

Такой подход действительно снижает операционную нагрузку на команду, но он не бесплатен. Поэтому возникает закономерный вопрос: какая часть этих преимуществ нужна небольшому, четко определенному сценарию, и во что обойдется та же нагрузка на двух недорогих VPS с Manticore Search - по цене и по производительности?

В этой статье мы подтверждаем это цифрами: сравниваем две системы в одинаковых условиях на одном и том же наборе данных.

Читать далее

Google добавил AI-отчёты в Search Console. Я разобрался, что они реально показывают

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели7.9K

Google начал разворачивать в Search Console отчётность по своим AI-поверхностям: трафик и показы стало видно с учётом AI Overviews и AI Mode. До этого AI-клики были размазаны внутри общего веб-отчёта, и понять, сколько дал именно ИИ-ответ, было нельзя. Я полез смотреть и довольно быстро уткнулся в потолок.

Оказалось, что Search Console показывает только AI-поверхности самого Google. Ни ChatGPT, ни Perplexity, ни Claude, ни Алиса в него не попадают в принципе — они не Google. Если вы, как и я, хотите видеть весь AI-трафик, а не только гугловский, придётся идти в логи сервера. Ниже — что именно даёт новый отчёт, где у него слепые зоны и как я закрываю их парсером логов.

Читать далее

YaGo: как я хотел бесплатный self-hosted Tavily API, а в итоге воскресил YaCy

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели13K

Всё началось не с мечты про «поисковик нового поколения». Мне понадобился быстрый self-hosted Tavily-compatible API для собственных рабочих и личных AI-решений: без оплаты за каждый запрос, без внешнего сервиса в обязательной цепочке и с индексом, содержимое которого контролирую я сам.

Тут я вспомнил про YaCy. Когда-то я уже поднимал его ноду. Идея мне нравилась, а реализация — заметно меньше: Java, тяжёлая машина и примерно шесть секунд ожидания ответа на моей тогдашней установке. Для человека, который один раз нажал Enter, это ещё можно пережить. Для агента, делающего несколько поисков, уточнений и extract подряд, это превращает один шаг в минутный перекур.

Поэтому вместо ещё одной обёртки над чужим поиском я оставил от YaCy сетевой протокол и начал собирать поисковую ноду заново: на Go, с отдельным краулером, embedded storage, нормальным API и ranking pipeline из современных работ по information retrieval.

Под катом — немного сетевой археологии, Bleve, bbolt, gRPC, BM25, LambdaMART и рассказ о том, как задача «дайте локальный endpoint для AI-агентов» постепенно превратилась в реинкарнацию YaCy.

Читать далее

Треть запросов ChatGPT к поиску — повторы. Разобрал 591 ответ: почему одних цитируют всегда, а других — через раз

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели12K

Недавно в отраслевой рассылке SEOFOMO мелькнула цифра — ChatGPT в режиме поиска повторяет около 34% своих query fan-out. То есть когда вы задаёте разные вопросы, модель под капотом раскладывает их на под-запросы к поиску — и примерно треть этих под-запросов повторяется от промпта к промпту. Есть устойчивое ядро, которое крутится постоянно.

Я работаю с видимостью брендов в нейросетях и сразу подумал: если ядро под-запросов стабильно, то и цитируемость источников не может быть равномерным шумом. Она должна расслаиваться — стабильное ядро сайтов, которые попадают в ответ почти всегда, и длинный хвост тех, кого система вспоминает через раз. Гипотезу можно проверить руками. Ниже — как я это сделал: замкнутый список из 16 брендов, шесть нейросетей, 591 обезличенный ответ и немного Python.

Читать далее

Как быстро нейросети забывают источники: за месяц большинство теряется, но выжившие держатся долго

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.8K

Два месяца назад я запустил повторный замер одних и тех же 20 промптов в двух ИИ-поисковых системах — хотел посчитать, с какой скоростью источники вымываются из цитируемой выдачи. Результат оказался неожиданно резким: за первый месяц ChatGPT перестаёт ссылаться примерно на три четверти доменов, которые цитировал в начале, Алиса AI — примерно на половину. А между первым и вторым месяцем распад почти останавливается. Ниже — как я это мерил, что получилось и почему на трёх точках во времени можно уверенно говорить про форму кривой, но нельзя — про точный коэффициент.

Читать далее

Поиск по короткому аудио фрагменту

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.8K

Рад всех приветствовать, тема на мой взгляд очень интересная! Приступим?

Постановка задачи

Есть короткая аудио запись продолжительностью от 3 до 6 секунд. Требуется найти: откуда она?

Читать далее

Опять назвали медведем. Прогнал 21 телеграм-канал про нейросети через 6 ИИ и посчитал, кого они реально видят

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели7K

Похоже, зря я назвал свой канал про ИИ исключительно по фамилии — Бурый. Оказалось, что из-за конкуренции с такими понятиями, как медведь и цвет, меня плохо видно в нейросетях. Пришлось проводить целое исследование, чтобы с этим разобраться.

Читать далее

Как измерить трафик из нейросетей в Яндекс.Метрике — и почему ChatGPT с Алисой в него не попадают

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели11K

Я собрал в Я.Метрике сегмент по реферальным доменам ИИ-сервисов для своего небольшого сайта и прогнал его за четыре окна. Число получилось маленькое — 10 визитов из 634 за 90 дней. Но интереснее не само число, а то, что с ним по-честному можно делать, а что нельзя. Разобрался, почему любой такой замер по определению даёт оценку снизу: реальная величина всегда больше, а насколько — метод сказать не может.

Читать далее

GEO: Как принудить нейросеть рассказать про ваш продукт. Часть 2 из 3

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели11K

Начну с тезиса, который большинство классических сеошников и маркетологов, честно говоря, не очень любят. Но именно с него начинается понимание, что такое GEO на самом деле.

Нейросеть не рекламирует ваш продукт — она пересказывает ценность вашей компании своими словами. Она не повторяет ваши рекламные лозунги, сколько бы раз вы их где-нибудь ни написали. То есть если вы сто раз напишете, что ваш сервис самый сервисный, качество самое качественное, а ассортимент самый многообразный — модель, скорее всего, вас даже не упомянет. Не потому, что вы плохие. А потому, что ей про вас нечего пересказать. Это сказано везде — значит, не сказано нигде.

Читать далее

Два движка, два разных веба: почему ChatGPT-search и Яндекс-нейропоиск цитируют из 174 доменов только 7 общих

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели12K

Я гоняю один и тот же пул из 60 промптов через шесть ИИ-движков раз в месяц — это часть мониторинга, который я веду для одной ниши. В какой-то момент решил не просто читать ответы, а посчитать, откуда движки берут источники. Ожидал разную выдачу по одной теме — обычное дело для поисковиков. Получил другое: два практически несвязанных множества доменов. Из 174 уникальных источников за последний срез общих оказалось 7.

Расскажу, как я это посчитал, почему дело не в шуме прогона, а в архитектуре, и почему первый вывод оказался не там, где я его искал.

Читать далее

Ближайшие события

GEO — эпоха продвижения в нейросетях уже наступила. Часть 1 из 3

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели12K

Это первая из трёх статей про GEO. Здесь — концептуальная база: за что вообще идёт борьба в нейровыдаче и почему это не косметическая надстройка над SEO. Во второй части будет содержательный слой — смыслы, граундинг, факт-чекинг и почему накрутка не держится. В третьей — прикладная техника: чанкование, разметка, замеры и атрибуция. Каждую часть можно читать отдельно.

Читать далее

Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. 

Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки.

Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска.

Переходим к VLM-системе

Можно ли продвигать коммерческий сайт на Tilda в 2026 году

Время на прочтение18 мин
Охват и читатели12K

Сайт на Тильде может получать поисковый трафик.

В 2026 году это уже странно доказывать: в выдаче достаточно проектов на конструкторах, у которых индексируются страницы, растут запросы, приходят заявки.

Поэтому вопрос лучше ставить практичнее: в каких случаях Тильда выдерживает SEO-задачу, а в каких начинает мешать работе.

Читать далее

Цитата — это ещё не рекомендация: разбираю, что на самом деле двигает бренд в ответах ИИ

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.6K

Я несколько месяцев мониторю, как ChatGPT, Perplexity, Gemini и «Алиса» отвечают на вопросы про бренды и продукты. И почти сразу упёрся в путаницу, которую тащат из классического SEO: считается, что «попасть в ответ ИИ» — это когда нейросеть поставила ссылку на твой сайт в списке источников. Ссылка есть — победа, ссылки нет — провал.

На практике это две разные вещи, и меряются они по-разному. Есть цитата (citation) — сноска, ссылка на страницу как на доказательство. И есть упоминание (mention) — когда модель называет бренд прямо в тексте ответа, без всякой ссылки. Дальше я разберу на публичных данных двух исследований (Ahrefs и Profound) плюс на собственном замере, почему упоминание важнее цитаты и почему оптимизировать имеет смысл именно под него.

Читать далее

RAG для закупок: Qdrant и LlamaIndex в локальном контуре

Время на прочтение15 мин
Охват и читатели8.6K

Привет Хабр! Меня зовут Владимир, и недавно я решил изучить новую (для себя) технологию - LlamaIndex. А тут и задачка подвернулась - надоело копаться в Положении о закупках, поэтому понадобился RAG для ответов по ФЗ-44, ФЗ-223, ну и локальному положению.

В этой статье разберу, как создать простенький RAG, не выходящий из локального контура, на базе LlamaIndex + Qdrant, напишем к нему API и UI на Gradio. Поехали.

Читать далее

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.8K

Классический RAG часто ошибается не из‑за слабой embedding‑модели, а потому что чанки теряют связь с исходным документом. Разбираем, как Contextual Retrieval возвращает этот контекст перед индексацией и помогает точнее искать нужные фрагменты в корпоративных базах знаний.

Читать далее

Модель почтовых адресов в реляционных БД

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Почтовые адреса используют в реляционных БД, просто записывая их в одно текстовой поле или распределяя по отдельным полям типа город, улица, номер дома, корпус, квартира (возможно, вынося города и улицы в отдельные таблицы). В данной статье хочу поделиться одной моделью представления, которая коррелирует с моделью адресов ГАР ФИАС и позволяет выполнять широкий спектр действий с адресами средствами языка SQL.

Как известно, вручную написанные адреса обладают рядом неприятных свойств, затрудняющих их программное использование. Это и многовариативность написания одного и того же элемента, и пропуски, и искажения, и добавление лишнего. Идея состоит в том, чтобы выделить адресные элементы, нормализовать их, по возможности привязать к элементам ГАР ФИАС и сохранять в таблице БД не только нормализованные строки элементов адреса, но и GUID привязанных к ГАР элементов. При таком представлении возможно средствами SQL производить поисковые операции, находить дубликаты и пр., что затруднительно делать на исходных текстах адресов.

Данная модель применялась в проекте Досье компании Preferentum для системы загрузки и анализа неструктурированной и полуструктурированной информации (выгрузки разных баз и информационных систем). Для нормализации и привязки к ГАР используется SDK Pullenti Address, которое автор и разрабатывает.

Читать далее
1
23 ...