Какой поисковик появился раньше всех. Поисковые системы в России и зарубежные поисковики (Google, Yahoo, AltaVista и др): сходства, отличия, особенности продвижения. Что такое поисковая система

26.08.2020

Жесткий диск

В архитектуру поисковой системы обычно входят:

Энциклопедичный YouTube

1 / 5

✪ Урок 3: Как работает поисковая система. Введение в SEO

✪ Поисковая система изнутри

✪ Shodan - черный Google

✪ Поисковая система ЧЕБУРАШКА заменит Google и Яндекс в России

✪ Урок 1 - Как устроена поисковая система

Субтитры

История

Хронология
Год	Система	Событие
1993	W3Catalog ?!	Запуск
	Aliweb	Запуск
	JumpStation	Запуск
1994	WebCrawler	Запуск
	Infoseek	Запуск
	Lycos	Запуск
1995	AltaVista	Запуск
	Daum	Основание
	Open Text Web Index	Запуск
	Magellan	Запуск
	Excite	Запуск
	SAPO	Запуск
	Yahoo!	Запуск
1996	Dogpile	Запуск
	Inktomi	Основание
	Рамблер	Основание
	HotBot	Основание
	Ask Jeeves	Основание
1997	Northern Light	Запуск
1997	Яндекс	Запуск
1998	Google	Запуск
1999	AlltheWeb	Запуск
	GenieKnows	Основание
	Naver	Запуск
	Teoma	Основание
	Vivisimo	Основание
2000	Baidu	Основание
2000	Exalead	Основание
2003	Info.com	Запуск
2004	Yahoo! Search	Окончательный запуск
	A9.com	Запуск
	Sogou	Запуск
2005	MSN Search	Окончательный запуск
	Ask.com	Запуск
	Нигма	Запуск
	GoodSearch	Запуск
SearchMe	Основание
2006	wikiseek	Основание
	Quaero	Основание
	Live Search	Запуск
	ChaCha	Запуск (бета)
	Guruji.com	Запуск (бета)
2007	wikiseek	Запуск
	Sproose	Запуск
	Wikia Search	Запуск
	Blackle.com	Запуск
2008	DuckDuckGo	Запуск
	Tooby	Запуск
	Picollator	Запуск
	Viewzi	Запуск
	Cuil	Запуск
	Boogami	Запуск
	LeapFish	Запуск (бета)
	Forestle	Запуск
	VADLO	Запуск
	Powerset	Запуск
2009	Bing	Запуск
	KAZ.KZ	Запуск
	Yebol	Запуск (бета)
	Mugurdy	Закрытие
	Scout	Запуск
2010	Cuil	Закрытие
	Blekko	Запуск (бета)
	Viewzi	Закрытие
2012	WAZZUB	Запуск
2014	Спутник	Запуск (бета)

На раннем этапе развития сети Интернет Тим Бернерс-Ли поддерживал список веб-серверов, размещённый на сайте ЦЕРН . Сайтов становилось всё больше, и поддерживать вручную такой список становилось всё сложнее. На сайте NCSA был специальный раздел «Что нового!» (англ. What"s New! ) , где публиковали ссылки на новые сайты.

Первой компьютерной программой для поиска в Интернете была программа Арчи (англ. archie - архив без буквы «в»). Она была создана в 1990 году Аланом Эмтэджем (Alan Emtage), Биллом Хиланом (Bill Heelan) и Дж. Питером Дойчем (J. Peter Deutsch), студентами, изучающими информатику в университете Макгилла в Монреале . Программа скачивала списки всех файлов со всех доступных анонимных FTP -серверов и строила базу данных, в которой можно было выполнять поиск по именам файлов. Однако, программа Арчи не индексировала содержимое этих файлов, так как объём данных был настолько мал, что всё можно было легко найти вручную.

Развитие и распространение сетевого протокола Gopher , придуманного в 1991 году Марком Маккэхилом (Mark McCahill) в университете Миннесоты , привело к созданию двух новых поисковых программ, Veronica и Jughead . Как и Арчи, они искали имена файлов и заголовки, сохранённые в индексных системах Gopher. Veronica (англ. Very Easy Rodent-Oriented Net-wide Index to Computerized Archives ) позволяла выполнять поиск по ключевым словам большинства заголовков меню Gopher во всех списках Gopher. Программа Jughead (англ. Jonzy"s Universal Gopher Hierarchy Excavation And Display ) извлекала информацию о меню от определённых Gopher-серверов. Хотя название поисковика Арчи не имело отношения к циклу комиксов «Арчи» , тем не менее Veronica и Jughead - персонажи этих комиксов.

К лету 1993 года ещё не было ни одной системы для поиска в вебе, хотя вручную поддерживались многочисленные специализированные каталоги. Оскар Нирштрасс (Oscar Nierstrasz) в Женевском университете написал ряд сценариев на Perl , которые периодически копировали эти страницы и переписывали их в стандартный формат. Это стало основой для W3Catalog ?! , первой примитивной поисковой системы сети, запущенной 2 сентября 1993 года .

Вероятно, первым поисковым роботом, написанным на языке Perl, был «World Wide Web Wanderer» - бот Мэтью Грэя (Matthew Gray) из в июне 1993 года. Этот робот создавал поисковый индекс «Wandex ». Цель робота Wanderer состояла в том, чтобы измерить размер всемирной паутины и найти все веб-страницы, содержащие слова из запроса. В 1993 году появилась и вторая поисковая система «Aliweb ». Aliweb не использовала поискового робота , но вместо этого ожидала уведомлений от администраторов веб-сайтов о наличии на их сайтах индексного файла в определённом формате.

JumpStation , созданный в декабре 1993 года Джонатаном Флетчером, искал веб-страницы и строил их индексы с помощью поискового робота, и использовал веб-форму в качестве интерфейса для формулирования поисковых запросов. Это был первый инструмент поиска в Интернете, который сочетал три важнейших функции поисковой системы (проверка, индексация и собственно поиск). Из-за ограниченности ресурсов компьютеров того времени индексация и, следовательно, поиск были ограничены только названиями и заголовками веб-страниц, найденных поисковым роботом.

Поисковые системы участвовали в «Пузыре доткомов» конца 1990-х . Несколько компаний эффектно вышли на рынок, получив рекордную прибыль во время их первичного публичного предложения . Некоторые отказались от рынка общедоступных поисковых движков и стали работать только с корпоративным сектором, например, Northern Light .

Google взял на вооружение идею продажи ключевых слов в 1998 году, тогда это была маленькая компания, обеспечивавшая работу поисковой системы по адресу goto.com . Этот шаг ознаменовал для поисковых систем переход от соревнований друг с другом к одному из самых выгодных коммерческих предприятий в Интернете . Поисковые системы стали продавать первые места в результатах поиска отдельным компаниям.

Поисковая система Google занимает видное положение с начала 2000-х . Компания добилась высокого положения благодаря хорошим результатам поиска с помощью алгоритма PageRank . Алгоритм был представлен общественности в статье «The Anatomy of Search Engine», написанной Сергеем Брином и Ларри Пейджем, основателями Google . Этот итеративный алгоритм ранжирует веб-страницы, основываясь на оценке количества гиперссылок на веб-страницу в предположении, что на «хорошие» и «важные» страницы ссылаются больше, чем на другие. Интерфейс Google выдержан в спартанском стиле, где нет ничего лишнего, в отличие от многих своих конкурентов, которые встраивали поисковую систему в веб-портал. Поисковая система Google стала настолько популярной, что появились подражающие ей системы, например, Mystery Seeker (тайный поисковик).

Поиск информации на русском языке

В 1996 году был реализован поиск с учётом русской морфологии на поисковой машине Altavista и запущены оригинальные российские поисковые машины Рамблер и Апорт . 23 сентября 1997 года была открыта поисковая машина Яндекс . 22 мая 2014 года компанией Ростелеком была открыта национальная поисковая машина Спутник , которая на момент 2015 года находится в стадии бета-тестировании. 22 апреля 2015 года был открыт новый сервис Спутник. Дети специально для детей с повышенной безопасностью.

Большую популярность получили методы кластерного анализа и поиска по метаданным . Из международных машин такого плана наибольшую известность получила «Clusty» компании Vivisimo . В 2005 году в России при поддержке МГУ запущен поисковик «Нигма », поддерживающий автоматическую кластеризацию . В 2006 году открылась российская метамашина Quintura , предлагающая визуальную кластеризацию в виде облака тегов . «Нигма» тоже экспериментировала с визуальной кластеризацией.

Как работает поисковая система

Основные составляющие поисковой системы: поисковый робот , индексатор , поисковик .

Как правило, системы работают поэтапно. Сначала поисковый робот получает контент, затем индексатор генерирует доступный для поиска индекс, и наконец, поисковик обеспечивает функциональность для поиска индексируемых данных. Чтобы обновить поисковую систему, этот цикл индексации выполняется повторно .

Поисковые системы работают, храня информацию о многих веб-страницах, которые они получают из HTML страниц. Поисковый робот или «краулер» (англ. Crawler ) - программа, которая автоматически проходит по всем ссылкам, найденным на странице, и выделяет их. Краулер, основываясь на ссылках или исходя из заранее заданного списка адресов, осуществляет поиск новых документов, ещё не известных поисковой системе. Владелец сайта может исключить определённые страницы при помощи robots.txt , используя который можно запретить индексацию файлов, страниц или каталогов сайта.

Поисковая система анализирует содержание каждой страницы для дальнейшего индексирования. Слова могут быть извлечены из заголовков, текста страницы или специальных полей - метатегов . Индексатор - это модуль, который анализирует страницу, предварительно разбив её на части, применяя собственные лексические и морфологические алгоритмы. Все элементы веб-страницы вычленяются и анализируются отдельно. Данные о веб-страницах хранятся в индексной базе данных для использования в последующих запросах. Индекс позволяет быстро находить информацию по запросу пользователя . Ряд поисковых систем, подобных Google, хранят исходную страницу целиком или её часть, так называемый кэш , а также различную информацию о веб-странице. Другие системы, подобные системе AltaVista, хранят каждое слово каждой найденной страницы. Использование кэша помогает ускорить извлечение информации с уже посещённых страниц . Кэшированные страницы всегда содержат тот текст, который пользователь задал в поисковом запросе. Это может быть полезно в том случае, когда веб-страница обновилась, то есть уже не содержит текст запроса пользователя, а страница в кэше ещё старая. Эта ситуация связана с потерей ссылок (англ. linkrot ) и дружественным по отношению к пользователю (юзабилити) подходом Google. Это предполагает выдачу из кэша коротких фрагментов текста, содержащих текст запроса. Действует принцип наименьшего удивления , пользователь обычно ожидает увидеть искомые слова в текстах полученных страниц (User expectations ). Кроме того, что использование кэшированных страниц ускоряет поиск, страницы в кэше могут содержать такую информацию, которая уже нигде более не доступна.

Поисковик работает с выходными файлами, полученными от индексатора. Поисковик принимает пользовательские запросы, обрабатывает их при помощи индекса и возвращает результаты поиска .

Когда пользователь вводит запрос в поисковую систему (обычно при помощи ключевых слов), система проверяет свой индекс и выдаёт список наиболее подходящих веб-страниц (отсортированный по какому-либо критерию), обычно с краткой аннотацией, содержащей заголовок документа и иногда части текста. Поисковый индекс строится по специальной методике на основе информации, извлечённой из веб-страниц . С 2007 года поисковик Google позволяет искать с учётом времени, создания искомых документов (вызов меню «Инструменты поиска» и указание временного диапазона). Большинство поисковых систем поддерживает использование в запросах булевых операторов И, ИЛИ, НЕ, что позволяет уточнить или расширить список искомых ключевых слов. При этом система будет искать слова или фразы точно так, как было введено. В некоторых поисковых системах есть возможность приближённого поиска , в этом случае пользователи расширяют область поиска, указывая расстояние до ключевых слов . Есть также концептуальный поиск , при котором используется статистический анализ употребления искомых слов и фраз в текстах веб-страниц. Эти системы позволяют составлять запросы на естественном языке. Примером такой поисковой системы является сайт ask com .

Полезность поисковой системы зависит от релевантности найденных ею страниц. Хоть миллионы веб-страниц и могут включать некое слово или фразу, но одни из них могут быть более релевантны, популярны или авторитетны, чем другие. Большинство поисковых систем использует методы ранжирования, чтобы вывести в начало списка «лучшие» результаты. Поисковые системы решают, какие страницы более релевантны, и в каком порядке должны быть показаны результаты, по-разному . Методы поиска, как и сам Интернет со временем меняются. Так появились два основных типа поисковых систем: системы предопределённых и иерархически упорядоченных ключевых слов и системы, в которых генерируется инвертированный индекс на основе анализа текста.

Большинство поисковых систем являются коммерческими предприятиями, которые получают прибыль за счёт рекламы , в некоторых поисковиках можно купить за отдельную плату первые места в выдаче для заданных ключевых слов. Те поисковые системы, которые не берут денег за порядок выдачи результатов, зарабатывают на контекстной рекламе, при этом рекламные сообщения соответствуют запросу пользователя. Такая реклама выводится на странице со списком результатов поиска, и поисковики зарабатывают при каждом клике пользователя на рекламные сообщения.

Типы поисковых систем

Существует четыре типа поисковых систем: с поисковыми роботами, управляемые человеком, гибридные и мета-системы .

системы, использующие поисковых роботов

Состоят из трёх частей: краулер («бот», «робот» или «паук»), индекс и программное обеспечение поисковой системы. Краулер нужен для обхода сети и создания списков веб-страниц. Индекс - большой архив копий веб-страниц. Цель программного обеспечения - оценивать результаты поиска. Благодаря тому, что поисковый робот в этом механизме постоянно исследует сеть, информация в большей степени актуальна. Большинство современных поисковых систем являются системами данного типа.

системы, управляемые человеком (каталоги ресурсов)

Эти поисковые системы получают списки веб-страниц. Каталог содержит адрес, заголовок и краткое описание сайта. Каталог ресурсов ищет результаты только из описаний страницы, представленных ему веб-мастерами. Достоинство каталогов в том, что все ресурсы проверяются вручную, следовательно, и качество контента будет лучше по сравнению с результатами, полученными системой первого типа автоматически. Но есть и недостаток - обновление данных каталогов выполняется вручную и может существенно отставать от реального положения дел. Ранжирование страниц не может мгновенно меняться. В качестве примеров таких систем можно привести каталог Yahoo , dmoz и Galaxy.

гибридные системы

Такие поисковые системы, как Yahoo , Google , MSN , сочетают в себе функции систем, использующие поисковых роботов, и систем, управляемых человеком.

мета-системы

Метапоисковые системы объединяют и ранжируют результаты сразу нескольких поисковиков. Эти поисковые системы были полезны, когда у каждой поисковой системы был уникальный индекс, и поисковые системы были менее «умными». Поскольку сейчас поиск намного улучшился, потребность в них уменьшилась. Примеры: MetaCrawler и MSN Search.

Рынок поисковых систем

Google - самая популярная поисковая система в мире с долей на рынке 68,69 %. Bing занимает вторую позицию, его доля 12,26 % .

Самые популярные поисковые системы в мире :

Поисковая система	Доля рынка в июле 2014	Доля рынка в октябре 2014	Доля рынка в сентябре 2015
Google	68,69 %	58,01 %	69,24%
Baidu	17,17 %	29,06 %	6,48%
Bing	6,22 %	8,01 %	12,26%
Yahoo!	6,74 %	4,01 %	9,19%
AOL	0,13 %	0,21 %	1,11%
Excite	0,22 %	0,00 %	0,00 %
Ask	0,13 %	0,10 %	0,24%

Азия

В восточноазиатских странах и в России Google - не самая популярная поисковая система. В Китае, например, более популярна поисковая система Soso ?! .

В Южной Корее поисковым порталом собственной разработки Naver пользуется около 70 % жителей Yahoo! Japan и Yahoo! Taiwan - самые популярные системы для поиска в Японии и Тайване соответственно .

Россия и русскоязычные поисковые системы

Согласно данным LiveInternet в июне 2015 года об охвате русскоязычных поисковых запросов :

Всеязычные:
- Yahoo! (0,1 %) и принадлежащие этой компании поисковые машины: Inktomi , AltaVista , Alltheweb
Англоязычные и международные:
- AskJeeves (механизм Teoma)
Русскоязычные - большинство «русскоязычных» поисковых систем индексируют и ищут тексты на многих языках - украинском , белорусском , английском , татарском и других. Отличаются же они от «всеязычных» систем, индексирующих все документы подряд, тем, что, в основном, индексируют ресурсы, расположенные в доменных зонах , где доминирует русский язык, или другими способами ограничивают своих роботов русскоязычными сайтами.

Некоторые из поисковых систем используют внешние алгоритмы поиска.

Количественные данные поисковой системы Google

Число пользователей Интернета и поисковых систем и требований пользователей к этим системам постоянно растёт. Для увеличений скорости поиска нужной информации крупные поисковые системы содержат большое количество серверов. Сервера обычно группируют в серверные центры (дата-центры). У популярных поисковых систем серверные центры разбросаны по всему миру .

В октябре 2012 года Google запустила проект «Где живёт Интернет», где пользователям предоставляется возможность познакомиться с центрами обработки данных этой компании .

О работе дата-центров поисковой системе Google известно следующее :

Суммарная мощность всех дата-центров Google, по состоянию на 2011 год, оценивалась в 220 МВт.
Когда в 2008 году Google планировала открыть в Орегоне новый комплекс, состоящий из трёх зданий общей площадью 6,5 млн м², в журнале Harper’s Magazine подсчитали, что такой большой комплекс потребляет свыше 100 МВт электроэнергии, что сравнимо с потреблением энергии города с населением 300 000 человек.
Ориентировочное число серверов Google в 2012 году - 1 000 000.
Расходы Google на дата-центры составили в 2006 году - $1,9 млрд, а в 2007 году - $2,4 млрд.

Размер всемирной паутины, проиндексированной Google на декабрь 2014 года, составляет примерно 4,36 миллиарда страниц .

Поисковые системы, учитывающие религиозные запреты

Глобальное распространение Интернета и увеличение популярности электронных устройств в арабском и мусульманском мире, в частности, в странах Ближнего Востока и Индийского субконтинента , способствовало развитию локальных поисковых систем, учитывающих исламские традиции. Такие поисковые системы содержат специальные фильтры, которые помогают пользователям не попадать на запрещённые сайты, например, сайты с порнографией, и позволяют им пользоваться только теми сайтами, содержимое которых не противоречит исламской вере. Незадолго до мусульманского месяца Рамадан , в июле 2013 года, миру был представлен Halalgoogling - система, выдающая пользователям только халяльные «правильные» ссылки , фильтруя результаты поиска, полученные от других поисковых систем, таких как Google и Bing . Двумя годами ранее, в сентябре 2011 года, был запущен поисковый движок I’mHalal, предназначенный для обслуживания пользователей Ближнего Востока. Однако этот поисковый сервис пришлось вскоре закрыть, по сообщению владельца, из-за отсутствия финансирования .

Отсутствие инвестиций и медленный темп распространения технологий в мусульманском мире препятствовали прогрессу и мешали успеху серьёзного исламского поисковика. Очевиден провал огромных инвестиций в веб-проекты мусульманского образа жизни, одним из которых был Muxlim . Он получил миллионы долларов от инвесторов, таких как Rite Internet Ventures, и теперь - в соответствии с последним сообщением от I’mHalal перед его закрытием - выступает с сомнительной идеей о том, что «следующий Facebook или Google могут появиться только в странах Ближнего Востока , если вы поддержите нашу блестящую молодёжь» . Тем не менее исламские эксперты в области Интернета в течение многих лет занимаются определением того, что соответствует или не соответствует шариату , и классифицируют веб-сайты как «халяль » или «харам ». Все бывшие и настоящие исламские поисковые системы представляют собой просто специальным образом проиндексированный набор данных либо это главные поисковые системы, такие как Google, Yahoo и Bing, с определённой системой фильтрации, использующейся для того, чтобы пользователи не могли получить доступ к харам-сайтам, таким как сайты о наготе, ЛГБТ , азартных играх и каким-либо другим, тематика которых считается антиисламской .

Среди других религиозно-ориентированных поисковых систем распространёнными являются Jewogle - еврейская версия Google и SeekFind.org - христианский сайт, включающий в себя фильтры, оберегающие пользователей от контента, который может подорвать или ослабить их веру .

Персональные результаты и пузыри фильтров

Многие поисковые системы, такие как Google и Bing, используют алгоритмы выборочного угадывания того, какую информацию пользователь хотел бы увидеть, основываясь на его прошлых действиях в системе. В результате, веб-сайты показывают только ту информацию, которая согласуется с прошлыми интересами пользователя. Этот эффект получил название «пузырь фильтров» .

Всё это ведёт к тому, что пользователи получают намного меньше противоречащей своей точке зрения информации и становятся интеллектуально изолированными в своём собственном «информационном пузыре». Таким образом, «эффект пузыря» может иметь негативные последствия для формирования гражданского мнения .

Предвзятость поисковых систем

Несмотря на то, что поисковые системы запрограммированы, чтобы оценивать веб-сайты на основе некоторой комбинации их популярности и релевантности, в реальности экспериментальные исследования указывают на то, что различные политические, экономические и социальные факторы оказывают влияние на поисковую выдачу .

Такая предвзятость может быть прямым результатом экономических и коммерческих процессов: компании, которые рекламируются в поисковой системе, могут стать более популярными в результатах обычного поиска в ней. Удаление результатов поиска, не соответствующих местным законам, является примером влияния политических процессов. Например, Google не будет отображать некоторые неонацистские веб-сайты во Франции и Германии, где отрицание Холокоста незаконно .

Предвзятость может также быть следствием социальных процессов, поскольку алгоритмы поисковых систем часто разрабатываются, чтобы исключить неформатные точки зрения в пользу более «популярных» результатов . Алгоритмы индексации главных поисковых систем отдают приоритет американским сайтам .

Поисковая бомба - один из примеров попытки управления результатами поиска по политическим, социальным или коммерческим причинам.

См. также

Qwika
Электронная библиотека#Списки библиотек и поисковые системы
Панель инструментов веб-разработчика

Примечания

Литература

Ашманов И. С. , Иванов А. А. Продвижение сайта в поисковых системах. - М. : Вильямс, 2007. - 304 с. - ISBN 978-5-8459-1155-1 .
Байков В.Д. Интернет. Поиск информации. Продвижение сайтов. - СПб. : БХВ-Петербург, 2000. - 288 с. - ISBN 5-8206-0095-9 .
Колисниченко Д. Н. Поисковые системы и продвижение сайтов в Интернете. - М. : Диалектика, 2007. - 272 с. - ISBN 978-5-8459-1269-5 .

Ландэ Д. В. Поиск знаний в Internet. - М. : Диалектика, 2005. - 272 с. - ISBN 5-8459-0764-0 .

Ландэ Д. В., Снарский А. А. , Безсуднов И. В. Интернетика: Навигация в сложных сетях: модели и алгоритмы . - M.: Либроком (Editorial URSS), 2009. - 264 с. - ISBN 978-5-397-00497-8 .

Chu H., Rosenthal M.

1. Введение

Поисковая оптимизация сайтов обычно включает в себя преобразование структуры сайта, наполнение текстовым содержимым в зависимости от продвигаемых запросов, а также различные способы повышения цитируемости ресурса. Кроме стандартных оптимизационных процессов имеются многочисленные методы, которые применяются уже к конкретной поисковой системе. Конечно, поисковики с открытыми кодами пока редкость, и оптимизаторам есть над чем поломать головы, но некоторые основные закономерности поведения можно проследить и у уже утвердившихся систем.

В этом мастер-классе мы с оттенком сравнительного анализа рассмотрим самые популярные зарубежные поисковики и поисковые системы России.

2. Российские поисковые системы

Google, Yandex, и Rambler на сегодняшний день считаются наиболее популярными поисковыми машинами в России. Система Yandex является более посещаемой и имеющей в необходимой степени релевантную выдачу, следовательно, чаще всего оптимизаторы берутся продвигать ресурс именно в этой системе.

Рассмотрим более подробно каждую их этих поисковых систем.

Google

Google имеет свой российский аналог, менее популярный чем исходный американский, но ничем ему не уступающий по качеству поиска. У Google в России есть многочисленные поклонники, считающие, что этот поисковик выдает наилучший результат.

PageRank, используемый в Google, в основном основан на link popularity. Т.е. при вычислении релевантности страницы наибольший вклад имеет количество и качество ссылок на страницы с других страниц.

На данный момент база данных Google насчитывает более миллиарда проиндексированных страниц.

Google - одна из немногих поисковых систем, которая глубоко индексирует ваш сайт. Google использует link popularity как наиболее весомый фактор в определении релевантности страницы. Поэтому большим и популярным сайтам проще попасть на высокие позиции в результатах поиска. Это также защищает Google от спама.

Google полагает, что следующие факторы будут наиболее весомыми при ранжировании страниц:

Link popularity (индекс цитирования);
Keyword proximity and density (плотность и частота ключевых слов);
Keywords in the link text (ключевые слова в ссылках);
Emphasized text (выделенный текст).

Yandex

Отличительная особенность Yandex – интуитивный поиск во всех словоформах. Уникальная разработка под особенности русского языка.

В каталоге Яндекса используется такое понятие, как тематический индекс цитирования (тИЦ) . Он определяется количеством и качеством внешних ссылок на ваш сайт. На качество ссылки влияет тИЦ ресурса, ссылающегося на вас. Немаловажную роль играет тематическая близость вашего сайта ссылающимися на вас ресурсам.

При подсчете индекса цитирования не берутся во внимание ссылки с форумов, веб-досок, конференций, сайтов, расположенных на бесплатных хостингах (если они не описаны в каталоге Яндекса). Естественно, не учитываются ссылки с тех сайтов, которые Яндекс не индексирует (например, зарубежные сайты).

Количество хостов зависит от посетителей (чем их больше, тем больше хостов), а индекс цитирования Яндекса – от авторов сайтов (чем больше авторов поставят ссылку на ваш ресурс, тем выше значение CY).

По значению индекса цитирования определяется релевантность ресурса в каталоге Яндекса и, соответственно, позиция вашего сайта в выбранном разделе.

Переиндексация документа происходит примерно раз в две недели, но под каждый сайт робот подстраивается в отдельности. Все зависит от частоты обновления. По словам Яндекса, тег < meta name="Revizit-after" content="n-days"> никакой роли в работе робота не играет.

Яндекс индексирует российскую сеть, поэтому в поисковую машину вносятся сервера в доменах su, ru, am, az, by, ge, kg, kz, md, ua, uz. Остальные сервера вносятся, только если на них найден текст на русском языке.

Информация в заголовке (тег < title >) Яндекс отображает в результатах поиска. Слова, находящиеся в теге < title >, имеют больший вес чем все остальные. Ключевые слова в теге < meta> также увеличивают вес слова в документе, но только если само слово находится на странице.

Помимо вышеперечисленных способов, на релевантность слова влияют частота его использования в заголовках (< h1>, < h2> ...), в атрибуте alt, во всплывающих подсказках (тег < acronym>) и процент встречаемости этого слова в документе, т.е. как часто вы его используете. Но при этом необходимо сохранить смысл документа, иначе Яндекс может посчитать это слово спамом.

Rambler

Является лучшим рубрикатором на сегодняшний день. Удобен тем, что все ресурсы разбиты на разделы, подразделы и т.д. Многие из них участвуют в рейтинге Top100, что позволяет определить популярность того или иного ресурса.

Считается, что основополагающим фактором для продвижения сайта в Rambler является хороший контент и посещаемость, измеряемая с помощью установленного на сайте счетчика. Таким образом, высокие позиции в рейтинге может занимать сайт хорошо раскрученный, качественно и давно зарекомендовавший себя в интернете, с большой посещаемостью.

Aport

Наименее популярная из перечисленных поисковых систем. Основные критерии, которые данная система учитывает при сортировке сайтов:

количество искомых слов в тексте документа (в процентах), расстояние между поисковыми словами в тексте документа;
место в тексте, где встречаются поисковые слова (заголовок, описание, мета-тег и т.п.);
внешний вид шрифта, которым набраны в тексте искомые слова (размер, жирность, цвет);
количество ссылок из Интернета на данный документ;
использование искомого слова в тексте ссылок из Интернета на данный документ.

3. Зарубежные поисковые системы

Представленные ниже зарубежные поисковые системы широко известны и используются во всем мире. Для веб-мастеров эти поисковые системы – наиболее важные места для регистрации, так как потенциально они способны привести большое количество посетителей на сайт. Некоторые из перечисленных систем не являются полноценными поисковиками, а лишь используют ресурсы других известных поисковых систем.

Считается по количеству проиндексированных страниц одной из наиболее крупных поисковых систем. Большую популярность система получила благодаря возможности вести поиск по усложненным критериям отбора. AltaVista предлагает дополнительные услуги в виде поиска по каталогам из Open Directory, LookSmart, Ask Jeeves.

Google – это поисковая система, которая использует количество ссылок на веб-сайт, как основной параметр популярности сайта. Это особенно полезно при поиске хороших сайтов с помощью простых поисковых запросов. Google знаменит высокой релевантностью ссылок. Google имеет очень большую базу данных проиндексированных сайтов и предоставляет часть своих результатов Yahoo и Netscape Search.

Yahoo является наиболее популярным и старейшим поисковым средством. В Yahoo работает около 150 редакторов, которые составляют и редактируют содержимое своих каталогов. Yahoo имеет в базе данных более 1 миллиона проиндексированных сайтов. Также, в случае нехватки своей собственной базы данных, Yahoo использует базу данных Google, а ранее, надо сказать, использовал базу Inktomi.

Direct Hit измеряет количество кликов. Сайты, по которым больше кликают, получают лучший рейтинг. Известна под названием "поисковая система популярности".

Результаты Direct Hit также появляются в HotBot, а также, в виде опции, могут показываться в MSN Search.

Результаты системы берутся из LookSmart, Inktomi, RealNames и Direct Hit. Для пользователей Search существует уникальная возможность сохранять результаты предыдущего поиска.

Ярким отличием системы является то, что позиции в выдаче продаются. GoTo считает такую выдачу более релевантной. Также можно купить более высокие места в различных рейтингах. Неоплаченные результаты предоставляет Inktomi.

В этой системе не реализована возможность ввода поискового слова напрямую, только через интерфейс других поисковых систем. А таких превеликое множество.

Характерной чертой можно назвать отличные результаты для каждого их партнеров этой базы. Варьирование результатов предоставляет возможность выдаче отдельного поисковика отличаться от других.

Наполнение данной системы осуществлялось с привлечением добровольцев. После достаточного формирования стало возможным свободно пользоваться ее результатами. В настоящее время Open Directory используют Lycos, AOL Search, AltaVista и HotBot.

Отличительная особенность этой системы заключается в том, что при наборе ключевого слова (например, бренда компании) можно попасть на официальный сайт этой компании.

4. Особенности продвижения

Какой бы ни была поисковая система, российской или зарубежной, какие бы она алгоритмы фильтрации не имела, все равно основным критерием оценки релевантности ресурса относительно конкретного запроса является наличие качественного текстового наполнения, что не может не радовать. Для добросовестных оптимизаторов первостепенной задачей при продвижении ресурса является, прежде всего, оптимизация контента сайта, его внутренней ссылочной навигации и удобства для непосредственного пользователя, а не прямая оптимизация под определенную поисковую систему.

Второй по значимости шаг при продвижении во многих поисковиках – это наличие максимального количества ссылок на ресурс. Хотя среди многих непосредственных пользователей бытует мнение, что этот критерий не может в полной мере предоставлять результат, на сегодняшний день он является необходимым.

Можно сказать, что другие особенности продвижения для разных поисковых систем, которые, откровенно говоря, уже и являются не совсем «чистыми», формируются непосредственно издержками фильтрующих алгоритмов самих поисковиков. Таким образом, сами поисковые системы провоцируют оптимизаторов идти на ухищрения. Особенно это касается основных российских поисковиков, отличающихся тенденцией к монополизму.

5. Заключение

Мастер-класс позволяет оценить принципиальные различия поисковых гигантов и составить некоторое представление о том, каким же образом в интернете можно получить более или менее релевантную информацию. Наличие многочисленных поисковых систем создает значительную конкуренцию, а, как известно, конкуренция влечет за собой процессы, направленные на прогресс и развитие в нужном направлении. В данном случае главным приоритетом все же является качественный результат. Ура!

Во времена, когда только начиналось развитие интернета, объём доступной информации был сравнительно мал, и пользователей сети было немного. На начальных стадиях развития сети, ее использовали сотрудники университетов и исследовательских лабораторий для обмена информацией между учреждениями. В то время поиск информации в сети интернет был не актуальным, в отличие от нынешних дней.

Первым способом организации и систематизации доступа к информационным ресурсам стало создание каталогов сайтов. В них стали группировать ссылки согласно определенной тематике.

Первопроходцем области стал Yahoo, который появился в апреле 1994 года. С течением времени количество сайтов возрастало, и Yahoo добавил опцию поиска по каталогам. Это не была поисковая система в прямом смысле, потому что область поиска ограничивалась ресурсами каталога.

Впоследствии каталоги распространились и стали использоваться повсеместно, но и интернет не стоял на месте, а продолжал развиваться. Вместе с ним развивались и методы поиска. На данный момент каталоги почти утратили популярность, это объясняется тем, что современный каталог, даже если он содержит огромное количество ресурсов, сможет обеспечить доступ лишь к малой части информации, которая содержится в сети.

В наши дни самым большим каталогом сети является Open Directory Project или DMOZ, включающий в себя информацию о 5 миллионах ресурсов, но это относительно мало, если сравнивать его, например, с поисковой системой Google, которая содержит около 8 миллиардов документов.

Полноценная же поисковая система вышла в свет только в 1994 году, ей стала система поиска WebCrawler.

Год спустя, в 1995 году появились проекты поисковых систем AltaVista и Lycos. Одна из них, в частности AltaVista, удерживала лидирующие позиции в области поиска в течение долгих лет.

По прошествии двух лет, в 1997 году, студенты Стэндфордского университета Сергей Брин и Ларри Пейдж разработали поисковую систему Google, являющуюся лидером в области поиска на сегодняшний день.

Этот год так же стал годом, когда было официально анонсировано о создании Российской поисковой системы Яндекс, которая и ныне лидирует в русскоязычном сегменте сети.

На данный момент существует только 3 поисковые системы, которые вышли на международный уровень, это MSN Search, Yahoo и Google. Эти системы имеют свои базы и поисковые алгоритмы. Большая часть остальных поисковиков используют их результаты. Так Mail.ru использует базу Yandex , search.aol.com — Google, а Lycos, AltaVista и AllTheWeb — Yahoo.

Лидером поиска на русских просторах интернета на данный момент является Яндекс, за ним — Rambler, далее идут Google, Mail.ru, A port и KM.ru.

У поисковых систем разные алгоритмы работы, и чтобы занять хорошую позицию в поисковой выдаче и привлечь целевых посетителей, нужно знать особенности SEO оптимизации для разных поисковиков. Например

История развития Российского интернета (Рунета) официально ведет отсчет с 1994 года. Именно тогда была зарегистрирована доменная зона.ru, и начали появляться первые сайты, многие из которых впоследствии выросли в популярные порталы.

Библиотека Мошкова, информационное агентство «РосБизнесКонсалтинг», студия Артемия Лебедева – все эти ресурсы были основаны в середине 90-х годов прошлого века.

Как появились первые поисковые системы

Довольно долго «население» Рунета ограничивалось небольшим количеством этих пионеров сетевых технологий. Их было настолько мало, что понятия «поиск» в те времена просто не существовало.

Большинство нужных сайтов можно было сохранить в закладках браузера, а для остальных существовали каталоги, где все ссылки были сгруппированы по нескольким основным категориям. Первым таким каталогом стал проект Russia on the Net (http://www.ru), чуть позже появились DMOZ, Yahoo и Яндекс.Каталог.

Однако с течением времени количество пользователей сети интернет увеличивалось, больше становилось и число сайтов, созданных для того чтобы эти пользователи могли их посещать и получать нужную им информацию.

Постепенно базы данных каталогов выросли настолько, что найти что-либо вручную стало очень сложно. Тогда и появилась идея автоматизировать процесс поиска и создать для этого специализированный интерактивный сервис.

Спрос всегда рождает предложение, поэтому в интернете один за другим стали появляться поисковые проекты от разных авторов. Одни из них, такие как WebCrawler, Lycos, InfoSeek и другие не смогли добиться каких-либо серьезных успехов и через некоторое время почили в безвестности на бескрайних просторах Всемирной паутины.

А вот для других, более удачливых компаний, все сложилось намного лучше – ведущие современные разработчики поисковых технологий образовались именно в этот период и за прошедшие годы сумели добиться ошеломляющих результатов.

Что такое поисковая система

Современный поисковой движок представляет собой сложнейший механизм, который требует огромных ресурсов (как людских, так и материальных) для поддержки текущей работы и устойчивого развития.

В основе формирования поисковой выдачи лежит пресловутая формула ранжирования, которая учитывает сотни различных факторов, начиная от внутреннего устройства сайта и текстов его страниц и заканчивая внешними ссылками, привлекательностью коммерческих предложений, размещенных на ресурсе, и особенностями поведения пользователей, перешедших на него с поиска.

Еще в 2006-2007 году представители Яндекса заявляли о том, что для расшифровки их алгоритма нужен целый научно-исследовательский институт, потому что их поиск основан на учете более чем 800 различных факторов. С тех пор прошли годы, формула ранжирования усложнилась на несколько порядков, а на факторы, которые оказывают наибольшее воздействие на результаты выдачи, воздействовать стало практически невозможно.

Так что за внешней простотой главной страницы и быстрой реакцией Яндекса или Гугла на введенную вами поисковую фразу скрывается кропотливая работа тысяч людей и огромные финансовые вложения в инфраструктуру, оборудование и человеческие ресурсы.

При этом очевидно, что компании-лидеры на сегодняшний момент обеспечили себе такое превосходство над теми, кто захочет составить им хотя бы какую-нибудь конкуренцию, что цена входного билета на этот рынок измеряется миллиардами долларов.

Подтверждением такого положения дел может служить история попыток проникновения на поисковой рынок известнейшей и богатейшей софтверной компании Microsoft. Ее поисковая система Bing на протяжении более чем десяти лет позиционировалась, как серьезный конкурент ведущим игрокам, для чего в нее вкладывались огромные средства.

И только в последние годы эти вложения начали давать первые результаты, хотя удовлетворительными их назвать все равно можно лишь с очень большим преувеличением: доля Bing на российском рынке на момент написания статьи составляла менее одного процента.

Другой пример, хорошо иллюстрирующий сделанные ранее выводы – российский поисковик Нигма. Его создатели выбрали стратегию нишевого маркетинга. Видимо, хорошо понимая, что в открытом поле общего поиска конкуренцию столпам рынка оказать практически невозможно, разработчики алгоритма пошли по пути предоставления услуг поиска по образовательным структурам в области химии, математики, физики и другим наукам.

Однако целевая аудитория такого проекта, очевидно, является немногочисленной, что однозначно отражается и на ее посещаемости: по данным счетчика Liveinternet количество пользователей этой системы составляет всего одну десятую процента.

Безусловным лидером рейтинга является компания Яндекс. По данным того же счетчика Яндекс имеет «контрольный пакет акций » на рынке поисковых систем: в июле 2014 доля поисковой машины составила более 52%.
На втором месте уверенно закрепился Гугл – 38%.
Третье место с довольно большим отрывом занимает портал mail.ru. Некоторое время назад популярный сайт, видимо, занимался поисками старшего брата, которому можно подороже продаться – на их поисковую площадку поочередно интегрировался движок Яндекса и Гугла. Но с 2013 года компания взяла курс на самостоятельное развитие, и теперь на сайте реализован поисковой алгоритм собственной разработки. Правда, это никак не сказалось на доле рынка системы, которая, по всей видимости, определяется в основном раскрученностью бренда и привлекательностью сервисов, представленных на площадке. На протяжении последних лет посещаемость сервиса go.mail.ru колеблется вокруг отметки 7%.

Все остальные поисковики, включая некогда могущественный Рамблер, могут расцениваться разве что, как естественный фон – все они не оказывают существенного влияния на распределение мест в топе поисковых систем, находясь на уровне 0,1-0,7 процентов рынка.

Анализ рынка российского интернет-поиска

Рынок поисковых систем в России является весьма специфическим. Для его описания можно использовать две характеристики: концентрированный и слабо конкурентный. Действительно, доля трех основных игроков превышает 97%, что говорит об их подавляющем преимуществе над всеми остальными.

Доминирующее положение имеет российский поисковик Яндекс. Как мы уже говорили, его доля превышает 50%. В этом наша страна является уникальной: только у нас, в Китае и в Чехии национальные поисковики оказывают ощутимую конкуренцию мировому гиганту – компании Гугл.

По количеству обработанных поисковых запросов Яндекс занимает четвертое место в мире. При этом если первое место Гугла в этом списке вряд ли можно подвергнуть обоснованному сомнению, то второе место китайского Baidu вызвано лишь огромной численностью этой страны. Третье место – у компании Yahoo, имеющей пока двукратный перевес относительно российского монополиста.

По правилам европейского рынка Яндекс действительно можно назвать монополистом – такое определение присваивается там любой компании, доля рынка которой превышает 35%.

В нашей стране такое положение вещей называется доминированием и не наказывается до тех пор, пока не доказан факт злоупотребления имеющимся преимуществом. Понятно, что в интернет-среде факт злоупотреблений подтвердить очень сложно.

Как определить долю поисковика в общем трафике

Объективную оценку данного показателя получить довольно просто. Дело в том, что подавляющее большинство российских сайтов имеет установленные счетчики ведущего оператора интернет-статистики Liveinternet.

Конечно, эти счетчики ставят не все сайты, к тому же в приведенной далее ссылке не учтены доменные зоны.su и рф. Но все же приведенную выборку можно считать вполне репрезентативной, она учитывает все основные тематики, регионы и типы сайтов, имеющихся на сегодняшний день в Рунете.

Итак, посмотреть текущее положение вещей можно по ссылке: http://www.liveinternet.ru/stat/ru/searches.html?date=2014-07-31;period=... .

Это полная сводка по количеству посетителей, переходивших на сайты, зарегистрированные на российских пользователей за июнь и июль 2014 года.

Выводы очевидны. Анализ положения вещей мы уже привели в предыдущем разделе.

Характеристика основных поисковых систем России

Яндекс

Появление этого поисковика на рынке очень хорошо иллюстрирует ситуацию в стране в то время, когда он начал приобретать современные очертания. Недаром Яндекс называют зеркалом Рунета – по-видимому, это определение можно расширить и на объективную реальность.

Развитие компании в чем-то очень схоже с эволюцией всего общества, так что в какой-то степени национальный лидер – это зеркало всей страны конца 20-го века.

Для того чтобы проиллюстрировать такое смелое утверждение обратимся вкратце к истории возникновения компании и поискового движка Яндекс.

Времена после перестройки характеризуются серьезной переоценкой ценностей наиболее активной частью общества и появлением на политической и деловой арене новых энергичных людей, объединенных главной в их жизни идеей: модернизировать условия существования себя и своей страны с целью обеспечения достойного уровня жизни для всех, кто разделяет их убеждения.

Одним из корифеев той эпохи является Аркадий Волож, который сумел объединить вокруг себя лучших специалистов-трудоголиков, заложивших основу будущей поисковой системы.

Яндекс, наверное, никогда не стал бы зеркалом Рунета, если бы не потрясающее чутье Аркадия Воложа, который сумел разглядеть главную перспективу того времени именно в построении российского поисковика.

Для реализации своей идеи он сумел перенаправить в этот проект финансовые потоки, образовывавшиеся от бартерных сделок по обмену партий импортируемых в нашу страну компьютеров в обмен на эшелоны кубанских тыквенных семечек.

Конечно, большие проекты не делаются без команды единомышленников. И тут основателю Яндекса повезло – он сумел привлечь на свою сторону талантливого и подававшего очень большие надежды физика Илью Сегаловича, с которым он был знаком еще со школьной скамьи.

Трудно сказать, что явилось последней каплей, перевесившей для будущего великого ученого все перспективы блестящей научной карьеры. Очень может быть, что решающую роль сыграла настоящая одержимость и талант убеждения бессменного директора Яндекса, но Илья стал техническим директором компании и внес неоценимый вклад в ее развитие.

Именно он стал автором названия и логотипа, который сейчас известен всем, кто хоть раз заходил в интернет. Сегалович увлекся идеей морфологического анализа фраз на русском языке и возможностью классификации текстов на основе правил построения грамматических конструкций.

В результате появилось выражение «Yet another index» – «еще один индекс», которое в сокращенном варианте с легкой руки основателей поисковой машины стало словом Yandex. В дальнейшем, чтобы подчеркнуть основное предназначение поисковой машины – искать в русскоязычном сегменте интернета – логотип преобразовали в Яндекс.

Илья Сегалович посвятил всю свою жизнь становлению и развитию этого проекта. К сожалению, в 2013 году его не стало, но дело его живет, Яндекс наращивает свое превосходство над конкурентами, постоянно совершенствуя алгоритм поиска, основы которого заложил его покойный директор по технологиям и разработке.

Гугл

Поисковая система Гугл была основана на год раньше Яндекса, но на российском рынке появилась лишь в 2004 году. Конечно, за эти годы Яндекс преуспел в адаптации своего поиска под специфику нашей страны.

Несмотря на то, что довольно значительное количество интернет-пользователей на вопрос, ответ на который они не знают, предлагают «погуглить», а не «спросить у Яндекса», основной проблемой мирового гиганта является недостаточный учет морфологии русскоязычных текстов, вследствие чего ответ на запросы пользователей часто является неполным или немного искаженным.

Можно долго спорить о том, чей поиск лучше и с какой системы идут более мотивированные (или «горячие») клиенты. Но, как нам кажется, типичная картина для российского пользователя выглядит следующим образом: сначала запрашивается «зеркало Рунета», а, если результаты его поиска оказались не релевантными (а такое, к сожалению, случается довольно часто), запрос перетранслируется в Гугл.

Глобальные апдейты Гугла происходят гораздо реже, чем у Яндекса. Зато они изменяют выдачу настолько серьезно, что многие авторитетные сайты, годами находившиеся в топе, оказываются в конце первой сотни результатов выдачи.

Так, например, последняя версия алгоритма «Панда» здорово прошлась по некоторым ведущим интернет-магазинам, затронув даже казавшихся неприкосновенными amazon.com и других.

В 2013 году компания наконец-то перестала транслировать чужой поиск на своей площадке и реализовала свой вариант поисковой машины по адресу go.mail.ru.

Этот шаг можно только приветствовать, поскольку в перспективе поисковик от mail.ru может оказать серьезное сопротивление дуэту лидеров, который пока может немного расслабиться, не чувствуя порывистого дыхания конкурентов за своей спиной.

Доля данной поисковой системы сейчас не превышает 7%, но имеет хорошую перспективу к увеличению за счет развития социальных сервисов, предоставляемых компанией: Одноклассники, Мой Круг, почта и т. д.

Поисковики с долей рынка менее 1%

В этой группе сосредоточены в основном системы, которые так и не смогли пробиться в элиту российского поиска. Среди них особое положение занимает компания Рамблер, когда-то уверенно занимавшая второе место и демонстрировавшая очень многообещающие тенденции.

Рамблер

Появившись в 1996 году, как детище программистов наукограда Пущино под руководством талантливого энтузиаста Дмитрия Крюкова, Рамблер сразу стал лидером рынка поисковых систем. В те времена Яндекса еще не было, а Гугл только начинал свое шествие по территории Америки и близлежащих стран.

Казалось бы, такая фора должна была помочь «бродяге» (а именно так переводится с английского слово Rambler) получить заметные конкурентные преимущества в развитии.

Но то ли внутренние конфликты в компании, то ли отсутствие четко выраженной стратегии привели к тому, что сейчас Рамблер транслирует поиск Яндекса и больше известен, как агрегатор некоторых популярных сервисов, включая рейтинг сайтов Rambler Top100

Бинг

Он же MSN Search, Live Seacrh, Windows Live Seacrh – продукт компании Microsoft, отчаянно борющейся за место под солнцем на рынке поисковых систем. Это один из немногих сервисов, использующих свой собственный движок.

Результаты поиска вполне приемлемы, главной проблемой сайта, по-видимому, является невысокая известность среди пользователей.

Апорт

Еще один пример печальной судьбы некогда одного из лидеров рынка. Были времена, когда этот поисковик твердо держал третье место после Яндекса и Рамблера, а в его каталог вебмастера стремились попасть так же активно, как в DMOZ или Яндекс-каталог.

Сейчас на сайте размещен интернет-магазин популярных бытовых товаров. Поиск на апорте если и остался, то спрятан где-то в глубинах ресурса, на одном из его поддоменов.

Что нужно, чтобы написать свой собственный поисковик

Для того чтобы ответить на этот вопрос, необходимо хорошо представлять себе, что такое поисковая система и как она работает. Частично мы уже рассмотрели основные принципы построения формулы ранжирования сайтов в поисковой выдаче. Кроме этого, необходимо отметить следующие моменты:

Главная задача поисковой машины – дать ответ на запрос пользователя. Ответ должен быть четким и актуальным, иначе пользователь уйдет в другие системы, даже несмотря на невысокую конкуренцию в этой отрасли.

Чтобы дать такой ответ, поисковому алгоритму необходимо в момент его формирования просмотреть содержимое многих миллиардов страниц в сети в поисках наиболее подходящих для конкретного запроса. Для этого поисковые системы создают собственные базы данных, которые называются индексами и хранят там всю необходимую информацию.

Индекс формируется путем постоянного сканирования сети в поисках новых появившихся сайтов, а также изменений на уже проиндексированных страницах. Выполняют эту работу специальные программы, называемые роботами-индексаторами.

Они круглосуточно ходят по сайтам и считывают обновленную информацию. Организация работы таких роботов требует построения большого дата-центра на несколько тысяч мощных компьютеров со всей инфраструктурой, начиная от бесперебойного питания и охлаждения и заканчивая регулярным обслуживанием и модернизацией.

Пользователи хотят получать быстрые и адекватные ответы на свои запросы. Поэтому современная поисковая система должна учитывать не только характеристики известных ей сайтов, но и предпочтения, особенности поведения и географическое положение каждого своего клиента.

Для этого алгоритмы поиска должны обладать элементами искусственного интеллекта и уметь самостоятельно обучаться в процессе своей работы. Очевидно, что для написания такого движка нужен большой коллектив программистов высочайшего класса.

Учитывая, что ведущие поисковики уже решили все эти проблемы и обладают всем необходимым потенциалом для дальнейшего развития, стоимость вхождения на этот рынок представляется практически заоблачной.

Поэтому вряд ли в ближайшее время может появиться новый игрок, способный быстро занять достойное место в ряду существующих систем. Хотя, если такое вдруг случится, выиграют все – и сами поисковые системы, которые получат новые стимулы для еще большего совершенствования, и мы, капризные рядовые пользователи, которым всегда чего-то не хватает и хочется, чтобы поиск с каждым днем становился лучше и качественнее.

В начале 90-х годов у пользователей интернета не было привычки задавать вопросы поисковым системам. Ссылки на полезные сайты, о которых узнавали преимущественно у знакомых, собирали в отдельные текстовые файлы. Позднее появились сайты-каталоги с рубрикаторами, которые пополняли вручную. Такими, например, были сайты Yahoo! и Virtual Library (VLib), который вёл и хранил на сервере CERN изобретатель современного интернета Тим Бернерс-Ли.

Первой же в истории поисковой системой считают появившийся в 1990 году Archie, файловый архив со скачиваемыми каталогами сайтов и возможностью поиска по ним, созданный студентами Университета Макгилла в Монреале. Archie не индексировал содержимое сайтов: этому научились поисковые системы, запущенные в 1993 году, среди которых были World Wide Web Wanderer, ALIWEB и JumpStation. Последняя стала первой полноценной поисковой системой в современном понимании: она с помощью роботов собирала и ранжировала ссылки в выдаче по схожести с запросом пользователя.

Создатели первых поисковиков
в основной массе либо бросили это занятие , либо перешли на работу
в крупные интернет-компании

Появившаяся в 1994 году AltaVista стала первой поисковой системой, работавшей с естественными языковыми запросами, а первым по-настоящему мощным поисковиком стал WebCrawler, который индексировал содержимое страниц полностью. Наконец, в 1997–1998 годах заработали Google и «Яндекс», самые популярные поисковые системы в России на сегодня. Благодаря лучшим алгоритмам они стали международным и региональным лидером соответственно, но на то, чтобы отобрать долю у других участников рынка, им потребовалось время. Создатели же первых поисковиков в основной массе либо бросили это занятие, либо перешли на работу в крупные интернет-компании, выкупившие их системы целиком.