Первой российской советской информационной поисковой системой является. Информационно-поисковые системы и их классификация

14.06.2019

5. Поиск в Интернет. Каталоги. Информационно-поисковые системы. Механизмы поиска в Интернет.

ИПС (информационно-поисковая система)– это система, обеспечивающая поиск и отбор необходимых данных в специальной базе с описаниями источников информации (индексе) на основе информационно-поискового языка и соответствующих правил поиска.

Главной задачей любой ИПС является поиск информации релевантной информационным потребностям пользователя. Очень важно в результате проведенного поиска ничего не потерять, то есть найти все документы, относящиеся к запросу, и не найти ничего лишнего. Поэтому вводится качественная характеристика процедуры поиска – релевантность.

Релевантность – это соответствие результатов поиска сформулированному запросу. Далее мы будем, в основном, рассматривать ИПС для всемирной паутины (WWW).

Основными показателями ИПС для WWW являются пространственный масштаб и специализация.

По пространственному масштабу ИПС можно разделить на локальные, глобальные,

региональные и специализированные. Локальные поисковые системы могут быть разработаны для быстрого поиска страниц в масштабе отдельного сервера.

Региональные ИПС описывают информационные ресурсы определенного региона, например, русскоязычные страницы в Интернете. Глобальные поисковые системы в отличие от локальных стремятся объять необъятное – по возможности наиболее полно описать ресурсы всего информационного пространства сети Интернет.

Кроме того, ИПС также могут специализироваться по поиску различных источников информации, например, документов WWW, файлов, адресов и т.д.

Рассмотрим подробнее основные задачи, которые должны решить разработчики ИПС. Как следует из определения, ИПС для WWW проводят поиск в собственной базе (индексе) с

описанием распределенных источников информации.

Следовательно, сначала нужно описать информационные ресурсы и создать индекс. Построение индекса начинается с определения начального набора URL источников информации. Затем проводится процедура индексирования.

Индексирование – описание источников информации и построение специальной базы данных (индекса ) для эффективного поиска.

В некоторых информационно-поисковых системах описание источников информации проводится персоналом ИПС, то есть, людьми, которые составляют краткую аннотацию на каждый ресурс. Затем, как правило, проводится сортировка аннотаций по темам (составление тематического каталога). Конечно, описание, составленное человеком, будет совершенно адекватно источнику. Правда, в этом случае процедура описания занимает значительный период времени, поэтому формируемый индекс имеет, как правило, ограниченный объем. Зато поиск в подобной системе можно будет проводить так же легко, как в тематических каталогах библиотек.

В ИПС второго типа процедура описания информационных ресурсов автоматизирована. Для этого разрабатывается специальная программа-робот, которая по определенной технологии обходит ресурсы, описывает их (проводит индексирование) и анализирует ссылки с текущей страницы для расширения области поиска. Как может описать документ программа? Чаще всего простосоставляется список слов, которые встречаются в тексте и других частях документа,

при этом учитывается частота повторения и местоположение слова, то есть, слову приписывается своеобразный весовой коэффициент в зависимости от его значимости. Например, если слово находится в названии Web-страницы, робот пометит этот факт для себя. Поскольку описание автоматизировано, затраты времени невелики, и индекс может оказаться очень большим по размеру.

Следовательно, следующей задачей для ИПС второго типа является разработка роботаиндексировщика. Для поиска в системах данного типа пользователю придется научиться составлять запросы, в простейшем случае состоящие из нескольких слов. Тогда ИПС будет искать

в своем индексе документы, в описаниях которых встречаются слова из запроса. Для проведения более качественного поиска необходимо разрабатывать специальный язык запросов для пользователя. В зависимости от особенностей построения модели индекса и поддерживаемого языка запросов разрабатывается механизм поиска и алгоритм сортировки результатов поиска. Поскольку индекс имеет значительный объем, количество найденных документов может оказаться достаточно большим. Следовательно, чрезвычайно важно, как поисковая машина проведет поиск и отсортирует его результаты.

Не последнее значение имеет внешний вид поисковой системы, предстающий перед пользователем, поэтому одной из задач является разработка удобного и красивого интерфейса. Наконец, исключительно важна форма представления результатов поиска, поскольку пользователю необходимо узнать как можно больше о найденном источнике информации, чтобы принять правильное решение о необходимости его посещения.

Для обращения к поисковому серверу пользователь использует стандартную программуклиент для всемирной паутины, то есть браузер. По адресу домашней страницы ИПС пользователь работает с интерфейсом поисковой системы, который служит для общения пользователя с поисковым аппаратом системы (системой формирования запросов и просмотра результатов поиска).

Информационно-поисковые системы

Основным компонентом ИПС является поисковая машина, которая служит для перевода запроса пользователя в формальный запрос системы, поиска ссылок на информационные ресурсы и выдачи результатов поиска пользователю.

Как уже говорилось ранее, поиск осуществляется в специальной базе, именуемой индексом. Архитектура индекса устроена таким образом, чтобы поиск проходил максимально быстро, и при этом можно было отследить ценность каждого из найденных ресурсов. Некоторые системы сохраняют запросы пользователя в его личной базе данных, поскольку на отладку каждого запроса уходит много времени, и чрезвычайно важно хранить запросы, на которые получен удовлетворительный ответ.

Робот-индексировшик – программа, которая служит для сканирования Интернет и поддержки базы данных индекса в актуальном состоянии.

Web-сайты – те информационные ресурсы, доступ к которым обеспечивает ИПС.

Как известно, Web-страница – это сложный документ, состоящий из множества элементов. При описании подобного документа программой-роботом необходимо учитывать, в какой именно части Web-страницы встретилось данное слово. Источниками индексирования для документов

WWW являются:

∙ Заголовки (Title).

∙ Заглавия.

∙ Аннотация (Description).

∙ Списки ключевых слов (KeyWords).

∙ Полные тексты документов.

Кстати, поисковые системы, которые описывают абсолютно весь текст документа WWW, называются полнотекстовыми.

Для того, чтобы описать файл в ресурсе FTP используется URL. Для описания статьи в группе новостей источниками индексирования являются поля Тема (Subject) и Keywords (ключевые слова).

Во время процедуры индексирования часто производится нормализация лексики (приведение слова к базовой форме), некоторые неинформативные слова, например, союзы или предлоги, игнорируются. В каждой ИПС существует свой список называемых стоп-слов, которые игнорируются в процессе индексирования. В системах с сильно изменяемыми языками, например, русским, проводится учет морфологии.

Учет морфологии означает умение работать с различными формами слов конкретного

Здесь следует отметить достаточную сложность русского языка, слова которого изменяются по числам, падежам, родам и временам, причем зачастую неожиданным образом. Например: идет, шел, пойдет, идут и т.д. Все существующие ИПС с учетом морфологии русского языка используют "Грамматический словарь русского языка", составленным Андреем Анатольевичем Зализняком. Словарь включает 90000 словарных статей, по каждому слову даются сведения о том, изменяемо ли оно, и как именно оно склоняется или спрягается.

Из вышеизложенного следует, что основными инструментами поиска информации в WWW являются ИПС.

Однако в Интернет существуют средства поиска, имеющие принципиальные отличия от рассмотренных выше ИПС. В общем случае, можно выделить следующие поисковые инструменты для WWW:

∙ поисковые системы,

∙ метапоисковые системы и программы ускоренного поиска.

Центральное место по праву принадлежит поисковым системам, которые в свою очередь подразделяются на каталоги, автоматические индексы (поисковые машины) и каталоги-индексы. Только поисковые системы почти в полном объеме обладают возможностями и свойствами ИПС.

Каталог – поисковая система с классифицированным по темам списком аннотаций со ссылками на web-ресурсы. Классификация, как правило, проводится людьми.

Рассмотрим особенности систем-каталогов.

Поиск в каталоге очень удобен и проводится посредством последовательного уточнения тем. Тем не менее, каталоги поддерживают возможность быстрого поиска определенной категории или страницы по ключевым словам с помощью локальной поисковой машины.

База данных ссылок (индекс) каталога обычно имеет ограниченный объем, заполняется вручную персоналом каталога. Некоторые каталоги используют автоматическое обновление индекса.

Результат поиска в каталоге представляется в виде списка, состоящего из краткого описания (аннотации) документов с гипертекстовой ссылкой на первоисточник.

Среди самых популярных зарубежных каталогов можно упомянуть: Yahoo (www.yahoo.com ), Magellan (www.mckinley.com),

Российские каталоги: @Rus (www.atrus.ru ); Weblist (www.weblist.ru ); Созвездие интернет (www.stars.ru).

Поисковая система – система с формируемой роботом базой данных, содержащей информацию об информационных ресурсах.

Отличительной чертой поисковых систем является тот факт, что база данных, содержащая информацию об Web-страницах, статьях Usenet и т.д., формируется программой-роботом. Поиск в такой системе проводится по запросу, составляемому пользователем, состоящему из набора ключевых слов или фразы, заключенной в кавычки. Индекс формируется и поддерживается в актуальном состоянии роботами-индексировщиками.

Зарубежные поисковые машины (системы):

Google - www.google.com (примерно 38% охвата русскоязычных запросов) Altavistawww.altavista.com

Excite www.excite.com HotBot - www.hotbot.com

Nothern Lightwww.northernlight.com Go (Infoseek) www.go.com (infoseek.com) Fast www.alltheweb.com

Российские поисковые машины:

Яndex - www.yandex.ru (илиwww.ya.ru ) (48% охвата русскоязычных запросов)

Рэмблер - www.rambler.ru Апортwww.aport.ru

Метапоисковая система – система, не имеющая своего индекса, способная послать запросы пользователя одновременно нескольким поисковым серверам, затем объединить полученные результаты и представить их пользователю в виде документа со ссылками.

6 Принципы работы метапоисковых систем. Механизмы поиска в интернет. Язык запросов.

При работе метапоисковой системы из полученного от поисковых систем множества документов необходимо выделить наиболее релевантные, то есть соответствующие запросу пользователя.

Простейшие метапоисковые системы реализуют стандартный подход, представленный на рис. 1. В таких системах анализ полученных описаний документов не производится, что может поставить нерелевантные документы, идущие первыми в одной поисковой системе, выше релевантных в другой, чем существенно понизить качество самого поиска.

Рис.1 Стандартная метапоисковая система

При разработке следующего поколения метапоисковых систем были учтены недостатки, присущие стандартным метапоисковым системам. Были созданы системы с возможностью выбора тех поисковых машин, в которых, по мнению пользователя, он с большей вероятностью может найти то, что ему нужно (рис. 2)

Рис. 2. Следующее поколение метапоисковых систем

Кроме этого, такой подход позволяет уменьшить используемые вычислительные ресурсы метапоискового сервера, не перегружая его слишком большим объемом ненужной информации и серьезно сэкономить трафик. Здесь нужно отметить, что в любой системе метапоиска наиболее узким местом в основном является пропускная способность канала передачи данных, так как обработка страниц с результатами поиска, полученными от нескольких десятков поисковых серверов не является слишком трудоемкой операцией, потому что затраты времени на обработку информации на порядки меньше времени прихода страниц, запрошенных у поисковых серверов.

Как пример систем, имеющих подобную организацию, можно назвать Profusion ,Ixquick ,SavvySearch ,MetaPing .

Примером метапоисковой системы является Nigma (Нигма. РФ)- российская интеллектуальная метапоисковая система.

Программа ускоренного поиска – это программа с возможностями метапоисковой системы, устанавливаемая на локальном компьютере.

Принципиальным отличием метапоисковых систем и программ ускоренного поиска от ИПС является отсутствие своего собственного индекса. Зато они превосходно умеют использовать результаты работы других поисковых систем.

Механизмы поиска

Обобщенная технология поиска состоит из следующих этапов:

∙ Пользователь формулирует запрос

∙ Система проводит поиск документов (или их поисковых образов)

∙ Пользователь получает результат (сведения о документах)

∙ Пользователь совершенствует или реформирует запрос

∙ Организация нового поиска...

Как правило, поисковые машины поддерживают два режима: режим простого поиска и режим расширенного поиска. Рассмотрим обобщенные возможности.

Формирования запроса в режиме простого поиска. Можно просто вводить через пробел одно или несколько слов; поиск слов со всевозможными окончаниями моделируется символом * в конце слова. Многие системы позволяют искать словосочетания или фразу, для этого необходимо ее заключить в кавычки. Возможно обязательное включение или исключение определенных слов.

Основная проблема поиска по примитивно составленному запросу (в виде перечисления ключевых слов) заключается в том, что поисковая машина найдет все страницы, на которых указанные слова встречаются в любой части документа. Как правило, количество найденных страниц будет слишком велико.

Для улучшения качества поиска в режиме простого поиска допустимо использование логических операторов и операторов, позволяющих ограничить область поиска, а также выбор определенной категории документов из представленного списка.

Многие поисковые системы включают в свой язык составления запросов специальные операторы, позволяющие проводить поиск в определенных зонах документа, например, в его заголовке, или искать документ по известной части его адреса.

Режим расширенного или детального запроса в разных системах реализован индивидуально, но чаще всего это бланк, в котором упомянутые операторы и ключевые элементы реализуются простой установкой соответствующих флажков или выбором параметров из списка.

Ниже в качестве примера приведены сведения из раздела помощь поисковой системы

Yandex: окно расширенного поиска, язык запросов, искать в найденном.

Искать в найденном Еслив результате запроса Яндекснашел много документов, но по более широкой теме, чем вам хочется, вы можете сократить этот список, уточнив запрос. Еще один вариант - включить флажокв найденном в форме поиска, задать дополнительные ключевые слова, и следующий поиск будет вестись только по тем документам, которые были отобраныв предыдущем поиске.

Памятка по использованию языка запросов

	Значение

"К нам на утренний рассол"	Слова идут подряд в точной форме

"Прибыл * посол"	Пропущено слово в цитате

полгорбушки & мосол	Слова в пределах одного предложения

снаряжайся && добудь	Слова в пределах одного документа

глухаря \| куропатку \| кого-нибудь	Поиск любого из слов

не смогешь << винить	Неранжирующее "и": выражение после оператора не влияет на
	позицию документа в выдаче

я должон /2 казнить	Расстояние в пределах двух слов в любую сторону (то есть
	между заданными словами может встречаться одно слово)




нешто я ~~ пойму

при моем /+2 уму	Расстояние в пределах двух слов в прямом порядке

чай ~ лаптем	Поиск предложения, где слово чай встречается без словалапте

щи /(-1 +2) хлебаю	Расстояние от одного слова в обратном порядке до двух слов в


Соображаю!что!чему	Слова в точной форме с заданным регистром

получается && (+на \| !мне)	Скобки формируют группы в сложных запросах

Политика	Словарная форма слова

title:(в стране)	Поиск по заголовкам документов

url:ptici.narod.ru/ptici/kuropatka.htm	Поиск по URL

беспременно inurl:vojne	Поиск с учетом фрагмента URL

	Поиск по хосту

	Поиск по хосту в обратной записи

site:http://www.lib.ru/PXESY/FILATOW	Поиск по всем поддоменам и страницам заданного сайта

	Поиск по одному типу файлов

	Поиск с ограничением по языку

	Поиск с ограничением по домену

	Поиск с ограничением по дате

государственное дело && /3 улавливаешь	Расстояние в 3 предложения в любую сторону


нешто я ~~ пойму	Исключение слова пойму из поиска

Интересной возможностью является поиск документов в сети, ссылающиеся на страницу с указанным вами адресом (URL). Таким образом, можно найти в сети страницы, на которых есть ссылки на ваш Web-сайт. Некоторые системы позволят ограничить область поиска внутри указанного домена.

В качестве дополнительных специальных операторов можно выделить:

∙ Операторы поиска документов с определенным графическим файлом;

∙ Операторы ограничения по дате искомых страниц;

∙ Операторы близости между словами;

∙ Операторы учета словоформы;

∙ Операторы сортировки результатов (по релевантности, свежести, старости). Следует заметить, что, к великому сожалению, на сегодняшний день не существует

стандарта на количество и синтаксис поддерживаемых операторов для различных поисковых систем. Попытки разработать стандарт на синтаксис поддерживаемых операторов предпринимаются, поэтому есть надежда на то, что разработчики поисковых систем позаботятся об удобстве пользователей. На данном этапе развития средств поиска, пользователь, обращаясь к определенной поисковой системе, непременно должен в первую очередь ознакомиться с ее правилами составления запросов. Как правило, на домашней странице будет обязательно присутствовать ссылка Помощь (Help), по которой вы перейдете к справочной информации.

Различные поисковые системы описывают разное количество источников информации в Интернет. Поэтому нельзя ограничиваться поиском только в одной из указанных поисковых системах.

Рассмотрим способы представления результатов поиска в поисковых машинах.

Чаще всего количество найденных документов превышает несколько десятков, а в отдельных случаях может достигать сотен тысяч! Поэтому в качестве формы выдачи составляется список документов по 5-10-15 единиц на странице с возможностью перехода к следующей порции внизу страницы. Обязательно указывается заголовок и URL(адрес) найденного документа, иногда система указывает в процентах степень релевантности документа.

В описании документа чаще всего содержится несколько первых предложений или выдержки из текста документа с выделением ключевых слов. Как правило, указана дата обновления (проверки) документа, его размер в килобайтах, некоторые системы определяют язык документа и его кодировку (для русскоязычных документов).

Что можно делать с полученными результатами? Если название и описание документа соответствует вашим требованиям, можно немедленно перейти к его первоисточнику по ссылке. Это удобнее делать в новом окне, чтобы иметь возможность далее анализировать результаты выдачи. Многие поисковые системы позволяют проводить поиск в найденных документах, причем вы можете уточнить ваш запрос введением дополнительных терминов.

Если интеллектуальность системы высока, вам могут предложить услугу поиска похожих документов. Для этого вы выбираете особо понравившийся документ и указываете его системе в качестве образца для подражания.

Однако, автоматизация определение похожести – весьма нетривиальная задача, и зачастую эта функция работает неадекватно вашим надеждам. Некоторые поисковики позволяют провести пересортировку результатов. Для экономии вашего времени можно сохранить результаты поиска в виде файла на локальном диске для последующего изучения в автономном режиме.

Тема: Информационно - поисковые системы.

1. Общие сведение о информационно-поисковых системах (ИПС). Основные определения.

2. Функционирование ИПС. Схема функционирования поисковой системы.

3. ИПС, базирующиеся на классификации.

4. Организация ИПС на поиски по ключевым словам.

5. Метасистемы.

6. Развитие информационно – поисковых систем.

Ключевые слова

Поиск информации, электронные каталоги, информационно – поисковая система, классификация, ключевые слова, метаданные, объём информации, анализ документа, поисковый образ, запрос, релевантность, атрибут, метасистема, рубрикация, информационные ресурс, эффективность, библиотечные каталоги, технология, портал, образовательная срда, пользователи, архитектура, автоматизированная система.

В последние годы сеть интернет стала основным хранилищем информации. С ростом объёмов хранимых данных стала актуальной проблема информационного поиска. Для облегчения поиска на открытых для доступа сайтах в интернет используют информационно – поисковые системы (ИПС) и электронные каталоги.

В ИПС собираются, индексируется и регистрируется информация о документах, имеющихся в обслуживаемой системой группе Web – серверов. Индексирование включает создание поисковых образов документов. Обычно в поисковый образ входят или все значащие слова, имеющиеся в документе, или только слова из заголовка.

Информационно – поисковая система – программная система для хранения, поиска и выдачи интересующей пользователя информации. Информационно – поисковая система выполняет анализ документов, создание и хранение поисковых образов документов, анализ запросов пользователей, поиск и выдачу пользователю данных о месте расположения в сети запрашиваемых документов.

В основе поиска лежит сопоставление запроса пользователя с поисковыми образами документов, в результате отбираются релевантные документы, т.е. документы, чьи поисковые образы соответствуют запросу. Во многих ИПС пользователю представляется возможность обращаться к серверу с запросами на естественном языке, а также со сложными запросами, включающими логические связки. Примерами таких ИПС могут служить системы Excite, Lycos, Altavista и другие. Для функционирования Altavista в своё время фирма DEC выделила несколько компьютеров, в том числе десятипроцессорную машину Alpha – 8400.

Поисковые образы, называемые также метаописаниямиили метаданными , могут представлять собой значения атрибутов документов или множество ключевых слов. Поиск на основе этих двух вариантов поисковых образов называют атрибутивным и контекстным поиском. Часто используют сочетание этих двух способов поиска.

Поиск в электронных каталогах основан на составлении запроса с разделами информации в иерархической структуре её классификации.

Классификацию информации называют рубрикацией . Наиболее сложной является разработка тематической рубрикации. В мире существует ряд систем тематической рубрикации. Та, в России широко известны иерархические системы УДК (универсальная десятичная классификация) и ГРНТИ (Государственные реестр научно – технической информации). Однако, они громоздки и неудобны для использования в электронных каталогах и образовательных ИПС. Поэтому существует ряд частных систем рубрикации с несколькими уровнями иерархии.

Отметим, что если в ИПС создание поисковых образов осуществляется автоматически, то в электронных каталогах структура информационных ресурсов определяется квалифицированными людьми.

Примеры поисковых систем, работающих по принципу электронного каталога: Yahoo!, Galaxy, Looksmart, Yandex. Так, в Yahoo! На верхнем уровне иерархи выделено 14 категорий (например, искусство и гуманитарные науки, образование, бизнес и экономика, наука и др.) Пользователь при поиске осуществляет навигацию по разделам иерархического дерева, спускаясь от верхнего уровня до искомого конечного, на котором он получает сведения об адресах сайтов с нужными информационными ресурсами. Объем информационного пространства в упомянутых системах довольно велик. Так, в системе Yahoo! Была собрана информация 1 800 000 сайтов.

Функционирование информационно – поисковой системы

Общая схема функционирования традиционной ИПС представлена на рис.

Рис. 1. Схемы функционирования ИПС.

Основными процессами в ИПС являются индексирование документов и поиск документов по запросу пользователя. Процесс информационного поиска происходит следующим образом. Пользователь выражает свои информационные потребности в виде специального текста – информационного запроса к ИПС. Система формирует из информационного запроса поисковое предписание , переводя запрос на информационно – поисковый язык (ИПЯ). ИПЯ представляет собой формальный язык, который используется внутри ИПС для представления пользовательского запроса и хранимых документов. Описание документов на ИПЯ называется поисковым образом документа. В процессе поиска ИПС должна выбрать из массива документов те, которые содержательно релевантны запросу, то есть соответствуют информационным потребностям пользователя, выраженным в запросе. Такое определение релевантности не формально, поэтому определяют формальную релевантность , как соответствие, определяемое алгоритмически, путем сравнения поискового предписания и поискового образа документа. Критерий выдачи документа – поискового образа документа и поискового предписания, по которому принимается решение о выдаче некоторого документа в ответ на информационный запрос.

В процессе индексирования, для каждого документа, хранящегося в системе, строится поисковый образ. Различают 2 основных подхода к построению поискового образа –приписывающее и выводящее индексирование. В первом случае в процессе индексирования документу присваивается номер ключевых слов из некоторой классификационной системы, и документ помещается в общую классификацию. Во втором случае из документа выбирается набор ключевых слов и объявляется поисковым образом, с которым далее работает ИПС.

Традиционные ИПС осуществляют как поиск, так и хранение документов. В отличие от традиционных ИПС, ИПС для поиска информации в интернет не могут осуществлять фукнцию хранения документов, что приводит к необходимости другого подхода к организации работы ИПС.

Рассмотрим основные классы промышленных ИПС для поиска информации в интернет.

ИПС, базирующиеся на классификации.

В целом, схема работы такой ИПС в Интернет аналогична схеме работы традиционной ИПС. Общая схема работы ИПС на основе классификации показана на рис. 2.

Рис. 2.Общая схема работы ИПС базирующейся на классификации.

Основным отличием является появление процесса поиска новых документов. В традиционных ИПС новые документы вводятся в систему хранения оператором и индексируются. В ИПС, ориентированных на работу в Интернет, ввод новых документов осуществляется либо вручную оператором, либо автоматически с помощью специальной программы обхода Интернет – индексирующего робота. Применение для информационного поиска в интернет ИПС базирующихся на классификации эффективно в случае, когда классификационная система построена по узкой предметной области.

Основных недостатков два:

1. Для качественного поиска они вынуждены выкачивать из Интернет все документы для индексирования и хранения их у себя. Это приводит к большому объёму хранимой информации, высокой нагрузке на сеть и необходимости постоянно обновлять информации в базе;

2. Поиск документов пользователем может осуществляться только по используемой классификационной системе.

ИПС, базирующиеся на поиске по ключевым словам.

ИПС базирующиеся по ключевым словам позволяют искать Web – страницы о их содержанию, формируя запрос в виде ключевых слов, которые должны присутствовать в документе. В настоящее время, системы поиска по ключевым словам представляют собой наиболее распространенные ИПС в интернет.

На рис. 3 показана общая схема работы системы поиска по ключевым словам. Основными процессами в работе системы является поиск новых документов индексирующим роботом, индексирование найденных документов и выполнения запроса пользователя.

Индексирующий робот представляет собой автономный процесс, постоянно или периодически обновляющий и пополняющий базу документов. Изначально роботу дается список Web – серверов, которые необходимо проиндексировать. В процессе работы индексирующий

Рис. 3. Общая схема работы системы по ключевым словам.

Робот осуществляет обход Web – серверов по гиперссылкам между страницами и собирает все найденные документы в базу документов, а ссылки - в базу ссылок. Таким образом, на основе начального списка серверов строятся документы для всех достижимых Web – страниц. Периодически, индексирующий робот проверяет хранящуюся информацию на корректность и целостность путем повторного обхода проиндексированных страниц.

По известным ИПС документам строится индекс, позволяющий эффективно осуществлять поиск по ключевым словам. Дальнейшее хранения всего документа после индексирования ненужно, для экономии дискового пространства хранится короткий поисковый образ. Запрос пользователя представляет собой набор ключевых слов с булевыми связками. Выбор документов по запросу осуществляется с помощью индекса. ИПС возвращает в ответ на запрос список ссылок на документы.

Достоинством систем поиска по ключевым словам является простота использования. К недостаткам можно отнести следующие особенности.

1. В ответ на запрос выдается много нерелевантной информации. Это происходит из-за того, что с помощь. Списка ключевых слов практически можно сформулировать информационные потребности пользователя.

2. Индексирующие роботы сильно загружают сеть. Так как робот не имеет возможности перемещаться по сети, он вынужден скачивать большие объемы информации для локальной обработки (объём информации исчисляется терабайтами).

3. Невозможность работы с часто изменяемой информацией.

4. Охват Интернет любой из имеющихся систем поиска по ключевым словам не превышает 16%.

5. Возможность работы пользователя только в интерактивном режиме.

Метасистемы. Метасистемы для ИП в Интернет, являются надстройками над существующими системами поиска по ключевым словам. Они позволяют преодолеть следующие недостатки промышленных систем поиска по ключевым словам.

Решение проблемы ИП в Интернет на сегодняшний день состоит не только в построении эффективных ИПС, но и в изменении структурной организации информации Интернет.

Технология поиска, основанная на упорядочении метаинформации наподобие библиотечных каталогов (классификация по содержанию) продолжает развиваться.

Однако поиск по ключевым словам во всем пространстве Интернет не всегда оказывается эффективным и может потребовать слишком много времени. Сделать работу пользователя корпоративной системы в интернет более эффективной позволяет технология порталов, применение языка разметки XML и языков поиска XPath или XQuery в базах XML – документов.

Контрольные вопросы и задания.

1. Какую информацию выполняют информационно – поисковые системы?

2. Что лежит в основе поиска информации?

3. Что представляют собой поисковые образы и каким образом осуществляется создание поисковых образов?

4. Приведите примеры ИПС.

5. Объясните и составьте общую схему работы ИПС, базирующейся на классификации.

6. Каким образом происходит поиск в ИПС по ключевым словам?

7. Какие недостатки имеет система поиска по ключевым словам?

9. По каким признакам классифицируется ИПС?

10. Приведите примеры поисковых систем по принципу электронного каталога.

11. Для каких целей в Интернет создают порталы?

12. Перечислите задачи, связанные с развитием ИПС.

Литература 2, 5, 13, 18.

Основой всех поисковых систем составляют базы данных - совокупность данных организованных по предельным правилам, предусматривающим общие принципы описания, хранения и манипулирования данными, независимо от прикладных программ.

Можно выделить следующие элементы функционирования информационных систем:

Сбор информации - организованный в специальном порядке процесс сбора и отображения информации:

Получение информации;

Оценка относимости информации;

Порядок отбора и фиксации информации.

Комплектование - процесс сложения информации из множества частей в единое целое и доведения её до пользователя.

Поиск и выдача информации - установление специального технологического порядка удовлетворения информационных потребностей абонентов информационной системы в управленческой деятельности и технологических процессах.

Поддержание целостности и сохранения информации - пересмотр, ревизия и отсеивание утратившей актуальность информации являются неотъемлемой функцией информационных подразделений. Сохранность информации осуществляется с помощью нормативно - инструктивных документов.

По характеру предоставления логической организации хранимой информации информационные системы разделяются на фактографические, документальные и геоинформационные.

Фактографические информационные системы накапливают и хранят данные в виде множества экземпляров одного или нескольких типов структурных элементов. Каждый из таких экземпляров структурных элементов или некоторая их совокупность отражают сведения, по какому - либо факту, событию. Структура каждого типа информационного объекта состоит из конечного набора реквизитов, отражающих основные аспекты и характеристики сведений для объектов данной предметной области.

В документальных информационных системах единичным элементом информации является нерасчлененный на более мелкие элементы документ и информация при вводе, как правило, не структурируется, или структурируются в ограниченном виде. Для вводимого документа могут устанавливаться некоторые формализованные позиции - дата изготовления, исполнитель, тематика. Некоторые виды документальных информационных систем обеспечивают установление логической взаимосвязи вводимых документов - соподчиненность по смысловому содержанию.

В геоинформационных системах данные организованы в виде отдельных информационных объектов, привязанных к общей электронной топографической основе. Геоинформационные системы применяются для информационного обеспечения в тех предметных областях, структура информационных объектов и процессов в которых имеется географический компонент.

Другим критерием классификации поисковых систем являются функции или решаемые задачи. По данному признаку различаются справочные, поисковые и расчётные системы.

Справочные являются наиболее распространенным типом функций информационных систем, и заключается в предоставлении абонентам системы возможностей получения установочных данных на определённые классы объектов.

Поисковые являются наиболее распространённым классом информационных систем. В общем, виде можно рассматривать как некое информационное пространство, задаваемое в терминах информационно - логического описания предметной области.

Расчетные заключается в обработке информации, находящейся в системе, по определённым расчётным алгоритмам для различных целей.

Технологические функции информационных систем заключаются в автоматизации всего технологического цикла или отдельных его компонентов, производственной или организационной структуры.

Таким образом, к основным функциям ИПС можно отнести:

Хранения больших объемов информации;

Быстрого поиска требуемой информации;

Добавления, удаления и изменения хранимой информации;

Вывода информации в удобном для человека виде.

Различают: - автоматизированные (coputerised);

Библиографические (reference);

Диалоговые (online);

Документальные и фактографические информационно-поисковые системы.

Информационно-поисковые системы в последнее время начали ускоренно развиваться, появляются новые системы, они широко рекламируются и продаются. Это обусловлено значительно возросшей потребностью общества в эффективной работе с правовой и нормативно-технической информацией и использованием при этом компьютерных информационно-поисковых систем. Широкое распространение поисковых систем явилось подлинным прорывом в области информатизации в России и дало возможность техническим специалистам предприятий получить свободный доступ к правовым и нормативно-техническим документам.

Качество принятых специалистом решений зависит от количества обработанной информации. В современных условиях обойтись без мощного и удобного инструмента, помогающего в поиске и обработке информации, невозможно. Эффективное использование поисковых систем зависит от того, насколько технический специалист знает специфику, возможности и область применения этих новых информационных систем.

Создание современных систем хранения информации осуществляется двумя основными способами: с использованием иерархической и гипертекстовой моделей. В иерархической модели используется многоуровневая рубрикация при классификации информации. Для поиска документа используется его краткое описание, составляемое при вводе информации в систему. Современная гипертекстовая модель позволяет в электронных документах использовать ссылки на другие документы.

Опыт эксплуатации различных систем обработки и поиска информации, основанных на таких моделях указывает на то, что они не лишены недостатков. Обе системы требуют значительных материальных затрат на разработку и формирование, а значит, ограничены в объемах хранимой информации. Формирование рубрикаторов и ссылок производится специалистами, а их представление об информации и представление пользователя могут различаться.

ИПС (информационно-поисковая система) – это система, обеспечивающая поиск и отбор необходимых данных в специальной базе с описаниями источников информации (индексе) на основе информационно-поискового языка и соответствующих правил поиска.

Релевантность – это соответствие результатов поиска сформулированному запросу.

По пространственному масштабу ИПС можно разделить на локальные, глобальные, региональные и специализированные. Локальные поисковые системы могут быть разработаны для быстрого поиска страниц в масштабе отдельного сервера.

Рассмотрим подробнее основные задачи, которые должны решить разработчики ИПС. Как следует из определения, ИПС для WWW проводят поиск в собственной базе (индексе) с описанием распределенных источников информации.

Индексирование – описание источников информации и построение специальной базы данных (индекса ) для эффективного поиска.

В ИПС второго типа процедура описания информационных ресурсов автоматизирована. Для этого разрабатывается специальная программа-робот, которая по определенной технологии обходит ресурсы, описывает их (проводит индексирование) и анализирует ссылки с текущей страницы для расширения области поиска. Как может описать документ программа? Чаще всего просто составляется список слов, которые встречаются в тексте и других частях документа, при этом учитывается частота повторения и местоположение слова, то есть, слову приписывается своеобразный весовой коэффициент в зависимости от его значимости. Например, если слово находится в названии Web-страницы, робот пометит этот факт для себя. Поскольку описание автоматизировано, затраты времени невелики, и индекс может оказаться очень большим по размеру.

Следовательно, следующей задачей для ИПС второго типа является разработка робота-индексировщика. Для поиска в системах данного типа пользователю придется научиться составлять запросы, в простейшем случае состоящие из нескольких слов. Тогда ИПС будет искать в своем индексе документы, в описаниях которых встречаются слова из запроса. Для проведения более качественного поиска необходимо разрабатывать специальный язык запросов для пользователя. В зависимости от особенностей построения модели индекса и поддерживаемого языка запросов разрабатывается механизм поиска и алгоритм сортировки результатов поиска. Поскольку индекс имеет значительный объем, количество найденных документов может оказаться достаточно большим. Следовательно, чрезвычайно важно, как поисковая машина проведет поиск и отсортирует его результаты.

Для обращения к поисковому серверу пользователь использует стандартную программу-клиент для всемирной паутины, то есть браузер. По адресу домашней страницы ИПС пользователь работает с интерфейсом поисковой системы, который служит для общения пользователя с поисковым аппаратом системы (системой формирования запросов и просмотра результатов поиска).

Информационно-поисковые системы

Робот-индексировшик – программа, которая служит для сканирования Интернет и поддержки базы данных индекса в актуальном состоянии.

Web-сайты – те информационные ресурсы, доступ к которым обеспечивает ИПС.

Заголовки (Title).

Заглавия.

Аннотация (Description).

Списки ключевых слов (KeyWords).

Полные тексты документов.

Кстати, поисковые системы, которые описывают абсолютно весь текст документа WWW, называются полнотекстовыми.

Учет морфологии означает умение работать с различными формами слов конкретного языка.

Из вышеизложенного следует, что основными инструментами поиска информации в WWW являются ИПС.

поисковые системы,

метапоисковые системы и программы ускоренного поиска.

Каталог – поисковая система с классифицированным по темам списком аннотаций со ссылками на web-ресурсы. Классификация, как правило, проводится людьми.

Рассмотрим особенности систем-каталогов.

Среди самых популярных зарубежных каталогов можно упомянуть: Yahoo (www.yahoo.com), Magellan (www.mckinley.com),

Российские каталоги: @Rus (www.atrus.ru); Weblist (www.weblist.ru); Созвездие интернет (www.stars.ru).

Поисковая система – система с формируемой роботом базой данных, содержащей информацию об информационных ресурсах.

Зарубежные поисковые машины (системы):

Google - www.google.com (примерно 38% охвата русскоязычных запросов)

Altavista- www.altavista.com

Excite www.excite.com

HotBot - www.hotbot.com

Nothern Light- www.northernlight.com

Go (Infoseek) www.go.com (infoseek.com)

Fast www.alltheweb.com

Российские поисковые машины:

Яndex - www.yandex.ru (или www.ya.ru) (48% охвата русскоязычных запросов)

Рэмблер - www.rambler.ru

Апорт- www.aport.ru

Метапоисковая система – система, не имеющая своего индекса, способная послать запросы пользователя одновременно нескольким поисковым серверам, затем объединить полученные результаты и представить их пользователю в виде документа со ссылками.

6 Принципы работы метапоисковых систем. Механизмы поиска в интернет. Язык запросов.

Рис.1 Стандартная метапоисковая система

Рис. 2. Следующее поколение метапоисковых систем

Как пример систем, имеющих подобную организацию, можно назвать Profusion,Ixquick,SavvySearch,MetaPing.

Примером метапоисковой системы является Nigma (Нигма. РФ) - российская интеллектуальнаяметапоисковаясистема.

Программа ускоренного поиска – это программа с возможностями метапоисковой системы, устанавливаемая на локальном компьютере.

Принципиальным отличием метапоисковых систем и программ ускоренного поиска от ИПС является отсутствие своего собственного индекса. Зато они превосходно умеют использовать результаты работы других поисковых систем.

Механизмы поиска

Обобщенная технология поиска состоит из следующих этапов:

Пользователь формулирует запрос

Система проводит поиск документов (или их поисковых образов)

Пользователь получает результат (сведения о документах)

Пользователь совершенствует или реформирует запрос

Организация нового поиска...

Формирования запроса в режиме простого поиска. Можно просто вводить через пробел одно или несколько слов; поиск слов со всевозможными окончаниями моделируется символом * в конце слова. Многие системы позволяют искать словосочетания или фразу, для этого необходимо ее заключить в кавычки. Возможно обязательное включение или исключение определенных слов.

Режим расширенного или детального запроса в разных системах реализован индивидуально, но чаще всего это бланк, в котором упомянутые операторы и ключевые элементы реализуются простой установкой соответствующих флажков или выбором параметров из списка.

Ниже в качестве примера приведены сведения из раздела помощь поисковой системы Yandex: окно расширенного поиска, язык запросов, искать в найденном.

Искать в найденном Если в результате запроса Яндекс нашел много документов, но по более широкой теме, чем вам хочется, вы можете сократить этот список, уточнив запрос. Еще один вариант - включить флажок в найденном в форме поиска, задать дополнительные ключевые слова, и следующий поиск будет вестись только по тем документам, которые были отобраны в предыдущем поиске.

Памятка по использованию языка запросов

	Значение
"К нам на утренний рассол"	Слова идут подряд в точной форме
"Прибыл * посол"	Пропущено слово в цитате
полгорбушки & мосол	Слова в пределах одного предложения
снаряжайся && добудь	Слова в пределах одного документа
глухаря \| куропатку \| кого-нибудь	Поиск любого из слов
не смогешь << винить	Неранжирующее "и": выражение после оператора не влияет на позицию документа в выдаче
я должон /2 казнить	Расстояние в пределах двух слов в любую сторону (то есть между заданными словами может встречаться одно слово)

нешто я ~~ пойму	Исключение слова пойму из поиска
при моем /+2 уму	Расстояние в пределах двух слов в прямом порядке
чай ~ лаптем	Поиск предложения, где слово чай встречается без слова лаптем
щи /(-1 +2) хлебаю	Расстояние от одного слова в обратном порядке до двух слов в прямом
Соображаю!что!чему	Слова в точной форме с заданным регистром
получается && (+на \| !мне)	Скобки формируют группы в сложных запросах
Политика	Словарная форма слова
title:(в стране)	Поиск по заголовкам документов
url:ptici.narod.ru/ptici/kuropatka.htm	Поиск по URL
беспременно inurl:vojne	Поиск с учетом фрагмента URL
	Поиск по хосту
	Поиск по хосту в обратной записи
site:http://www.lib.ru/PXESY/FILATOW	Поиск по всем поддоменам и страницам заданного сайта
	Поиск по одному типу файлов
	Поиск с ограничением по языку
	Поиск с ограничением по домену
	Поиск с ограничением по дате
государственное дело && /3 улавливаешь нить	Расстояние в 3 предложения в любую сторону
нешто я ~~ пойму	Исключение слова пойму из поиска

В качестве дополнительных специальных операторов можно выделить:

Операторы поиска документов с определенным графическим файлом;

Операторы ограничения по дате искомых страниц;

Операторы близости между словами;

Операторы учета словоформы;

Операторы сортировки результатов (по релевантности, свежести, старости).

Следует заметить, что, к великому сожалению, на сегодняшний день не существует стандарта на количество и синтаксис поддерживаемых операторов для различных поисковых систем. Попытки разработать стандарт на синтаксис поддерживаемых операторов предпринимаются, поэтому есть надежда на то, что разработчики поисковых систем позаботятся об удобстве пользователей. На данном этапе развития средств поиска, пользователь, обращаясь к определенной поисковой системе, непременно должен в первую очередь ознакомиться с ее правилами составления запросов. Как правило, на домашней странице будет обязательно присутствовать ссылка Помощь (Help), по которой вы перейдете к справочной информации.

Рассмотрим способы представления результатов поиска в поисковых машинах.

http://www. *****/dir/cat32/subj385/file16459/view156596/page2.html

Информационно-поисковые системы. Вопросы к экзамену

1. Понятие информации. Виды информации. Свойства.

Информация (от лат. informatio - осведомление, разъяснение, изложение) - в широком смысле абстрактное понятие, имеющее множество значений, в зависимости от контекста. В узком смысле этого слова - сведения (сообщения, данные) независимо от формы их представления. В настоящее время не существует единого определения термина информация. С точки зрения различных областей знания, данное понятие описывается своим специфическим набором признаков. Информация - совокупность данных, зафиксированных на материальном носителе, сохранённых и распространённых во времени и пространстве.

Информация - это осознанные сведения об окружающем мире, которые являются объектом хранения, преобразования, передачи и использования.

Основные виды информации по ее форме представления, способам ее кодирования и хранения, что имеет наибольшее значение для информатики, это:

графическая или изобразительная

звуковая

текстовая

числовая

видеоинформация

Существуют также виды информации, для которых до сих пор не изобретено способов их кодирования и хранения - это тактильная информация, передаваемая ощущениями, органолептическая, передаваемая запахами и вкусами и др.

Свойства информации

Как и всякий объект, информация обладает свойствами. Характерной отличительной особенностью информации от других объектов природы и общества, является дуализм: на свойства информации влияют как свойства исходных данных, составляющих ее содержательную часть, так и свойства методов, фиксирующих эту информацию.
С точки зрения информатики наиболее важными представляются следующие общие качественные свойства: объективность, достоверность, полнота, точность, актуальность, полезность, ценность, своевременность, понятность, доступность, краткость и пр.

Объективность информации . Объективный – существующий вне и независимо от человеческого сознания. Информация – это отражение внешнего объективного мира. Информация объективна, если она не зависит от методов ее фиксации, чьего-либо мнения, суждения.
Пример. Сообщение «На улице тепло» несет субъективную информацию, а сообщение «На улице 22°С» – объективную, но с точностью, зависящей от погрешности средства измерения.
Объективную информацию можно получить с помощью исправных датчиков, измерительных приборов. Отражаясь в сознании человека, информация может искажаться (в большей или меньшей степени) в зависимости от мнения, суждения, опыта, знаний конкретного субъекта, и, таким образом, перестать быть объективной. Достоверность информации . Информация достоверна, если она отражает истинное положение дел. Объективная информация всегда достоверна, но достоверная информация может быть как объективной, так и субъективной. Достоверная информация помогает принять нам правильное решение. Недостоверной информация может быть по следующим причинам:

преднамеренное искажение (дезинформация) или непреднамеренное искажение субъективного свойства; искажение в результате воздействия помех («испорченный телефон») и недостаточно точных средств ее фиксации. Полнота информации . Информацию можно назвать полной, если ее достаточно для понимания и принятия решений. Неполная информация может привести к ошибочному выводу или решению. Точность информации определяется степенью ее близости к реальному состоянию объекта, процесса, явления и т. п. Актуальность информации – важность для настоящего времени, злободневность, насущность. Только вовремя полученная информация может быть полезна. Полезность (ценность) информации . Полезность может быть оценена применительно к нуждам конкретных ее потребителей и оценивается по тем задачам, которые можно решить с ее помощью.

Самая ценная информация – объективная, достоверная, полная, и актуальная. При этом следует учитывать, что и необъективная, недостоверная информация (например, художественная литература), имеет большую значимость для человека. Социальная (общественная) информация обладает еще и дополнительными свойствами:

имеет семантический (смысловой) характер, т. е. понятийный, так как именно в понятиях обобщаются наиболее существенные признаки предметов, процессов и явлений окружающего мира. имеет языковую природу (кроме некоторых видов эстетической информации, например изобразительного искусства). Одно и то же содержание может быть выражено на разных естественных (разговорных) языках, записано в виде математических формул и т. д.

2. Основные термины из теории информационного поиска: документ, информационная потребность, пертинентность документа, реливантность.

Докуме́нт (от лат. documentum - образец, свидетельство, доказательство) - материальный объект, содержащий информацию в зафиксированном виде и специально предназначенный для её передачи во времени и пространстве.

Информационная потребность - потребность, возникающая, когда цель, стоящая перед пользователем в процессе его профессиональной деятельности либо в его социально-бытовой практике, не может быть достигнута без привлечения дополнительной информации.

Релевантность

Соответствие текста (документа, фактографической записи) фактической информационной потребности называется пертинентностью , а соответствие одного текста другому - релевантностью. При поиске различают смысловую и формальную релевантность.

Документ, центральный предмет или тема которого в целом соответствует смысловому содержанию информационного запроса, называется релевантным, а свойство смысловой близости между двумя и более текстами (в данном случае - между документом и информационным запросом) - релевантностью . Релевантность - это фундаментальное понятие теории информационного поиска. Говорят о двух видах релевантности: смысловой и формальной . Соответствие документа содержанию информационного запроса называют смысловой релевантностью, а соответствие поискового образа этого документа формализованному поисковому предписанию, выражающему данный информационный запрос, - формальной релевантностью. Также формальную релевантность называют релевантностью документа, а смысловую релевантность - релевантностью информации (имеется в виду «информации, содержащейся в документе»).

3. Информационно-поисковая система. Определение. Структура ИПС.

Информационно-поисковая система (ИПС) - это упорядоченная совокупность документов (массивов документов) и информационных технологий , предназначенных для хранения и поиска информации - текстов (документов) или данных (фактов). Информационно-поиско-выми системами являются любые определенным образом организованные хранилища информации. Причем информационно-поисковые системы могут быть и неавтоматизированными. Главное - это целевая функция: хранение и поиск информации.

В зависимости от объекта хранения и типа запроса различают два вида информационного поиска: документальный и фактографический - и, соответственно, два типа ИПС - документальные и фактографические. Последние также называют информационно-справочными ИПС.

Документальными называются ИПС, в которых реализуется поиск по тематическим запросам в массиве документов или текстов с последующим предоставлением пользователю подмножества этих документов или их копий. Понятие документа может меняться от системы к системе. В общем случае это некий информационный объект, зафиксированный (обычно посредством некоторой знаковой системы) на каком-то материальном носителе (бумага, фото - и кинопленка, магнитная память и т. п.) и предназначенный для передачи в пространстве и времени в системе социальных коммуникаций.

Фактографические ИПС реализуют хранение, поиск и выдачу непосредственно фактических данных (научных, технических, экономических характеристик и свойств объектов, процессов, явлений, адресов, наименований, количественных данных и т. п.).

Главное, сущностное, различие между документальным и фактографическим поиском заключается в подходе к семантике документов. В документальных системах описывается смысл документов в целом с точки зрения их тематического, предметного содержания. В этом случае важно выявить и назвать (перечислить) основные темы и объекты, которым посвящен документ. В фактографических системах описываются объекты, фиксируются их признаки и значения этих признаков. Отсюда различия в языках описания и способах хранения описаний в системе. Соответственно, для каждого вида поиска существуют свои поисковые средства.

Фактографические системы предполагают накопление и поиск в массиве документов со строго регламентированной структурой. Такая структура является или результатом предварительной интеллектуальной обработки документов при вводе информации в систему, или наличием таких документов в готовом виде в конкретных сферах человеческой деятельности, например, учетные формы, бланки, справочники, расписания и т. п. Существуют фактографические ИПС, которые обеспечивают накопление информации и поиск только по одному типу объектов и только по одному типу запросов. Существуют и более развитые фактографические системы, обеспечивающие хранение и поиск данных, разнообразных по содержанию и структуре, но это разнообразие всегда конечно.

В то же время между документальными и фактографическими системами нет непреодолимой разницы. Нередко реальные ИПС представляют собой пример смешанных систем, в которых фактографическая информация используется как дополнительное средство документального поиска, и наоборот. В документальных системах тексты (документы) также могут быть структурированы, разбиты на фрагменты или поля, и обработка и выдача документальной информации может вестись на уровне отдельных полей.

Выделяют еще и третий тип систем, которые называют информационно-логическими. Это системы, отвечающие на запросы, на которые в информационной базе в явном виде ответа нет. Получить ответ помогает экстралингвистическая база знаний и информация, порождаемая алгоритмически из уже имеющейся (документальной или фактографической). Эта новая информация или выдается как ответ на запрос, или дополнительно используется для поиска.

Информационно-поисковая система документального типа представляет собой упорядоченную совокупность документов, а также совокупность средств и методов, предназначенных для хранения, поиска и выдачи по запросам документальной информации. Документальная ИПС выдает документы, соответствующие запросу по теме, по предмету. Документ, центральный предмет или тема которого в целом соответствует смысловому содержанию информационного запроса, называется релевантным , а свойство смысловой близости между двумя и более текстами (в данном случае - между документом и информационным запросом) - релевантностью . Релевантность - это фундаментальное понятие теории информационного поиска. Говорят о двух видах релевантности: смысловой и формальной. Соответствие документа содержанию информационного запроса называют смысловой релевантностью, а соответствие поискового образа этого документа формализованному поисковому предписанию, выражающему данный информационный запрос, - формальной релевантностью. Также формальную релевантность называют релевантностью документа, а смысловую релевантность - релевантностью информации (имеется в виду «информации, содержащейся в документе»).

Составные части ИПС называют подсистемами. Разделение на подсистемы необходимо и полезно как в целях разработки, так и для описания технологии функционирования систем. Оно может иметь разную основу. Обычно рассматривают два типа разбиения ИПС на подсистемы: по функциональному принципу (функциональные подсистемы) и по типу средств (обеспечивающие подсистемы).

Различные средства, реализующие функции ИПС, получили название обеспечивающих подсистем , или «обеспечений». Выделяют следующие подсистемы: лингвистическое обеспечение, информационное обеспечение , техническое обеспечение, программное обеспечение

Понятие системы охватывает комплекс взаимосвязанных элементов, действующих как единое целое. Система включает в себя следующие компоненты:

Структура - это множество элементов системы и взаимосвязи между ними.

Входы и выходы - это материальные потоки или потоки сообщений, поступающие в систему или выводимые ею. Поступающую инф-цию мы будем рассматривать как набор символов {x(i)}, значение которого образует вектор X. Данные сообщения проходят обработку в системе и находятся в прямой зависимости от времени. Аналогично множество выходных - {y(i, t)} образует вектор Y.

Цель и ограничения. Порядок функционирования системы описывается рядом переменных: U1, U2…, Un. Часть этих переменных должна всегда поддерживаться в экстремальном положении - max U1 и т. п. U1 = f (X, t, Y, …), тогда U1 наз-ся целевой функцией системы. Данная функция определяет соответствие целей системы результатам ее функционирования.

Закон проведения системы. Это функция f(х), связывающая изменение входа и выхода системы.

Среди известных свойств системы можно выделить следующие: относительность, делимость и целостность.

ИС представляет собой систему, функционирование которой во времени заключается в сборе, хранении, обработке, распределении инф-и о деятельности какого-либо экономического объекта реального мира

4. Типы информационно-поисковых систем в зависимости от характера выдаваемой информации.

5. Функции информационно-поисковой системы.

Информационно-поисковая система - система, выполняющая функции:
- хранения больших объемов информации;
- быстрого поиска требуемой информации;
- добавления, удаления и изменения хранимой информации;
- вывода информации в удобном для человека виде.

Различают:
- автоматизированные (coputerised);
- библиографические (reference);
- диалоговые (online);
- документальные и фактографические информационно-поисковые системы.

6. Исторические предпосылки развития поисковых систем.

Обратимся к истории возникновения сети Internet, которая была создана в связи с возникшей необходимостью совместного использования информационных ресурсов, распределенных между различными компьютерными системами. Большинство первых приложений, включая FTP и электронную почту, были разработаны исключительно для обмена данными между хост-компьютерами Internet.
Другие приложения, такие как Telnet, создавались для того, чтобы пользователь получил возможность доступа не только к информации, но и к рабочим ресурсам удаленной системы. По мере развития Internet (увеличения пользователей и хост-компьютеров) прежние методы обмена данными перестали отвечать возросшим потребностям пользователей. Возникла необходимость разработки новых способов поиска сетевых ресурсов и доступа к ним, которые позволяли бы использовать информацию независимо от ее формата и расположения.

Для удовлетворения таких потребностей сначала были созданы поисковая система Archie, решающая задачу локализации ресурсов на FTP-сервере, и система Gopher, упрощающая доступ к различным сетевым ресурсам. Затем были разработаны сетевые информационные системы WWW и WAIS, предлагающие абсолютно новые методы получения информации. Принципы работы этих систем позволяют легко ориентироваться в огромном количестве информационных ресурсов без необходимости предоставления механизмов работы самой сети Internet. Такой подход позволяет говорить уже не просто о ресурсах взаимосвязанных компьютерных систем, а об особых информационных пространствах сети.

Система Archie представляет собой комплекс программных средств, работающих со специальными базами данных . В этих базах данных содержится постоянно пополняющаяся информация о файлах, к которым можно получить доступ через сервис FTP. Пользуясь услугами системы Archie, можно осуществить поиск файла по шаблону его имени. При этом пользователь получит список файлов с точным указанием места их хранения в сети, а также с информацией о типе, времени создания и размере файлов. Доступ к информационно-поисковой системе Archie может осуществляться различными путями, начиная от запросов по электронной почте и с помощью сервиса Telnet и заканчивая использованием графических Archie-клиентов.
Система Gopher была разработана для упрощения процесса локализации FTP-ресурсов Internet и для более удобного представления сведений о содержании хранящихся на FTP-серверах файлов. Система Gopher дает возможность в удобной форме (в виде меню) представлять пользователям об имеющихся файлах и их содержании. Меню Gopher-серверов могут содержать ссылки на другие Gopher - и FTP-серверы. Таким образом, пользователь получает возможность “путешествовать” по Internet, не обращая внимания на местонахождение интересующих его ресурсов, и получать доступ к этим ресурсам.
Система Veronica используется для поиска информации в Gopher-пространстве по заголовкам пунктов меню. После ввода ключевого слова, система Veronica выясняет, встречается ли оно в меню на каком-либо Gopher-сервере, и в качестве результатов поиска выдает список заголовков пунктов меню, содержащих ключевое слово. Поскольку система Veronica не является автономной поисковой программой, а тесно связана с системой Gopher, она обладает тем же, что и система Gopher, недостатком: далеко не всегда по заголовку можно сказать, что собой представляет тот или иной информационный ресурс. Достоинства системы заключается в том, что нет необходимости узнавать, где расположена найденная информация, достаточно выбрать требуемую запись из списка.

7. История развития автоматизированных документальных информационно-поисковых систем, этапы развития. Особенности современного этапа.

Переход к информационному обществу XXI века породил беспрецедентный рост объемов и концентрации информации в глобальных компьютерных сетях. Это резко обострило проблему создания информационно-поисковых систем (ИПС) и их эффективного использования.

История автоматизированных информационно-поисковых систем исчисляется полувеком. Типичная ИПС первых лет - это человеко-машинная система, где анализ и описание содержания документов (индексирование) выполняется вручную, а поиски проводятся машиной. Первоначально основу ИПС составляли информационно-поисковые языки (ИПЯ), основным элементом которых являются дескрипторные словари и тезаурусы. Сегодня, однако, большинство работающих ИПС относится к классу вербальных систем бестезаурусного типа, когда индексационные термины выбираются непосредственно из текстов документов. Лавинообразный рост объемов электронной документальной информации, ее видовое, тематическое и языковое разнообразие являются как причиной кризиса современного информационного поиска, так и стимулом его совершенствования.

Проблема поиска ресурсов в сети Интернет была осознана достаточно скоро, и в ответ появились различные системы и программные инструменты для поиска, среди которых следует назвать системы Gopher, Archie, Veronica, WAIS, WHOIS и др. В последнее время на смену этим инструментам пришли «клиенты» и «серверы» всемирной паутины WWW.

Достигнутые в течение последнего десятилетия результаты развития средств вычислительной техники, методов проектирования программного и информационного обеспечения систем автоматизации различного уровня и назначения способствовали существенному пересмотру принятых ранее подходов к созданию информационных систем, и, прежде всего, к созданию новой информационной технологии, основными принципами которой являются:

Обеспечение общения конечного пользователя (исследователя, проектировщика, конструктора, технолога, оператора ИПК. и ГАП, плановика) с системой автоматизации на профессионально-ограниченном естественном языке, представление входной и результирующей информации в привычной и удобной пользователю форме.

Обеспечение возможности решения задач планирования, управления, проектирования, подготовки производства и научных исследований по их постановкам и исходным данным независимо от сложности и наличия формальных математических моделей этих задач.

Создание конечному пользователю таких условий работы, при которых он осуществляет процессы управления, планирования, проектирования и поиска новых решений в режиме активного, расширяющегося диалога с ЭВМ, оперируя понятиями своей предметной области, используя профессиональный опыт и навыки и принимая решения одновременно по множеству критериев, часть из которых не описана формально и не имеет количественного выражения.

8. Характиристики ИПС

9. Поиск Запроса. Опередление. Виды поисковых запросов.

10. Лингвистическое обеспечение.

11. Фактографические информационно-поисковые системы. Библиографический поиск как вид фактографического.

Фактографические ИПС реализуют поиск и выдачу фактов, текстов, документов, содержащих сведения, которые могут удовлетворить поступивший запрос пользователя. В этом случае осуществляется поиск не какого-то конкретного документа, а всей совокупности сведений по данному запросу, хранящихся в информационном фонде ИПС или ИСС. Отметим, что основным отличием фактографических информационно-поисковых систем от документальных является то, что эти системы выдают пользователю. не какой-либо ранее введенный документ, а уже в той или иной степени обработанную информацию.

В зависимости от того, как в фактографической ИПС реализована подобная обработка информации , различают три поколения таких систем.

ИС первого поколения обеспечивают накопление и поиск информации по одному типу объектов и реализуют один тип запросов при использовании для фактографического описания данных фиксированного формата.

В фактографических системах второго поколения возможен уже выбор типа запроса из представленного набора. Отображаемые объекты могут принадлежать к различным классам, формат фактографического описания задается для класса объектов.

В фактографических ИПС третьего поколения, которые являются, по сути дела, разновидностью интеллектуальных диалоговых систем, реализуется поиск информации по нерегламентированному перечню запросов, поисковый образ задается пользователем в произвольной форме, предусматриваются операции синтеза информации для удовлетворения запросов пользователей, имеется специальный аппарат анализа вновь вводимой информации на смысловую и формальную релевантности хранящимся в информационном фонде данным.

13. Интеллектуальные информационно-поисковые системы.

14. Нормирование лексики в ИПС.

15. Индексирование в ИПС.

Под индексированием понимается процесс, состоящий из двух этапов:

определение тем, которые отражаются в данном документе;

выражение этих тем на языке, принятом в информационно-поисковой системе, и запись в виде поисковых образов, которые связываются с документом.

Для того чтобы при помощи ИПС можно было отыскать документы, соответствующие некоторому информационному запросу, сам запрос также должен быть заиндексирован. Процесс поиска осуществляется путем сопоставления поисковых образов документов с поисковым образом запроса. При полном или частичном совпадении образов документ считается соответствующим запросу и выдается пользователю.

16. Модели поиска. Языковые средства представления и структурирования электронных документов. Языки метаданных.

Метаданные в HTML-документах

Константин А. Рыбаков

Известно, что метаданные несут в себе справочную и управляющую информацию, которая используется разными агентами (клиентскими приложениями, поисковыми роботами) в различных целях.

В данной статье будут рассмотрены мета тэги, включение которых в документ, как правило, преследует следующие основные цели: управление процессом индексации документа (или всего сайта в целом) поисковыми роботами, описание содержимого данного документа (опять же для поисковых роботов) и управление некоторыми функциями броузеров. Все мета тэги описывать будет лишним, так как многие из них являются довольно абстрактными, то есть не несут никакой полезной информации с точки зрения агентов и просто ими игнорируются.

Мета тэги делятся две на группы: эквиваленты HTTP-заголовка и информационно-управляющую часть, не входящую в заголовок HTTP. Такое разделение связано, в основном, с синтаксисом ( и соответственно) и стандартом. Если же говорить о самих метаданных, то такое деление будет в какой-то степени условным, то есть речь идет не о том, что тэги NAME могут выступать в роли HTTP-заголовков, просто заголовок HTTP также является носителем справочно-управляющей информации. Вообще, эквиваленты HTTP имеют более низкий приоритет перед "истинным" заголовком, который генерируется WEB-сервером. Следует также отметить общий формат декларирования мета-тэгов в HTML-документе, как это показано ниже:

...<TITLE><META HTTP-EQUIV="..." CONTENT="..."><META NAME="..." CONTENT="..."> Группа HTTP-EQUIV 1. EXPIRES (дата устаревания документа) После истечения указанного срока документ будет каждый раз загружаться заново, а не браться из кэша. Формат даты: RFC850 2. PRAGMA (управление кэшированием) Возможно одно значение NO-CACHE, то есть данный документ не кэшируется броузером. Пример: <META HTTP-EQUIV="PRAGMA" CONTENT="NO-CACHE"> 3. CONTENT-TYPE (Тип документа и его кодировка) Было много споров относительно этого тэга... Он в основном требуется для <a href="/microsoft-office/modelnyi-ryad-macbook-pro-pravilnyi-vybor-macbook-ot-firmy-apple.html">правильного выбора</a> кодировки броузером, но это актуально только тогда, когда WEB-сервер не поддерживает автоматическую перекодировку документов (например, для иностранных серверов, предоставляющих <a href="/scan/rambler-staraya-versiya-rambler-pochta-vhod-nastroika-rabota-s.html">бесплатное место</a> для вашего сайта, такая возможность не предусмотрена), в ином случае CONTENT-TYPE может только привести к путанице. Пример: <META HTTP-EQUIV="CONTENT-TYPE" CONTENT="text/html; charset=koi8-r"> 4. CONTENT-LANGUAGE Явное указание языка документа. Данные этого тэга могут использоваться как поисковыми роботами, так и WEB-серверами. Формат: <Язык>-<Диалект> Пример: <META HTTP-EQUIV="CONTENT-LANGUAGE" CONTENT="en-GB"> Время (в секундах), через которое произойдет <a href="/windows-xp/chto-delat-s-sinim-ekranom-smertelnyi-ekran-bsod-chto-eto-takoe.html">автоматическая перезагрузка</a> документа или переход на другой документ с заданным URL. Формат: <ВРЕМЯ> или <ВРЕМЯ>; <URL> Пример: <META HTTP-EQUIV="REFRESH" CONTENT="5; http://algo. /"> 6. CACHE-CONTROL (управление кэшированием) Возможные случаи: кэширование в общем (PUBLIC) / частном (PRIVATE) кэше. Документ вообще не кэшируется (NO-CACHE) или кэшируется но не сохраняется (NO-STORE). Пример: <META HTTP-EQUIV="CACHE-CONTROL" CONTENT="NO-STORE"> Группа NAME 1. DESCRIPTION (описание документа) Наряду с описанием ключевых слов этот тэг является, на наш взгляд, наиболее важным. Именно информация, содержащаяся в нем выводится в результатах поиска, выдаваемых <a href="/laptops/poiskovaya-stranica-proksi-server-hameleon-hameleon---besplatnyi-anonimaizer-dlya-vkontakte-i-odnokla.html">поисковыми серверами</a> на запрос пользователя. В общем случае вид результатов поиска как правило выглядит так: а) URL документа б) Название документа (содержимое <TITLE>...)
в) Описание документа, то есть DESCRIPTION или несколько сотен байт начала документа (включая атрибуты ALT, TITLE у картинок), если DESCRIPTION отсутствует. В первом случае пользователь получает достаточно краткое, но в то же время емкое описание документа, хотя это, конечно, зависит от автора документа, а во втором случае информация о документе носит довольно скудный характер, а именно это может быть бессмысленный набор слов или несколько первых предложений, которые, возможно, и не относятся к общей теме документа и, соответственно, его никак не характеризуют.
г) Рейтинг (коэффициент соответствия документа запросу пользователя).

Пример:

2. KEYWORDS (ключевые слова)

Под словом "ключевые", понимается набор слов и фраз, наиболее полно характеризующих данный документ. Они активно используются поисковыми роботами при индексации. В конечном счете эти слова учитываются при выдаче результатов поиска и способствуют повышению рейтинга.

Пример:

Как видно из описания применение DESCRIPTION и KEYWORDS никогда не является лишним, их наличие, при условии грамотного описания и правильного подбора ключевых слов, будет увеличивать рейтинг документа при выдаче результатов поиска поисковыми системами.

3. DOCUMENT-STATE (статус документа)

Данный тэг управляет частотой индексации и может принимать два значения: STATIC (документ статичен, то есть не меняется, и, следовательно, индексировать его нужно только один раз) и DYNAMIC (для часто изменяющися документов, которые нужно реиндексировать)

Пример:

4. ROBOTS (управление процессом индексации)

Возможные варианты:
a) INDEX - возможность индексирования данного документа (иначе NOINDEX)
б) FOLLOW - возможность индексирования всех документов, на которые есть ссылки в данном HTML файле (иначе NOFOLLOW)
в) ALL - одновременное выполнение условий INDEX и FOLLOW
г) NONE - одновременное выполнение условий NOINDEX и NOFOLLOW

Пример:

5. RESOURCE-TYPE (тип ресурса)

Для обычных HTML документов значение этого мета тэга устанавливается равным "DOCUMENT"

Пример:

6. URL (расположение основного сайта)

Базовый URL (не путать с BASE) определяет какой документ следует индексировать (чтобы не обрабатывать "зеркала")

Пример:

Допустимо добавлять в мета тэги атрибут LANG, указывающий язык данных, но это не обязательно.

17. Информационные ресурсы и их представление в информационно-поисковой системе.

Информационные ресурсы и их представление в информационно-поисковой системе

Как видно из схемы (рисунок 3.41) документальным массивом ИПС Internet является все множество документов шести основных типов: WWW-страницы, Gopher-файлы, документы Wais, записи архивов FTP, новости Usenet, статьи почтовых списков рассылки. Все это довольно разнородная информация, которая представлена в виде различных, никак несогласованных друг с другом форматов данных. Здесь есть и текстовая информация, и графическая информация, и аудио информация и вообще все, что есть в указанных выше хранилищах. Естественно встает вопрос, как информационно-поисковая система должна со всем этим работать. В традиционных системах есть понятие поискового образа документа - ПОД"а. ПОД (Поисковый Образ Документа) - это нечто, что заменяет собой документ и используется при поиске вместо реального документа. Поисковый образ является результатом применения некоторой модели информационного массива документов к реальному массиву. Наиболее популярной моделью является векторная модель, в которой каждому документу приписывается список терминов, наиболее адекватно отражающих его смысл. Если быть более точным, то документу приписывается вектор, размерность которого равна числу терминов, которыми можно воспользоваться при поиске. При булевой векторной модели элемент вектора равен 1 или 0, в зависимости от наличия термина в ПОД"е документа или его отсутствия. В более сложных моделях термины взвешиваются, т. е. элемент вектора равен не 1 или 0, а некоторому числу, которое отражает соответствие данного термина документу. Именно последняя модель наиболее популярна в информационно-поисковых системах Internet. Вообще говоря, существуют и другие модели описания документов: вероятностная модель информационных потоков и поиска, и модель поиска в нечетких множествах. Анализ преимуществ и недостатков применения этих моделей при реализации информационно-поисковых систем в Internet - это тема специального исследования. Здесь имеет смысл обратить внимание читателя только на то, что пока именно линейная модель применяется в системах Lycos, WebCrawler, AltaVista, OpenText, AliWeb и ряде других. Исследования по применению других моделей также ведутся, например, в рамках проекта AltaVista или научными группами. Таким образом, первая задача, которою должна решить информационно-поисковая система - это приписывание списка ключевых слов документу или информационному ресурсу. Именно эта процедура и называется индексированием. Часто, однако, индексированием называют составление файла инвертированного списка, в котором каждому термину индексирования ставится в соответствие список документов, в которых он встречается. Такая процедура является только частным случаем, а точнее техническим аспектом создания поискового аппарата информационно-поисковой системы.