Главная

Популярная публикация

Научная публикация

Случайная публикация

Обратная связь

ТОР 5 статей:

Методические подходы к анализу финансового состояния предприятия

Проблема периодизации русской литературы ХХ века. Краткая характеристика второй половины ХХ века

Ценовые и неценовые факторы

Характеристика шлифовальных кругов и ее маркировка

Служебные части речи. Предлог. Союз. Частицы

КАТЕГОРИИ:






Документальных информационных систем




Напомним, что в фактографических информационных си­стемах единичным элементом данных, имеющим отдельное смысловое значение, является запись, образуемая конечной со­вокупностью полей-атрибутов. Иначе говоря, информация о предметной области представлена набором одного или несколь­ких типов структурированных на отдельные поля записей.

В отличие от фактографических информационных систем, единичным элементом данных в документальных информационных системах является неструктурированный на более мелкие элементы документ. В качестве неструктурированных документов в подавляющем большинстве случаев выступают, прежде всего, текстовые документы, представленные в виде текстовых файлов, хотя к классу неструктурированных доку­ментированных данных могут также относиться звуковые и графические файлы.

Основной задачей документальных информационных сис­тем является накопление и предоставление пользователю до­кументов, содержание, тематика, реквизиты и т. п. которых адекватны его информационным потребностям. Поэтому мож­но дать следующее определение документальной информационной системыединое хранилище документов с инструментарием поиска и отбора необходимых документов. Поисковый характер документальных информационных систем исторически определил еще одно их название — информаци­онно-поисковые системы (ИПС), хотя этот термин не совсем полно отражает специфику документальных ИС3. Соответствие найденных документов информационным потребностям пользователя называется пертинентностью. В силу теоретических и практических сложностей с формализацией смысло­вого содержания документов пертинентность относится скорее к качественным понятиям, хотя, как будет рассмотрено ниже, может выражаться определенными количественными показа­телями.

3 Поиск информации (данных) осуществляется и в фактографических ИС. Таким образом, термин ИПС определяет функциональное назначение ИС, но не отражает спе­цифики представления и обработки данных. Специфика документальных ИПС заключается в том, что они удовлетворяют информационные потребности пользователя, предоставляя ему документы, в которых содержится интересующая пользователя информация.

В зависимости от особенностей реализации хранилища до­кументов и механизмов поиска документальные ИПС можно разделить на две группы:

• системы на основе индексирования;

• семантически-навигационные системы.

В семантически-навигационных системах документы, помещаемые в хранилище (в базу) документов, оснащаются специальными навигационными конструкциями, соответству­ющими смысловым связям (отсылкам) между различными до­кументами или отдельными фрагментами одного документа. Такие конструкции реализуют некоторую семантическую4 (смысловую) сеть в базе документов. Способ и механизм выра­жения информационных потребностей в подобных системах заключаются в явной навигации пользователя по смысловым отсылкам между документами. В настоящее время такой под­ход реализуется в гипертекстовых ИПС.

4 Семантика (от греч.«semantikos»—обозначающий)— смысловая сторона языка, отдельных слов и частей слова, а также — раздел языкознания, изучающий значения слов.

В системах на основе индексирования исходные докумен­ты помещаются в базу без какого-либо дополнительного пре­образования5, но при этом смысловое содержание каждого до­кумента отображается в некоторое поисковое пространство. Процесс отображения документа в поисковое пространство на­зывается индексированием и заключается в присвоении каж­дому документу некоторого индекса-координаты в поисковом пространстве. Формализованное представление (описание) ин­декса документа называется поисковым образом документа (ПОД). Пользователь выражает свои информационные потреб­ности средствами и языком поискового пространства, форми­руя поисковый образ запроса (ПОЗ) к базе документов. Система на основе определенных критериев и способов ищет доку­менты, поисковые образы которых соответствуют или близки поисковым образам запроса пользователя, и выдает соответству­ющие документы. Соответствие найденных документов запро­су пользователя называется релевантностью6. Схематично об­щий принцип устройства и функционирования документаль­ных ИПС на основе индексирования иллюстрируется на рис. 6.1.

5 За исключением возможного сжатия (архивирования). 6 На практике термин релевантность часто отождествляют с термином перти­пент­ность, хотя в строгом отношении они различны.

 

Рис. 6. 1. Общий принцип устройства и функционирования документальных ИПС на основе индексирования.

 

Особенностью документальных ИПС является также то, что в их функции, как правило, включаются и задачи информаци­онного оповещения пользователей по всем новым поступаю­щим в систему документам, соответствующим заранее опреде­ленным информационным потребностям пользователя7. Прин­цип решения задач информационного оповещения в документальных ИПС на основе индексирования аналогичен принципу решения задач поиска документов по запросам и ос­нован на отображении в поисковое пространство информа­ционных потребностей пользователя в виде так называемых поисковых профилей пользователей (ППП). Информационно-поисковая система по мере поступления и индексирования но­вых документов сравнивает их образы с поисковыми профиля­ми пользователей и принимает решение о соответствующем опо­вещении. Принцип решения задач информационного оповеще­ния схематично иллюстрируется на рис. 6.2.

7 Задачи информационного оповещения основаны на идеологии т.н. избирательного распространения информации (ИРИ), наработанной в библиотечном деле.

 

Рис. 6.2. Принцип решения задач информационного оповещения в документальных ИПС па основе индексирования.

 

Поисковое пространство, отображающее поисковые образы документов и реализующее механизмы информационного поиска документов так же, как и в СУБД фактографических систем, стро­ится на основе языков документальных баз данных, называемых информационно-поисковыми языками (ИПЯ). Инфорлшциоппо-поисковый язык представляет собой некоторую формализован­ную семантическую систему, предназначенную для выражения содержания документа и запросов, но поиску необходимых доку­ментов. По аналогии с языками баз данных фактографических систем ИПЯ можно разделить на структурную и манипуляционную составляющие.

Структурная составляющая ИПЯ (поискового пространства) документальных ИПС на основе индексирования реализуется индексными указателями в форме информационно-поисковых ка­талогов, тезаурусов и генеральных указателей.

Информационно-поисковые каталоги являются традицион­ными технологиями организации информационного поиска в документальных фондах библиотек, архивов и представляют со­бой классификационную систему знаний по определенной пред­метной области. Смысловое содержание документа в информа­ционно-поисковых каталогах отображается тем или иным клас­сом каталога, а индексирование документов заключается в присвоении каждому документу специального кода (индекса) со­ответствующего по содержанию класса (классов) каталога и со­здания на этой основе специального индексного указателя.

Тезаурус представляет собой специальным образом органи­зованную совокупность основных лексических единиц (понятий) предметной области (словарь терминов) и описание парадигма­тических отношений между ними. Парадигматические отноше­ния выражаются семантическими отношениями между элемен­тами словаря, не зависящими от любого контекста. Независи­мость от контекста означает обобщенность (абстрагированность) смысловых отношений, например отношения «род-вид», «пред­мет-целое», «субъект – объект – средство – место – время действия». Так же, как и в информационно-поисковых каталогах, в системах на основе тезаурусов в информационно-поисковое пространство отображается не весь текст документа, а только лишь выражен­ное средствами тезауруса смысловое содержание документа.

Генеральный указатель 8 (глобальный словарь-индекс) в об­щем виде представляет собой перечисление всех слов (словоформ), имеющихся в документах хранилища, с указанием (отсылками) координатного местонахождения каждого слова (№ докумен­та —№ абзаца—№ предложения—№ слова). Индексирование нового документа в таких системах производится через дополне­ние координатных отсылок тех словоформ генерального указа­теля, которые присутствуют в новом документе. Так как поис­ковое пространство в таких системах отражает полностью весь текст документа (все слова документа), а не только его смысловое содержание, то такие системы получили название полнотекстовых ИПС9.

8 Исторически в специальной литературе употреблялся также термин «конкор­данс». 9 В специальной литературе такие системы иногда называют системами без лекси­ческого контроля, т. е. без учета возможной синонимичности отдельных групп слово­форм, объединения отдельных групп словоформ в общие смысловые группы, семанти­ческих отношений между словоформами.

Структурная составляющая ИПЯ семантически-навигаци­онных систем реализуется в виде техники смысловых отсылок в текстах документов и специальном навигационном интерфей­се по ним и в настоящее время представлена гипертекстовы­ми технологиями,

Поисковая (манипуляционная) составляющая ИПЯ реали­зуется дескрипторными и семантическими языками запросов.

В дескрипторных языках документы и запросы представ­ляются наборами некоторых лексических единиц (слов, слово­сочетаний, терминов) — дескрипторов, не имеющих между со­бой связей, или, как еще говорят, не имеющих грамматики. Та­ким образом, каждый документ или запрос ассоциируется или, лучше сказать, представлен некоторым набором дескрипторов. Поиск осуществляется через поиск документов с подходящим набором дескрипторов. В качестве элементов-дескрипторов выступают либо элементы словаря ключевых терминов, либо элементы генерального указателя (глобального словаря всех словоформ). В силу отсутствия связей между дескрипторами, набор которых для конкретного документа и конкретного зап­роса выражает, соответственно, поисковый образ документа — ПОД или поисковый образ запроса ПОЗ, такие языки применя­ются, прежде всего, в полнотекстовых системах.

Семантические языки содержат грамматические и семан­тические конструкции для выражения (описания) смыслового содержания документов и запросов. Все многообразие семан­тических языков подразделяется на две большие группы:

• предикатные языки;

• реляционные языки.

В предикатных языках в качестве элементарной осмыс­ленной конструкции высказывания выступает предикат, кото­рый представляет собой, многоместное отношение некоторой совокупности грамматических элементов. Многоместность отношения означает, что каждый элемент предиката играет оп­ределенную роль для группы лексических элементов в целом, но не имеет конкретных отношений с каждым элементом этой группы в отдельности. Аналогом предикатного высказывания в естественном языке выступает предложение, констатирую­щее определенный факт или описывающее определенное со­бытие.

В реляционных языках лексические единицы высказыва­ний могут вступать только в бинарные (друг с другом), но не в совместные, т. е. не многоместные отношения.

В качестве лексических единиц семантических языков выс­тупают функциональные классы естественного языка, важней­шими из которых являются:

понятия-классы (общее определение совокупности однородных элементов реального мира, обладающих некоторым характерным набором свойств, позволяющих одни понятия-классы отделять от других);

понятия-действия (лексический элемент, выражающий динамику реального мира, содержит универсальный набор признаков, включающий субъект действия, объект действия, время действия, место действия, инструмент действия, цель и т. д.);

понятия-состояния (лексические элементы, фиксирующие состояния объектов);

имена (лексические элементы, идентифицирующие понятия-классы);

отношения (лексические элементы, служащие для установления связей на множестве понятий и имен);

квантификаторы (всеобщности, существования и т. д.).

Семантические языки составляют языково-манипуляционную основу информационно-поисковых каталогов, тезаурусов и семантически-навигационных (гипертекстовых) ИПС, опи­сывая своими средствами собственно сами каталоги, тезауру­сы, семантические сети и выражая смысловое содержание до­кументов и запросов.

В заключение общей характеристики документальных ИПС приведем основные показатели эффективности их функци­онирования. Такими показателями являются полнота и точность информационного поиска.

Полнота информационного поиска К определяется отно­шением числа найденных пертинентных документов А к обще­му числу пертинентных документов С, имеющихся в системе или в исследуемой совокупности документов:

Точность информационного поиска P определяется отно­шением числа найденных пертинентных документов А к обще­му числу документов L, выданных на запрос пользователя:

Наличие среди отобранных на запрос пользователя нере­левантных документов называется информационным шумом системы. Коэффициент информационного шума к, соответ­ственно, определяется отношением числа нерелевантных до­кументов (L — A), выданных в ответе пользователю к общему числу документов L, выданных на запрос пользователя:

В идеале полнота информационного поиска и точность ин­формационного поиска должны приближаться к единице, хотя на практике их значения колеблются в пределах от 60 до 90%.






Не нашли, что искали? Воспользуйтесь поиском:

vikidalka.ru - 2015-2024 год. Все права принадлежат их авторам! Нарушение авторских прав | Нарушение персональных данных