5.3.2. Файлы с неплотным индексом, или индексно-последовательные файлы

Неплотный индекс строится для упорядоченных файлов. Если основной файл хранить в упорядоченном виде и применить к нему алгоритм двоичного поиска для доступа к произвольной записи, то время доступа будет существенно меньше. Для нашего примера составит:

Т = log₂KBO = log₂12 500 = 14 обращений к диску.

Это существенно меньше, чем 12 500 обращений при произвольном хранении записей файла. Однако и поддержание основного файла в упорядоченном виде также операция сложная.

Неплотный индекс основывается на принципе внутреннего упорядочивания. Структура записи индекса для таких файлов имеет следующий вид: значение ключа первой записи блока; номер блока с этой записью.

В индексной области ищут нужный блок по заданному значению первичного ключа. Так как все записи упорядочены, то значение первой записи блока позволяет быстро определить, в каком блоке находится искомая запись. Все остальные действия происходят в основной области. На рис. 5.4 представлен пример заполнения основной и индексной областей, если первичным ключом являются целые числа.

Время сортировки больших файлов весьма значительно, но поскольку файлы поддерживаются сортированными с момента их создания, накладные расходы в процессе добавления новой информации будут гораздо меньше.

Индексная область		Основная область
100	0	100 …	Блок 0
200	1		Свободное пространство
400	2	200 …	Блок 1
			Свободное пространство

…

Рис. 5.4. Пример заполнения индексной и основной области при организации неплотного индекса

Оценим время доступа к произвольной записи для файлов с неплотным индексом. Алгоритм решения задачи аналогичен.

Сначала определим размер индексной записи. Если ранее ссылка рассчитывалась исходя из того, что требовалось ссылаться на 100 000 записей, то теперь нам требуется ссылаться всего на 12 500 блоков, поэтому для ссылки достаточно двух байт. Тогда длина индексной записи будет равна:

LI = LK + 2 = 14 + 2 = 14 байт.

Тогда количество индексных записей в одном блоке будет равно:

KIZB = LB / LI = 1024 / 14 = 73 индексные записи в одном блоке.

Определим количество индексных блоков, которое необходимо для хранения требуемых индексных записей:

KIB = KBO /KIZB = 12 500 / 73 = 172 блока.

Тогда время доступа по прежней формуле будет определяться:

Т_поиска = log₂KIB + 1 = log₂172 + 1 = 8 + 1 = 9 обращений к диску.

Таким образом, при переходе к неплотному индексу время доступа уменьшилось практически в полтора раза. Поэтому можно признать, что организация неплотного индекса дает выигрыш в скорости доступа.

Рассмотрим процедуры добавления и удаления новой записи при подобном индексе.

Механизм включения новой записи принципиально отличен от ранее рассмотренного. Новая запись должна заноситься сразу в требуемый блок на требуемое место, которое определяется заданным принципом упорядоченности на множестве значений первичного ключа. Поэтому сначала ищут требуемый блок основной памяти, в который надо поместить новую запись, а потом этот блок считывается, затем в оперативной памяти корректируется содержимое блока, и он снова записывается на диск на старое место. Здесь, так же, как и в первом случае, должен быть задан процент первоначального заполнения блоков, но только применительно к основной области. В MS SQL server этот процент называется Full-factor и используется при формировании кластеризованных индексов. Кластеризованными называются индексы, в которых исходные записи физически упорядочены по значениям первичного ключа. При внесении новой записи индексная область не корректируется.

Количество обращений к диску при добавлении новой записи равно количеству обращений, необходимых для поиска соответствующего блока плюс одно обращение, которое требуется для занесения измененного блока на старое место.

Т_{добавления} = log₂N + 1 + 1 обращений.

Уничтожение записи происходит путем ее физического удаления из основной области, при этом индексная область обычно не корректируется, даже если удаляется первая запись блока. Поэтому количество обращений к диску при удалении записи такое же, как и при добавлении новой записи.

<<< < Предыдущая 29 30 31 32 33 34 35 36 37 38 39 4041 / 5541 42 43 44 45 46 47 48 49 50 51 52 53 > Следующая >>>

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]

#
30.04.20221.24 Mб6Учебное пособие 3000254.doc
#
30.04.20221.25 Mб9Учебное пособие 3000255.doc
#
30.04.20221.25 Mб5Учебное пособие 3000256.doc
#
30.04.20221.26 Mб38Учебное пособие 3000257.doc
#
30.04.20221.26 Mб5Учебное пособие 3000258.doc
#
30.04.20221.27 Mб27Учебное пособие 3000259.doc
#
30.04.2022172.03 Кб5Учебное пособие 300026.doc
#
30.04.20221.29 Mб12Учебное пособие 3000260.doc
#
30.04.20221.3 Mб9Учебное пособие 3000261.doc
#
30.04.20221.31 Mб6Учебное пособие 3000262.doc
#
30.04.20221.31 Mб6Учебное пособие 3000263.doc