2. Свойства, определяющие надежность.

Под надежностью любой информационной системы понимают свойство системы выполнять свои функции "сохраняя во времени значения установленных эксплуатационных показателей в заданных пределах" (ГОСТ 13377-75). При оценке качества системы связи необходимо учитывать возможность возникновения сбоев и отказов. Под сбоем обычно понимается самоустраняющийся отказ, приводящий к кратковременному нарушению работоспособности. Под отказом понимают нарушение работоспособности аппаратуры.
Проблема надежности отличается от проблемы помехоустойчивости тем, что в случае отказа повторение одной и той же операции во времени не позволит обнаружить и исправить ошибку. Вместе с тем в системах с последовательными кодами одиночный отказ элемента может привести к неодиночной ошибке в выходном сигнале. Однако при соответствующем проектировании информационных систем основные методы обеспечения помехоустойчивой передачи информации могут быть применены к задаче конструирования надежных технических устройств. Также как и для повышения помехоустойчивости, для увеличения надежности необходимо вводить избыточность. В частности, с небольшими изменениями можно использовать большинство результатов теории кодирования при введении аппаратурной кодовой избыточности.
Проблема помехоустойчивости в определенной степени является противоречивой по отношению к проблеме надежности. Если для увеличения помехоустойчивости необходимо увеличивать избыточность передаваемой информации, то это приводит к усложнению системы и если вводимая избыточность не рассчитывалась на исправление ошибок, возникших из-за неисправности аппаратуры, то снижается надежность. Только оценивая помехоустойчивость и надежность единым критерием, можно оценить общую эффективность построения системы связи.

НАДЕЖНОСТЬ [reliability]

     Способность реального или абстрактного объекта при определенных условиях безотказно выполнять требуемые функции в течение определенного времени.
     Показателями надежности являются: вероятность безотказной работы, вероятность отказов, среднее время наработки на отказ, среднее время восстановления и др.

Поскольку информационные серверы получают все больше и больше коммуникационных заданий от потребителей, они должны быть такими же надежными, как современные телефонные системы. Для этого сервер реального времени может быть сконфигурирован для обеспечения надежности на разных уровнях.

Несомненно, самым распространенным местом сбоя в изохронном сервере является магнитный дисковод. Это происходит в значительной степени из-за того, что дисководы - единственная часть центральной системы, содержащая движущиеся элементы. Даже при времени наработки на отказ (MTBF) в 1 миллион часов, в системах с большими массивами дисков будут регулярно наблюдаться отдельные отказы. Для системы, оперирующей многими терабайтами и тысячами дисководов, частые выходы дисков из строя могут сделать недоступными большие объемы информации.

Сервер реального времени может обнаруживать и исправлять дисковые сбои без приостановки потока данных реального времени. Используемый подход уникален (и, к сожалению, закрыт, поэтому его подробности не могут быть изложены в данной статье), так как традиционные подходы к дисковой избыточности (например, RAID - Redundant Arrays of Inexpensive Disks, избыточные массивы недорогих дисков) работают со всем, но не с истинным реальным временем. Диски также отключаются много раз в день из-за нарушения температурного режима, профилактических процедур и т.д. Что касается сбоев дисков, то система выдержит эти временные прерывания работы без какого-либо прекращения работы служб реального времени. В любой системе с дисками, которые могут быть заменены в процессе работы, когда Media Server определяет, что диск вышел из строя и должен быть заменен, он (Media Server, прим. перев.) предлагает оператору отключить устройство с плохим диском и включить другое. Затем он запрашивает у планировщика ресурсы для того, чтобы как можно быстрее подключить диск без остановки потока воспроизведения информации. Система обеспечивает два уровня конфигурирования надежности дисков; администратор системы может выбрать размер накладных расходов внешней памяти для защиты как от одновременного сбоя нескольких дисков, так и от сбоя контроллера, обслуживающего несколько дисков. Способность продолжать проигрывание при одновременных отказах и диска и контроллера решает самую трудную проблему надежности, существующую в серверах реального времени.

Вторым наиболее распространенным отказом является выход из строя коммуникаций базовой сети, большей частью из-за оборудования, расположенного вне сервера потоков реального времени. Для преодоления этого, система может принимать команды маршрутизации во время проигрывания потока. Когда служба управления сетью определяет, что поток должен передаваться по другому пути, она выдает команду переключателю сети переадресовать информацию и одновременно информирует потоковый сервер о том, куда нужно посылать данные. Это происходит на ходу, без перезапуска потока.

Сбой программного обеспечения - это третий потенциальный источник выхода системы из строя. Большей частью, элементы системы, находящиеся за пределами компонент реального времени, независимы друг от друга, таким образом, единичный сбой программного обеспечения приведет к прерыванию небольшого количества потоков. Поскольку служба потока реального времени часто сохраняет его состояние, поток быстро может быть запущен из другой точки в системе, только с небольшим перебоем в обслуживании пользователя. Как только менеджер службы обнаруживает программную ошибку, он мгновенно перезапускает отказавшие части системы.

Аппаратная и программная избыточность и независимая способность к рестартам - части базовой архитектуры Media Server. Если иметь эти элементы в каждой службе, то сложную систему можно диагностировать и возвращать в рабочее состояние в кратчайшее время

 

Hosted by uCoz