Важной характеристикой информации служит её избыточность. Избыточная информация присутствует практически в любом тексте. Изначально избыточность текста появляется из-за того, что вероятность встречаемости букв в алфавите русского, как и любого другого, языка неодинакова. Если проанализировать встречаемость различных букв в русском тексте, то мы увидим, что в половине случаев мы обнаружим буквы О, Е, А, И, Т, Р или Н, и меньше 5 % придётся на долю букв Ю, Ж, Х, Щ, Ф, Ш, Э, Ц, И, Ъ. С учётом неравномерной встречаемости букв энтропия алфавита русского языка равна не 5 битам, а всего 4,39 бита. Отношение максимальной энтропии к реальной и определяет её избыточность.
В действительности избыточность языка оказывается ещё большей из-за того, что в языке существуют устойчивые пары или тройки сочетаний букв, вероятность появления которых значительно больше, чем у других сочетаний. Если учесть вероятность появления различных сочетаний двух букв, то энтропия становится равной 3,52, а при учёте вероятности сочетаний трёх букв – 3,05 бит/букву[5]. Благодаря этому часто даже при потере значительной части букв текст удаётся восстановить, т. е. извлечь из него всю изначально содержащуюся информацию. Классический пример можно найти в книге Жюля Верна «Дети капитана Гранта». В записке, которую извлекли из желудка акулы, было смыто морской водой 170 букв из 250. Паганель не смог полностью расшифровать испорченный текст, но ему удалось извлечь из него достаточно информации, чтобы после нескольких попыток найти потерявшуюся экспедицию. Тексты с меньшим числом потерянных знаков часто можно восстановить полностью.
Допустим, вам встретилось слово, в котором есть такое сочетание: «Б, затем утерянный знак, затем Ф». Восстановить это испорченное слово будет не так уж трудно. Скорее всего, в голову придёт что-то съедобное: «бифштекс», «ростбиф», «бефстроганов» или «буфет»; может быть, вспомните ещё «буфер», а вот дальше у вас начнутся затруднения. Набор будет очень ограничен ещё из-за того, что буква «Ф» в русском языке встречается очень редко, практически только в словах, заимствованных из других языков. Но и при более простых сочетаниях восстановить текст нетрудно в том случае, когда небольшая его часть утрачена. Особенно просто это сделать с текстом, в котором содержатся знакомые, часто употребляемые выражения. Сможете ли вы, например, прочитать такое объявление:
«До..лни…ь.ые к.н.уль.а..и п. м…ма..ке .у..т пр.в..ить.я в. …рник .осл. пя..г. ур..а»?
Из этого объявления «выпала» почти половина знаков, и тем не менее нетрудно восстановить его полный текст[6].
Различные виды текстов обладают различным количеством избыточной информации. Если вспомнить, что мерой величины информации служит её неожиданность, то часто можно услышать или прочесть в сети тексты, содержащие практически нулевую информацию. Вот типичный пример:
– Привет!
– Привет!
– Ну как ты?
– Нормально. А ты?
– И я нормально.
– Ну, хорошо. А я вот иду, смотрю, ты тут стоишь.
– Ну да. Ну что, пока?
– Пока. Ну, я пошла.
Часто большой избыточной информацией обладают художественные, особенно поэтические тексты. У некоторых поэтов-авангардистов встречаются тексты, абсолютно лишённые какого-либо смысла, где вся информация основана только на грамматических связях. Вот отрывок из произведения русского поэта начала прошлого века Велимира Хлебникова:
«Хатославль песен певучего слога, старомилы, шкурники, баромилые годы, брюхомолы, особая порода самобожеств, пузомолы, брюховеры, смежни зарёю главной, мозговеры».
Каждая ситуация, каждый текст требуют своего уровня избыточной информации. Преимуществом избытка информации может быть либо эстетическое качество художественного произведения, либо его лучшее понимание. Если бы тексты не содержали избыточной информации, их восстановление после повреждения стало бы невозможным.
5
Можно придумать тексты с исключительно редким сочетанием букв. Например, существует фраза, которая содержит семь подряд стоящих букв «и». История такая. Хозяин галантерейного магазина заказал вывеску с надписью «Нитки и иголки». Увидев выполненную работу, он остался недоволен и сказал художнику: «Перерисуй! Надо сделать больше промежутки между «Нитки» и «и» и «и» и «иголки»». Вторым примером может служить вполне законный вопрос садовника «Полили ли лилии?», содержащий пять «ли» подряд.
6
«Дополнительные консультации по математике будут проводиться во вторник после пятого урока».