Мы не должны рассматривать данные только как скучных, но готовых помочь родителей, а технологии – как стильных подростков. Важность науки о данных не начинается и не заканчивается объяснением того, что технологии нуждаются в данных как одном из многих других функциональных элементов. Это было бы отрицанием прелести данных и множества интересных приложений, которые они предлагают для работы и игры. Короче говоря, невозможно иметь одно без другого. Это означает, что, если у вас есть основа для науки о данных, перед вами будет открыта дверь к широкому кругу других областей, в которых нужен аналитик данных. Это делает науку о данных необычной и благоприятной областью исследований и практики.
В первой части приводится информация о вездесущности данных, а также о развитии и ключевых принципах науки о данных. Эти сведения полезны для начального погружения в предмет. Вы получите четкое представление о том, какое отношение данные имеют к вам, и задумаетесь не только о том, как данные могут непосредственно принести пользу вам и вашей компании, но и как вы можете в течение длительного времени использовать их в профессиональной и прочих сферах.
Глава 1 станет началом нашего путешествия в науку о данных. Сначала в ней будет продемонстрировано, насколько велики масштабы распространения данных и то, каким образом мы все вносим вклад в их производство в наш компьютерный век. Затем я расскажу, как люди собирают данные, работают с ними и, что очень важно, как данные можно использовать для поддержки большого количества проектов и методов внутри и вне самой дисциплины.
Мы установили, что проблемы с наукой о данных частично связаны не с ее относительной сложностью, а скорее с тем, что эта область знаний для многих по-прежнему покрыта туманом. Только когда мы точно понимаем, сколько данных имеется и как они собраны, мы можем начать рассматривать различные способы работы с ними. Мы достигли той точки в нашем технологическом развитии, когда информацию можно эффективно собирать и хранить на благо всех отраслей промышленности и научных дисциплин, о чем свидетельствует количество общедоступных баз данных и финансируемых правительством проектов по агрегированию данных культурными и политическими институтами. Вместе с тем сравнительно немногие знают, как получить доступ к данным и как их проанализировать. Если же люди не осознают пользу данных для своей профессиональной деятельности, все красивые массивы данных только собирают пыль. В этой главе объясняется, почему наука о данных крайне важна именно сейчас, почему это не просто тенденция, которая скоро выйдет из моды, и почему вы должны рассмотреть возможность внедрения ее практик в качестве ключевого компонента решения ваших рабочих задач.
Наконец, в этой главе описывается, как стремительная траектория развития технологий не позволяет нам даже на время отвернуться от науки о данных. Каковы бы ни были представления о мире, к которому мы стремимся, невозможно остановить сбор данных, их обработку и использование. Тем не менее нельзя игнорировать тот факт, что сами по себе данные не касаются вопросов морали, и это обусловливает возможность их нечестного или неправильного использования. Те из вас, кто обеспокоен такого рода злоупотреблениями, могут принять участие в противостоянии им и вступить в дискуссию с глобальными институтами, которые занимаются проблемами, связанными с этикой данных – аспектом, который я нахожу настолько существенным, что отвел ему специальный подраздел в главе 3.
Все – каждый процесс, каждый датчик – скоро будет управляться данными. Это резко изменит способ ведения бизнеса. Я предсказываю, что через десять лет от каждого сотрудника любой организации в мире будет требоваться обладание определенным уровнем грамотности в сфере данных и умение работать с ними, получая на их основе некоторые идеи для повышения ценности бизнеса. Не такая уж дикая мысль, если учесть, что на момент публикации этой книги предполагается, что многие люди знают, как пользоваться цифровым кошельком Apple Pay, выведенным на рынок только в 2014 г.
Глава 2 – «Как данные удовлетворяют наши потребности» – наглядно демонстрирует, что данные являются эндемичными для каждого аспекта нашей жизни. Они управляют нами, накапливая силу в цифрах. Данные всегда играли важную роль в нашем существовании. Наша ДНК несет в себе основные данные о нас, и эти базовые формы данных руководят нами: отвечают за то, как мы выглядим, за форму наших конечностей, за структуру нашего мозга и его способность обрабатывать информацию, а также за диапазон эмоций, которые мы испытываем. Мы – хранилища этих данных, шагающие флеш-накопители биохимической информации; вместе с данными нашего партнера мы передаем их нашим детям и «кодируем». Не интересоваться данными означает не интересоваться самыми фундаментальными принципами жизни.