Статистические методы являются ключевой частью науки о данных, однако лишь немногие ученые, работающие с данными, имеют формальную статистическую подготовку.. Курсы и книги по базовой статистике редко освещают эту тему с точки зрения науки о данных.. Второе издание этого популярного руководства добавляет исчерпывающие примеры на Python, предоставляет практические рекомендации по применению статистических методов к науке о данных, рассказывает, как избежать их неправильного использования, и дает советы о том, что важно, а что нет.
Многие ресурсы по науке о данных включают статистические методы, но им не хватает более глубокой статистической перспективы.. Если вы знакомы с языками программирования R или Python и немного разбираетесь в статистике, этот краткий справочник восполняет пробелы в доступном, читаемом формате.
С этой книгой вы узнаете:
Почему исследовательский анализ данных является ключевым предварительным шагом в науке о данных
Как случайная выборка может уменьшить предвзятость и обеспечить более качественный набор данных даже при работе с большими данными
Как принципы планирования эксперимента дают окончательные ответы на вопросы
Как использовать регрессию для оценки результатов и обнаружения аномалий
Ключевые методы классификации для прогнозирования того, к каким категориям принадлежит запись
Статистические методы машинного обучения, которые «обучаются» на данных
Методы обучения без учителя для извлечения смысла из неразмеченных данных
об авторе
Питер Брюс — основатель и главный академический директор Института статистики образования на Statistics.com, который предлагает около 80 курсов по статистике и аналитике, примерно половина из которых ориентирована на специалистов по данным.. Он является автором или соавтором нескольких книг по статистике и аналитике, получил степень бакалавра в Принстоне и степени магистра в Гарварде и Университете Мэриленда.
^
Эндрю Брюс, главный научный сотрудник Amazon, имеет более 30 лет опыта в статистике и науке о данных в академической сфере, правительстве и бизнесе.. Соавтор книги «Прикладной вейвлет-анализ с S-PLUS», он получил степень бакалавра в Принстоне и степень доктора философии по статистике в Вашингтонском университете.
^
Петер Гедек, старший специалист по данным в Collaborative Drug Discovery, специалилизируется на разработке алгоритмов машинного обучения для прогнозирования биологических и физико-химических свойств кандидатов в лекарственные препараты.. Соавтор книги «Data Mining for Business Analytics», он получил докторские степени по химии в Университете Эрлангена-Нюрнберга в Германии и по математике в Фернуниверситете Хагена в Германии.