CRISP-DM/Data Understanding
Материал из MachineLearning.
На фазе изучения данных данные собираются, происходит ознакомление с данными, определяются проблемы в качестве данных, делаются первые попытки анализа данных с целью выделения интересных подмножеств данных и формирования гипотез о скрытых зависимостях.
Содержание |
Выгрузить данные
Запросить доступ к данным из списка ресурсов проекта и осуществить их выгрузку (если это возможно). Если необходимо, непосредственно загрузить данные в анализирующие инструменты.
N.B.: В случае нескольких источников данных, их интеграция выносится в отдельную задачу на данном или более поздних этапах.
Отчет о выгрузке данных
Список полученных наборов данных вместе с описанием доступа к ним и возможными проблемами при осуществлении этого доступа. Подробное описание всех возникших проблем и способов их решения (для использования этой информации в будущем).
Описание данных
Исследовать основные или "поверхностные" свойства собранных данных и описать результаты.
Отчет по описанию данных
Описание собранных данных, включающее: формат данных, количество данных, например, число объектов и признаков в каждой таблице, сущности в каждом признаке и все другие найденные поверхностные характеристики данных. Удовлетворяют ли собранные данные каким-то характерным требованиям?
Ознакомление с данными
Эта задача связана с вопросами анализа данных, которые решаются с помощью запросов, визуализации и отчетности. Она включает в себя выяснение распределения ключевых признаков, например, поиск целевого признака задачи предсказания;отношения между парами или малым числом признаков; результаты простого агрегирования;свойства больших групп населения;простой статистический анализ. Это ознакомление может быть обращено конкретно к цели самого анализа данных;также оно может добавлять или уточнять информацию о данных и их качестве. Также ознакомление заключается в передаче данных для преобразования и для других этапов подготовки, необходимых для дальнейшего анализа.
Отчет о ознакомлении с данными
Опишите результаты этой задачи, включая информацию о первых замечаниях и гипотезах, а также о их возможном влиянии на оставшуюся часть проекта. Если это уместно, включите диаграммы и графики, которые показывают свойства данных или описывают те части данных, которые будут интересны для дальнейшего рассмотрения.
Определение качества данных
Следует определить качество данных, поставив, например, такие вопросы: являются ли данные полными (покрывают ли они все требуемые случаи)? Являются ли данные корректными, или же содержат ошибки, и где эти ошибки? Встречаются ли в данных пропущенные значения? Если встречаются, то где и насколько часто?
Отчет о качестве данных
Список результатов по верификации качества данных. Если встретились ошибки, список должен содержать возможные решения. Решения этих проблем в равной степени зависят от данных и бизнес-целей.