Датасет (англ. dataset) — это набор данных, подготовленный для анализа или обучения моделей. Он может быть как полностью структурированным, например в виде таблицы, так и частично неструктурированным, например представлять собой коллекцию изображений, текстов или аудиофайлов. В датасете у каждого объекта есть конкретные свойства: признаки, связи между объектами или определённое место в выборке данных. Датасеты используют, чтобы строить на основе данных гипотезы, делать выводы или обучать нейросети.
Для примера возьмём набор фотографий разных животных. Сам по себе этот набор — просто массив данных, его невозможно использовать для аналитики или обучения нейросети. Чтобы он стал датасетом, в нём должно быть однозначно прописано, какое конкретно животное изображено на фотографии и по каким признакам оно отличается от других животных.
Данные в датасете могут быть разные, например:
Данных в датасете должно быть достаточно много, особенно если для анализа используется несколько признаков. Если нейросети нужно отличать кошек от собак, попугаев, лошадей и рыб, то сотни объектов для датасета обычно не хватит. Для классических моделей компьютерного зрения обычно требуются десятки тысяч размеченных примеров. Однако современные методы transfer learning и генеративные модели позволяют обучать прикладные решения на значительно меньших выборках. Если нужно спрогнозировать, что именно купит конкретный клиент, то понадобятся демографические данные и данные о покупках десятков тысяч других клиентов. Только так прогноз будет точным.
● Автоматически. Системы сбора информации сразу заполняют заранее подготовленную таблицу структурированными данными. Например, так можно собрать датасет о демографии клиентов магазина на основе анкеты, которую они заполняют на сайте.
На курсе Практикума «Аналитик данных» студенты учатся работать с датасетами: проверять их, анализировать и использовать в моделях машинного обучения.
Датасет состоит из двух основных компонентов:
Характеристики объекта обычно задают не словами, а цифрами. Например, нужно отметить пол покупателя. Это делают не буквами «М» и «Ж», а создают два признака «Мужской» и «Женский», и один могут обозначить как 0, а другой как 1.
Именно поэтому признаки часто могут иметь нулевые значения, и иногда их даже больше, чем единичных. Например, у нас есть человек и 100 вариантов городов, где он родился. Только в одном городе может стоять единица — а во всех остальных будут нули. Получается, что большая часть датасета часто пустая, и это нормально.
Есть и другие методы представления категориальных признаков.
Выбор метода зависит от задачи, объёма данных и используемой модели.
Чем больше в датасете для обучения объектов, тем лучше он отражает реальность, и тем более достоверной получается аналитика и обученные с её помощью нейросети.
Чем больше в датасете характеристик, тем он сложнее для анализа. Это даже называют «проклятием размерности». С ростом количества признаков сложность обработки датасета растёт не линейно, а по экспоненте, то есть очень быстро.
Это таблица, в строках которой расположены объекты, а в колонках — признаки. Явных связей между строками и столбцами нет, признаки просто соответствуют конкретным объектам. Чаще всего датасеты выглядят именно так.
Данные о связях между объектами, которые могут быть представлены визуально в виде схемы из объектов, соединённых стрелками. А могут быть в виде таблицы, где в строках и колонках указаны объекты, а в пересечениях — связи между ними.
Графы бывают структурированные и неструктурированные. У первых присутствуют либо отсутствуют соотношения между объектами. У вторых они могут быть направленные — например, первый объект соотносится со вторым, а второй с первым уже нет. Кроме того, у соотношений может быть разный вес. Например, первый объект отправил второму 10 сообщений — тогда вес этого соотношения равен 10.
Здесь роль играет не соотношение объектов или их признаки, а конкретное расположение в таблице с данными, пространстве или времени.
Например, такой датасет для анализа данных может быть в виде таблицы, в которой главная информация — это расположение объекта.
Один из инструментов для поиска открытых наборов данных — Google Dataset Search. Также датасеты часто публикуют на специализированных платформах и в репозиториях — например, на Kaggle, в каталогах Hugging Face или на GitHub.
Часто бывает так, что датасета по конкретному запросу не существует. Например, если речь про список клиентов конкретного магазина. В таком случае датасет может предоставить компания, либо его придется формировать самостоятельно: собирать данные и очищать их вручную или автоматически. Часто такие задачи отдают на аутсорс — есть компании, которая занимается подготовкой датасетов из сырых данных.
Совет от эксперта
Читать также: