Сбор данных
Извлечение данных или интеллектуальный анализ данных [1] — это набор методов и методологий, целью которых является извлечение полезной информации из больших объемов данных (например , баз данных , хранилищ данных и т. д .) с помощью автоматических или полуавтоматических методов (например, машинное обучение ) и их научное, корпоративное, промышленное или операционное использование.
Описание
Для характеристики интеллектуального анализа данных может быть полезно рассмотреть статистику , которую иначе можно определить как извлечение полезной информации из наборов данных .
Концепция интеллектуального анализа данных похожа, но с существенным отличием: статистика позволяет обрабатывать общую информацию о населении (например , уровень безработицы , рождаемость ), в то время как интеллектуальный анализ данных используется для поиска корреляций между несколькими переменными, относящимися к отдельным лицам; например, зная среднее поведение клиентов телефонной компании, можно попытаться предсказать, сколько средний клиент потратит в ближайшем будущем.
По сути, интеллектуальный анализ данных — это анализ с математической точки зрения, выполняемый в больших базах данных , которому обычно предшествуют другие этапы подготовки, преобразования или фильтрации данных, такие как очистка данных . Термин « интеллектуальный анализ данных» стал популярным в конце 1990-х годов как сокращенная версия приведенного выше определения; сегодня интеллектуальный анализ данных имеет двойную ценность:
- извлечение с помощью передовых аналитических методов неявной, скрытой информации из уже структурированных данных, чтобы сделать ее доступной и пригодной для непосредственного использования;
- исследование и анализ, выполняемые автоматически или полуавтоматически, на больших объемах данных с целью обнаружения существенных закономерностей (образцов или закономерностей).
В обоих случаях понятия информации и значения тесно связаны с предметной областью, в которой выполняется интеллектуальный анализ данных; другими словами, данные могут быть интересными или незначительными в зависимости от типа приложения, в котором они работают.
Этот вид деятельности имеет решающее значение во многих областях научных исследований , а также в других секторах (например, в исследованиях рынка ). В профессиональном мире он используется для решения разных задач, начиная от управления взаимоотношениями с клиентами (CRM) и заканчивая обнаружением мошеннического поведения и оптимизацией веб- сайтов . [2]
Помещения
Основными факторами, которые способствовали развитию интеллектуального анализа данных, являются:
- большие скопления данных в электронном формате;
- недорогое хранилище данных ;
- новые методы и приемы анализа ( машинное обучение ).
Методы интеллектуального анализа данных основаны на определенных алгоритмах . Выявленные закономерности могут быть, в свою очередь, отправной точкой для выдвижения гипотез и, следовательно, проверки новых причинно-следственных связей между явлениями; в общем, их можно использовать в статистическом смысле для прогнозирования новых наборов данных.
Концепция, связанная с интеллектуальным анализом данных, — это машинное обучение ; фактически идентификацию закономерностей можно сравнить с изучением системой интеллектуального анализа данных ранее неизвестной причинно-следственной связи, которая находит применение в таких областях, как эвристические алгоритмы и искусственный интеллект . Однако следует отметить, что процесс интеллектуального анализа данных всегда сопряжен с риском выявления причинно-следственных связей, которые затем оказываются несуществующими.
Методы
Среди наиболее часто используемых методов в этой области:
- кластеризация ;
- нейронные сети ;
- деревья решений ;
- Анализ ассоциаций (выявление совместно приобретаемой продукции).
Другой популярный метод интеллектуального анализа данных — обучение по классификации. Этот шаблон обучения начинается с четко определенного набора примеров классификации для известных случаев, из которых ожидается вывод способа классификации неизвестных примеров. Этот подход также называют «контролируемым» в том смысле, что схема обучения работает под контролем, неявно обеспечиваемым классификационными примерами для известных случаев; эти примеры, по этой причине, также называются обучающими примерами , или «примерами для обучения». Знания, полученные путем обучения посредством классификации, могут быть представлены в виде дерева решений.
Таким образом, фактическое извлечение данных происходит в конце процесса, состоящего из множества этапов: идентифицируются источники данных; создается единый набор агрегированных данных; проводится предварительная обработка (очистка данных, поисковый анализ, отбор и т. д.); данные извлекаются по выбранному алгоритму; паттерны интерпретируются и оцениваются; последний шаг идет от паттернов к полученному таким образом новому знанию.
Существует несколько предложений и методов, каждый из которых имеет определенные характеристики и преимущества.
- Деревья решений : классификация, суммирование (например, по алгоритмам C4.5, CART, ID3 , Entropy , CHAID).
- Логический анализ и целостное программирование: классификация, изучение правил (например, LAD).
- Теория графов : кластеризация, классификация (например, B&C).
- Нейронные сети (ANN): классификация (например, персептрон, однослойные, многоуровневые, обратное распространение, сети R&F с радиальной базисной функцией, такие как SNNS и Nevprop).
- Байесовские методы: регрессия, классификация, байесовское обучение, байесовская сеть доверия, байесовские классификаторы, максимальное правдоподобие.
- Машины опорных векторов (SVM): классификация, распознавание образов (например, RSVM).
- Обнаружение ассоциации/образца: правила ассоциации и зависимости, последовательные партнеры (например, CN2).
Предварительная обработка
Прежде чем вы сможете использовать алгоритмы интеллектуального анализа данных , вам необходимо собрать целевой набор данных. Поскольку интеллектуальный анализ данных может обнаруживать только те модели, которые действительно присутствуют в данных, целевой набор данных должен быть достаточно большим, чтобы содержать эти модели, но при этом оставаться достаточно кратким, чтобы его можно было извлечь в течение приемлемого срока. [3] Распространенным источником данных является витрина данных или хранилище данных. Предварительная обработка необходима для анализа многомерных наборов данных перед интеллектуальным анализом данных. Затем набор линз очищают. Очистка данных удаляет наблюдения, содержащие шум, и наблюдения с отсутствующими данными.
Примеры
Что такое интеллектуальный анализ данных ?
- сделать поиск в сети по ключевому слову и классифицировать найденные документы по смысловому критерию (например "курьер": название газеты, профессия и т.д.);
- выяснить, какие клиенты с наибольшей вероятностью приобретут определенные продукты или рекламные кампании.
Что «не является» интеллектуальным анализом данных ?
- поиск номера телефона в списке;
- поищите в Интернете "отдых на Мальдивах".
Интеллектуальный анализ текста
Это особая форма интеллектуального анализа данных, в которой данные состоят из текстов на естественном языке: другими словами, «неструктурированных» документов. Интеллектуальный анализ текста сочетает языковые технологии с алгоритмами интеллектуального анализа данных. Цель всегда одна и та же: извлечение неявной информации, содержащейся в наборе документов.
Он получил значительное развитие благодаря достижениям в области методов обработки естественного языка (NLP на английском языке), доступности сложных приложений через поставщиков услуг приложений (ASP) и интересу к методам автоматического управления языком, проявленному как учеными, так и производителями программного обеспечения. и менеджерами поисковых систем .
Используемое программное обеспечение
- SPSS : SPSS Клементина
- SAS : SAS Enterprise Miner и SAS Text Miner
- БЫЛ
- Р.
- Oracle Data Miner
- Microsoft SQL Server : средства интеллектуального анализа данных СУБД производства Microsoft.
- Weka , датамайнинг на Java
- РапидМайнер
Последние разработки
Одним из последних достижений в области интеллектуального анализа данных является визуализация данных . Специализированный сектор инфографики визуализация данных связана не только с тем, чтобы сделать текст графически понятным, но и вступает в более непосредственную связь со структурированием баз данных и экспортом графики из данных.
Еще одним новым рубежом является интеллектуальный анализ социальных данных или анализ информации, генерируемой онлайновыми социальными сетями , такой как анализ настроений .
Приложения
Исследование рынка
Использование интеллектуального анализа данных в исследованиях рынка направлено на расширение знаний, на которых основываются процессы принятия решений . В бизнес-контексте интеллектуальный анализ данных считается частью процесса, который приводит к созданию хранилища данных . Это особенно эффективно для улучшения корпоративной информации, находящейся в этих больших хранилищах данных. Чтобы информация, извлеченная из существующих данных, была значимой и, следовательно, потенциально полезной, она должна быть:
- действителен (т. е. может воздействовать и на новые данные);
- ранее неизвестный;
- понятно.
В этом контексте паттерн — это не что иное, как представление ключевых отношений, которые обнаруживаются в процессе извлечения данных: повторяющиеся последовательности, однородность, появление правил и т. д. Например, если шаблон показывает, что клиенты из определенной демографической группы с большой вероятностью приобретут определенный продукт, то можно использовать выборочный запрос к хранилищу данных потенциальных покупателей для создания списка рекламных адресов.
Классический пример, часто используемый в университетских курсах, — это неуказанная сеть супермаркетов (вероятно, американских), которые, проанализировав чеки, обнаружили нечто, что иначе трудно было бы представить: люди, покупавшие подгузники, часто покупали больше пива, чем другие, поэтому самое дорогое пиво недалеко от подгузников может увеличить продажи. На самом деле те люди, у которых были маленькие дети, чаще проводили вечера дома у телевизора, попивая пиво, не имея возможности гулять с друзьями. Тем не менее, следует отметить, что неясно, о какой сети супермаркетов идет речь, и пример, хотя и превосходный для образовательных целей, а также широко используемый в журналистике, возможно, был выдуман, а также мог быть правдой.
Закон об авторском праве
Ситуация в Европе
В соответствии с европейскими законами об авторском праве и базах данных извлечение произведений, защищенных авторским правом (например, с помощью веб-майнинга) без разрешения владельца авторских прав является незаконным. Если база данных состоит из чистых данных в Европе, авторское право может отсутствовать, но могут существовать права на базу данных, так что интеллектуальный анализ данных становится объектом прав владельцев интеллектуальной собственности, защищенных Директивой о базах данных. По рекомендации обзора Hargreaves это привело к тому, что правительство Великобритании внесло поправки в свой закон об авторском праве в 2014 году, чтобы разрешить извлечение контента в качестве ограничения и исключения. [4] Великобритания стала второй страной в мире, сделавшей это после Японии , которая в 2009 году ввела исключение для интеллектуального анализа данных. Однако из-за ограничения Директивы об информационном обществе (2001 г.) исключение для Великобритании разрешает извлечение контента только в некоммерческих целях. Закон об авторском праве Великобритании также не позволяет отменять это положение договорными условиями.
В 2013 году Европейская комиссия способствовала обсуждению с заинтересованными сторонами интеллектуального анализа текста и данных под названием «Лицензии для Европы » [5] . Акцент на решении этой правовой проблемы, такой как лицензирование, а не ограничения и исключения, привел к тому, что представители университетов, исследователей, библиотек, групп гражданского общества и издателей открытого доступа покинули диалог с заинтересованными сторонами в мае 2013 года. [6]
Примечания
- ^ Идентификатор записи 917359 , на iate.europa.eu . Проверено 15 июля 2022 г. .
- ↑ Даниэле Медри: Большие данные и бизнес: продолжающаяся революция , на сайте Statisticsviews.com, Просмотры статистики , 21 октября 2013 г. Проверено 21 июня 2015 г. (архивировано из оригинала 17 июня 2015 г.) .
- ^ Наука о данных с нуля. Первые принципы работы с Python , О'Рейли, 2019 г., ISBN 9781492041139 .
- ↑ Британским исследователям предоставлено право на интеллектуальный анализ данных в соответствии с новыми законами Великобритании об авторском праве. (Архивировано из оригинала 9 июня 2014 г.) . Out-Law.com. Проверено 14 ноября 2014 г.
- ^ Лицензии для диалога с заинтересованными сторонами, структурированного в Европе, 2013 г., о Европейской комиссии . Проверено 14 ноября 2014 г.
- ^ Интеллектуальный анализ текста и данных: его важность и необходимость изменений в Европе , su Association of European Research Libraries . Проверено 14 ноября 2014 г. (архивировано из оригинала 29 ноября 2014 г.) .
Библиография
- П. Кабена; П. Хаджинян; Р. Стадлер; Дж. Верхиз; А. Занаси. Открытие интеллектуального анализа данных от концепции до реализации , Prentice Hall PTR 1997 г.
- Дулли Суси; Сара Фурини; Перон Эдмондо. Интеллектуальный анализ данных . , Спрингер Верлаг , 2009 г.
Связанные элементы
- Групповой анализ
- Очистка данных
- Хранилище данных
- Хранилище геоданных
- Алгоритм
- База знаний
- Восстановление (ИТ)
- Бизнес-аналитика
- Технологический майнинг
- Обработка данных
- инфографика
- Поиск информации
- Пытливый ум
- Переоснащение
- Тезаурус
- Затопленная паутина
- Большие данные
- Машинное обучение
- Правила ассоциации
Другие проекты
Wikimedia Commons содержит изображения или другие файлы интеллектуального анализа данных.
Внешние ссылки
- интеллектуальный анализ данных , на Sapienza.it , Де Агостини .
- ( EN ) Интеллектуальный анализ данных , в Encyclopedia Britannica , Encyclopædia Britannica, Inc.
- ( EN ) Работы, касающиеся интеллектуального анализа данных , в открытой библиотеке , Интернет-архиве .
- Архив УКИ . : общедоступный репозиторий данных для экспериментов по интеллектуальному анализу данных.
- Группа интеллектуального анализа данных . : Консорциум производителей программного обеспечения для разработки стандартов интеллектуального анализа данных.
- Веб-сайт базы данных и группы интеллектуального анализа данных на dbdmg.polito.it .
- (ИТ) Информационная статья о интеллектуальном анализе данных и кластеризации , на сайте mathematici.it .
- (IT) Одноминутный словарь . Архивировано из оригинала 17 ноября 2011 года. Проверено 2 октября 2019 года . : Интеллектуальный анализ данных в одноминутном видео