Примеры интеллектуального анализа данных - Examples of data mining

Интеллектуальный анализ данных , процесс обнаружения закономерностей в больших наборах данных , использовался во многих приложениях.

Игры

С начала 1960-х годов, с появлением оракулов для некоторых комбинаторных игр , также называемых базами таблиц (например, для шахмат 3x3) с любой начальной конфигурацией, точками и квадратами на маленькой доске, шестигранной маленькой доской и некоторыми эндшпилями в шахматах. , точки-и-квадраты, и шестигранник; открыта новая область интеллектуального анализа данных. Это извлечение человеческих стратегий из этих оракулов. Современные подходы к распознаванию образов, похоже, не в полной мере достигают высокого уровня абстракции, необходимого для успешного применения. Вместо этого для получения проницательных шаблонов используются обширные эксперименты с базами таблиц - в сочетании с интенсивным изучением базовых ответов на хорошо разработанные проблемы и со знанием предшествующего уровня техники (т. Е. Знаниями до создания базовых таблиц). Берлекамп (в точках и прямоугольниках и т. Д.) И Джон Нанншахматных эндшпилях ) являются яркими примерами исследователей, выполняющих эту работу, хотя они не участвовали и не участвуют в создании базы таблиц.

Бизнес

В бизнесе интеллектуальный анализ данных - это анализ исторической деловой активности, хранящейся в виде статических данных в базах данных хранилища данных. Цель - выявить скрытые закономерности и тенденции. Программное обеспечение интеллектуального анализа данных использует передовые алгоритмы распознавания образов, чтобы просеивать большие объемы данных, чтобы помочь в обнаружении ранее неизвестной стратегической бизнес-информации. Примеры того, для чего компании используют интеллектуальный анализ данных, включают выполнение анализа рынка для выявления новых пакетов продуктов, поиск первопричин производственных проблем, предотвращения ухода клиентов и привлечения новых клиентов, перекрестных продаж существующим клиентам и более точного профилирования клиентов. .

  • В современном мире компании стремительно собирают необработанные данные. Например, Walmart ежедневно обрабатывает более 20 миллионов транзакций в точках продаж. Эта информация хранится в централизованной базе данных, но была бы бесполезной без какого-либо программного обеспечения интеллектуального анализа данных для ее анализа. Если бы Walmart проанализировал свои данные о торговых точках с помощью методов интеллектуального анализа данных, они смогли бы определять тенденции продаж, разрабатывать маркетинговые кампании и более точно прогнозировать лояльность клиентов.
  • Категоризация товаров, доступных на сайте электронной коммерции, является фундаментальной проблемой. Правильная система категоризации элементов важна для взаимодействия с пользователем, поскольку она помогает определить элементы, относящиеся к нему при поиске и просмотре. Категоризацию элементов можно сформулировать как проблему контролируемой классификации в интеллектуальном анализе данных, где категории являются целевыми классами, а функции - словами, составляющими некоторое текстовое описание элементов. Один из подходов - сначала найти похожие группы и объединить их в скрытую группу. Теперь, получив новый элемент, сначала классифицируйте его в скрытую группу, которая называется классификацией грубого уровня. Затем выполните второй раунд классификации, чтобы найти категорию, к которой принадлежит товар.
  • Каждый раз, когда используется кредитная карта или карта постоянного покупателя или заполняется гарантийный талон, собираются данные о поведении пользователя. Многие люди считают, что объем информации, хранящейся о нас от таких компаний, как Google, Facebook и Amazon, беспокоит, и их беспокоит конфиденциальность. Хотя есть вероятность того, что наши личные данные будут использованы во вредных или нежелательных целях, они также используются для улучшения нашей жизни. Например, Ford и Audi надеются когда-нибудь собрать информацию о способах вождения клиентов, чтобы они могли рекомендовать более безопасные маршруты и предупреждать водителей об опасных дорожных условиях.
  • Интеллектуальный анализ данных в приложениях для управления взаимоотношениями с клиентами может существенно повлиять на чистую прибыль. Вместо того, чтобы случайно связываться с потенциальным клиентом или клиентом через колл-центр или отправлять почту, компания может сосредоточить свои усилия на потенциальных клиентах, которые, по прогнозам, с высокой вероятностью откликнутся на предложение. Можно использовать более сложные методы для оптимизации ресурсов в разных кампаниях, чтобы можно было предсказать, на какой канал и на какое предложение человек с наибольшей вероятностью откликнется (по всем потенциальным предложениям). Кроме того, для автоматизации рассылки можно использовать сложные приложения. После определения результатов интеллектуального анализа данных (потенциальный потенциальный клиент / клиент и канал / предложение) это «сложное приложение» может автоматически отправлять электронную или обычную почту. Наконец, в случаях, когда многие люди совершают действие без предложения, можно использовать « моделирование поддержки », чтобы определить, у каких людей больше всего откликов на предложение. Таким образом, моделирование роста позволяет маркетологам сосредоточить рассылки и предложения на убедительных людях, а не посылать предложения людям, которые купят продукт без предложения. Кластеризация данных также может использоваться для автоматического обнаружения сегментов или групп в наборе данных о клиентах.
  • Компании, использующие интеллектуальный анализ данных, могут увидеть окупаемость инвестиций, но они также осознают, что количество прогнозных моделей может быстро стать очень большим. Например, вместо того, чтобы использовать одну модель для прогнозирования количества оттока клиентов , компания может создать отдельную модель для каждого региона и типа клиента. В ситуациях, когда необходимо поддерживать большое количество моделей, некоторые предприятия обращаются к более автоматизированным методологиям интеллектуального анализа данных.
  • Интеллектуальный анализ данных может быть полезен отделам управления персоналом при определении характеристик их наиболее успешных сотрудников. Полученная информация - например, об университетах, которые посещают очень успешные сотрудники - может помочь HR-отделу соответствующим образом сосредоточить усилия по подбору персонала. Кроме того, приложения стратегического управления предприятием помогают компании преобразовывать цели корпоративного уровня, такие как целевые показатели прибыли и доли маржи, в операционные решения, такие как производственные планы и уровни персонала.
  • Анализ рыночной корзины использовался для определения моделей покупок Альфа-Потребителя . Анализ данных, собранных об этом типе пользователей, позволяет компаниям прогнозировать будущие тенденции покупок и прогнозировать потребности в предложениях.
  • Интеллектуальный анализ данных - очень эффективный инструмент в индустрии каталожного маркетинга. Каталогизаторы имеют обширную базу данных истории транзакций своих клиентов для миллионов клиентов, насчитывающих несколько лет. Инструменты интеллектуального анализа данных могут выявить закономерности среди клиентов и помочь выявить наиболее вероятных клиентов, которые отреагируют на предстоящие рассылки.
  • Интеллектуальный анализ данных для бизнес-приложений может быть интегрирован в сложный процесс моделирования и принятия решений. LIONsolver использует реактивную бизнес-аналитику (RBI) для защиты «целостного» подхода, который объединяет интеллектуальный анализ данных, моделирование и интерактивную визуализацию в процесс непрерывного поиска и непрерывных инноваций, основанный на человеческом и автоматизированном обучении.
  • В области принятия решений подход RBI использовался для сбора знаний, которые постепенно приобретаются от лиц, принимающих решения, и затем соответствующим образом самостоятельно настраивать метод принятия решений. Отношение между качеством системы интеллектуального анализа данных и объемом инвестиций, которые лицо, принимающее решения, готово сделать, было формализовано путем предоставления экономической точки зрения на ценность «извлеченных знаний» с точки зрения их отдачи для организации. Структура классификации была применена к реальной линии по производству полупроводниковых пластин, где были разработаны правила принятия решений для эффективного мониторинга и управления линией производства полупроводниковых пластин.
  • Пример интеллектуального анализа данных, связанный с производственной линией интегральных схем (ИС), описан в статье «Анализ данных тестирования ИС для оптимизации тестирования СБИС». В этой статье описывается применение интеллектуального анализа данных и анализа решений к проблеме функционального тестирования на уровне кристалла. Упомянутые эксперименты демонстрируют возможность применения системы анализа исторических данных испытаний штампов для создания вероятностной модели схем отказа штампов. Затем эти шаблоны используются для принятия решения в режиме реального времени, что нужно тестировать следующим, а когда прекратить тестирование. На основе экспериментов с историческими данными испытаний было показано, что эта система имеет потенциал для увеличения прибыли от зрелых продуктов IC. Другие примеры применения методологий интеллектуального анализа данных в среде производства полупроводников предполагают, что методологии интеллектуального анализа данных могут быть особенно полезны, когда данных мало, а различные физические и химические параметры, влияющие на процесс, демонстрируют очень сложные взаимодействия. Другое значение состоит в том, что онлайн-мониторинг процесса производства полупроводников с использованием интеллектуального анализа данных может быть очень эффективным.

Наука и инженерия

В последние годы интеллектуальный анализ данных широко используется в таких областях науки и техники, как биоинформатика , генетика , медицина , образование и электроэнергетика .

  • При изучении генетики человека анализ последовательностей помогает решить важную задачу - понять взаимосвязь между индивидуальными вариациями в последовательности ДНК человека и вариабельностью восприимчивости к болезням. Проще говоря, он направлен на то, чтобы выяснить, как изменения в последовательности ДНК человека влияют на риски развития распространенных заболеваний, таких как рак , что имеет большое значение для улучшения методов диагностики, предотвращения и лечения этих заболеваний. Один из методов интеллектуального анализа данных, который используется для выполнения этой задачи, известен как многофакторное уменьшение размерности .
  • В области электроэнергетики методы интеллектуального анализа данных широко используются для мониторинга состояния высоковольтного электрооборудования. Целью мониторинга состояния является получение ценной информации, например, о состоянии изоляции (или других важных параметрах безопасности). Методы кластеризации данных , такие как самоорганизующаяся карта (SOM), были применены для мониторинга и анализа вибрации устройств РПН трансформатора. Используя мониторинг вибрации, можно наблюдать, что каждая операция переключения ответвлений генерирует сигнал, который содержит информацию о состоянии контактов переключателя ответвлений и механизмов привода. Очевидно, что разные положения ответвлений будут генерировать разные сигналы. Однако между сигналами нормального состояния для одного и того же положения РПН наблюдались значительные различия. SOM применялся для обнаружения аномальных состояний и выдвижения гипотез о природе аномалий.
  • Методы интеллектуального анализа данных применялись для анализа растворенных газов (DGA) в силовых трансформаторах . DGA как средство диагностики силовых трансформаторов существует уже много лет. Такие методы, как SOM, были применены для анализа сгенерированных данных и определения тенденций, которые не очевидны для стандартных методов соотношения DGA (таких как треугольник Дюваля).
  • В образовательных исследованиях, где интеллектуальный анализ данных использовался для изучения факторов, побуждающих студентов к выбору поведения, ограничивающего их обучение, и для понимания факторов, влияющих на удержание студентов в университете. Аналогичным примером социального применения интеллектуального анализа данных является его использование в системах поиска экспертных знаний , посредством которых дескрипторы человеческого опыта извлекаются, нормализуются и классифицируются, чтобы облегчить поиск экспертов, особенно в научных и технических областях. Таким образом, интеллектуальный анализ данных может облегчить институциональную память .
  • Методы интеллектуального анализа биомедицинских данных с помощью онтологий предметной области , интеллектуального анализа данных клинических испытаний и анализа трафика с использованием SOM.
  • При наблюдении за побочными реакциями на лекарственные препараты Центр мониторинга Упсалы с 1998 года использовал методы сбора данных для регулярного скрининга моделей отчетности, указывающих на возникающие проблемы безопасности лекарств, в глобальной базе данных ВОЗ, содержащей 4,6 миллиона случаев подозреваемых побочных реакций на лекарства . Недавно подобная методология была разработана для поиска в больших коллекциях электронных медицинских карт временных паттернов, связывающих рецепты на лекарства с медицинскими диагнозами.
  • Интеллектуальный анализ данных применялся к программным артефактам в области разработки программного обеспечения : Mining Software Repositories .
  • В области микробиологии методы интеллектуального анализа данных использовались для прогнозирования популяционного поведения бактерий в продуктах питания.

Права человека

Интеллектуальный анализ данных в государственных отчетах - особенно в отчетах системы правосудия (например, судов, тюрем) - позволяет обнаруживать систематические нарушения прав человека в связи с созданием и публикацией недействительных или поддельных юридических документов различными государственными учреждениями.

Интеллектуальный анализ медицинских данных

Некоторые алгоритмы машинного обучения могут применяться в медицине в качестве диагностических инструментов второго мнения и в качестве инструментов на этапе извлечения знаний в процессе открытия знаний в базах данных . Один из этих классификаторов (называемый классификатором обучения прототипов ( PEL-C )) способен обнаруживать синдромы, а также нетипичные клинические случаи.

Современная область медицины, использующая процесс интеллектуального анализа данных, - это метаболомика , которая представляет собой исследование и изучение биологических молекул и того, как охарактеризовано их взаимодействие с жидкостями организма, клетками, тканями и т. Д. Метаболомика - это предмет, в котором очень много данных, и она часто включает в себя анализ огромных объемов нерелевантных данных, прежде чем делать какие-либо выводы. Интеллектуальный анализ данных позволил этой относительно новой области медицинских исследований значительно расшириться за последнее десятилетие и, вероятно, станет методом, в котором будут найдены новые исследования в рамках предмета.

В 2011 году Верховный суд США вынес решение по делу Соррелл против IMS Health, Inc. , согласно которому аптеки могут передавать информацию сторонним компаниям. Такая практика была разрешена 1-й поправкой к Конституции , защищающей «свободу слова». Однако принятие Закона о медицинских информационных технологиях для экономического и клинического здоровья (HITECH Act) помогло инициировать внедрение электронной медицинской карты (EHR) и вспомогательных технологий в Соединенных Штатах. Закон о HITECH был подписан 17 февраля 2009 года как часть Закона о восстановлении и реинвестировании Америки (ARRA) и помог открыть дверь для интеллектуального анализа медицинских данных. До подписания этого закона, по оценкам, только 20% врачей в США использовали электронные карты пациентов. Сорен Брунак отмечает, что «история болезни пациента становится максимально информативной» и, таким образом, «максимизирует возможности интеллектуального анализа данных». Таким образом, электронные карты пациентов расширяют возможности интеллектуального анализа медицинских данных, открывая тем самым доступ к обширному источнику анализа медицинских данных.

Интеллектуальный анализ пространственных данных

Интеллектуальный анализ пространственных данных - это применение методов интеллектуального анализа данных к пространственным данным. Конечная цель интеллектуального анализа пространственных данных - найти закономерности в данных с учетом географии. До сих пор интеллектуальный анализ данных и географические информационные системы (ГИС) существовали как две отдельные технологии, каждая со своими собственными методами, традициями и подходами к визуализации и анализу данных. В частности, большинство современных ГИС имеют только самые базовые функции пространственного анализа. Огромный взрыв данных с географической привязкой, вызванный развитием информационных технологий, цифровых карт, дистанционного зондирования и глобального распространения ГИС, подчеркивает важность разработки индуктивных подходов к географическому анализу и моделированию, основанных на данных.

Интеллектуальный анализ данных предлагает большие потенциальные преимущества для принятия решений на основе ГИС. В последнее время задача интеграции этих двух технологий приобрела критически важное значение, особенно в связи с тем, что различные организации государственного и частного секторов, обладающие огромными базами данных с тематическими и географически привязанными данными, начинают осознавать огромный потенциал содержащейся в них информации. Среди этих организаций:

  • Офисы, требующие анализа или распространения статистических данных с географической привязкой
  • Службы общественного здравоохранения ищут объяснения кластеризации болезней
  • Экологические агентства, оценивающие влияние изменения моделей землепользования на изменение климата
  • Геомаркетинговые компании проводят сегментацию клиентов на основе пространственного расположения.

Проблемы пространственного анализа данных: репозитории геопространственных данных, как правило, очень большие. Более того, существующие наборы данных ГИС часто разделяются на компоненты объектов и атрибутов, которые обычно архивируются в гибридных системах управления данными. Алгоритмические требования существенно различаются для управления реляционными (атрибутивными) данными и для управления топологическими (характеристическими) данными. С этим связан диапазон и разнообразие форматов географических данных, которые создают уникальные проблемы. Революция цифровых географических данных создает новые типы форматов данных, выходящие за рамки традиционных «векторных» и «растровых» форматов. Репозитории географических данных все чаще включают плохо структурированные данные, такие как изображения и мультимедийные данные с географической привязкой.

Есть несколько важных исследовательских задач в области открытия географических знаний и интеллектуального анализа данных. Миллер и Хан предлагают следующий список новых исследовательских тем в этой области:

  • Разработка и поддержка хранилищ географических данных (GDW) : Пространственные свойства часто сводятся к простым пространственным атрибутам в основных хранилищах данных. Создание интегрированного GDW требует решения проблем взаимодействия пространственных и временных данных, включая различия в семантике, системах привязки, геометрии, точности и положении.
  • Лучшее пространственно-временное представление при открытии географических знаний : современные методы обнаружения географических знаний (GKD) обычно используют очень простые представления географических объектов и пространственных отношений. Методы интеллектуального анализа географических данных должны распознавать более сложные географические объекты (т. Е. Линии и многоугольники) и взаимосвязи (т. Е. Неевклидовы расстояния, направление, связность и взаимодействие через приписываемое географическое пространство, такое как местность). Кроме того, измерение времени необходимо более полно интегрировать в эти географические представления и отношения.
  • Открытие географических знаний с использованием различных типов данных : следует разработать методы GKD, которые могут обрабатывать различные типы данных, помимо традиционных растровых и векторных моделей, включая изображения и мультимедийные данные с географической привязкой, а также динамические типы данных (видеопотоки, анимация).

Интеллектуальный анализ временных данных

Данные могут содержать атрибуты, созданные и записанные в разное время. В этом случае для поиска значимых взаимосвязей в данных может потребоваться рассмотрение временного порядка атрибутов. Временные отношения могут указывать на причинную связь или просто на ассоциацию.

Сенсорный анализ данных

Сети беспроводных датчиков могут использоваться для облегчения сбора данных для интеллектуального анализа пространственных данных для различных приложений, таких как мониторинг загрязнения воздуха. Особенностью таких сетей является то, что близлежащие узлы датчиков, контролирующие объект окружающей среды, обычно регистрируют аналогичные значения. Такой вид избыточности данных из-за пространственной корреляции между наблюдениями датчиков вдохновляет на создание методов внутрисетевого агрегирования и интеллектуального анализа данных. Измеряя пространственную корреляцию между данными, полученными с помощью различных датчиков, можно разработать широкий класс специализированных алгоритмов для разработки более эффективных алгоритмов интеллектуального анализа пространственных данных.

Визуальный анализ данных

В процессе перехода от аналогового к цифровому, большие наборы данных были созданы, собраны и сохранены, выявляя статистические закономерности, тенденции и информацию, которая скрыта в данных, с целью построения прогнозных закономерностей. Исследования показывают, что визуальный анализ данных выполняется быстрее и интуитивно понятнее, чем традиционный интеллектуальный анализ данных. См. Также Компьютерное зрение .

Интеллектуальный анализ музыкальных данных

Методы интеллектуального анализа данных и, в частности, анализ совместной встречаемости использовались для обнаружения соответствующих сходств между музыкальными корпусами (радиосписки, базы данных компакт-дисков) для целей, в том числе для более объективной классификации музыки по жанрам .

Наблюдение

Правительство США использовало интеллектуальный анализ данных. Программы включают программу Total Information Awareness (TIA), Secure Flight (ранее известную как компьютерная система предварительного отбора пассажиров ( CAPPS II )), Analysis, Dissemination, Visualization, Insight, Semantic Enhancement ( ADVISE ) и Multi-State Anti- Обмен информацией о терроризме ( MATRIX ). Эти программы были прекращены из-за разногласий по поводу того, нарушают ли они 4-ю поправку к Конституции Соединенных Штатов, хотя многие программы, которые были созданы в соответствии с ними, по-прежнему финансируются разными организациями или под разными названиями.

В контексте борьбы с терроризмом два наиболее вероятных метода интеллектуального анализа данных - это «анализ закономерностей» и «анализ данных на основе предмета».

Анализ шаблонов

«Анализ шаблонов» - это метод интеллектуального анализа данных, который включает в себя поиск существующих шаблонов в данных. В этом контексте шаблоны часто означают правила ассоциации . Первоначальная мотивация для поиска ассоциативных правил возникла из желания проанализировать данные о транзакциях в супермаркете, то есть изучить поведение покупателей в отношении приобретенных продуктов. Например, правило ассоциации «пиво ⇒ картофельные чипсы (80%)» гласит, что четыре из пяти покупателей, купивших пиво, также купили картофельные чипсы.

В контексте поиска паттернов как инструмента выявления террористической деятельности Национальный исследовательский совет дает следующее определение: «Анализ данных на основе паттернов ищет паттерны (включая паттерны аномальных данных), которые могут быть связаны с террористической деятельностью - эти паттерны могут быть рассматриваются как небольшие сигналы в большом океане шума ". Анализ шаблонов включает в себя новые области, такие как поиск музыкальной информации (MIR), где шаблоны, наблюдаемые как во временной, так и во вневременной областях, импортируются в классические методы поиска знаний.

Предметный анализ данных

«Интеллектуальный анализ данных на основе предмета» - это метод интеллектуального анализа данных, включающий поиск ассоциаций между людьми в данных. В контексте борьбы с терроризмом Национальный исследовательский совет дает следующее определение: "При добыче данных на основе предмета используется исходный индивидуальный или иной элемент данных, который считается, на основе другой информации, представляющим большой интерес, и цель состоит в том, чтобы определить какие другие лица или финансовые операции или движения и т. д. связаны с этим исходным данным ».

Сетка знаний

Обнаружение знаний «в сети» обычно относится к обнаружению знаний в открытой среде с использованием концепций грид-вычислений , что позволяет пользователям интегрировать данные из различных онлайн-источников данных, а также использовать удаленные ресурсы для выполнения своих задач интеллектуального анализа данных. Самым ранним примером была сеть Discovery , разработанная в Имперском колледже Лондона , которая получила награду «Самое инновационное приложение с интенсивным использованием данных» на конференции и выставке ACM SC02 (Supercomputing 2002), основанной на демонстрации полностью интерактивного распределенного приложения для обнаружения знаний. для приложения биоинформатики. Другие примеры включают работу, проведенную исследователями из Университета Калабрии , которые разработали архитектуру Knowledge Grid для распределенного открытия знаний, основанную на грид-вычислениях .

использованная литература

внешние ссылки