Эффект дизайна - Design effect
В методологии обследования , то конструкция эффект ( как правило , обозначается , как или ) представляет собой отношение между дисперсиями из двух оценок к некоторому параметру интереса. В частности, отношение фактической дисперсии оценщика, основанного на выборке из некоторого плана выборки , к дисперсии альтернативного оценщика, которая будет рассчитана (гипотетически) с использованием выборки из простой случайной выборки (SRS) с тем же номером. элементов. Он измеряет ожидаемое влияние структуры проекта (например, корреляции между кластерами наблюдений, неравная вероятность выборки и т. Д.) На дисперсию некоторого интересующего оценщика. Эффект схемы - это положительное действительное число, которое может указывать на инфляцию ( ) или дефляцию ( ) в дисперсии оценки для некоторого параметра, что связано с исследованием, не использующим SRS (с , когда дисперсии идентичны).
Deff может быть полезен, когда исследование включает в себя сложную выборку, такую как кластерная выборка , стратифицированная выборка , кластерное рандомизированное контролируемое исследование , непропорциональная выборка, неполный охват, отсутствие ответов, статистическая корректировка данных и т. Д. в расчетах размера выборки , количественное определение представителя выборки (для целевой совокупности), а также для корректировки (часто раздувания) дисперсии некоторого оценщика (в случаях, когда мы можем вычислить дисперсию этой оценщика, предполагая SRS).
Термин «эффект схемы» был впервые введен Лесли Кишом в 1965 году. С тех пор в литературе было предложено множество расчетов (и оценок) для описания влияния известного плана выборки на увеличение / уменьшение дисперсии оценок. представляет интерес. В общем, эффект схемы варьируется в зависимости от статистики интересов, такой как общее или относительное среднее ; также имеет значение, коррелирует ли план (например, вероятности выбора) с интересующим результатом. И, наконец, на него влияет распределение самого результата. Все это следует учитывать при оценке и использовании эффекта дизайна на практике.
Определения
Deff
Эффект схемы (Deff, или ) - это отношение двух теоретических дисперсий для оценок некоторого параметра ( ):
- В числителе - фактическая дисперсия для оценщика некоторого параметра ( ) в заданном плане выборки ;
- В знаменателе стоит дисперсия, предполагающая тот же размер выборки, но если бы выборка была получена с использованием оценщика, мы бы использовали простую случайную выборку без замены ( ).
Так что:
Иными словами, на то, насколько увеличилась (или уменьшилась в некоторых случаях) дисперсия из-за того, что наша выборка была составлена и скорректирована в соответствии с конкретным планом выборки (например, с использованием весов или других мер), как если бы вместо этого выборка было из простой случайной выборки (без замены). Существует множество способов расчета , в зависимости от интересующего параметра (например: общая совокупность, среднее значение совокупности, квантили, соотношение количеств и т. Д.), Используемого средства оценки и схемы выборки (например: кластерная выборка, стратифицированная выборка, пост- стратификация, многоступенчатая выборка и др.).
Для оценки среднего генерального значения Deff (для некоторого плана выборки p) составляет:
Где n - размер выборки, f - доля выборки из генеральной совокупности (n / N), (1-f) - (квадрат) поправка конечной совокупности (FPC), а также несмещенная дисперсия выборки .
Оценки единичной дисперсии (или дисперсии элемента) производятся при умножении Deff на дисперсию элемента, чтобы учесть все сложности плана выборки.
Обратите внимание, как определение Deff основано на параметрах генеральной совокупности, которые мы часто не знаем (то есть: дисперсии оценок при двух разных схемах выборки). Процесс оценки Deff для конкретных конструкций будет описан в следующем разделе .
Общая формула для (теоретического) эффекта схемы при оценке общего (а не среднего) для некоторого дизайна приведена в Cochran 1977.
Ловко
Величина, связанная с Deff, предложенная Кишем в 1995 году, называется Deft (Design Effect Factor). Он определяется на основе квадратного корня из отношений дисперсии, а также в знаменателе используется простая случайная выборка с заменой (srswr), а не без замены (srswor):
В этом более позднем определении (предложенном в 1995 г. по сравнению с 1965 г.) утверждалось, что srs «без замены» (с его положительным влиянием на дисперсию) следует учесть в определении эффекта схемы, поскольку он является частью плана выборки. Это также более напрямую связано с использованием вывода (поскольку мы часто используем + Z * DE * SE, а не + Z * DE * VAR при создании доверительных интервалов ). Кроме того, в некоторых ситуациях сложнее вычислить поправку на конечную популяцию (FPC). Но для многих случаев, когда популяция очень большая, Deft (почти) является квадратным корнем из Deff ( ).
Первоначальное намерение Deft состояло в том, чтобы «выразить эффекты дизайна выборки за пределами элементарной изменчивости , удалив как единицы измерения, так и размер выборки как мешающие параметры», это сделано для того, чтобы сделать эффект дизайна обобщаемым (актуальным для) множество статистических данных и переменных в рамках одного опроса (и даже между опросами). Однако последующие работы показали, что расчет эффекта схемы для таких параметров, как общая численность населения или среднее значение, зависит от изменчивости показателя результата, что ограничивает первоначальное стремление Киша к этому показателю. Однако это утверждение может приблизительно (то есть: при некоторых условиях) быть верным для взвешенного среднего .
Эффективный размер выборки
Эффективный размер выборки , также определяется Киса в 1965 году, это оригинальный размер образца , деленный на дизайн - эффекта. Эта величина отражает размер выборки, необходимый для достижения текущей дисперсии оценщика (для некоторого параметра) с существующим планом, если бы план выборки (и соответствующий оценщик параметров) был основан на простой случайной выборке .
А именно:
Другими словами, он говорит о том, сколько ответов у нас осталось при использовании оценщика, который правильно корректирует эффект схемы от схемы выборки. Например, использование взвешенного среднего с обратной вероятностью взвешивания вместо простого среднего .
Эффект дизайна для известных планов выборки
Дизайн выборки определяет, как следует рассчитывать дизайн-эффект
Различные планы выборки существенно различаются по своему влиянию на оценки (например, среднее значение) с точки зрения смещения и дисперсии.
Например, в случае кластерной выборки единицы могут иметь равные или неравные вероятности выбора, независимо от их внутриклассовой корреляции (и их отрицательного эффекта увеличения дисперсии наших оценок). В случае стратифицированной выборки вероятности могут быть равными (EPSEM) или неравными. Но, тем не менее, использование априорной информации о размере страты в генеральной совокупности на этапе выборки может дать статистическую эффективность наших оценок. Например: если мы знаем, что пол коррелирует с нашим интересующим результатом, а также знаем, что соотношение мужчин и женщин для некоторой популяции составляет 50% -50%. Затем, если мы удостоверились, что выбрали ровно половину каждого пола, мы таким образом уменьшили дисперсию оценок, потому что мы удалили вариативность, вызванную неравным соотношением мужчин и женщин в нашей выборке. Наконец, в случае корректировки на неполный охват, неполучение ответов или некоторое разбиение населения по слоям (недоступное на этапе выборки), мы можем использовать статистические процедуры (например, постстратификация и другие). Результат таких процедур может привести к оценкам вероятностей выборки, которые аналогичны или сильно отличаются от истинных вероятностей выборки единиц. Качество этих оценок зависит от качества вспомогательной информации и случайных допущений, использованных при их создании. Даже когда этим оценщикам вероятности выборки (оценкам склонности) удается уловить большинство явлений, которые их породили, влияние вероятностей выбора переменных на оценщики может быть небольшим или большим, в зависимости от данных (подробности в следующем разделе).
Из-за большого разнообразия планов выборки (с влиянием или без влияния на вероятности неравенства выбора) были разработаны различные формулы для определения потенциального эффекта плана, а также для оценки правильной дисперсии оценок. Иногда эти различные эффекты схемы могут быть объединены вместе (как в случае неравной вероятности выбора и кластерной выборки, более подробная информация представлена в следующих разделах). Следует ли использовать эти формулы или просто предполагать SRS, зависит от ожидаемой величины уменьшенной систематической ошибки по сравнению с увеличением дисперсии оценки (а также от накладных расходов, связанных с методологической и технической сложностью).
Неравные вероятности выбора
Источники неравных вероятностей выбора
Существуют различные способы выборки единиц, чтобы каждая единица имела одинаковую вероятность выбора. Такие методы называются методами равновероятной выборки (EPSEM). Некоторые из более простых методов включают простую случайную выборку (SRS, с заменой или без нее) и систематическую выборку для получения фиксированного размера выборки. Существует также выборка Бернулли со случайным размером выборки. Более продвинутые методы, такие как стратифицированная выборка и кластерная выборка, также могут быть разработаны для EPSEM. Например, при выборке кластера мы можем убедиться, что отбираем каждый кластер с вероятностью, пропорциональной его размеру, а затем измеряем все единицы внутри кластера. Более сложный метод выборки кластеров состоит в использовании двухэтапной выборки, при которой мы отбираем кластеры на первом этапе (как и раньше, пропорционально размеру кластера), а выборку из каждого кластера на втором этапе, используя SRS с фиксированной пропорцией ( Например: образец половины кластера).
В своих работах Киш и другие выделяют несколько известных причин, которые приводят к неравным вероятностям выбора:
-
Непропорциональная выборка из-за рамки или процедуры отбора. Это происходит, когда исследователь целенаправленно строит свою выборку таким образом, чтобы больше / меньше выборки конкретных подгрупп или кластеров. Это может произойти во многих случаях. Например:
- При стратифицированной выборке, когда известно, что единицы из одних страт имеют большую дисперсию, чем другие страты. В таких случаях намерение исследователя может заключаться в использовании этих предварительных знаний о дисперсии между слоями, чтобы уменьшить общую дисперсию оценки некоторого интересующего параметра уровня популяции (например, среднего). Это может быть достигнуто с помощью стратегии, известной как оптимальное распределение , при которой страта подвергается избыточной выборке пропорционально более высокому стандартному отклонению и более низкой стоимости выборки (то есть: где - стандартное отклонение результата в , и относится к стоимости найма одного элемент из ). Пример оптимального распределения является распределением оптимальной Нейман в котором, когда стоимость фиксирована для набора каждого слоя, образец размера: . Где суммирование ведется по всем слоям; n - общий размер выборки; - размер выборки для страты h ; относительный размер страты h по сравнению со всей популяцией N ; и - стандартная ошибка в страте h . Идея, связанная с оптимальным дизайном, - это оптимальный экспериментальный дизайн .
- Если есть интерес к сравнению двух слоев (например, людей из двух конкретных социально-демографических групп или из двух регионов и т. Д.), В этом случае меньшая группа может быть отобранной с избыточной выборкой. Таким образом, дисперсия оценщика, сравнивающего две группы, уменьшается.
- В выборке кластера могут быть кластеры разного размера, но измеряются выборки процедур из всех кластеров, использующих SRS , и все элементы в кластере (например, если размеры кластера не известны заранее на этапе выборки).
- При использовании двухэтапной выборки, так что на первом этапе кластеры отбираются пропорционально их размеру (иначе: вероятность PPS, пропорциональная размеру), но затем на втором этапе только определенное фиксированное количество единиц (например, один или два ) выбираются из каждого кластера - это может произойти из соображений удобства / бюджета. Аналогичный случай возникает, когда на первом этапе пытаются выполнить выборку с использованием PPS, но количество элементов в каждой единице неточно (так что у некоторого меньшего кластера может быть больше шансов быть выбранным, чем следовало бы. И наоборот для кластеры большего размера со слишком малой вероятностью выборки). В таких случаях, чем больше ошибки в структуре выборки на первом этапе, тем больше будет необходимых вероятностей неравного выбора.
- Когда структура, используемая для выборки, включает дублирование некоторых элементов, что приводит к тому, что некоторые элементы имеют большую вероятность, чем другие, для выборки (например: если структура выборки была создана путем объединения нескольких списков. Или если набор пользователей из нескольких рекламных каналов - в котором некоторые пользователи доступны для набора из нескольких каналов, в то время как другие доступны для набора только из одного из каналов). В каждом из этих случаев разные единицы будут иметь разную вероятность выборки, что делает эту процедуру выборки не EPSEM.
- Когда комбинируются несколько разных сэмплов / кадров. Например, при запуске разных рекламных кампаний по набору респондентов. Или при объединении результатов нескольких исследований, проведенных разными исследователями и / или в разное время (например, метаанализ ).
- Когда происходит непропорциональная выборка из-за решений по составлению выборки, исследователь может (иногда) иметь возможность отследить решение и точно рассчитать точную вероятность включения. Когда эти вероятности выбора трудно отследить, их можно оценить с помощью некоторой модели оценки склонности в сочетании с информацией из вспомогательных переменных (например: возраст, пол и т. Д.).
- Непокрытие . Это происходит, например, если люди отбираются на основе некоторого заранее определенного списка, который не включает всех людей в популяции (например, телефонная книга или использование рекламы для набора людей для участия в опросе). Эти недостающие единицы отсутствуют из-за того , что не удалось создать основу выборки , в отличие от преднамеренного исключения некоторых людей (например, несовершеннолетних, людей, которые не могут голосовать и т. Д.). Влияние неполного охвата на вероятность выборки считается трудным для измерения (и корректировки) в различных ситуациях обследования, если не сделаны сильные допущения.
- Отсутствие ответа . Это относится к невозможности получения измерений на выбранных единицах, которые предназначены для измерения. Причины отсутствия ответа разнообразны и зависят от контекста. Человек может быть временно недоступен, например, если он не может поднять трубку во время опроса. Человек также может отказаться отвечать в опросе по разным причинам, например: разные тенденции людей из разных этнических / демографических / социально-экономических групп отвечать в целом; недостаточный стимул тратить время или делиться данными; название учреждения, проводящего опрос; неспособность ответить (например: из-за болезни, неграмотности или языкового барьера); респондент не найден (например: они переехали в квартиру); ответ был потерян / уничтожен во время кодирования или передачи (то есть: ошибка измерения). В контексте опросов эти причины могут быть связаны с ответом на весь опрос или только на конкретные вопросы.
- статистические корректировки . Они могут включать такие методы, как пост-стратификацию , риски или предрасположенность балл (оценку) моделей - используются для выполнения одноранговой регулировки образца к некоторым известным (или оценке) размерам слоя. Такие процедуры используются для смягчения проблем при выборке, начиная от ошибки выборки , неполного охвата основы выборки и заканчивая неполучением ответов. Например, если используется простая случайная выборка, пост-стратификация (с использованием некоторой вспомогательной информации) не предлагает оценщика, который всегда лучше, чем просто невзвешенный оценщик. Однако его можно рассматривать как более «надежную» оценку. В качестве альтернативы, эти методы можно использовать для того, чтобы сделать выборку более похожей на некоторые целевые «контроли» (например, интересующую популяцию), процесс, также известный как «стандартизация». В таких случаях эти корректировки помогают обеспечить объективные оценки (часто за счет увеличения дисперсии, как показано в следующих разделах). Если исходная выборка не является вероятностной выборкой , то корректировки после стратификации аналогичны выборке по специальной квоте .
Когда план выборки полностью известен (что приводит к некоторой вероятности выбора для некоторого элемента из страты h), а отсутствие ответа поддается измерению (т. Е. Мы знаем, что только наблюдения дали ответ в страте h), тогда точно известный вес обратной вероятности может быть вычислено для каждого элемент I из пластовой ч с использованием: . Иногда для оценки вероятности отбора используется статистическая корректировка, такая как постстратификация или сгребание. Например: при сравнении имеющейся у нас выборки с той же целевой популяцией, также известной как сопоставление с контролем. Процесс оценки может быть сосредоточен только на приведении существующего населения в альтернативное население (например, при попытке экстраполировать панель, составленную из нескольких регионов, на всю страну). В таком случае корректировка может быть сосредоточена на некотором калибровочном коэффициенте, и веса будут рассчитаны как . Однако в других случаях неполный охват и неполучение ответов моделируются за один раз в рамках статистической корректировки, которая приводит к оценке общей вероятности выборки (скажем ). В таком случае вес просто: . Обратите внимание, что при использовании статистических корректировок часто оценивается на основе какой-либо модели. Формулировка в следующих разделах предполагает, что это известно, что неверно для статистических корректировок (поскольку они есть только у нас ). Однако, если предполагается, что ошибка оценки очень мала, следующие разделы можно использовать, как если бы она была известна. Верность этого предположения зависит от размера выборки, используемой для моделирования, и ее следует помнить во время анализа.
Когда вероятности выбора могут быть разными, размер выборки является случайным, а вероятности попарного выбора независимы, мы называем это пуассоновской выборкой .
«На основе дизайна» и «на основе модели» для описания свойств оценщиков
При корректировке на неравный вероятностный выбор с помощью «весов отдельных случаев» (например, обратного взвешивания вероятностей) мы получаем различные типы оценок для представляющих интерес величин. Такие оценщики, как оценщик Хорвица – Томпсона, дают несмещенные оценщики (если вероятности выбора действительно известны или приблизительно известны) для общего и среднего значения генеральной совокупности. Девиль и Сэрндал (1992) придумали термин « калибровочный оценщик » для оценщиков, использующих веса, удовлетворяющие некоторым условиям, например, наличие суммы весов, равной размеру популяции. И в более общем смысле, взвешенная сумма весов равна некоторому количеству вспомогательной переменной: (например: сумма взвешенных возрастов респондентов равна размеру населения в каждом возрастном сегменте).
Два основных способа спорить о свойствах калибровочных оценщиков:
- на основе рандомизации (или на основе плана выборки) - в этих случаях веса ( ) и значения интересующего результата , которые измеряются в выборке, считаются известными. В этой структуре существует различие в (известных) значениях результата (Y). Однако единственная случайность зависит от того, какой из элементов в генеральной совокупности был выбран в выборку (часто обозначается как получение 1, если элемент находится в выборке, и 0, если это не так). Для простой случайной выборки каждое будет распределением Бернулли с некоторым параметром . Для общего EPSEM (равновероятная выборка) все еще будет бернулли с некоторым параметром , но они больше не будут независимыми случайными величинами. Для чего-то вроде постстратификации количество элементов в каждой страте можно смоделировать как полиномиальное распределение с разными вероятностями включения для каждого элемента, принадлежащего к некоторой страте . В этих случаях размер выборки может быть случайной величиной.
- на основе модели - в этих случаях выборка фиксирована, веса фиксированы, но интересующий результат рассматривается как случайная величина. Например, в случае постстратификации результат может быть смоделирован как некоторая функция линейной регрессии, где независимые переменные являются индикаторными переменными, отображающими каждое наблюдение в его соответствующие страты, а изменчивость связана с ошибкой.
Как мы увидим позже, некоторые доказательства в литературе опираются на структуру, основанную на рандомизации, в то время как другие сосредоточены на перспективе, основанной на модели. При переходе от среднего к средневзвешенному добавляется больше сложности. Например, в контексте методологии обследования часто сама численность населения считается неизвестной величиной, которая оценивается. Таким образом, вычисление средневзвешенного значения фактически основано на оценке отношения , с оценкой общей суммы в числителе и оценкой размера генеральной совокупности в знаменателе (что усложняет расчет дисперсии).
Общие типы весов
Существует множество типов (и подтипов) весов с разными способами их использования и интерпретации. Для некоторых весов их абсолютное значение имеет важное значение, в то время как для других весов важной частью являются относительные значения весов по отношению друг к другу. В этом разделе представлены некоторые из наиболее распространенных типов весов, чтобы на них можно было ссылаться в последующих разделах.
- Частотные веса - это основной тип взвешивания, представленный во введении к курсам статистики. В них каждый вес представляет собой целое число, которое указывает абсолютную частоту элемента в выборке. Их также иногда называют повторными (или повторяющимися) весами. Конкретное значение имеет абсолютное значение, которое теряется при преобразовании весов (например, масштабирование ). Например: если у нас есть числа 10 и 20 со значениями частотных весов 2 и 3, то при «распределении» наших данных это будет: 10,10, 20, 20, 20 (с весами 1 для каждого из этих элементов. ). Веса частот включают количество информации, содержащейся в наборе данных, и, таким образом, позволяют создавать несмещенные взвешенные оценки дисперсии с использованием поправки Бесселя . Обратите внимание, что такие веса часто являются случайными величинами , поскольку конкретное количество элементов, которые мы увидим из каждого значения в наборе данных, является случайным.
- Взвешивание обратной дисперсии - это когда каждому элементу присваивается вес, обратный его (известной) дисперсии. Когда все элементы имеют одинаковое ожидание, использование таких весов для расчета средневзвешенного значения имеет наименьшее отклонение среди всех средневзвешенных значений. В общепринятой формулировке эти веса известны, а не случайны (похоже, это связано с весами надежности).
- Нормализованные (выпуклые) веса - это набор весов, образующих выпуклую комбинацию . То есть: каждый вес - это число от 0 до 1, а сумма всех весов равна 1. Любой набор (неотрицательных) весов можно превратить в нормализованные веса, разделив каждый вес на сумму всех весов, в результате чего получится веса нормализованы к сумме до 1.
- Связанная форма - это веса, нормализованные к сумме размера выборки (n) . Эти (неотрицательные) веса суммируются с размером выборки (n), а их среднее значение равно 1. Любой набор весов может быть нормализован до размера выборки путем деления каждого веса на среднее значение всех весов. Эти веса имеют хорошую относительную интерпретацию, где элементы с весом больше 1 являются более «важными» (с точки зрения их относительного влияния, скажем, на средневзвешенное значение), чем среднее наблюдение, в то время как веса меньше 1 менее «важны», чем среднее наблюдение.
- Взвешивание обратной вероятности - это когда каждому элементу присваивается вес, который (пропорционален) обратной вероятности выбора этого элемента. Например, используя. С помощью обратных вероятностных весов мы узнаем, сколько элементов каждый элемент «представляет» в целевой совокупности. Следовательно, сумма таких весов возвращает размер целевой совокупности, представляющей интерес. Веса обратной вероятности могут быть нормализованы для суммирования до 1 или нормализованы для суммирования до размера выборки (n), и многие из вычислений из следующих разделов дадут те же результаты.
- Когда выборка представляет собой EPSEM, тогда все вероятности равны, а обратная величина вероятности выбора дает веса, которые все равны друг другу (все они равны , где - размер выборки и - размер генеральной совокупности). Такой образец называется самовзвешивающимся образцом .
Существуют также косвенные способы применения «взвешенных» корректировок. Например, существующие случаи могут быть продублированы для вменения недостающих наблюдений (например, из-за неполучения ответов) с оценкой дисперсии с использованием таких методов, как множественное вменение . Дополнительной обработкой данных является удаление (присвоение веса 0) некоторым случаям. Например, при желании уменьшить влияние групп с избыточной выборкой, которые менее важны для некоторого анализа. Оба случая аналогичны по своей природе обратному взвешиванию вероятностей, но на практике приложение дает больше / меньше строк данных (что делает ввод потенциально более простым для использования в некоторых программных реализациях) вместо применения дополнительного столбца весов. Тем не менее, последствия таких реализаций аналогичны простому использованию весов. Таким образом, в то время как в случае удаления наблюдений данные могут быть легко обработаны с помощью обычных программных реализаций, в случае добавления строк требуются специальные настройки для оценок неопределенности. Невыполнение этого может привести к ошибочным выводам (например: бесплатный обед отсутствует при использовании альтернативного представления основных проблем).
Термин «случайные веса», введенный Кишом, используется для обозначения весов, которые соответствуют неравным вероятностям выбора , но не связаны с ожиданием или дисперсией выбранных элементов.
Случайные веса с расчетным средним отношением ( ) - эффект дизайна Киша
Формула
При взятии неограниченной выборки элементов мы можем затем случайным образом разделить эти элементы на непересекающиеся слои, каждый из которых содержит элементы определенного размера, так что . Всем элементам в каждой страте присвоен некоторый (известный) неотрицательный вес ( ). Вес может быть получен путем инверсии некоторой неравной вероятности выбора для элементов в каждой страте (то есть: взвешивания обратной вероятности после чего-то вроде пост-стратификации). В этой настройке эффект дизайна Киша для увеличения дисперсии взвешенного среднего по выборке из-за этого дизайна (отраженного в весах) по сравнению с SRS некоторой переменной результата y (когда нет корреляции между весами и результатом, т. Е. : случайные веса) это:
Рассматривая каждый элемент из его собственной страты , Киш (в 1992 г.) упростил приведенную выше формулу до (хорошо известной) следующей версии:
Эта версия формулы действительна, когда из одного слоя было взято несколько наблюдений (то есть: каждый из них имел одинаковый вес), или когда было всего несколько слоев, из каждого из которых было взято одно наблюдение, но у нескольких из них были одинаковые вероятность выбора. Хотя интерпретация немного отличается, расчет двух сценариев оказывается одинаковым.
Обратите внимание , что определение Киса по проектированию эффекта тесно связанно с коэффициентом вариации (также называемым относительной дисперсией , relvariance или relvar для краткости) весов (при использовании неисправленного (уровня населения) стандартное отклонение выборки для оценки ). Это имеет несколько обозначений в литературе:
- .
Где - дисперсия населения , а - среднее значение. Когда веса нормализуются к размеру выборки (так, чтобы их сумма была равна n, а их среднее значение было равно 1), тогда и формула сводится к . Хотя верно и то, что мы предполагаем, что веса фиксированы, мы можем рассматривать их дисперсию как дисперсию эмпирического распределения, определенного путем выборки (с равной вероятностью) одного веса из нашего набора весов (аналогично тому, как мы думаем о корреляции x и y в простой линейной регрессии ).
Предположения и доказательства
Приведенная выше формула дает увеличение дисперсии взвешенного среднего на основе «случайных» весов , что отражает, когда y - наблюдения, выбранные с использованием неравных вероятностей выбора (без корреляции внутри кластера и без связи с ожиданием или дисперсией результата. измерение); и y '- наблюдения, которые у нас были бы, если бы мы получили их из простой случайной выборки , тогда:
С точки зрения модели , эта формула верна, когда все n наблюдений ( ) (по крайней мере приблизительно) некоррелированы ( ) с одинаковой дисперсией ( ) в интересующей переменной отклика (y). Также предполагается, что веса сами по себе не являются случайной величиной, а скорее некоторыми известными константами (например: обратная величина вероятности выбора для некоторого заранее определенного и известного плана выборки ).
Следующее является упрощенным доказательством отсутствия кластеров (т.е. отсутствие внутриклассовой корреляции между элементами выборки) и каждая страта включает только одно наблюдение:
Переходы:
- из определения средневзвешенного значения .
- используя нормированные (выпуклые) весы определения (весы , что сумма в 1): .
- сумма некоррелированных случайных величин .
- Если веса постоянны (из основных свойств дисперсии). Другими словами, веса известны заранее для каждого наблюдения i. А именно то, что мы на самом деле вычисляем
- когда все наблюдения имеют одинаковую дисперсию ( ).
Условия на у тривиально проводятся , если у наблюдения IID с тем же ожиданием и дисперсией . В таком случае у нас есть , и мы можем оценить , используя . Если не все y имеют одинаковые ожидания, тогда мы не можем использовать оценочную дисперсию для расчета, поскольку эта оценка предполагает, что все s имеют одинаковое ожидание. В частности, если существует корреляция между весами и выходной переменной y, это означает, что ожидание y не одинаково для всех наблюдений (а, скорее, зависит от конкретного значения веса для каждого наблюдения). В таком случае, хотя формула эффекта схемы может быть верной (при соблюдении других условий), потребуется другая оценка дисперсии средневзвешенного значения. Например, может быть лучше использовать оценщик взвешенной дисперсии .
Если разные s имеют разные дисперсии, тогда, хотя взвешенная дисперсия может уловить правильную дисперсию на уровне популяции, формула Киша для эффекта схемы может больше не соответствовать действительности.
Аналогичная проблема возникает, если в выборках присутствует некоторая корреляционная структура (например, при использовании кластерной выборки ).
Альтернативные определения в литературе
Стоит отметить, что некоторые источники в литературе дают следующее альтернативное определение эффекту схемы Киша, утверждая, что это: «отношение дисперсии взвешенного среднего значения обследования при непропорциональной стратифицированной выборке к дисперсии при пропорциональной стратифицированной выборке, когда все единицы страты отклонения равны ".
Это определение может немного вводить в заблуждение, поскольку его можно интерпретировать как означающее, что «пропорциональная стратифицированная выборка» была достигнута посредством стратифицированной выборки , в которой заранее определенное количество единиц выбирается из каждой страты. Такой отбор приведет к уменьшению дисперсии (по сравнению с простой случайной выборкой ), поскольку он устраняет некоторую неопределенность в конкретном количестве элементов на страту. Это отличается от первоначального определения Киша, в котором дисперсия плана сравнивалась с простой случайной выборкой (что дало бы вероятность, приблизительно пропорциональную выборке, но не точно - из-за дисперсии в размерах выборки в каждой страте). Парк и Ли (2006) размышляют над этим, заявляя, что «Обоснование вышеупомянутого вывода состоит в том, что потеря точности [средневзвешенного значения] из-за случайного неравного взвешивания может быть аппроксимирована отношением дисперсии при непропорциональной стратифицированной выборке к что при пропорциональной стратифицированной выборке ". Насколько эти два определения отличаются друг от друга, в литературе не упоминается. В своей книге 1977 года Кокран предоставляет формулу для пропорционального увеличения дисперсии из-за отклонения от оптимального распределения (то, что, по формуле Киша, будет называться L ). Однако связь этой формулы с L Киша не очевидна.
Альтернативные соглашения об именах
В более ранних статьях этот термин использовался . По мере того, как появлялось все больше определений дизайн-эффекта, дизайн-эффект Киша для неравных вероятностей выбора был обозначен (или ) или просто для краткости. Эффект дизайна Киша также известен как «эффект неравномерного взвешивания» (или просто UWE), названный Liu et al. в 2002.
Когда результат коррелирует с вероятностями выбора
Дефф Спенсера для расчетной суммы ( )
Оценщик итога - это оценщик «p-расширенный с заменой» (также известный как pwr-Estimator или Hansen and Hurwitz ). Он основан на простой случайной выборке (с заменой, обозначенной SIR ) из m элементов ( ) из совокупности размера M. Каждый элемент имеет вероятность (k от 1 до N) быть вытянутым в одном розыгрыше ( т. Е. : это полиномиальное распределение ). Вероятность того, что конкретный объект появится в нашей выборке, равна . «Р-расширено с заменой» значение со следующей продолжительностью: . Следовательно , pwr-оценка представляет собой несмещенную оценку общей суммы y.
В 2000 году Брюс Д. Спенсер предложил формулу для оценки эффекта схемы для дисперсии оценки общей (а не средней) некоторой величины ( ), когда существует корреляция между вероятностями выбора элементов и интересующей переменной результата. .
В этой установке, образец размера п обращается (с заменой) из популяции размера N . Каждый элемент рисуется с вероятностью (где , например: полиномиальное распределение ). Вероятности выбора используется для определения нормированного (выпуклый) весов : . Обратите внимание, что для некоторого случайного набора из n элементов сумма весов будет равна 1 только с помощью математического ожидания ( ) с некоторой изменчивостью суммы вокруг нее (то есть: сумма элементов из биномиального распределения Пуассона ). Связь между и определяется следующей простой линейной регрессией (популяционной) :
Где - результат элемента i , который линейно зависит от точки пересечения и наклона . Остаток от подобранной линии равен . Мы также можем определить дисперсию совокупности результатов и остатков как и . Соотношение между и есть .
Эффект дизайна Спенсера (приблизительный) для оценки суммы y равен:
Где:
- оценки
- оценивает наклон
- оценивает дисперсию населения , и
- L - относительная дисперсия весов, как определено в формуле Киша :: .
Это предполагает, что регрессионная модель хорошо подходит, так что вероятность выбора и остатки независимы , поскольку это приводит к тому, что остатки и квадратные остатки не коррелируют с весами. Т.е.: то и еще .
Когда размер популяции (N) очень велик, формулу можно записать как:
(поскольку , где )
Это приближение предполагает наличие линейной зависимости между P и y . А также, что корреляция весов с ошибками и квадраты ошибок равны нулю. Т.е.: а .
Мы замечаем, что если , то (т.е. среднее значение y ). В таком случае формула сводится к
Только если дисперсия у значительно больше , чем его среднее , то самый правый термин близок к 0 (т.е. ), что снижает дизайн эффект Спенсера (для estimatoed общего) равная конструкция эффекта Кисы (для средств соотношения ) . В противном случае две формулы дадут разные результаты, что демонстрирует разницу между эффектом схемы для общей суммы и средним.
Дефф Парка и Ли для оценочного среднего отношения ( )
В 2001 году Парк и Ли расширили формулу Спенсера на случай отношения среднего (то есть: оценка среднего путем деления оценки итоговой суммы на оценку размера популяции). Это:
Где:
- - (оценочный) коэффициент вариации вероятностей выбора.
Формула Парка и Ли в точности равна формуле Киша, когда . Обе формулы относятся к расчетному эффекту среднего значения y (в то время как Deff Спенсера относится к оценке общей суммы).
В общем, Deff для total ( ) имеет тенденцию быть менее эффективным, чем Deff для отношения mean ( ), когда оно мало. И в целом влияет на эффективность обоих эффектов дизайна.
Выборочное обследование
Для данных, собранных с помощью кластерной выборки, мы предполагаем следующую структуру:
- наблюдения в каждом кластере и K кластеров, а также с общим количеством наблюдений.
- Наблюдения имеют блок корреляционную матрицы , в которой каждая пару наблюдений из одного кластера коррелируют с внутриклассовой корреляцией из , в то время как каждая пара из разностных кластеров некоррелированна. Т.е. для каждой пары наблюдений и , если они принадлежат одному кластеру , мы получаем . А два элемента из двух разных кластеров не коррелирует, то есть: .
- Предполагается , элемент из любого кластера , чтобы иметь ту же самую дисперсию: .
Когда все кластеры имеют одинаковый размер , эффект дизайна D eff , предложенный Кишом в 1965 году (и позже повторно посещенный другими), определяется следующим образом:
Иногда его также обозначают как .
В различных статьях, когда размеры кластеров не равны, приведенная выше формула также используется в качестве среднего размера кластера (его также иногда обозначают как ). В таких случаях формула Киша (с использованием среднего веса кластера) служит консервативной (верхней границей) точного эффекта схемы.
Существуют альтернативные формулы для неравных размеров кластеров. Последующая работа обсуждала чувствительность использования среднего размера кластера с различными предположениями.
Неравные вероятности отбора Кластерная выборка
В своей статье 1987 года Киш предложил комбинированный эффект дизайна, который включает в себя как эффекты, связанные с взвешиванием, учитывающим неравные вероятности выбора, так и кластерную выборку:
С обозначениями, аналогичными приведенным выше.
Эта формула получила модельное обоснование, предложенное в 1999 г. Gabler et al.
Стратифицированная выборка Вероятности неравного выбора Кластерная выборка
В 2000 году Лю и Арагон предложили декомпозицию эффекта схемы неравных вероятностей выбора для разных слоев в стратифицированной выборке. В 2002 году Лю и др. Эта работа была расширена для учета стратифицированной выборки, которая находилась внутри каждой страты, и представляет собой набор неравных весов вероятности выбора. Кластерная выборка бывает глобальной или по стратам. Аналогичная работа была проделана также Park et al. в 2003 г.
Использует
Deff в основном используется для нескольких целей:
- При разработке дизайна - оценить его эффективность. То есть: если есть потенциально "слишком большое" увеличение дисперсии из-за какого-либо решения, или если новый дизайн более эффективен (например: как в стратифицированной выборке).
- Как способ определения размера выборки (в целом, по страте, по кластеру и т. Д.), А также
- При оценке потенциальных проблем с помощью апостериорного взвешивания (например, из-за неполучения ответов). Не существует универсального эмпирического правила, для которого значение эффекта дизайна «слишком велико», но в литературе указывается, что это может привлечь к себе внимание.
В своей статье 1995 года Киш предложил следующую категоризацию того, когда Дефф полезен, а когда нет:
- Эффект дизайна не нужен, когда: исходная совокупность близка к iid или когда план выборки данных был составлен как простая случайная выборка . Это также менее полезно, когда размер выборки относительно невелик (по крайней мере, частично, по практическим причинам). А также, если интересна только описательная статистика (например, оценка в баллах ). Также предполагается, что если стандартные ошибки необходимы только для небольшого количества статистических данных, можно игнорировать Deff.
- Эффект схемы необходим при: усреднении ошибок выборки для различных переменных, измеренных в одном обследовании. ИЛИ при усреднении одного и того же измеренного количества из нескольких съемок за период времени. Или при экстраполяции ошибки простой статистики (например, среднего) на более сложные (например, коэффициенты регрессии). При разработке будущего обследования (но с должной осторожностью). В качестве вспомогательной статистики для выявления явных проблем с данными или их анализом (например: от ошибок до наличия выбросов ).
При планировании размера выборки была проделана работа по корректировке эффекта дизайна, чтобы отделить эффект интервьюера (ошибка измерения) от влияния плана выборки на дисперсию выборки.
В то время как Киш изначально надеялся, что эффект дизайна будет максимально независимым от лежащего в основе распределения данных, вероятностей выборки, их корреляций и интересующей статистики, последующие исследования показали, что они действительно влияют на эффект дизайна. Следовательно, при принятии решения о том, какое вычисление Deff использовать и как его использовать, следует принимать во внимание тщательное внимание к этим свойствам.
История
Термин «эффект дизайна» был введен Лесли Кишом в 1965 году в его книге «Обзорная выборка». В своей статье 1995 года Киш упоминает, что аналогичная концепция, названная «Lexis ratio», была описана в конце 19 века. Тесно связанная внутриклассовая корреляция была описана Фишером в 1950 году, тогда как расчеты отношений дисперсий уже были опубликованы Кишом и другими с конца 40-х до 50-х годов. Одним из предшественников определения Киша была работа, проделанная Корнфилдом в 1951 году.
В своей оригинальной книге 1965 года Киш предложил общее определение эффекта схемы (отношение дисперсии двух оценок, одной из выборки с некоторым планом, а другой из простой случайной выборки). В своей книге Киш предложил формулу эффекта схемы кластерной выборки (с внутриклассовой корреляцией); а также знаменитая формула эффекта дизайна для выборки с неравной вероятностью . Их часто называют «эффектом дизайна Киша», и позже они были объединены в единую формулу.
Смотрите также
- Коэффициент инфляции дисперсии (VIF). VIF и Deff - схожие концепции в том, что они оба являются отношениями дисперсии оценки некоторого параметра в альтернативных моделях.
- Эффективный размер выборки