Методы моментов максимального правдоподобия. Методы получения оценок

Метод максимального правдоподобия (ММП) является одним из наиболее широко используемых методов в статистике и эконометрике. Для его применения необходимо знание закона распределения исследуемой случайной величины.

Пусть имеется некоторая случайная величина У с заданным законом распределения ДУ). Параметры этого закона неизвестны и их нужно найти. В общем случае величину Y рассматривают как многомерную, т.е. состоящую из нескольких одномерных величин У1, У2, У3 ..., У.

Предположим, что У – одномерная случайная величина и ее отдельные значения являются числами. Каждое из них (У],у 2, у3, ...,у„) рассматривается как реализация не одной случайной величины У, а η случайных величин У1; У2, У3 ..., У„. То есть:

уj – реализация случайной величины У];

у2 – реализация случайной величины У2;

уз – реализация случайной величины У3;

у„ – реализация случайной величины У„.

Параметры закона распределения вектора У, состоящего из случайных величин Y b Y 2, У3,У„, представляют как вектор Θ, состоящий из к параметров: θχ, θ2,в к. Величины Υ ν Υ 2, У3,..., Υ η могут быть распределены как с одинаковыми параметрами, так и с различными; некоторые параметры могут совпадать, а другие различаться. Конкретный ответ на этот вопрос зависит от той задачи, которую решает исследователь.

Например, если стоит задача определения параметров закона распределения случайной величины У, реализацией которой являются величины У1; У2, У3, У,„ то предполагают, что каждая из этих величин распределена так же, как величина У. Иначе говоря, любая величина У, описывается одним и тем же законом распределения/(У, ), причем с одними и теми же параметрами Θ: θχ, θ2,..., д к.

Другой пример – нахождение параметров уравнения регрессии. В этом случае каждая величина У, рассматривается как случайная величина, имеющая "собственные" параметры распределения, которые могут частично совпадать с параметрами распределения других случайных величин, а могут и полностью различаться. Более подробно применение ММП для нахождения параметров уравнения регрессии будет рассмотрено ниже.

В рамках метода максимального правдоподобия совокупность имеющихся значений У], у2, у3, ...,у„ рассматривается как некоторая фиксированная, неизменная. То есть закон /(У;) есть функция от заданной величиныу, и неизвестных параметров Θ. Следовательно, для п наблюдений случайной величины У имеется п законов /(У;).

Неизвестные параметры этих законов распределения рассматриваются как случайные величины. Они могут меняться, однако приданном наборе значений Уі,у2,у3, ...,у„ наиболее вероятны конкретные значения параметров. Иначе говоря, вопрос ставится таким образом: каковы должны быть параметры Θ, чтобы значения уj, у2, у3, ...,у„ были наиболее вероятны?

Для ответа на него нужно найти закон совместного распределения случайных величин У1; У2, У3,..., Уп –КУі, У 2, Уз, У„). Если предположить, что наблюдаемые нами величиныу^ у2,у3, ...,у„ независимы, то он равен произведению п законов/

(У;) (произведению вероятностей появления данных значений для дискретных случайных величин или произведению плотностей распределения для непрерывных случайных величин):

Чтобы подчеркнуть тот факт, что в качестве переменных рассматриваются искомые параметры Θ, введем в обозначение закона распределения еще один аргумент – вектор параметров Θ:

С учетом введенных обозначений закон совместного распределения независимых величин с параметрами будет записан в виде

(2.51)

Полученную функцию (2.51) называют функцией максимального правдоподобия и обозначают :

Еще раз подчеркнем тот факт, что в функции максимального правдоподобия значения У считаются фиксированными, а переменными являются параметры вектора (в частном случае – один параметр). Часто для упрощения процесса нахождения неизвестных параметров функцию правдоподобия логарифмируют, получая логарифмическую функцию правдоподобия

Дальнейшее решение по ММП предполагает нахождение таких значений Θ, при которых функция правдоподобия (или ее логарифм) достигает максимума. Найденные значения Θ; называют оценкой максимального правдоподобия.

Методы нахождения оценки максимального правдоподобия достаточно разнообразны. В простейшем случае функция правдоподобия является непрерывно дифференцируемой и имеет максимум в точке, для которой

В более сложных случаях максимум функции максимального правдоподобия не может быть найден путем дифференцирования и решения уравнения правдоподобия, что требует поиска других алгоритмов его нахождения, в том числе итеративных.

Оценки параметров, полученные с использованием ММП, являются:

– состоятельными , т.е. с увеличением объема наблюдений разница между оценкой и фактическим значением параметра приближается к нулю;
– инвариантными : если получена оценка параметра Θ, равная 0L, и имеется непрерывная функция q(0), то оценкой значения этой функции будет величина q(0L). В частности, если с помощью ММП мы оценили величину дисперсии какого-либо показателя (af ), то корень из полученной оценки будет оценкой среднего квадратического отклонения (σ,), полученной по ММП.
– асимптотически эффективными ;
– асимптотически нормально распределенными.

Последние два утверждения означают, что оценки параметров, полученные по ММП, проявляют свойства эффективности и нормальности при бесконечно большом увеличении объема выборки.

Для нахождения параметров множественной линейной регрессии вида

необходимо знать законы распределения зависимых переменных 7; или случайных остатков ε,. Пусть переменная Y t распределена по нормальному закону с параметрами μ, , σ, . Каждое наблюдаемое значение у, имеет, в соответствии с определением регрессии, математическое ожидание μ, = МУ„ равное его теоретическому значению при условии, что известны значения параметров регрессии в генеральной совокупности

где xfl, ..., x ip – значения независимых переменных в і -м наблюдении. При выполнении предпосылок применения МНК (предпосылок построения классической нормальной линейной модели), случайные величины У, имеют одинаковую дисперсию

Дисперсия величины определяется по формуле

Преобразуем эту формулу:

При выполнении условий Гаусса – Маркова о равенстве нулю математического ожидания случайных остатков и постоянстве их дисперсий можно перейти от формулы (2.52) к формуле

Иначе говоря, дисперсии случайной величины У,- и соответствующих ей случайных остатков совпадают.

Выборочную оценку математического ожидания случайной величины Yj будем обозначать

а оценку ее дисперсии (постоянной для разных наблюдений) как Sy.

Если предположить независимость отдельных наблюдений y it то получим функцию максимального правдоподобия

(2.53)

В приведенной функции делитель является константой и не оказывает влияния на нахождение ее максимума. Поэтому для упрощения расчетов он может быть опущен. С учетом этого замечания и после логарифмирования функция (2.53) примет вид

В соответствии с ММП найдем производные логарифмической функции правдоподобия по неизвестным параметрам

Для нахождения экстремума приравняем полученные выражения к нулю. После преобразований получим систему

(2.54)

Эта система соответствует системе, полученной по методу наименьших квадратов. То есть ММП и МНК дают одинаковые результаты, если соблюдаются предпосылки МНК. Последнее выражение в системе (2.54) дает оценку дисперсии случайной переменной 7, или, что одно и то же, дисперсии случайных остатков. Как было отмечено выше (см. формулу (2.23)), несмещенная оценка дисперсии случайных остатков равна

Аналогичная оценка, полученная с применением ММП (как следует из системы (2.54)), вычисляется по формуле

т.е. является смещенной .

Мы рассмотрели случай применения ММП для нахождения параметров линейной множественной регрессии при условии, что величина У, нормально распределена. Другой подход к нахождению параметров той же регрессии заключается в построении функции максимального правдоподобия для случайных остатков ε,. Для них также предполагается нормальное распределение с параметрами (0, σε). Нетрудно убедиться, что результаты решения в этом случае совпадут с результатами, полученными выше.

Кроме метода моментов, который изложен в предыдущем параграфе, существуют и другие методы точечной оценки неизвестных параметров распределения. К ним относится метод наибольшего правдоподобия, предложенный Р. Фишером.

А. Дискретные случайные величины. Пусть X - дискретная случайная величина, которая в результате n испытаний приняла значения х 1 , х 2 , ..., х п . Допустим, что вид закона распределения величины X задан, но неизвестен параметр θ , которым определяется этот закон. Требуется найти его точечную оценку.

Обозначим вероятность того, что в результате испытания величина X примет значение х i (i = 1 , 2, . . . , n ), через p (х i ; θ ).

Функцией правдоподобия дискретной случайной вели чины X называют функцию аргумента θ :

L (х 1 , х 2 , ..., х п ; θ ) = p (х 1 ; θ ) р (х 2 ; θ ) . . . p (х n ; θ ),

где х 1 , х 2 , ..., х п - фиксированные числа.

В качестве точечной оценки параметра θ принимают такое его значение θ * = θ * (х 1 , х 2 , ..., х п ), при котором функция правдоподобия достигает максимума. Оценку θ * называют оценкой наибольшего правдоподобия.

Функции L и ln L достигают максимума при одном и том же значении θ , поэтому вместо отыскания максимума функции L ищут (что удобнее) максимум функции ln L .

Логарифмической функцией правдоподобия называют функцию ln L . Как известно, точку максимума функции ln L аргумента θ можно искать, например, так:

3) найти вторую производную ; если вторая производная приθ = θ * отрицательна, то θ * - точка максимума.

Найденную точку максимума θ * принимают в качестве оценки наибольшего правдоподобия параметра θ .

Метод наибольшего правдоподобия имеет ряд достоинств: оценки наибольшего правдоподобия, вообще говоря, состоятельны (но они могут быть смещенными), распределены асимптотически нормально (при больших значениях n приближенно нормальны) и имеют наименьшую дисперсию по сравнению с другими асимптотически нормальными оценками; если для оцениваемого параметра θ существует эффективная оценка θ *, то уравнение правдоподобия имеет единственное решение θ *; этот метод наиболее полно использует данные выборки об оцениваемом параметре, поэтому он особенно полезен в случае малых выборок.

Недостаток метода состоит в том, что он часто требует сложных вычислений.

Замечание 1. Функция правдоподобия - функция от аргумента θ ; оценка наибольшего правдоподобия - функция от независимых аргументов х 1 , х 2 , ..., х п .

Замечание 2. Оценка наибольшего правдоподобия не всегда совпадает с оценкой, найденной методом моментов.

Пример 1. λ распределения Пуассона

где m - число произведенных испытаний; x i - число появлений события в i -м (i =1, 2, ..., n ) опыте (опыт состоит из т испытаний).

Решение. Составим функцию правдоподобия, учитывая, что. θ= λ :

L = p (х 1 ; λ :) p (х 2 ; λ :) . . .p (х n ; λ :),=

Напишем уравнение правдоподобия, для чего приравняем первую производную нулю:

Найдем критическую точку, для чего решим полученное уравнение относительно λ:

Найдем вторую производную по λ:

Легко видеть, что при λ = вторая производная отрицательна; следовательно,λ = - точка максимума и, значит, в качестве оценки наибольшого правдоподобия параметра λ распределения Пуассона надо принять выборочную среднюю λ* = .

Пример 2. Найти методом наибольшего правдоподобия оценку параметра p биномиального распределения

если в n 1 независимых испытаниях событие А появилось х 1 = m 1 раз и в п 2 независимых испытаниях событие А появилось х 2 = т 2 раз.

Решение. Составим функцию правдоподобия, учитывая, что θ = p :

Найдем логарифмическую функцию правдоподобия:

Найдем первую производную по р:

Найдем критическую точку, для чего решим полученное уравнение относительно p :

Найдем вторую производную по p :

Легко убедиться, что при вторая производная отрицательна; следовательно, - точка максимума и, значит, ее надо принять в качестве оценки наибольшего правдоподобия неизвестной вероятности p биномиального распределения:

Б. Непрерывные случайные величины. Пусть X - непрерывная случайная величина, которая в результате n испытаний приняла значения х 1 , х 2 , ..., x п . Допустим, что вид плотности распределения f (x ) задан, но не известен параметр θ , которым определяется эта функция.

Функцией правдоподобия непрерывной случайной вели чины X называют функцию аргумента θ :

L (х 1 , х 2 , ..., х п ; θ ) = f (х 1 ; θ ) f (х 2 ; θ ) . . . f (x n ; θ ),

где х 1 , х 2 , ..., x п - фиксированные числа.

Оценку наибольшего правдоподобия неизвестного параметра распределения непрерывной случайной величины ищут так же, как в случае дискретной величины.

Пример 3. Найти методом наибольшего правдоподобия оценку параметра λ, показательного распределения

(0< х < ∞),

если в результате n испытаний случайная величина X , распределенная по показательному закону, приняла значения х 1 , х 2 , ..., х п .

Решение. Составим функцию правдоподобия, учитывая, что θ= λ:

L = f (х 1 ; λ ) f (х 2 ; λ ) . . . f (х n ; λ ) =.

Найдем логарифмическую функцию правдоподобия:

Найдем первую производную по λ:

Напишем уравнение правдоподобия, для чего приравняем первую производную нулю:

Найдем критическую точку, для чего решим полученное уравнение относительно λ:

Найдем вторую производную по λ:

В работах, предназначенных для первоначального знакомства с математической статистикой, обычно рассматривают оценки максимального правдоподобия (сокращенно ОМП):

Таким образом, сначала строится плотность распределения вероятностей, соответствующая выборке. Поскольку элементы выборки независимы, то эта плотность представляется в виде произведения плотностей для отдельных элементов выборки. Совместная плотность рассматривается в точке, соответствующей наблюденным значениям. Это выражение как функция от параметра (при заданных элементах выборки) называется функцией правдоподобия. Затем тем или иным способом ищется значение параметра, при котором значение совместной плотности максимально. Это и есть оценка максимального правдоподобия.

Хорошо известно, что оценки максимального правдоподобия входят в класс наилучших асимптотически нормальных оценок. Однако при конечных объемах выборки в ряде задач ОМП недопустимы, т.к. они хуже (дисперсия и средний квадрат ошибки больше), чем другие оценки, в частности, несмещенные. Именно поэтому в ГОСТ 11.010-81 для оценивания параметров отрицательного биномиального распределения используются несмещенные оценки, а не ОМП. Из сказанного следует априорно предпочитать ОМП другим видам оценок можно - если можно - лишь на этапе изучения асимптотического поведения оценок.

В отдельных случаях ОМП находятся явно, в виде конкретных формул, пригодных для вычисления.

В большинстве случаев аналитических решений не существует, для нахождения ОМП необходимо применять численные методы. Так обстоит дело, например, с выборками из гамма-распределения или распределения Вейбулла-Гнеденко. Во многих работах каким-либо итерационным методом решают систему уравнений максимального правдоподобия или впрямую максимизируют функцию правдоподобия.

Однако применение численных методов порождает многочисленные проблемы. Сходимость итерационных методов требует обоснования. В ряде примеров функция правдоподобия имеет много локальных максимумов, а потому естественные итерационные процедуры не сходятся. Для данных ВНИИ железнодорожного транспорта по усталостным испытаниям стали уравнение максимального правдоподобия имеет 11 корней. Какой из одиннадцати использовать в качестве оценки параметра?

Как следствие осознания указанных трудностей, стали появляться работы по доказательству сходимости алгоритмов нахождения оценок максимального правдоподобия для конкретных вероятностных моделей и конкретных алгоритмов.

Однако теоретическое доказательство сходимости итерационного алгоритма - это еще не всё. Возникает вопрос об обоснованном выборе момента прекращения вычислений в связи с достижением требуемой точности. В большинстве случаев он не решен.

Но и это не все. Точность вычислений необходимо увязывать с объемом выборки - чем он больше, тем точнее надо находить оценки параметров, в противном случае нельзя говорить о состоятельности метода оценивания. Более того, при увеличении объема выборки необходимо увеличивать и количество используемых в компьютере разрядов, переходить от одинарной точности расчетов к двойной и далее - опять-таки ради достижения состоятельности оценок.

Таким образом, при отсутствии явных формул для оценок максимального правдоподобия нахождение ОМП натыкается на ряд проблем вычислительного характера. Специалисты по математической статистике позволяют себе игнорировать все эти проблемы, рассуждая об ОМП в теоретическом плане. Однако прикладная статистика не может их игнорировать. Отмеченные проблемы ставят под вопрос целесообразность практического использования ОМП.

Пример 1. В статистических задачах стандартизации и управления качеством используют семейство гамма-распределений. Плотность гамма-распределения имеет вид

Плотность вероятности в формуле (7) определяется тремя параметрами a, b, c , где a >2, b >0. При этом a является параметром формы, b - параметром масштаба и с - параметром сдвига. Множитель 1/Г(а) является нормировочным, он введен, чтобы

Здесь Г(а) - одна из используемых в математике специальных функций, так называемая "гамма-функция", по которой названо и распределение, задаваемое формулой (7),

Подробные решения задач оценивания параметров для гамма-распределения содержатся в разработанном нами государственном стандарте ГОСТ 11,011-83 «Прикладная статистика. Правила определения оценок и доверительных границ для параметров гамма-распределения». В настоящее время эта публикация используется в качестве методического материала для инженерно-технических работников промышленных предприятий и прикладных научно-исследовательских институтов.

Поскольку гамма-распределение зависит от трех параметров, то имеется 2 3 - 1 = 7 вариантов постановок задач оценивания. Они описаны в табл. 1. В табл. 2 приведены реальные данные о наработке резцов до предельного состояния, в часах. Упорядоченная выборка (вариационный ряд) объема n = 50 взята из государственного стандарта. Именно эти данные будут служить исходным материалом для демонстрации тех или иных методов оценивания параметров.

Выбор «наилучших» оценок в определенной параметрической модели прикладной статистики - научно-исследовательская работа, растянутая во времени. Выделим два этапа. Этап асимптотики : оценки строятся и сравниваются по их свойствам при безграничном росте объема выборки. На этом этапе рассматривают такие характеристики оценок, как состоятельность, асимптотическая эффективность и др. Этап конечных объемов выборки: оценки сравниваются, скажем, при n = 10. Ясно, что исследование начинается с этапа асимптотики: чтобы сравнивать оценки, надо сначала их построить и быть уверенными, что они не являются абсурдными (такую уверенность дает доказательство состоятельности).

Пример 2. Оценивание методом моментов параметров гамма-распределения в случае трех неизвестных параметров (строка 7 таблицы 1).

В соответствии с проведенными выше рассуждениями для оценивания трех параметров достаточно использовать три выборочных момента - выборочное среднее арифметическое:

выборочную дисперсию

и выборочный третий центральный момент

Приравнивая теоретические моменты, выраженные через параметры распределения, и выборочные моменты, получаем систему уравнений метода моментов:

Решая эту систему, находим оценки метода моментов. Подставляя второе уравнение в третье, получаем оценку метода моментов для параметра сдвига:

Подставляя эту оценку во второе уравнение, находим оценку метода моментов для параметра формы:

Наконец, из первого уравнения находим оценку для параметра сдвига:

Для реальных данных, приведенных выше в табл. 2, выборочное среднее арифметическое = 57,88, выборочная дисперсия s 2 = 663,00, выборочный третий центральный момент m 3 = 14927,91. Согласно только что полученным формулам оценки метода моментов таковы: a * = 5,23; b * = 11,26, c * = - 1,01.

Оценки параметров гамма-распределения, полученные методом моментов, являются функциями от выборочных моментов. В соответствии со сказанным выше они являются асимптотически нормальными случайными величинами. В табл. 3 приведены оценки метода моментов и их асимптотические дисперсии при различных вариантах сочетания известных и неизвестных параметров гамма-распределения.

Все оценки метода моментов, приведенные в табл. 3, включены в государственный стандарт. Они охватывают все постановки задач оценивания параметров гамма-распределения (см. табл. 1), кроме тех, когда неизвестен только один параметр - a или b . Для этих исключительных случаев разработаны специальные методы оценивания.

Поскольку асимптотическое распределение оценок метода моментов известно, то не представляет труда формулировка правил проверки статистических гипотез относительно значений параметров распределений, а также построение доверительных границ для параметров. Например, в вероятностной модели, когда все три параметра неизвестны, в соответствии с третьей строкой таблицы 3 нижняя доверительная граница для параметра а , соответствующая доверительной вероятности г = 0,95, в асимптотике имеет вид

а верхняя доверительная граница для той же доверительной вероятности такова

где а * - оценка метода моментов параметра формы (табл. 3).

Пример 3. Найдем ОМП для выборки из нормального распределения, каждый элемент которой имеет плотность

Таким образом, надо оценить двумерный параметр (m , у 2).

Произведение плотностей вероятностей для элементов выборки, т.е. функция правдоподобия, имеет вид

Требуется решить задачу оптимизации

Как и во многих иных случаях, задача оптимизации проще решается, если прологарифмировать функцию правдоподобия, т.е. перейти к функции

называемой логарифмической функцией правдоподобия. Для выборки из нормального распределения

Необходимым условием максимума является равенство 0 частных производных от логарифмической функции правдоподобия по параметрам, т.е.

Система (10) называется системой уравнений максимального правдоподобия. В общем случае число уравнений равно числу неизвестных параметров, а каждое из уравнений выписывается путем приравнивания 0 частной производной логарифмической функции правдоподобия по тому или иному параметру.

При дифференцировании по m первые два слагаемых в правой части формулы (9) обращаются в 0, а последнее слагаемое дает уравнение

Следовательно, оценкой m * максимального правдоподобия параметра m является выборочное среднее арифметическое,

Для нахождения оценки дисперсии необходимо решить уравнение

Легко видеть, что

Следовательно, оценкой (у 2)* максимального правдоподобия для дисперсии у 2 с учетом найденной ранее оценки для параметра m является выборочная дисперсия,

Итак, система уравнений максимального правдоподобия решена аналитически, ОМП для математического ожидания и дисперсии нормального распределения - это выборочное среднее арифметическое и выборочная дисперсия. Отметим, что последняя оценка является смещенной.

Отметим, что в условиях примера 3 оценки метода максимального правдоподобия совпадают с оценками метода моментов. Причем вид оценок метода моментов очевиден и не требует проведения каких-либо рассуждений.

Пример 4. Попытаемся проникнуть в тайный смысл следующей фразы основателя современной статистики Рональда Фишера: “нет ничего проще, чем придумать оценку параметра”. Классик иронизировал: он имел в виду, что легко придумать плохую оценку. Хорошую оценку не надо придумывать (!) - ее надо получать стандартным образом, используя принцип максимального правдоподобия.

Задача. Согласно H 0 математические ожидания трех независимых пуассоновских случайных величин связаны линейной зависимостью: .

Даны реализации этих величин. Требуется оценить два параметра линейной зависимости и проверить H 0 .

Для наглядности можно представить линейную регрессию, которая в точках принимает средние значения. Пусть получены значения. Что можно сказать о величине и справедливости H 0 ?

Наивный подход

Казалось бы, оценить параметры можно из элементарного здравого смысла. Оценку наклона прямой регрессии получим, поделив приращение при переходе от x 1 =-1 к x 3 =+1 на, а оценку значения найдем как среднее арифметическое:

Легко проверить, что математические ожидания оценок равны (оценки несмещенные).

После того как оценки получены, H 0 проверяют как обычно с помощью хи-квадрат критерия Пирсона:

Оценки ожидаемых частот можно получить, исходя из оценок:

При этом, если наши оценки ”правильные”, то расстояние Пирсона будет распределено как случайная величина хи-квадрат с одной степенью свободы: 3-2=1. Напомним, что мы оцениваем два параметра, подгоняя данные под нашу модель. При этом сумма не фиксирована, поэтому дополнительную единицу вычитать не нужно.

Однако, подставив, получим странный результат:

С одной стороны ясно, что для данных частот нет оснований отвергать H 0 , но мы не в состоянии это проверить с помощью хи-квадрат критерия, так как оценка ожидаемой частоты в первой точке оказывается отрицательной. Итак, найденные из “здравого смысла” оценки не позволяют решить задачу в общем случае.

Метод максимального правдоподобия

Случайные величины независимы и имеют пуассоновское распределение. Вероятность получить значения равна:

Согласно принципу максимального правдоподобия значения неизвестных параметров надо искать, требуя, чтобы вероятность получить значения была максимальной:

Если постоянны, то мы имеем дело с обычной вероятностью. Фишер предложил новый термин “правдоподобие” для случая, когда постоянны, а переменными считаются. Если правдоподобие оказывается произведением вероятностей независимых событий, то естественно превратить произведение в сумму и дальше иметь дело с логарифмом правдоподобия:

Здесь все слагаемые, которые не зависят от, обозначены и в окончательном выражении отброшены. Чтобы найти максимум логарифма правдоподобия, приравняем производные по к нулю:

Решая эти уравнения, получим:

Таковы “правильные” выражения для оценок. Оценка среднего значения совпадает с тем, что предлагал здравый смысл, однако оценки для наклона различаются: . Что можно сказать по поводу формулы для?

1) Кажется странным, что ответ зависит от частоты в средней точке, так как величина определяет угол наклона прямой.
2) Тем не менее, если справедлива H 0 (линия регрессии - прямая), то при больших значениях наблюдаемых частот, они становятся близки к своим математическим ожиданием. Поэтому: , и оценка максимального правдоподобия становится близка к результату, полученному из здравого смысла.

3) Преимущества оценки начинают ощущаться, когда мы замечаем, что все ожидаемые частоты теперь оказываются всегда положительными:

Это было не так для “наивных” оценок, поэтому применить хи-квадрат критерий можно было не всегда (попытка заменить отрицательную или равную нулю ожидаемую частоту на единицу не спасает положения).

4) Численные расчеты показывают, что наивными оценками можно пользоваться только, если ожидаемые частоты достаточно велики. Если использовать их при малых значениях, то вычисленное расстояние Пирсона часто будет оказываться чрезмерно большим.

Вывод : Правильный выбор оценки важен, так как в противном случае проверить гипотезу с помощью критерия хи-квадрат не удастся. Оценка, казалось бы, очевидная может оказаться непригодной!

непрерывная случайная величина с плотностью Вид плотности известен, но неизвестны значения параметров Функцией правдоподобия называется функция (здесь - выборка объема п из распределения случайной величины £). Легко видеть, что функции правдоподобия можно придать вероятностный смысл, а именно: рассмотрим случайный вектор компоненты которого независимые в совокупности одинаково распределенные случайные величины с законом Д(ж). Тогда элемент вероятности вектора Е имеет вид т.е. функция правдоподобия связана с вероятностью получения фиксированной выборки в последовательности экспериментов П. Основная идея метода правдоподобия состоит в том, что в качестве оценок параметров А предлагается взять такие значения (3), которые доставляют максимум функции правдоподобия при данной фиксированной выборке, т. е. предлагается считать выборку, полученную в эксперименте, наиболее вероятной. Нахождение оценок параметров pj сводится к решению системы к уравнений (к - число неизвестных параметров): Поскольку функция log L имеет максимум в той же точке, что и функция правдоподобия, то часто систему уравнений правдоподобия (19) записывают в виде В качестве оценок неизвестных параметров Д следует брать решения системы (19) или (20), действительно зависящие от выборки и не являющиеся постоянными. Вслучае, когда £ дискретна с рядом распределения, функцией правдоподобия называют функцию и оценки ищут как решения системы Метод максимального правдоподобия или эквивалентной ей Можно показать, что оценки максимального правдоподобия обладают свойством состоятельности. Следует отмстить, что метод максимального правдоподобия приводит к более сложным вычислениям, нежели метод моментов, но теоретически он более эффективен, так как оценки максимального правдоподобия меньше уклоняются от истинных значений оцениваемых параметров, чем оценки, полученные по методу моментов. Для наиболее часто встречающихся в приложениях распределений оценки параметров, полученные по методу моментов и по методу максимального правдоподобия, в большинстве случаев совпадают. Пршир 1. Отклонение (размера детали от номинала является нормально распределенной случайной личиной. Требуется по выборке определить систематическую ошибку и дисперсию отклонения. М По условию (- нормально распределенная случайная величина с математическим ожиданием (систематическая ошибка) и дисперсией, подлежащими оценке по выборке объема п: Х\>...уХп. В этом случае Функция правдоподобия Система (19) имеет вид Отсюда, исключай решения, не зависящие от Хх, получаем т е. оценки максимального правдоподобия в этом случае совпадают с уже известными нам эмпирическими средним и дисперсией > Пример 2. Оценить по выборке параметр /i экспоненциально распределенной случайной величины. 4 Функция правдоподобия имеет вид Уравнение правдоподобия приводит нас к решению совпадающему с оценкой этого же параметра, полученной по методу моментов, см. (17). ^ Пример 3. Пользуясь методом максимального правдоподобия, оценить вероятность появления герба, если при десяти бросаниях монеты герб появился 8 раз. -4 Пусть подлежащая оценке вероятность равна р. Рассмотрим случайную величину (с рядом распределения. Функция правдоподобия (21) имеет вид Метод максимального Уравнение правдоподобия дает в качестве оценки неизвестной вероятности р частоту появления герба в эксперименте Заканчивая обсуждение методов нахождения оценок, подчеркнем, что, даже имея очень большой объем экспериментальных данных, мы все равно не можем указать точного значения оцениваемого параметра, более того, как уже неоднократно отмечалось, получаемые нами оценки близки к истинным значениям оцениваемых параметров только «в среднем» или «в большинстве случаев». Поэтому важной статистической задачей, которую мы рассмотрим далее, является задача определения точности и достоверности проводимого нами оценивания.

В предыдущем разделе рассматривалась байесовская теория оценивания. Одной из наиболее полезных оценок, полученных там, является оценка по максимуму апостериорной плотности вероятности. Значения этой оценки определяются путем максимизации условной плотности

относительно переменной . Для этой оценки было введено специальное обозначение . Так как безусловная плотность не зависит от параметра , то значения оценки могут отыскиваться путем максимизации совместной плотности

относительно . Можно также максимизировать значение натурального логарифма от этой плотности. В этом случае значение оценки при каждой выборке является корнем уравнения

Предположим теперь, что никаких априорных сведений о параметре нет. Если бы параметр был случайным и имел нормальную плотность вероятности

то рассматриваемый здесь случай можно было бы получить предельным переходом при неограниченном увеличении дисперсий всех компонент вектора . Так как при этом

то при имеем . Таким образом, при отсутствии априорных сведений о параметре можно положить

. (6.27)

Получающаяся при этом из ур-ния (6.26) оценка называется оценкой максимального правдоподобия. Она является корнем уравнения

(6.28)

или, что эквивалентно,

. (6.29)

Оценка максимального правдоподобия была предложена раньше, чем была развита байесовская теория оценивания . Она определялась как значение параметра , при котором функция правдоподобия принимает наибольшее значение. Из приведенных выше рассуждений должно быть очевидным, что точность оценки максимального правдоподобия будет хуже, чем байесовской оценки. Несмотря на это, существуют достаточно веские причины, из-за которых использование этой оценки оказывается разумным. Так, довольно часто встречаются задачи оценивания, в которых

Параметр не является случайным, а его значение неизвестно;

Параметр является случайным, однако его априорная плотность вероятности неизвестна;

Выражение для апостериорной плотности [или для ] оказывается настолько сложным, что его трудно использовать для вычислений, в то время как функция правдоподобия имеет относительно простой вид.

В первом случае вообще нет возможности найти байесовскую оценку, поскольку о плотности вероятности вообще нельзя говорить. Один из возможных путей преодоления этой трудности состоит в том, чтобы использовать псевдобайесовские оценки. Такие оценки будут рассмотрены в § 6.5.

Пример 6.6. Рассмотрим одну из классических задач оценивания, которая была решена с использованием оценок максимального правдоподобия. Пусть требуется оценить среднее значение и дисперсию нормальной случайной величины по выборке из независимых наблюдений этой величины. Для наблюдаемой величины при этом имеем

, где

В силу независимости наблюдений можно зависать

В этой задаче подлежащие оцениванию параметры и не являются случайными, так чтобайесовские оценки найти нельзя.

Это уравнение имеет единственный корень , который и следует принять в качестве оценки максимального правдоподобия для среднего значения. Так как математическое ожидание этой оценки совпадает со значением оцениваемого параметра, т. е. то эту оценку называют несмещенной.

Случай 2. Предположим теперь, что значение параметра известно. Оценка максимального правдоподобия для дисперсии в этом случае является корнем уравнения

Решив это уравнение, получаем

Эта оценка также является несмещенной, поскольку .

Рассмотрим теперь задачу оценивания стандартного отклонения . Можно предположить, что эта оценка представляется как корень квадратный из оценки для дисперсии. Это действительно так, поскольку оценка

является корнем уравнения

Случай 3. Значения обоих параметров и неизвестны. В этом случае оцениваться должны два параметра и . Вычисляя производные функции правдоподобия по переменным и , приравнивая их нулю и решая найденную систему из двух уравнений, получаем

; .

Оценка среднего значения здесь вновь является несмещенной, а среднее значение оценки дисперсии равно значению оцениваемого параметра, т. е. в указанных условиях является смещенной. Можно было бы, введя поправку, получить несмещенную оценку , которая не является, однако, более оценкой максимального правдоподобия.

Часто полезно иметь алгоритмы последовательного вычисления оценок и . Здесь нижние индексы оценок максимального правдоподобия заменены индексом , который указывает объем используемой для оценивания выборки. При объеме выборки, равном , оценка . Поэтому алгоритм последовательного вычисления этой оценки имеет вид . Алгоритм последовательного вычисления оценки отыскивается несколько сложнее. Воспользуемся уже полеченным ранее выражением для оценки

и выпишем аналогичное выражение для оценки

Оценку теперь представим в рекуррентном виде. Тогда из двух выписанных равенств после немногочисленных алгебраических преобразований получаем

Рекуррентные алгоритмы вычисления оценок и должны использоваться совместно.

Пример 6.7. Найдем оценку максимального правдоподобия для параметра рассматривавшегося в примере 6.1. Теперь плотность вероятности

Оценка максимального правдоподобия определяется как корень уравнения

и имеет вид

В рассматриваемом случае можно найти и байесовскую оценку

Если принять, что , , то оценка, обеспечивающая минимум среднеквадратической ошибки, совпадает с оценкой максимального правдоподобия. Интересно отметить, что в этом случае оценка с минимальной дисперсией, которая совпадает также с байесовской оценкой при модульной функции стоимости и с оценкой по максимуму апостериорной плотности вероятности, так же, как и оценка максимального правдоподобия, является несмещенной.

Чрезвычайно полезно вычислить корреляционные матрицы вектора ошибок этих двух оценок. Для байесовской оценки такая матрица уже была вычислена и было показано, что

Для оценки максимального правдоподобия получаем

Если теперь воспользоваться представлением , то

Корреляционная матрица вектора ошибок при использовании оценки максимального правдоподобия всегда больше, чем корреляционная матрица вектора ошибок для оценки с минимальной среднеквадратической ошибкой. Эти матрицы совпадают только в том случае, когда .

Полезно рассмотреть также случай, когда матрица является единичной, т. е . При этом .

Оценка максимального правдоподобия, байесовская оценка и их корреляционные матрицы в этом случае принимают вид

Здесь нельзя ожидать, что оценка максимального правдоподобия окажется достаточно точной, поскольку ее значения просто совпадают со значениями получаемой выборки.

Если объем выборки намного больше размерности оцениваемого параметра , то оценка максимального правдоподобия может оказаться достаточно хорошей. Например, пусть , где - скалярный параметр, а векторы и имеют размерность . Предположим также, что

и . Рассматривающиеся здесь оценки и их среднеквадратические ошибки при этом определяются соотношениями

; ;

; .

Часто оказывается, что для достаточно больших значений выполняется неравенство . В этом случае среднеквадратические ошибки обеих оценок будут фактически одинаковы.

Аналогичные результаты можно получить при непрерывном времени для примера 6.3. Если модель наблюдений в последнем примере с дискретным временем трактовать как дискретный аналог следующей модели наблюдаемого процесса

; .

где - нормальный белый шум с нулевым средним значением, то, используя обозначения примера 6.3, можно получить

; .

Отсюда следует, что если вид функции не изменяется при изменении , то среднеквадратическая ошибка оценивания уменьшается с ростом . Если же энергия сигнала , определяемая как , должна оставаться постоянной при любом значении параметра , то значение среднеквадратической ошибки не зависит ни от длительности , ни от формы сигнала . Если , то среднеквадратическая ошибка байесовской оценки фактически будет такой же, как и у оценки максимального правдоподобия. Если же это не так и справедливо обратное неравенство , то это означает, что либо имеется достаточно интенсивный шум ( велико), либо имеется хорошая априорная оценка для , с которой можно начать ( мало). Значения оценки с минимальной среднеквадратической ошибкой и среднеквадратическая ошибка этой оценки при этом мало отличаются от соответствующих параметров априорного распределения и можно записать

;

Так что в этом случае среднее значение априорного распределения принимается в качестве наилучшей оценки для параметра . В примере 6.5 уже отмечалось, что при больших отношениях сигнал/шум среднеквадратические ошибки оценивания при использовании оценки по максимуму апостериорной плотности и оценки с минимальной среднеквадратической ошибкой практически одинаковы. Из результатов этого примера следует, что при больших значениях отношения сигнал/шум (здесь при ) точность оценок и практически такая же, как и у оценки максимального правдоподобия

Пример 6.8. Приведем теперь подробный анализ простой задачи оценивания по методу максимального правдоподобия при наличии окрашенного шума. В процессе решения этой задачи будут проиллюстрированы соображения, которыми можно будет пользоваться при практическом выборе интервала дискретизации. Пусть наблюдению доступны реализации скалярного процесса , , где - постоянный скалярный параметр, и

Для решения задачи оценивания параметра поступим следующим образом. Введем соответствующую модель наблюдений при дискретном времени , , , где период отсчетов выбирается так, чтобы изменения процесса на таком интервале были хорошо заметны. Для этой модели имеем

Наблюдаемый процесс можно теперь записать в векторной форме:

Оценка максимального правдоподобия параметра

где ковариационная матрица шума имеет элементы: (или от периода отсчетов компоненты вектора (или ) при дальнейшем, даже неограниченном, увеличении объема выборки оказывается незначительным.

Рис. 6.8. Зависимость дисперсии ошибки оценивания от объема выборки (пример 6.8.): 1 - алгоритм, ориентированный на белый шум; 2 - алгоритм, ориентированный на окрашенный шум.

Приведенное выше выражение для справедливо только в том случае, если компоненты вектора в самом деле независимы. Истинное значение среднеквадратической ошибки оценивания при использовании оценки в случае окрашенного шума может быть найдено из соотношения

) алгоритм, ориентированный на белый шум, обеспечивает значение среднеквадратической ошибки, лишь незначительно превышающее значение ошибки для алгоритма, ориентированного на окрашенный шум. Поскольку алгоритмы для белого шума намного проще, чем алгоритмы для окрашенного шума, то в практических приложениях можно поступить следующим образом, объем выборки принять равным 40 и использовать простые алгоритмы оценивания, ориентированные на белый шум, если такая высокая частота отсчетов допустима. Среднеквадратическая ошибка оценивания по выборке объема при использовании алгоритма для окрашенного шума (когда шум на самом деле окрашен) равна среднеквадратической ошибке оценивания по выборке объема при использовании алгоритма для белого шума. Отношение этих среднеквадратических ошибок при равно примерно двум.