Лекция 2

3. Алгебра линейной регрессии
3.1. Обозначения и определения

x - n-вектор-строка переменных xj;

a - n-вектор-столбец коэффициентов (параметров) регрессии aj при переменных x;

b - свободный член в уравнении регрессии;

e - ошибки измерения (ошибки уравнения, необъясненные остатки);

xa = b + e - уравнение (линейной) регрессии;

xa = b - гиперплоскость регрессии размерности n-1;

a, b, e - истинные значения соответствующих величин;

a, b, e - их оценки;

x-j - вектор x без j-й компоненты;

-a-j - вектор a без j-й компоненты;

Xj - N- вектор-столбец наблюдений {xij} за переменной xj (вектор фактических значений переменной);

X - N´n-матрица наблюдений {Xj} за переменными x;

- та же матрица без j-го столбца;

e - N- вектор-столбец ошибок (остатков) по наблюдениям;

Xa = 1Nb + e - регрессия по наблюдениям (уравнение регрессии);

 - n-вектор-строка средних;

 - тот же вектор без j-й компоненты;

 - матрица центрированных наблюдений;

 - n´n -матрица {mij} оценок  ковариаций переменных x (эта матрица, по определению, - вещественная, симметрическая и положительно полуопределенная);

- та же матрица без j- го столбца и j-й строки;

m-j - (n-1)-вектор-столбец (оценок) ковариаций xj c остальными переменными.

 - оценка остаточной дисперсии.

Коэффициенты регрессии a и b находятся так, чтобы  достигала своего наименьшего значения. В этом заключается применение метода наименьших квадратов.

Из условия  определяется, что  и , т.е. гиперплоскость регрессии проходит через точку средних значений переменных, и ее уравнение можно записать в сокращенной форме:

     a = e.


3.2. Простая регрессия

Когда на вектор параметров регрессии a накладывается ограничение aj=1, имеется в виду простая регрессия, в левой части уравнения которой остается только одна переменная:

Это уравнение регрессии xj по x-j; переменная xj - объясняемая, изучаемая или моделируемая, переменные x-j - объясняющие, независимые факторы, регрессоры.

Из условия  определяется, что  и m-j = M-ja-j. Последнее называется системой нормальных уравнений, из которой находятся искомые МНК-оценки параметров регрессии:

  .

Систему нормальных уравнений можно вывести, используя иную логику. Если обе части уравнения регрессии (записанного по наблюденям) умножить слева на  и разделить на N, то получится условие , из которого следует искомая система при требованиях  и .

Такая же логика используется в методе инструментальных переменных. Пусть имеется N´(n-1)-матрица наблюдений Z за некоторыми величинами z, называемыми инструментальными переменными, относительно которых известно, что они взаимно независимы с e. Умножение обеих частей уравнения регрессии слева на  и деление их на N дает условие , из которого - после отбрасывания 2-го члена правой части - следует система нормальных уравнений

  

метода инструментальных переменных,

где .

МНК-оценка остаточной дисперсии удовлетворяет следующим формулам:

   ,

где  - объясненная дисперсия.

 или  (т.к. ) - коэффициент детерминации (равный квадрату коэффициента множественной корреляции между xj и x-j), показывающий долю исходной дисперсии моделируемой переменной, которая объяснена регрессионной моделью.


- расчетные значения моделируемой переменной (лежащие на гиперплоскости регрессии).

В n-пространстве переменных вектора-строки матрицы X образуют так называемое облако наблюдений. Искомая гиперплоскость регрессии в этом пространстве располагается так, чтобы сумма квадратов расcтояний от всех точек облака наблюдений до этой гиперплоскости была минимальна. Данные расcтояния измеряются параллельно оси моделируемой переменной xj.

В N-пространстве наблюдений показываются вектора-столбцы матрицы . Коэффициент множественной корреляции между xj и x-j равен косинусу угла между  и гиперплоскостью,”натянутой” на столбцы матрицы , вектор e является нормалью из   на эту гиперплоскость, а вектор a-j образован коэффициентами разложения проекции   на эту гиперплоскость по векторам-столбцам матрицы .

В зависимости от того, какая переменная остается в левой части уравнения регрессии, получаются различные оценки вектора a (и, соответственно, коэффициента b). Пусть a( j ) - оценка этого вектора из регрессии xj по x-j. Равенство

 

при  выполняется в том и только в том случае, если e = 0 и, соответственно, R2 = 1.

При n = 2 регрессия x1 по x2 называется прямой, регрессия x2 по x1 - обратной.

Замечание: в отечественной литературе простой обычно называют регрессию с одной переменной в правой части, а регрессию с несколькими независимыми факторами - множественной.


3.3. Ортогональная регрессия

В случае, когда ограничения на параметры a состоят в требовании равенства единице длины этого вектора

a/a = 1,

получается ортогональная регрессия, в которой расстояния от точек облака наблюдений до гиперплоскости регрессии измеряются перпендикулярно этой гиперплоскости.

Уравнение ортогональной регрессии имеет вид:

  .

Теперь применение МНК означает минимизацию  по a при указанном ограничении на длину этого вектора. Из условия равенства нулю производной по a соответствующей функции Лагранжа следует, что

   причем ,

(l - половина множителя Лагранжа указанного ограничения) т.е. применение МНК сводится к поиску минимального собственного числа l ковариационной матрицы M и соответствующего ему собственного (правого) вектора a. Благодаря свойствам данной матрицы, искомые величины существуют, они вещественны, а собственное число неотрицательно (предполагается, что оно единственно). Пусть эти оценки получены.

В ортогональной регрессии все переменные x выступают изучаемыми или моделируемыми, их расчетные значения определяются по формуле

  ,

а аналогом коэффициента детерминации выступает величина

     ,

где  - суммарная дисперсия переменных x, равная следу матрицы M.

Таким образом, к n оценкам вектора a простой регрессии добавляется оценка этого вектора ортогональной регрессии, и общее количество этих оценок становится равным n+1.

Задачу простой и ортогональной регрессии можно записать в единой, обобщенной форме:

       ,

где W - диагональная n´n-матрица, на диагонали которой могут стоять 0 или 1.

В случае, если в матрице W имеется единственный ненулевой элемент wjj = 1, это - задача простой регрессии xj по xj; если W является единичной матрицей, то это - задача ортогональной регрессии. Очевидно, что возможны и все промежуточные случаи, и общее количество оценок регрессии - 2n-1.

Задача ортогональной регрессии легко обобщается на случай нескольких уравнений и альтернативного представления расчетных значений изучаемых переменных.

Матрица M, являясь вещественной, симметрической и положительно полуопределенной, имеет n вещественных неотрицательных собственных чисел, сумма которых равна , и n соответствующих им вещественных взаимноортогональных собственных векторов, дающих ортонормированный базис в пространстве наблюдений. Пусть собственные числа, упорядоченные по возрастанию, образуют диагональную матрицу L, а соответствующие им собственные вектора (столбцы) - матрицу A. Тогда

       A/A = InMA = AL.

Собственные вектора, если их рассматривать по убыванию соответствующих им собственных чисел,  есть главные компоненты облака наблюдений, которые показывают направления наибольшей “вытянутости” (наибольшей дисперсии) этого облака. Количественную оценку степени этой “вытянутости” (дисперсии) дают соответствующие им собственные числа.

Пусть первые k собственных чисел “малы”.

 - сумма этих собственных чисел;

AE - часть матрицы A, соответствующая им (ее первые k стоблцов); это - коэффициенты по k уравнениям регрессии или k младших главных компонент;

AF - остальная часть матрицы A, это - n-k старших главных компонент или собственно главных компоненет;

A = [AE,AF];

xAE = 0 - гиперплоскость ортогональной регрессии размерности n-k;

 - координаты облака наблюдений в базисе главных компонент;

E - N´k-матрица остатков по уравнениям регрессии;

F - N´(n-k)-матрица, столбцы которой есть так называемые главные факторы.

Поскольку A/ = A-1 и AA/ = In, можно записать

       .

Откуда получается два возможных представления расчетных значений переменных:

  .

Первое из них - по уравнениям ортогональной регрессии, второе (альтернативное) - по главным факторам.

 - аналог коэффициента детерминации, дающий оценку “качества” этих обеих моделей.


3.4. Многообразие оценок регрессии

Множество оценок регрессии не исчерпывается 2n-1 отмеченными выше элементами.

D - N/´N-матрица преобразований в пространстве наблюдений ().

Преобразование в пространстве наблюдений проводится умножением слева обеих частей уравнения регрессии (записанного по наблюдениям) на эту матрицу:

  .

После такого преобразования - если D не единичная матрица - применение МНК приводит к новым оценкам регрессии (как простой, так и ортогональной), при этом параметр b - если  - теряет смысл свободного члена в уравнении.

C - невырожденная n´n-матрица преобразований в пространстве переменных.

Преобразование в пространстве пременных проводится следующим образом:   ,

и в результате получается новое выражение для уравнения регрессии:

      ,

где .

МНК-оценки f и a количественно различаются, если C не единичная матрица. Однако f является новой оценкой, только если .  В противном случае она совпадает с исходной оценкой a с точностью до сделанного преобразования (представляет ту же оценку в другой метрике или шкале измерения).

Результаты преобразования в пространстве переменных различны для простой и ортогональной регрессии.

В случае простой регрессии xj по x-j это преобразование не приводит к получению новых оценок, если j-я строка матрицы C является ортом, т.е. в независимые факторы правой части не “попадает” - после преобразования - моделируемая переменная. Если C диагональная матрица с элементами cjj=1,  при , то оценка f дается в так называемой стандартизированной шкале.

Если j-я строка матрицы имеет ненулевые внедиагональные элементы, Cf и a совпадают только при R2 = 1.

В случае ортогональной регрессии задача определения f записывается следующим образом:

      ,

где .

После обратной подстановки переменных и элементарного преобразования она приобретает следующий вид:

      ,

где .

Решение этой задачи дает новую оценку, даже если C является диагональной матрицей.   Это - так называемая регрессия в метрике W-1.


4. Основная модель линейной регрессии

4.1. Различные формы уравнения регрессии

x - моделируемая переменная;

z - n-вектор-строка независимых факторов;

x = za + b + e - уравнение регрессии;

X, Z - N-вектор и N´n-матрица наблюдений за соответствующими переменными;

 - n-вектор-строка средних значений переменных z.

Первые две формы уравнения регрессии по наблюдениям аналогичны используемым в предыдущем разделе и  имеют следующий вид:

    e,

или       (истинные значения заменены их оценками)

- исходная форма;

   

- сокращенная форма.

Оператор МНК-оценивания для этих двух форм имеет следующий вид:

,

где  - nxn-матрица ковариации (вторых центральных моментов) z;

 - n-вектор-столбец ковариации между z и x.

Третья форма - без свободного члена - записывается следующим образом:

     ,

где Z - N´(n+1)-матрица, последний столбец которой состоит из единиц (равен 1N);

a - (n+1)-вектор-столбец, последний элемент которого является свободным членом регрессии.

Какая из этих форм регрессии используется и, соответственно, что именно означают a и Z, будет в дальнейшем ясно из контекста или будет специально поясняться.

В этом разделе, в основном,  используется форма уравнения регрессии без свободного члена.

Оператор МНК-оценивания для нее записывается более компактно:

       ,

но  - (n+1)´(n+1)-матрица вторых начальных моментов [z,1];

 - (n+1)-вектор-столбец вторых начальных моментов между [z,1] и x.

Если в этом операторе вернуться к обозначениям первых двух форм уравнения регрессии, то получится следующее выражение:

   ,

из которого видно, что

- обратная матрица ковариации z (размерности N´N) совпадает с соответствующим блоком обратной матрицы вторых начальных моментов (размерности (N+1)´(N+1));

- результаты применения двух приведенных операторов оценивания одинаковы.


4.2. Основные гипотезы, свойства оценок

1. Между переменными x и z существует зависимость x = za + b + e.

2. Переменные z детерминированы, наблюдаются без ошибок и линейно независимы (в алгебраическом смысле).

3. E(e) = 0, E(ee/) = s2IN.

4. В модели линейной регрессии математической статистики, в которой переменные z случайны, предполагается, что ошибки e не зависят от них и - по крайней мере - не скоррелированы с ними. В данном случае это предположение формулируется так: независимо от того, какие значения принимают переменные z, ошибки e удовлетворяют гипотезе 3.

В этих предположениях a относится к классу линейных оценок, т.к.

      a = LX,

где L =  - неслучайный (n+1)´(N+1)-оператор оценивания;

а также доказывается что

- a является несмещенной оценкой a, их матрица ковариации Ma равна (в обозначениях сокращенной формы уравнения регрессии это выражение давало бы - как показано в предыдущем пункте - матрицу ковариации коэффициентов регрессии при независимых факторах, а дисперсия свободного члена определялась бы по формуле ), и дисперсия любой их линейной комбинации минимальна на множестве линейных оценок, т.е. они относятся к классу BLUE - Best Linear Unbiased Estimators;

- несмещенной оценкой s2 является

    = .

Для расчета коэффициента детерминации можно использовать следующую формулу:

   ,

где ,

.

Если предположить, что e (и, следовательно,  их оценки e) распределены нормально:

      e,

то оценки a также будут иметь нормальное распределение:

       ,

они совпадут с оценками максимального правдоподобия, будут несмещенными, состоятельными и эффективными.

В этом случае можно строить доверительные интервалы для оценок и использовать статистические критерии проверки гипотез.

(1-q)100-процентный доверительный интервал для aii =1,...,n+1 (an+1=b), строится следующим образом:

       ,

где  - среднеквадратическое отклонение ai ( - ii-й элемент матрицы M-1);

tN-n-1,1-q - (1-q)100-процентный двусторонний квантиль tN-n-1-распределения.

Для проверки нулевой гипотезы ai = 0 применяется t-критерий. Гипотеза отвергается (влияние i-го фактора считается статистически значимым) с вероятностью ошибки (1-го рода) q, если

    ,

т.к. при выполнении нулевой гипотезы величина  имеет tN-n-1-распределение. Эта величина называется t-статистикой (ti-статистикой) и ее фактическое значение обозначается в дальнейшем .

При использовании современных статистических пакетов программ не требуется искать нужные квантили t-распределения в статистических таблицах, поскольку в них (пакетах) рассчитывается уровеньошибки , с которой можно отвергнуть нулевую гипотезу, т.е. такой, что:

    ,

и, если он меньше желаемого значения либо равен ему, то нулевая гипотеза отвергается.

Для проверки нулевой гипотезы об отсутствии искомой связи  применяется  F-критерий. Если эта гипотеза верна, величина

 

имеет Fn,N-n-1-распределение. Данная величина называется F-статистикой и ее фактическое значение обозначается в дальнейшем Fc. Нулевая гипотеза отвергается (влияние z на x считается статистически значимым) с вероятностью ошибки (1-го рода) q, если

    ,

где Fn,N-n-1,1-q - (1-q)100-процентный (односторонний) квантиль Fn,N-n-1-распределения.

В современных статистических пакетах программ также рассчитывается уровень qс ошибки для Fc, такой, что

      .

Уместно отметить, что приведенные в разделе 2.1. сведения являются частным случаем рассмотренных здесь результатов при n=0.


4.3. Независимые факторы

Если не выполняется 2-я гипотеза, и некоторые из переменных z линейно зависят от других, то матрица M вырождена, и использование приведенного оператора оценивания невозможно.

Вообще говоря, предложить метод оценивания параметров регрессии в этом случае можно. Так, пусть множество независимых факторов разбито на две части (в этом фрагменте используются обозначения сокращенной формы уравнения регрессии):

       , ,

   и .

Тогда можно записать уравнение регрессии в форме

+ e,

и оценить линейную комбинацию параметров  (предполагая, что столбцы Z1 линейно независимы). Но чтобы оценить сами параметры, нужна априорная информация, например: .

Однако вводить в регрессию факторы, которые линейно зависят от уже введенных факторов, не имеет смысла, т.к. при этом не растет объясненная дисперсия (см. ниже).

На практике редко встречается ситуация, когда матрица M вырождена. Более распространен случай, когда она плохо обусловлена (между переменными Z существуют зависимости близкие к линейным). В этом случае имеет место мультиколлинеарность факторов. Поскольку гипотеза 2 в части отсутствия ошибок измерения, как правило, нарушается, получаемые (при мультиколлинеарности) оценки в значительной степени обусловлены этими ошибками измерения. В таком случае (если связь существует), обычно, факторы по отдельности оказываются незначимыми по t-критерию, а все вместе - существенными по F-критерию. Поэтому в регрессию стараются не вводить факторы сильно скоррелированные с остальными.

В общем случае доказывается, что

    ,

где  и  - дисперсии, объясненные факторами z1 и z2 по отдельности;

 - прирост объясненной дисперсии, вызванный добавлением в регрессии факторов z2 к факторам z1.

В соотношении для прироста объясненной дисперсии:

- левая часть выполняется как строгое равенство, если и только если

 (коэффициент детерминации в регрессии по z1 уже равен единице), или

вектор остатков в регрессии по z1 ортогонален факторам , т.е. имеет с ними нулевую корреляцию (возможное влияние факторов z2 уже “приняли” на себя факторы z1), или

факторы  линейно зависят от факторов ;

- правая часть выполняется как строгое равенство, если и только если

факторы  ортогональны  факторам .

Если в множество линейно независимых факторов добавлять новые элементы, то коэффициент детерминации растет вплоть до единицы, после чего рост прекращается. Своего максимального значения он обязательно достигнет при n = N (возможно и раньше) - даже если вводимые факторы не влияют по-существу на изучаемую переменную. Поэтому сам по себе коэффициент детерминации не может служить статистическим критерием “качества” уравнения регрессии. Более приемлем в этой роли коэффициент детерминации, скорректированный на число степеней свободы:

     ,

который может и уменьшиться при введении нового фактора. Точную же статистическую оценку качества (в случае нормальности распределения остатков) дает F-критерий. Однако учитывая, что значения Fc оказываются несопоставимыми при изменении n (т.к. получают разное число степеней свободы), наиболее правильно эту роль возложить на уровень ошибки qс для Fc.

В результате введения новых факторов в общем случае меняются оценки параметров при ранее введенных факторах:

,

где  - оценка параметров регрессии по z1 (до введения новых факторов);

A12 - матрица, столбцы которой являются оценками параметров регрессии переменных z2 по z1.

“Старые” оценки параметров сохраняются (), если и только если

- коэффициент детерминации в регрессии по z1 уже равен единице, или

вектор остатков в регрессии по z1 ортогонален факторам  (в этих двух случаях a2 = 0), или

факторы  ортогональны  факторам  (в этом случае A12 = 0).

Итак, возникает проблема определения истинного набора факторов, фигурирующих в гипотезе 1, который позволил бы найти оценки истинных параметров регрессии. Определение такого набора факторов есть спецификация модели. Формальный подход к решению этой проблемы заключается в поиске так называемого наилучшего уравнения регрессии, для чего используется процесс (метод) шаговой регрессии.

Пусть z - полный набор факторов, потенциально влияющих на x. Рассматривается процесс обращения матрицы ковариации переменных [x,z]. В паре матриц (n+1)´(n+1)

  

делаются одновременные преобразования их строк в орты. Известно, что, если 1-ю матрицу преобразовать в единичную, то на месте 2-й матрицы будет получена обратная к 1-й (исходной). Пусть этот процесс не завершен, и только несколько строк 1-й матрицы (но не ее 1-я строка) преобразованы в орты. Это - ситуация на текущем шаге процесса.

На этом шаге строкам-ортам в 1-й матрице соответствуют включенные в регрессию факторы, на их месте в 1-й строке этой матрицы оказываются текущие оценки параметров регрессии при них. Строкам-ортам во 2-й матрице соответствуют невведенные факторы, на их месте в 1-й строке 1-й матрицы размещаются коэффициенты ковариации этих факторов с текущими остатками изучаемой переменной. На месте mxx показывается текущее значение остаточной дисперсии.

На каждом шаге оцениваются последствия введения в регрессию каждого не включенного фактора (преобразованием в орты сответствующих строк 1-й матрицы) и исключения каждого введенного ранее фактора (преобразованием в орты соответствующих строк 2-й матрицы). Выбирается тот вариант, который дает минимальный уровень ошибки qс для Fc. Процесс продолжается до тех пор, пока этот уровень сокращается.

Иногда в этом процессе используются более простые критерии. Например, задается определенный уровень t-статистики (правильнее - уровень ошибки qс для tc), и фактор вводится в уравнение, если фактическое значение tc для него выше заданного уровня (ошибка qс ниже ее заданного уровня), фактор исключается из уравнения в противном случае.

Такие процессы, как правило, исключают возможность введения в уравнение сильно скоррелированных факторов, т.е. решают проблему мультиколлинеарности.

Формальные подходы к спецификации модели должны сочетаться с теоретическими подходами, когда набор факторов и, часто, знаки параметров регрессии определяются из теории изучаемого явления.


4.4. Прогнозирование

Требуется определить наиболее приемлемое значения для xN+1 (прогноз), если известны значения независимых факторов (вектор-строка):

       .

 - истинное значение искомой величины;

 - ожидаемое значение;

 - искомый МНК-прогноз.

Полученный прогноз не смещен относительно ожидаемого значения:

    ,

и его ошибка   имеет нулевое матожидание:

      E(d) = 0,

и дисперсию , которая минимальна в классе линейных оценок a.

Оценка стандартной ошибки прогноза при n = 1 рассчитывается по формуле

.



5. Гетероскедастичность и автокорреляция ошибок

5.1. Обобщенный метод наименьших квадратов (взвешенная регрессия)

Если матрица ковариации ошибок по наблюдениям отлична от s2IN (нарушена 3-я гипотеза основной модели), то МНК-оценки параметров регрессии остаются несмещенными, но перестают быть эффективными в классе линейных. Смещенными оказываются МНК-оценки их ковариции, в частности оценки их стандартных ошибок (как правило, они преуменьшаются).

Пусть теперь E(ee/) = s2W, где  W - вещественная, симметрическая положительно определенная матрица (структура ковариации ошибок). Обобщенный метод наименьших квадратов (ОМНК), приводящий к оценкам класса BLUE, означает минимизацию взвешенной суммы квадратов отклонений:

   .

Для доказательства проводится преобразование в пространстве наблюдений с помощью невырожденной N´N-матрицы D, такой, что . После такого преобразования остатки De начинают удовлетворять 2-й гипотезе.

На практике с матрицами W общего вида обычно не работают. Рассматривается два частных случая.


5.2. Гетероскедастичность ошибок

Пусть ошибки не скоррелированы по наблюдениям, и матрица W диагональна. Если эта матрица единична, т.е. дисперсии ошибок одинаковы по наблюдениям (гипотеза 3 не нарушена), то имеет место гомоскедастичность или однородность ошибок по дисперсии. В противном случае констатируют гетероскедастичность ошибок или их неоднородность по дисперсии.

Для проверки гипотезы о гомоскедастичности можно использовать критерий Бартлета. Для расчета bc - статистики, лежащей в основе применения этого критерия, множество МНК-оценок остатков ei, i = 1,...,N делится на k непересекающихся подмножеств.

Nl - количество элементов в l-м подмножестве, ;

 - оценка дисперсии в l-м подмножестве;

 - отношение средней арифметической дисперсий к средней геометрической; это отношение больше или равно единице, и чем сильнее различаются дисперсии по подмножествам, тем оно выше;

.

При однородности наблюдений по дисперсии эта статистика распределена как .

Факт неоднородности наблюдений по дисперсии остатков мало сказывается на качестве оценок регрессии, если эти дисперсии не скоррелированы с независимыми факторами. Проверить наличие зависимости дисперсии ошибок от факторов-регрессоров можно следующим образом.

Все наблюдения упорядочиваются по возрастанию одного из независимых факторов или расчетного значения изучаемой переменной Za. Оценивается остаточная дисперсия  по K “малым” и  по K “большим” наблюдениям (“средние” N-2K наблюдения в расчете не участвуют, а K выбирается приблизительно равным трети N). В случае гомоскедастичности ошибок отношение  распределено как FK-n-1,K-n-1.

Если гипотеза гомоскедастичности отвергается, необходимо дать оценку матрице W. Совместить проверку этой гипотезы с оценкой данной матрицы можно следующим образом.

В качестве оценок дисперсии ошибок по наблюдениям принимаются квадраты оценок остатков , и строится регрессия  на все множество независимых факторов или какое-то их подмножество. Если какая-то из этих регрессий оказывается статистически значимой, то гипотеза гомоскедастичности отвергается, и в качестве оценок  ( по предположению) примаются расчетные значения .

В некоторых статистических критериях проверки на гомоскедастичность в качестве оценок wii принимаются непосредственно .

Имея оценку матрицы W, можно провести преобразование в пространстве наблюдений с помощью матрицы , после которого остатки De можно считать удовлетворяющими гипотезе 3.


5.3. Автокорреляция ошибок

Пусть теперь наблюдения однородны по дисперсии и их последовательность имеет физический смысл и жестко фиксирована (например, наблюдения проводятся в последовательные моменты времени).

Для проверки гипотезы о наличии линейной автокорреляции 1-го порядка ошибок по наблюдениям

  ,

где r - коэффициент авторегрессии 1-го порядка;

h - N-вектор-столбец {hi};

можно использовать критерий Дарбина-Уотсона или DW-критерий (при автокорреляции 2-го и более высоких порядков его применение становится ненадежным).

Фактическое значение dc статистики Дарбина-Уотсона (отношения Фон-Неймана) или DW-статистики раcсчитывается следующим образом:

 

Оно лежит в интервале от 0 до 4, в случае отсутствия автокорреляции ошибок приблизительно равно 2, при положительной автокорреляции смещается в меньшую сторону, при отрицательной - в большую сторону.

Если r = 0, величина d распределена нормально, но параметры этого распределения зависят не только от N и n. Поэтому существует по два значения для каждого (двустороннего) квантиля, соответствующего определенным q, N и n: его нижняя dL и верхняя dU границы. Нулевая гипотеза принимается, если ; она отвегается в пользу гипотезы о положительной автокорреляции, если , и в пользу гипотезы об отрицательной автокорреляции, если . Если  или , вопрос остается открытым (это - зона неопределенности DW-критерия).

Пусть нулевая гипотеза отвергнута. Тогда необходимо дать оценку матрицы W.

Оценка r параметра авторегрессии r определяется из приближенного равенства

,

или рассчитывается непосредственно из регрессии e на него самого со двигом на одно наблюдение.

Оценкой матрицы W является , а матрица D

преобразований в пространстве наблюдений равна .

Для преобразования в простанстве наблюдений, называемом в данном случае авторегрессионным, используют обычно указанную матрицу без 1-й строки, что ведет к сокращению количества наблюдений на одно. В результате такого преобразования из каждого наблюдения, начиная со 2-го, вычитается предыдущее, умноженное на r, теоретическими остатками становятся hi, которые удовлетворяют гипотезе 2.

После этого преобразования снова оцениваются параметры регрессии. Если новое значение DW-статистики неудовлетворительно, то можно провести следующее авторегрессионное преобразование.

Обобщает процедуру последовательных авторегрессионных преобразований метод Кочрена-Оркарта, который заключается в следующем.

Для одновременной оценки r, a и b используется критерий ОМНК (в обозначениях исходной формы уравнения регрессии):

,

где zi - n-вектор-строка значений независимых факторов в i-м наблюдении (i-строка матрицы Z).

Поскольку производные функционала по искомым величинам нелинены относительно них, применяется итеративная процедура, на каждом шаге которой сначала оцениваются a и b при фиксированном значении r предыдущего шага (на первом шаге обычно r = 0), а затем - r при полученных значениях a и b. Процесс, как правило, сходится.


Практическое занятие №2. «Eviews при построении и анализе линейной однофакторной модели регрессии»

Пример 2. Имеются следующие данные по 10 фермерским хозяйствам области:

№ п\п

1

2

3

4

5

6

7

8

9

10

Урожайность зерновых ц\га

15

12

17

21

25

20

24

14

23

13

Внесено удобрений на 1 га посевов, кг

4,0

2,5

5,0

5,8

7,5

5,7

7,0

3,0

6,0

3,5


Необходимо:

1. Создать файл с исходными данными в среде Excel (файл example_02.xls).

2. Осуществить импорт исходных данных в Eviews.

3. Создать workfile (рабочий файл).

4. Найти значения описательных статистик по каждой переменной и объяснить их.

5. Построить поле корреляции моделируемого (результативного) и факторного признаков. Объяснить полученные результаты.

6. Найти значение линейного коэффициента корреляции и пояснить его смысл.

7. Определить параметры уравнения парной регрессии и интерпретировать их. Объяснить смысл полученного уравнения регрессии.

8. Оценить статистическую значимость коэффициента регрессии и уравнения в целом. Сделать выводы.

9. Объяснить полученное значение .

10. Построить эмпирическую и теоретическую линию регрессии и объяснить их.

11. Построить и проанализировать график остатков.

12. С вероятностью 0,95 построить доверительный интервал для ожидаемого значения урожайности по точечному значению .

13. Оформить отчет по занятию.


Порядок выполнения задания

1. В Excel исходные данные должны быть организованы таким образом, чтобы в каждой колонке были представлены данные по соответствующей переменной (рис. 21). Имена переменных набираются латинскими буквами. Файл необходимо сохранить в формате Excel 5.0/95 (рис. 22). Введем обозначения: урожайность зерновых – переменная Productivity (зависимая, Y); внесено удобрений на 1 га посевов – Fertilizers (независимая, X).

Рис. 21.

Рис. 22.

2. Создаем рабочий файл для импортирования исходных данных из Excel в Eviews, работая с диалоговым окном File/New/Workfile (рис. 23), далее выбираем: Procs/Import/Read Text-Lotus-Excel (рис. 24).

Рис. 23.

Рис. 24.

3. Далее в открывшемся окне находим и выбираем файл Excel с исходными данными (файл не должен в этот момент использоваться любыми программами), осуществляя автоматический импорт исходных данных в workfile (рис. 25). В следующем открывшемся диалоговом окне нужно указать адрес ячейки, в которой записаны данные первого по счету наблюдения и число переменных в рассматриваемом примере (рис. 26).. Если все выполнено правильно, то в открывшемся окне workfile должны появиться имена переменных, а также константа (с) и остатки ( resid) (рис. 27).

Рис. 25.

Рис. 26.

Рис.27.

Рис. 28.

Сохраним рабочий файл (рис. 28).

4. Значения описательных статистик находим следующим образом: в окне workfile выделяем переменные, щелкаем мышкой по выделенной части и далее выбираем: Open/As Group/ (рис. 29). Открывается окно с исходными данными. Новую группу можно сохранить, выбрав опцию Name (рис. 30). Для просмотра описательных статистик View/Descriptive Stats/Common Sample (рис 31). Результат представлен на рис. 32.

Рис. 29.

Рис. 30.

Рис. 31.

Рис. 32.

5. В окне workfile (рис. 32) для построения поля корреляции необходимо выбрать следующие пункты меню: VIEW/GRAPH/SCATTER/SIMPLE SCATTER/ (рис. 33). Полученный в результате график представляет собой поле корреляции результативного и факторного признаков (рис. 34).

6. В окне Workfile (используя созданную группу из двух переменных) выбрать: /VIEW/CORRELATION/ (рис. 35). Полученная таблица - корреляционная матрица, в которой отражено значение коэффициента парной корреляции результативного и факторного признаков (рис. 36).

Рис. 33.

Рис. 34.

Рис. 35.

Рис. 36.

7. В диалоговом окне описать в общем виде искомое уравнение: LS PRODUCTIVITY C FERTILIZERS <Enter> (метод наименьших квадратов (LS) эндогенная переменная, константа, экзогенная переменная), или выбрать в строке главного меню EVIEWS: QUICK/ESTIMATE EQUATION/ PRODUCTIVITY C FERTILIZERS (рис. 37). В открывшемся окне (рис. 38) должны быть переменные: зависимая переменная, применяемый метод, число наблюдений, параметры уравнения регрессии, стандартные ошибки, значения t – статистик и соответствующие им вероятности, значение и ряд других показателей.

Рис. 37.

Рис. 38.

8. и 9. Результаты выполнения п.7 позволяют оценить статистическую значимость параметров уравнения регрессии и объяснить полученное значение R .

Рис. 39.

10. Для построения эмпирической линии регрессии в окне workfile выделить группу переменных и выбрать: VIEW/GRAPH/SCATTER/SCATTER WITH REGRESSION/ (рис. 39). В промежуточном окне (рис. 40) необходимо нажать <Ok>. Полученный график (рис. 41) – эмпирическая линия регрессии. Чтобы построить теоретическую (подогнанную) линию регрессии, необходимо найти теоретические (вычисленные с помощью уравнения регрессии) значения результативного признака. Для этого открыть окно с параметрами уравнения регрессии, далее выбрать Forecast (рис. 42). Появится окно (рис. 43), в котором к исходным добавилась новая переменная PRODUCTIVIf (прогнозное, (теоретическое, выровненное) значение переменной PRODUCTIVITY). Затем, выделив все переменные (включая теоретическое значение результативного признака), в командной строке записать SCAT FERTILIZERS PRODUCTIVITY PRODUCTIVIf. Полученный график (рис. 44) – теоретическая (подогнанная) линия регрессии.

Рис. 40.

Рис. 41.

Рис. 42.

Рис. 43.

Рис. 44.

11. Данная операция возможна только в том случае, если ей предшествует построение регрессионного уравнения. В окне Workfile можно дважды щелкнуть на переменной Resid (рис. 45). Далее, выбрать: VIEW/LINE GRAPH/, или, открыв окно с параметрами уравнения регрессии, выбрать: VIEW /ACTUAL, FITTED…/ACTUAL, FITTEDTABLE/ (рис. 46). Результат представлен на рис. 47. Другой вариант вывода (фактические, предсказанные значения переменных, остатки, график остатков) – рис. 48.

Рис. 45.

Рис. 46.

Рис. 47.

Рис. 48.

12. Для нахождения границ доверительного интервала в командной строке необходимо указать (рис. 49):

GENR XK = 5 * 1.05

GENR YFK = 4.53 +2.77*XK

GENR h = ((1 + 0.25^2)/1.6957^2) ^0.5

GENR CI = 2.31*(1.07/10^0.5)*h

В результате искомые границы определяются следующим образом:

YFK CI , т.е. от YFK+CI до YFK-CI (см. рис. 50).

Рис. 49.

Рис. 50.

13. Оформить отчет по занятию.

Отчет должен содержать : подробные пояснения расчетов, ссылки на используемые формулы, результаты работы Eviews в виде экранных копий, другую, необходимую на Ваш взгляд, информацию.


Практическое занятие № 3. «Применение Eviews при построении и анализе линейной однофакторной модели регрессии»
(Выполняется самостоятельно).

Пример 3. Компания American Express Company в течение долгого времени полагала, что владельцы ее кредитных карточек имеют тенденцию путешествовать более интенсивно, как по делам бизнеса, так и для развлечений. Как часть объемного исследования, проведенного Нью-Йоркской компанией рыночных исследований по заказу American Express Company, было осуществлено определение взаимосвязи между путешествиями и расходами владельцев кредитных карточек. Исследовательская фирма случайным образом выбрала 25 владельцев карточек из компьютерного файла American Express Company и записала суммы их общих расходов за определенный период времени. Для выбранных владельцев карточек фирма так же подготовила и разослала по почте вопросы о числе миль, которые провел в путешествиях владелец карточки за изучаемый период. Данные, полученные из опроса, составляют исходную информацию анализа (Х – число миль, проведенных в пути; У – расходы путешественников (усл. ден ед.).

№ п\п

Miles (Х)

Costs (У)

1

1211

1802

2

1345

2405

3

1422

2005

4

1687

2511

5

1849

2332

6

2026

2305

7

2133

3016

8

2253

3385

9

2400

3090

10

2468

3694

11

2699

3371

12

2806

3998

13

3082

3555

14

3209

4692

15

3466

4244

16

3643

5298

17

3852

4801

18

4033

5147

19

4267

5738

20

4498

6420

21

4533

6059

22

4804

6426

23

5090

6321

24

5233

7026

25

5439

6964


1. Создать файл с исходными данными в среде Excel (файл example_03.xls).

2. Осуществить импорт исходных данных в Eviews.

3. Создать рабочий файл (workfile).

4. Найти значения описательных статистик по каждой переменной и объяснить их (рис. 51).

5. Построить поле корреляции моделируемого (результативного) и факторного признаков (рис. 52). Объяснить полученные результаты.

6. Найти значение линейного коэффициента корреляции и пояснить его смысл (рис. 53).

7. Определить параметры уравнения парной регрессии и интерпретировать их. Объяснить смысл полученного уравнения регрессии (рис. 54).

8. Оценить статистическую значимость коэффициента регрессии и уравнения в целом. Сделать выводы.

9. Объяснить полученное значение .

10. Построить эмпирическую и теоретическую линию регрессии и объяснить их (рис. 55).

11. Построить и проанализировать график остатков (рис. 56).

12. С вероятностью 0,95 построить доверительный интервал для оценки ожидаемого значения средних расходов владельцев карточек, дальность путешествий которых составила 4000 миль (рис. 57).

13. Оформить отчет по занятию.



Результаты расчетов по практическому занятию №3 для самоконтроля

Рис. 51.

Рис. 52.

Рис. 53.

Рис. 54.

Рис. 55.

Рис. 56.

Рис. 57.