برای مقایسه میانگین اثرات یک یا چند متغیر مستقل بر روی یک متغیر وابسته براساس طرح های آزمایشی مختلف، روش های آماری متعددی مانند آزمون t و آزمون تحلیل واریانس تک متغیری ANOVAبکار گرفته می شود.اما در حالتی که بیش از یک متغیر وابسته مدنظر قرار دارد، با توجه به وابستگی بین متغیرهای وابسته از روش های تحلیل چند متغیره استفاده می شود.

 

در طرح تحلیل واریانس چند متغیری دو یا چند متغیر وابسته پیوسته با یک یا چند متغیر مستقل مقوله ای ارزیابی می شوند. برای مثال مطالعه اثرات جنسیت(مرد، زن) روی رضایت شغلی کارگران و غیبت آنان از کار و یا بررسی اثرات نوع تدبیر درمانی (رفتاری-شناختی، روان کاوی، درمان فشرده) روی ارزیابی کارکرد کلی(پیامد بالینی) و رضایت مراجع از خدمات درمانی، از این قبیل می باشد. فرضیه صفر برای این آزمون در حالت کلی به صورت زیر است :H_0: μ_1=μ_2=⋯=μ_i

این فرضیه بیان می کند که میانگین همه گروه ها در جامعه برابر می باشد. 
در روش MANOVA ماتریس حاصلضرب برداری کل(T) به دو گروه ماتریس حاصلضرب برداری بین گروه ها (B) و ماتریس حاصلضرب برداری درون گروه ها(W) تفکیک می شود.T=B+W 
Tمیزان انحراف نمونه ها از میانگین را در هر سطح متغیر مستقل یا گروه از میانگین کل هر متغیر وابسته را نشان می دهد.ماتریس B اثرات متفاوت تدابیرآزمایشی را روی مجموعه متغیرهای وابسته نشان می دهد.در نهایت W نشان می دهد که نمونه ها در هر سطح یا گروه متغیر مستقل چگونه از میانگین های متغیرهای وابسته منحرف می شوند. چهار آزمون آماری متعارف در این زمینه وجود دارد : اثر پیلایی، لامبدای ویلکز، اثر هتلینگ و روش بزرگترین ریشه دوم. پرکاربردترین این آماره ها لامبدای ویلکز می باشد که براساس نسبت Wبر B+Wساخته می شود.در عمل اگر اثرمتغیر مستقل بر متغیرهای وابسته از نظر آماری معنادار باشد، یعنی اگر تدابیرآزمایشی اثرگذار باشند، در اینصورت مقدار B نسبتا بزرگ و Wکوچک خواهد بود.

دلایل استفاده از MONOVA

اغلب اتفاق می افتد زمانی که هدف محقق بررسی بیش از یک متغیر وابسته است، به جای استفاده از روش های چند متغیری هر بار یکی از متغیرهای وابسته را در نظر گرفته و از روش ANOVA برای تحلیل استفاده می نماید. استفاده از این روش می تواند اشکالاتی را به وجود آورد که در ادامه به بیان آن ها می پردازیم :
1- آزمون های آماری تک متغیری به طور معمول همبستگی متقابل متغیرهای وابسته را نادیده می گیرد. در حالیکه روش MANOVAهمبستگی متقابل بین متغیرهای وابسته را با بررسی ماتریس های واریانس کواریانس در نظر می گیرد. 
2- روش MANOVA محققان را قادر می سازد تا روابط بین متغیرهای وابسته را در هر سطحی از متغیرهای مستقل بررسی کنند.
3- این روش به شناسایی متغیرهای وابسته با بیشترین توان تفکیک در گروه بندیکمک می کند.
4- MANOVAبه واسطه توان افزایش یافته در موقعیت چند متغیری می تواند تفاوت های گروهی نامشخص تحت شرایط تحلیل های آماری تک متغیری را آشکار نماید.
5- روش MANOVA سطح آلفای کلی یا میزان خطای نوع اول (یعنی احتمال این که فرض صفر درست بوده و به اشتباه رد شود)را کنترل می کند. برای مثال اگر بخواهیم تفاوت های جنسیتی(متغیر مستقل) را با چهار متغیر وابسته رضایت شغلی (پرداخت، مزایا، همکاران و محل کار) بررسی کنیم و برای این کار از چهار آزمون جداگانه t و یا روش ANOVAاستفاده نماییم، با سطح خطای 5% برای هر آزمون با خطای نوع اول برابر 0.054 مواجه خواهیم شد. در این حالت استفاده از روش MANOVA این مشکل را برطرف می کند.

چه موقع نباید از MANOVA استفاده کرد

حداقل دو حالت وجود دارد که تحت آن شرایط نباید از MANOVA استفاده نمود و یا اینکه در کاربرد آن ها باید جانب احتیاط رعایت شود : 
1- اگر همبستگی بین متغیرهای وابسته وجود نداشته باشد. موقعیت ایده آل برای استفاده از تحلیل واریانس چند متغیری زمانی است که متغیرهای وابسته دارای همبستگی متوسط باشند. 
2- در شرایطی که متغیرهای وابسته دارای همبستگی بسیار بالایی هستند نیز نباید از MANOVA استفاده شود. از نظر آماری اینگونه همبستگی ها خطر هم خطی چندگانه را افزایش می دهد. از لحاظ مفهومی متغیرهایی که دارای همبستگی بالایی هستند، ممکن است سازه ی یکسانی را اندازه گیری کنند و بنابراین در مطالعه به عنوان متغیرهای زائد تلقی شوند.

مفروضه ها و محدودیت های آماری در تحلیل واریانس چند متغیری

نرمال بودن چند متغیری : یکی از شرایط استفاده از تحلیل واریانسواریانس چند متغیری نرمال بودن چند متغیری متغیرهای وابسته می باشد.در صورت عدم برقراری این فرض از روش های مختلف تبدیل داده ها مختلف استفاده می شود.
استقلال : کننده گان در تحقیق باید مستقل از یکدیگر باشند، به لحاظ آزمایشی می توان گفت اگر شرکت کنندگان به صورت تصادفی انتخاب شوند، فرض استقلال برقرار می شود.
مقادیر پرت و گمشده : روش تحلیل واریانس چند متغیری به مقادیر پرت یا کرانه های متغیرهای وابسته بسیار حساس است. خارج نکردن مقادیر پرت از تحلیل و یا تبدیل نکردن این داده ها می تواند میزان خطای نوع اول و دوم را افزایش دهد.
همگنی ماتریس های واریانس-کواریانس : روش استاندارد برای ارزیابی برابری ماتریس های کواریانس آزمونت M باکس است، که در آن معناداری آماری شاخص ناهمگنی یا نابرابری محسوب می شود. از جمله روش های اصلاح نقض این مفروضه ها تبدیل متغیرهای وابسته است. 
خطی بودن : فرض بر آن است که بین جفت متغیرهای وابسته روابط خطی برقرار است. در صورت مشاهده روابط غیرخطی می توان از تبدیل های مناسب استفاده نمود.

منبع : پژوهش چند متغیری کاربردی ، نوشته ی لاورنس اس.میزر، گلن گامست و ا.جی.گارینو. ترجمه دکتر حسن پاشا شریفی و همکاران. انتشارات رشد.



 
 
 
 
کلیات رگرسیون خطی ساده
نوشته شده توسط پژوهشگران آمار در ساعت 22:27

یکی از پرکاربردترین روش های آماری در علوم مختلف، اجرای انواع روش های رگرسیون برای تعیین رابطه ی بین یک متغیر وابسته با یک یا چند متغیر مستقل می باشد . متغیر وابسته ، پاسخ و متغیرهای مستقل ، متغیرهای توضیحی نیز نامیده می شوند. اجرای یک مدل رگرسیونی با تعریف مدل رگرسیون امکان پذیر است. مدل رگرسیون ساده با متغیر وابسته یY وp-1  متغیر مستقل X1,X2,…,Xp-1 به صورت زیر تعریف می شود ،

کلیات رگرسیون خطی ساده

به عنوان مثال فرض کنید یک محقق قصد دارد اثر دو متغیر سن و وزن را بر فشارخون اندازه گیری نماید. برای این مطالعه مقادیر سن و وزن برای n=500 نفر اندازه گیری می شود. در این مطالعه سن و وزن متغیرهای مستقل یا پیشگو و متغیر فشارخون متغیر وابسته می باشد.

معادله ی (1) را می توان به فرم ماتریسی زیر نیز تعریف کرد:

کلیات رگرسیون خطی ساده

ماتریسX مقادیر مشاهده شده ی p-1  متغیر را برای n نفر نشان می دهد. بردارY نیز مقادیر مشاهده  شده ی متغیر وابسته برای نمونه ای به حجم n می باشد. در یک مدل رگرسیونیکلیات رگرسیون خطی ساده ها پارامترهای مدل بوده و به کمک روش های مختلفی مانند روش حداقل مربعات و روش درستنمایی ماکزیمم برآورد می شوند.کلیات رگرسیون خطی ساده ها نیز جملات خطا نامیده می شوند و دارای توزیع نرمال با میانگین صفر و واریانسکلیات رگرسیون خطی ساده هستند.

کلیات رگرسیون خطی ساده

معادله ی رگرسیون با تعریف ماتریس متغیرهای توضیحی و بردارهای متغیر پاسخ ، پارامترهای مدل و جملات خطا به صورت زیر تعریف می شود :

کلیات رگرسیون خطی ساده

برآورد ضرایب رگرسیون :به کمک روش حداقل مربعات مقادیر بردارکلیات رگرسیون خطی ساده با می نیمم کردن معادله

کلیات رگرسیون خطی ساده

حاصل می شود. برآورد بردارکلیات رگرسیون خطی ساده  را باکلیات رگرسیون خطی ساده نشان داده و با توجه به فرم ماتریسی تعریف شده در معادله (2) به صورت زیر محاسبه می شود

کلیات رگرسیون خطی ساده

مقادیر برازش شده وخطاها : با برآورد پارامترهای مدل ، برآورد بردارYبا استفاده از رابطه ی

کلیات رگرسیون خطی ساده

حاصل می شود. بکلیات رگرسیون خطی ساده مقادیر برازش شده گفته می شود.

تفاوت بین مقادیر واقعی و مقادیر برازش شده مانده های رگرسیون نامیده می شوند؛

کلیات رگرسیون خطی ساده

مجموع و میانگین مربعات: برای تهیه ی جدول آنالیز واریانس و بررسی معنی داری مدل برازش داده شده  به معرفی مقادیر مجموع مربعات خطا و میانگین مربعات خطا می پردازیم.

مجموع مربعات کل : این مقدار مجموع توان دوم تفاضل هریک از اعضای بردار Y از میانگین این بردار حاصل می شود. مجموع مربعات کل با SSTO نمایش داده شده و به صورت زیر تعریف می شود .

SSTO دارای n-1 درجه آزادی است .

کلیات رگرسیون خطی ساده

  ماتریسی n*n است که تمام اعضای آن 1 هستند.

مجموع مربعات رگرسیون : این مقدار میزان  تغییراتی از متغیر پاسخ را که توسط مدل برازش شده تبیین می شود، نشان می دهد. مجموع مربعات رگرسیون دارای p-1 درجه آزادی می باشد:

کلیات رگرسیون خطی ساده

مجموع مربعات خطا : میزان تغییراتی از متغیر پاسخ که توسط مدل رگرسیون بیان نمی شود ، در مجموع مربعات خطا قرار می گیرد. این عبارت دارای n-p درجه ی آزادی است.

کلیات رگرسیون خطی ساده

ماتریس H به شکل زير تعریف می شود :

 

کلیات رگرسیون خطی ساده

ا توجه به تعاریف ارائه شده ذکر این نکته لازم به نظر می رسد که مجموع تغییرات متغیر پاسخ به وسیله ی دو جزء مجموع مربعات رگرسیون و مجموع مربعات خطا قابل بیان می باشد.

SSTO=SSR+SSE 

به این ترتیب میانگین مربعات رگرسیون و میانگین مربعات خطا از تقسیم SSR وSSE بر درجه آزادی هریک حاصل می شوند وداریم :

کلیات رگرسیون خطی ساده

منبع : کتاب مقدمه ای بر مدل های خطی آماری . نوشته ی مایکل کاتنر (Michael H.Kutner) و جان نتر (John Neter).