Statystyka w prosty sposób
8. wydanie poprawione (marzec 2026) - wiele obrazowych przykładów - tylko 8,99 €
Analiza regresji
Autor: Dr. Hannah Volk-Jesussek
Zaktualizowano:
Czym jest regresja?
Regresja to metoda statystyczna służąca do analizy zależności między zmiennymi. Pozwala wyjaśniać lub przewidywać jedną zmienną na podstawie innych.
Pomaga odpowiedzieć na takie pytania jak:
- Czy X jest związane z Y?
- Jak silna jest ta zależność?
- Czy mogę przewidzieć Y, jeśli znam X?
Podstawowa idea analizy regresji
- Zmienna zależna (Y): to, co chcesz wyjaśnić lub przewidzieć
- Zmienna lub zmienne niezależne (X): to, co może być związane z Y
W tym przykładzie chcemy wiedzieć, co jest związane z wynagrodzeniem danej osoby (zmienną zależną). Aby to zbadać, uwzględniamy zmienne: poziom wykształcenia, tygodniowy czas pracy oraz wiek (zmienne niezależne).
Możemy teraz sprawdzić, czy te trzy zmienne są związane z wynagrodzeniem osoby. Jeśli tak, można wykorzystać najwyższy poziom wykształcenia, tygodniowy czas pracy oraz wiek tej osoby do przewidywania jej wynagrodzenia.
Uwaga: zmienna, którą chcemy wnioskować lub przewidywać (zmienna zależna), jest także nazywana kryterium. Zmienne używane do predykcji (zmienne niezależne) są także nazywane predyktorami.
Cele analizy regresji
Analiza regresji zwykle służy dwóm głównym celom:
- Opisowi zależności między jedną lub kilkoma zmiennymi a inną zmienną
- Przewidywaniu wartości zmiennej na podstawie jednej lub kilku innych zmiennych
1) Opis zależności między jedną lub kilkoma zmiennymi a inną zmienną
- Co wpływa na zdolność dzieci do koncentracji?
- Czy poziom wykształcenia rodziców i miejsce zamieszkania wpływają na przyszłe osiągnięcia edukacyjne dzieci?
2) Przewidywanie zmiennej za pomocą jednej lub kilku innych zmiennych
- Jak długo pacjent pozostaje w szpitalu?
- Jaki produkt dana osoba najprawdopodobniej kupi w sklepie internetowym?
Analiza regresji pokazuje zatem, jak zmienia się zmienna zależna, gdy zmienia się jedna lub więcej zmiennych niezależnych.
Rodzaje analizy regresji
Analizy regresji można podzielić na prostą regresję liniową, wieloraką regresję liniową oraz regresję logistyczną. Odpowiedni typ analizy regresji zależy od liczby zmiennych niezależnych oraz poziomu pomiaru zmiennej zależnej.
| Liczba zmiennych niezależnych | Skala zmiennej zależnej | Skala zmiennej niezależnej | |
| Prosta regresja liniowa | Jedna | Metryczna | Metryczna, porządkowa, nominalna |
| Wieloraka regresja liniowa | Wiele | Metryczna | Metryczna, porządkowa, nominalna |
| Regresja logistyczna | Jedna lub wiele | Porządkowa, nominalna | Metryczna, porządkowa, nominalna |
Jeśli w regresji liniowej do predykcji chcesz użyć tylko jednej zmiennej, stosuje się prostą regresję liniową. Gdy używana jest więcej niż jedna zmienna niezależna, stosuje się wieloraką regresję liniową.
Jeśli zmienna zależna ma dwie kategorie, można użyć binarnej regresji logistycznej. Dla większej liczby kategorii stosuje się odpowiednie rozszerzenia regresji logistycznej. Jeśli zmienna zależna jest mierzona na skali metrycznej, odpowiednia jest regresja liniowa.
To, czy stosuje się model regresji liniowej czy nieliniowej, zależy od charakteru zależności między zmiennymi. Aby przeprowadzić regresję liniową, konieczna jest liniowa zależność między zmiennymi niezależnymi a zmienną zależną.
Niezależnie od rodzaju regresji zmienne niezależne mogą być metryczne, porządkowe lub nominalne. Jeśli jednak porządkowa lub nominalna zmienna niezależna ma więcej niż dwie kategorie, należy utworzyć zmienne zero-jedynkowe.
Przykłady regresji
Prosta regresja liniowa
Czy tygodniowy czas pracy jest związany ze stawką godzinową pracowników?
Wieloraka regresja liniowa
Czy tygodniowy czas pracy oraz wiek pracowników są związane z ich stawką godzinową?
Regresja logistyczna
Czy tygodniowy czas pracy oraz wiek pracowników są związane z prawdopodobieństwem, że są oni zagrożeni wypaleniem zawodowym?
Zmienna zależna
Zmienne niezależne
Zmienne zero-jedynkowe i kategoria referencyjna
Gdy zmienna niezależna jest kategoryczna, przed włączeniem do modelu regresji koduje się ją jako zestaw binarnych zmiennych zero-jedynkowych.
Tworzenie zmiennych zero-jedynkowych oznacza przekształcenie zmiennej kategorycznej z wieloma kategoriami w kilka zmiennych binarnych.
Obejmuje to następujące kroki:
- Zmienna kategoryczna z wieloma kategoriami jest przekształcana w kilka zmiennych binarnych.
- Jedna kategoria jest wybierana jako kategoria referencyjna.
- Dla każdej z pozostałych kategorii tworzona jest nowa zmienna zero-jedynkowa.
- Każda zmienna zero-jedynkowa przyjmuje wartość 1, jeśli obserwacja należy do danej kategorii, oraz 0 w przeciwnym razie.
W naszym przykładzie chcemy zbadać związek poziomu wykształcenia (szkoła średnia, studia licencjackie, studia magisterskie) z wynagrodzeniem:
- Zmienna zależna: wynagrodzenie
- Zmienna niezależna: poziom wykształcenia, który ma trzy kategorie
- Kategoria referencyjna: szkoła średnia
-
Utworzone zmienne zero-jedynkowe:
- czy_licencjat
- czy_magister
- Przykład: czy_licencjat = 1, jeśli dana osoba ukończyła studia licencjackie, oraz 0 w przeciwnym razie.
Zmienne kontrolne (kowariaty)
W analizie regresji zmienna kontrolna (kowariata) to dodatkowa zmienna niezależna, która jest uwzględniana w modelu, aby ograniczyć potencjalnych czynników zakłócających.
Głównym celem uwzględniania zmiennych kontrolnych jest wyizolowanie zależności będącej przedmiotem zainteresowania między główną zmienną lub zmiennymi niezależnymi a zmienną zależną, tak aby obserwowana zależność nie była zniekształcona przez uwzględnione czynniki zakłócające.
Uwzględnienie zmiennych kontrolnych może pomóc na kilka sposobów:
- Zmniejszenie obciążenia wynikającego z pominięcia zmiennej: jeśli istnieje zmienna, która wpływa zarówno na zmienną zależną, jak i na jedną ze zmiennych niezależnych, a nie zostanie uwzględniona w modelu, współczynnik przy zmiennej niezależnej może być obciążony. Uwzględnienie zmiennej kontrolnej pomaga zmniejszyć lub wyeliminować to obciążenie.
- Zwiększenie precyzji: kontrolowanie dodatkowych źródeł zmienności może zmniejszyć wariancję reszt, prowadząc do bardziej precyzyjnych oszacowań.
- Kontrola zakłócania: w wielu przypadkach zależność między dwiema zmiennymi może być pozorna z powodu trzeciej zmiennej, która wpływa na obie. Uwzględnienie tej trzeciej zmiennej jako kontrolnej może pomóc ujawnić rzeczywistą zależność.
Przykład
Załóżmy, że badasz wpływ ćwiczeń fizycznych na utratę masy ciała.
- Zmienna niezależna: ćwiczenia fizyczne
- Zmienna zależna: utrata masy ciała
-
Potencjalna zmienna kontrolna:
- Wiek może wpływać na utratę masy ciała ze względu na związane z wiekiem zmiany metabolizmu.
- Wiek może być powiązany z aktywnością fizyczną, ponieważ młodsze osoby często ćwiczą więcej.
Wiek nieuwzględniony w modelu:
- Wpływ ćwiczeń fizycznych na utratę masy ciała może być przeszacowany.
- Część obserwowanego efektu może w rzeczywistości wynikać z wieku, a nie z ćwiczeń.
Wiek uwzględniony w modelu:
- Konkretny wpływ ćwiczeń fizycznych na utratę masy ciała można dokładniej wyizolować.
Kwestie do rozważenia
Przy wyborze zmiennych kontrolnych należy wziąć pod uwagę następujące kwestie:
- Uwzględnianie nieistotnych zmiennych kontrolnych może niepotrzebnie komplikować model.
- Zbyt wiele zmiennych kontrolnych może zmniejszyć moc statystyczną analizy.
- Pominięcie ważnych zmiennych kontrolnych może prowadzić do obciążonych oszacowań.
- Wybór zmiennych kontrolnych powinien opierać się na uzasadnieniu teoretycznym oraz empirycznych testach diagnostycznych.
Przyczynowość w regresji
W przypadku regresji liniowej zmienna niezależna może być użyta do przewidywania zmiennej zależnej, jeśli istnieje korelacja między tymi dwiema zmiennymi . Należy jednak podkreślić, że korelacja między dwiema zmiennymi niekoniecznie oznacza przyczynowość.
Oznacza to, że:
- Korelacja wskazuje, że dwie zmienne mają tendencję do wspólnej zmiany.
- Jeśli wysokie wartości jednej zmiennej są powiązane z wysokimi wartościami innej zmiennej, odzwierciedla to zależność statystyczną, niekoniecznie zależność przyczynową.
- Wzrost jednej zmiennej nie oznacza automatycznie, że powoduje wzrost drugiej zmiennej.
Na obserwowaną zależność mogą wpływać:
- Trzecia zmienna (kowariata)
- Odwrócona przyczynowość
- Czysty przypadek
Dlatego:
- Regresja liniowa może służyć do opisywania i przewidywania zależności między zmiennymi.
- Wnioski przyczynowe wymagają odpowiedniego projektu badania i dodatkowych założeń. Najmocniejszych dowodów dostarczają zwykle dobrze zaplanowane eksperymenty.
Oblicz regresję z numiqo
Wystarczą trzy proste kroki, a kalkulator regresji poda wszystkie najważniejsze statystyki:
- 1. Skopiuj swoje dane do tabeli kalkulatora statystycznego
- 2. Kliknij Regresja
- 3. Wybierz zmienną zależną oraz jedną lub więcej zmiennych niezależnych
Jeśli jedna ze zmiennych niezależnych ma kategoryczny poziom pomiaru (porządkowy lub nominalny), automatycznie generowane są zmienne zero-jedynkowe i definiowana jest kategoria referencyjna. Gdy tylko seria zawiera wyłącznie liczby, kalkulator statystyczny automatycznie definiuje ją jako zmienną metryczną.
Statystyka w prosty sposób
- wiele obrazowych przykładów
- idealna do egzaminów i prac dyplomowych
- statystyka w prosty sposób na 464 stronach
- 8. poprawione wydanie (marzec 2026)
Tylko 8,99 €
Bezpłatny fragment
"Napisana bardzo prosto"
"Prościej się nie da"
"Tyle pomocnych przykładów"