Kalkulator krzywej ROC
Wczytaj przykładowy zbiór danychAby utworzyć krzywą ROC online, wystarczy skopiować dane do górnej tabeli oraz wybrać zmienną testową i zmienną stanu. Następnie możesz określić wartość zmiennej stanu, dla której ma zostać utworzona krzywa ROC.
Krzywa ROC jest wyświetlana online, a jej współrzędne można odczytać.
Co oblicza numiqo
Oprócz samej krzywej numiqo podaje pole pod krzywą (AUC) wraz z jego błędem standardowym, 95% przedziałem ufności oraz testem istotności względem hipotezy zerowej AUC = 0,5, dokładnie tak, jak potrzebujesz tego do publikacji. numiqo wyznacza optymalny próg za pomocą indeksu Youdena i pokazuje odpowiadającą mu czułość, swoistość oraz dodatni i ujemny iloraz wiarygodności (LR+ i LR−) przy tym progu.
Prostym wyborem określasz, czy na stan dodatni wskazują wysokie, czy niskie wartości testu. Dzięki temu możesz analizować także markery, dla których na chorobę wskazują niskie wartości. Dodatkowo otrzymujesz tabelę ze współrzędnymi krzywej, czyli czułością i odsetkiem wyników fałszywie dodatnich dla każdego progu.
Krzywa ROC
Krzywa ROC jest graficzną prezentacją skuteczności klasyfikatora binarnego przy zmieniającym się progu klasyfikacji. Przedstawia odsetek wyników prawdziwie dodatnich (czułość) w zależności od odsetka wyników fałszywie dodatnich (1 - swoistość) dla różnych wartości progu.
Krzywa ROC jest przydatnym narzędziem do oceny skuteczności klasyfikatora, ponieważ nie zależy od rozkładu klas i wizualnie przedstawia kompromis między odsetkiem wyników prawdziwie dodatnich a odsetkiem wyników fałszywie dodatnich.
Pole pod krzywą ROC (AUC) jest często stosowaną miarą skuteczności w problemach klasyfikacji binarnej. Wartość AUC mieści się w przedziale od 0 do 1. Dla idealnego klasyfikatora AUC wynosi 1, a dla klasyfikatora losowego 0,5. Im wartość AUC jest bliższa 1, tym lepiej klasyfikator rozróżnia obie klasy.
Definicje
-
Odsetek wyników prawdziwie dodatnich (TPR), znany również jako czułość
lub pełność: jest to odsetek rzeczywiście dodatnich przypadków, które model poprawnie
identyfikuje. Matematycznie oblicza się go następująco:
TPR = prawdziwie dodatnie / (prawdziwie dodatnie + fałszywie ujemne)
-
Odsetek wyników fałszywie dodatnich (FPR): jest to odsetek rzeczywiście
ujemnych przypadków, które model błędnie identyfikuje jako dodatnie. Matematycznie
definiuje się go następująco:
FPR = fałszywie dodatnie / (fałszywie dodatnie + prawdziwie ujemne)
Krzywa ROC jest wykresem z FPR na osi X i TPR na osi Y. Krzywa ROC idealnego modelu przebiega blisko lewego górnego rogu, co wskazuje na wysoką czułość i swoistość. Dla modelu pozbawionego zdolności rozróżniania (czyli równie skutecznego jak losowe zgadywanie) krzywa ROC jest linią ukośną pod kątem 45 stopni, nazywaną zwykle „linią braku dyskryminacji”.
Powszechnie stosowaną miarą wyznaczaną na podstawie krzywej ROC jest pole pod krzywą (AUC). Wartość AUC przedstawia ogólną zdolność modelu do rozróżniania klas dodatnich i ujemnych:
- AUC = 1: idealny klasyfikator
- 0,5 < AUC < 1: wynik lepszy niż losowe zgadywanie
- AUC = 0,5: brak zdolności rozróżniania (odpowiednik losowego zgadywania)
- AUC < 0,5: wynik gorszy niż losowe zgadywanie (w praktyce można jednak odwrócić decyzje modelu, aby otrzymać klasyfikator z AUC > 0,5)
Kiedy stosuje się krzywą ROC?
W praktyce krzywa ROC jest często stosowana do wyboru optymalnego progu klasyfikatora binarnego. Na przykład dla klasyfikatora, w którym priorytetem jest wysoki odsetek wyników prawdziwie dodatnich (wysoka czułość), próg będzie bliższy zeru. Dla klasyfikatora, w którym priorytetem jest niski odsetek wyników fałszywie dodatnich (wysoka swoistość), próg będzie bliższy jedności.
Podsumowując, krzywa ROC jest skutecznym narzędziem do oceny działania klasyfikatorów binarnych. Wizualnie przedstawia kompromis między odsetkiem wyników prawdziwie dodatnich a odsetkiem wyników fałszywie dodatnich, natomiast AUC stanowi przydatną miarę skuteczności. Krzywa ROC pomaga także wybrać optymalny próg klasyfikatora binarnego.