Základy a testování hypotéz
Populace a výběr
základní soubor · výběrový soubor
Populace (základní soubor) je celá skupina jednotek, o které chcete něco tvrdit — všichni pacienti, všechny výrobky z linky.
Průměr, medián a modus
míry polohy · střední hodnota
Průměr, medián a modus jsou míry polohy — jedno číslo, které shrnuje, „kde“ data leží.
Směrodatná odchylka a rozptyl
SD · variabilita
Rozptyl je průměr čtverců odchylek hodnot od průměru; směrodatná odchylka (SD) je jeho odmocnina a má stejné jednotky jako data.
Normální rozdělení
Gaussovo rozdělení · Gaussova křivka
Normální (Gaussovo) rozdělení je symetrické zvonovité rozdělení popsané průměrem a směrodatnou odchylkou.
p-hodnota
p-value · hladina významnosti testu
p-hodnota je pravděpodobnost, že byste při platnosti nulové hypotézy (např. „skupiny se neliší“) získali výsledek stejně nebo více extrémní, než jaký pozorujete.
Interval spolehlivosti
konfidenční interval · CI
Interval spolehlivosti je rozmezí hodnot, které s danou spolehlivostí (nejčastěji 95 %) pokrývá skutečnou hodnotu parametru populace — průměr, podíl, rozdíl skupin.
Hladina významnosti a chyby I. a II. druhu
alfa · beta · falešně pozitivní výsledek
Hladina významnosti α je maximální riziko chyby I. druhu — zamítnutí nulové hypotézy, která ve skutečnosti platí (falešný poplach).
Velikost účinku
effect size · Cohenovo d · eta kvadrát
Velikost účinku vyjadřuje, jak velký je rozdíl nebo jak silná je souvislost — nezávisle na velikosti výběru.
Síla testu a velikost výběru
statistická síla · power analysis · rozsah výběru
Síla testu je pravděpodobnost, že test odhalí efekt, který skutečně existuje (1 − β).
Statistické testy
t-test
Studentův t-test · párový t-test · dvouvýběrový t-test
t-test porovnává průměry: jednovýběrový průměr s pevnou hodnotou, dvouvýběrový průměry dvou nezávislých skupin (kontrola vs. léčba) a párový dvě…
ANOVA (analýza rozptylu)
analysis of variance · jednofaktorová ANOVA · vícefaktorová ANOVA
ANOVA (analýza rozptylu) testuje, zda se liší průměry tří a více skupin.
Post-hoc testy
mnohonásobné porovnávání · Tukeyův test · Scheffého test · Bonferroniho korekce
Post-hoc testy následují po významné ANOVA a porovnávají skupiny po dvojicích, aby ukázaly, které se skutečně liší.
Chí-kvadrát test
χ² test · test nezávislosti · kontingenční tabulka
Chí-kvadrát test pracuje s četnostmi kategorií. Test nezávislosti v kontingenční tabulce zjišťuje, zda spolu souvisí dvě kategoriální proměnné…
Neparametrické testy
Mannův–Whitneyho U test · Wilcoxonův test · Kruskalova–Wallisova ANOVA · Friedmanův test
Neparametrické testy nepředpokládají normální rozdělení — pracují s pořadím hodnot místo s hodnotami samými.
Test normality
Shapirův–Wilkův test · Kolmogorovův–Smirnovův test · Lillieforsův test
Test normality ověřuje, zda data pocházejí z normálního rozdělení — předpoklad t-testu, ANOVA, regrese i indexů způsobilosti.
Korelace
Pearsonův korelační koeficient · Spearmanova korelace · korelační matice
Korelace měří sílu a směr lineární souvislosti dvou veličin číslem od −1 do 1.
Regrese a modely
Lineární regrese
vícenásobná regrese · metoda nejmenších čtverců · regresní model
Lineární regrese popisuje, jak závislá proměnná (výnos, cena, spotřeba) závisí na jedné nebo více vysvětlujících proměnných pomocí přímky či roviny…
Logistická regrese
logit model · poměr šancí · binární klasifikace
Logistická regrese modeluje pravděpodobnost binárního výsledku — pacient odpoví na léčbu / neodpoví, zákazník odejde / zůstane — v závislosti na vysvětlujících proměnných.
Nelineární regrese
nelineární odhad · křivková regrese · Levenbergův–Marquardtův algoritmus
Nelineární regrese prokládá data modelem, který je nelineární v parametrech — exponenciální růst, logistickou křivku, Michaelisovu–Mentenovou kinetiku, dávka–odpověď.
Zobecněné lineární modely (GLM)
GLZ · obecné lineární modely · Poissonova regrese
Zobecněné lineární modely rozšiřují lineární regresi na výsledky, které nejsou normálně rozdělené: binární (logistická regrese), četnosti (Poissonova…
Časové řady a předpovídání
ARIMA · exponenciální vyrovnávání · sezónní dekompozice
Časová řada je posloupnost hodnot měřených v čase — měsíční prodeje, denní teplota, spotřeba energie.
Analýza přežití
Kaplanův–Meierův odhad · Coxova regrese · cenzorovaná data
Analýza přežití modeluje dobu do události — úmrtí, relapsu, poruchy stroje, odchodu zákazníka — a umí pracovat s cenzorovanými pozorováními, u nichž…
Vícerozměrné metody
Analýza hlavních komponent (PCA)
PCA · redukce dimenze · hlavní komponenty
Analýza hlavních komponent (PCA) zhušťuje mnoho korelovaných proměnných do několika nových nekorelovaných komponent, které zachycují co největší část původní variability.
Faktorová analýza
latentní faktory · rotace Varimax · explorační faktorová analýza
Faktorová analýza hledá malý počet skrytých (latentních) faktorů, které vysvětlují korelace mezi mnoha měřenými proměnnými — např. položky dotazníku…
Shluková analýza
clustering · k-means · hierarchické shlukování · segmentace
Shluková analýza rozděluje pozorování do skupin (shluků) tak, aby si jednotky uvnitř shluku byly co nejpodobnější a shluky se navzájem lišily — bez předem známých tříd.
Diskriminační analýza
LDA · klasifikační funkce · Fisherova diskriminace
Diskriminační analýza hledá kombinace proměnných, které nejlépe oddělují předem známé skupiny — zdravé od nemocných, dobré výrobky od zmetků, tři…
Řízení kvality a SPC
Regulační diagramy (SPC)
statistická regulace procesu · Shewhartovy diagramy · X-bar a R diagram
Regulační diagram je základní nástroj statistické regulace procesu (SPC): vynáší měření v čase spolu s centrální přímkou a regulačními mezemi ±3σ…
Způsobilost procesu (Cp, Cpk)
indexy způsobilosti · Pp a Ppk · analýza způsobilosti
Indexy způsobilosti porovnávají variabilitu procesu s tolerančními mezemi zákazníka.
Plánování experimentů (DOE)
DOE · faktoriální experiment · Taguchiho návrhy · metoda odezvových ploch
Plánování experimentů (DOE) je systematický způsob, jak s minimem pokusů zjistit, které faktory (teplota, tlak, materiál) ovlivňují výsledek a jak je nastavit.
Six Sigma
DMAIC · úroveň sigma · DPMO
Six Sigma je metodika zlepšování procesů založená na datech a statistice.
Analýza systému měření (Gauge R&R)
MSA · opakovatelnost a reprodukovatelnost · Gage R&R
Analýza systému měření (MSA) zjišťuje, jak velkou část pozorované variability způsobuje samotné měření. Studie opakovatelnosti a reprodukovatelnosti…
Paretův diagram
Paretova analýza · pravidlo 80/20 · ABC analýza
Paretův diagram je sloupcový graf příčin nebo kategorií vad seřazených od nejčetnější po nejméně četnou, doplněný kumulativní křivkou podílu.
Data mining a strojové učení
Rozhodovací stromy
klasifikační a regresní stromy · C&RT · CHAID · CART
Rozhodovací strom rozděluje data posloupností jednoduchých pravidel („věk > 45 a příjem < 30 tisíc“) do stále homogennějších skupin, dokud v listech…
Náhodné lesy a boosting
random forest · boosted trees · gradient boosting · souborové metody
Náhodné lesy a boosting jsou souborové metody, které kombinují stovky rozhodovacích stromů do jednoho přesnějšího modelu.
Neuronové sítě
umělé neuronové sítě · MLP · vícevrstvý perceptron · SANN
Umělá neuronová síť je model složený z vrstev propojených „neuronů“, který se učí z dat aproximovat i velmi složité nelineární vztahy mezi vstupy a výstupem.
Křížová validace
k-fold cross-validation · trénovací a testovací data · holdout
Křížová validace odhaduje, jak dobře bude model fungovat na nových datech.
ROC křivka a AUC
citlivost a specificita · plocha pod křivkou · klasifikační práh
ROC křivka zobrazuje, jak se u klasifikačního modelu mění citlivost (podíl správně zachycených pozitivních) a falešná pozitivita při posouvání rozhodovacího prahu.
Přeučení modelu (overfitting)
overfitting · generalizace · regularizace
Přeučení nastane, když se model naučí nejen skutečné vztahy, ale i náhodný šum trénovacích dat — na nich je skvělý, na nových datech selhává. Typické…
Skórování a nasazení modelu
scoring · deployment · PMML · prediktivní model v produkci
Skórování je použití natrénovaného modelu na nová data — každému zákazníkovi, vzorku nebo výrobku přiřadí předpověď nebo pravděpodobnost.
Text mining
dolování z textu · analýza textu · zpracování přirozeného jazyka
Text mining převádí nestrukturovaný text — reklamace, poznámky servisu, otevřené odpovědi v dotaznících, zprávy — na strukturovaná data, se kterými umí pracovat statistika.
Data a vizualizace
Krabicový graf
boxplot · box-and-whisker plot · graf kvartilů
Krabicový graf zobrazuje rozdělení dat pěti čísly: krabice sahá od dolního k hornímu kvartilu (prostředních 50 % hodnot), čára uvnitř je medián a…
Histogram
rozdělení četností · sloupcový graf četností
Histogram zobrazuje rozdělení spojité proměnné: hodnoty rozdělí do intervalů (tříd) a výška sloupce ukazuje, kolik pozorování do intervalu spadá.…
Odlehlé hodnoty
outliers · extrémní hodnoty · vlivné body
Odlehlá hodnota je pozorování, které se nápadně liší od ostatních — chyba měření či zápisu, jiná populace, nebo skutečný vzácný jev.
Chybějící hodnoty
missing data · imputace · nevyplněné odpovědi
Chybějící hodnoty jsou prázdná místa v datech — nezměřený vzorek, nevyplněná otázka, výpadek senzoru.
Aktualizováno: září 2026.