04. Inferenza Statistica

Definizioni generali

Vettori di Variabili Aleatorie

vettori di va

X=(X1,X2,⋯,Xn)∈Rn
Dove considereremo le Xk indipendenti tra loro

Osservazioni

osservazioni ($x$)

Sono realizzazioni di X:
x=(x1,x2,⋯,xn)
fatte su un certo campione

Densità

Siano X,Y due Variabili Aleatorie indipendenti continue,

P(X≤x,Y≤y)=F(X,Y)(x,y)P(X≤x)⋅P(Y≤y)=FX(x)⋅FY(y)

Derivando otteniamo:

∂2∂x∂yF(X,Y)(x,y)=FX′(x)FY′(y)=fX(x)fY(y)=f(X,Y)(x,y)

Dove distinguiamo tra [[#Densità congiunta]] e [[#Densità marginali]]

Posso anche dire che la funzione di ripartizione congiunta è data dall'integrale

F(X,Y)(x,y)=P(X≤x,Y≤y)=∫−∞x∫−∞yf(X,Y)(s,z)dsdz

Inoltre

∫Rf(X,Y)(x,y)dx=fY(y)∫Rf(X,Y)(x,y)dy=fX(x)
esempio

Calcolare la [[#Densità congiunta]] fX(x),x∈R dato il [[#Vettori di Variabili Aleatorie]] X=(X1,X2,...,Xn) nel caso in cui Xk∼Exp(λ),λ>0∀k.

fX=∏k=1nfXk(xk)==∏k=1nλe−λxk1(0,∞)(xk)==λne−λ∑k=1nxk1(0,∞)(xk)

❗❗❗❗❗❗❗❗❗❗❗❗❗
❗❗❗ COMPLETARE ❗❗❗
❗❗❗❗❗❗❗❗❗❗❗❗❗ altri esempi

Densità congiunta

f(X,Y)(x,y)

Densità marginali

fX(x)fY(y)

2023-05-04


Inferenza Statistica

Statistica descrittiva

statistica descrittiva

Parto da un campione o da alcune osservazioni

  • x=(x1,x2,⋯,xn): Osservazioni in generale (variabile)
  • xOSS= "x osservato": La successione di numeri nota

Media Campionaria

media campionaria

x―=1n∑k=1nxk
La media dei valori che ho osservato

Momento

Momento campionario

momento campionario

mr=1n∑k=1n(xk)r

m1=x―

Momento teorico

momento teorico

$

M_{R} = EX^{r} = \begin{cases}
\int_\mathbb{R} x^{r}f_{X}(x) , dx \
\sum\limits_{k}(x_{k})^{r}p_{k}
\end{cases}
$

Famiglia di distribuzioni di probabilità

famiglia di distribuzione di probabilità

Date

  • fX(x)=fX(x,θ) dove θ è il parametro che caratterizza X continua
  • pk=pk(θ) dove θ è il parametro che caratterizza X discreta

Si dice famiglia di distribuzione:

  • F{fX(x,θ),x∈R:θ∈Rm}: X continua
  • F{pk(θ),k∈Z:θ∈Rm}: X discreta
esempio

{e(x−μ)222π,x∈R:μ∈R}
la famiglia delle densità N(μ,σ2=1) con θ=[μ1], μ∈R.


{eλλkk!,k∈N0:λ>0}

la famiglia delle densità Pois(λ) con θ=λ∈(0,∞)

Massima affidabilità

Massimizzare l'affidabilità del risultato (già ottenuto)

Suppongo che la popolazione P oggetto di studio si distribuisca in accordo con X1 con densità fX1.

Tutte le osservazioni provengono dalla popolazione P∼X1, quindi:

X=(X1,⋯,Xn)

è tale che Xk∼X1∀k, inoltre le Xk sono indipendenti

In generale

maxθP(X∈I)=max∫IfX(x,θ)dx

Per massimizzare l'affidabilità, esistono 2 metodi:

  1. [[#Metodo della massima Verosimiglianza]]
  2. [[#Metodo dei Momenti]]

Funzione di verosimiglianza

funzione di verosimiglianza

L(θ,x)=fX(x,θ)
Dove x è dato e θ è da "stimare". In questo caso θ è la variabile di interesse.
L è continua rispetto alla variabile θ.
Devo massimizzare. Cerco
θ^MV, il punto di massimo per L.

Metodo della massima Verosimiglianza

Consiste nel trovare i punti di massimo della [[#Funzione di verosimiglianza]] imponendo

dLdθ(θ,x)=!0

esempio

Sia P∼N(μ,1)
X=(X1,⋯,Xn) dove Xk∼N(μ,1)∀k

Dato il campione x=(x1,⋯,xn), voglio determinare μ^MV, ossia la stima di μ ottenuta con il [[#Metodo della massima Verosimiglianza]]


Scrivo la [[#Funzione di verosimiglianza]]
L(μ,x)=fX(x,μ)==∏k=1nfXk(x,μ)==∏k=1ne−(xk−μ)222π==1(2π)ne−12∑k=1n(xk−μ)2
Posso ora derivarla e imporre uguale a 0:

dLdμ=ddμ1(2π)n2e−12∑k=1n(xk−μ)2=1(2π)n2ddμe−12∑k=1n(xk−μ)2==1(2π)n2e−12∑k=1n(xk−μ)2(122∑k=1n(xk−μ))==1(2π)n2(∑k=1n(xk−μ))e−12∑k=1n(xk−μ)2

Impongo uguale a zero per trovare i massimi e ottengo:

μ^MV=1n∑k=1nxk=x―

Notiamo che lo stimatore di massima verosimiglianza è proprio la media campionaria.
La media campionaria è quindi la migliore stima per la media vera.

esempio

Sia P∼Exp(λ),λ>0
X=(X1,⋯,Xn) dove Xk∼Exp(λ)

Dato il campione x=(x1,⋯,xn), voglio determinare λ^MV, ossia la stima di λ ottenuta con il [[#Metodo della massima Verosimiglianza]]


Scrivo la [[#Funzione di verosimiglianza]]
L(λ,x)=fXk(x,λ)==λne−λ∑k=1nxk
Per cui derivo e impongo uguale a 0.

ddλL=nλn−1e−λ∑k=1nxk+λn(e−λ∑k=1nxk∑k=1nxk)=!0
Posso riscrivere ∑k=1nxk=nx―.
ddλL=nλn−1e−λnx―+λn(e−λnx―nx―)=!0e−λnx―(nλn−1−λnnx―)=!0⟺nλn−1=λnnx―nλn−1λn=nx―λ−1=x―

per cui la stima di λ, λ^MV è
λ^MV=1x―

teorema

Data una funzione monotona h, il punto di massimo per la [[#Funzione di verosimiglianza]] L(θ,x) coincide con il punto di massimo di h(L(θ,x))

In particolare questa affermazione è vera se h=log.

GraficoMaxVerosimiglianzaLog.png

Questo ci permette di semplificare di molto i calcoli

esempio

Ricalcoliamo λ^MV applicando il teorema appena enunciato

L(λ,x)=λne−λnx―
calcolo
ln⁡(L(λ,x))=ln⁡(λn)+ln⁡(e−λnx―)=nln⁡(λ)−λnx―
Derivo e impongo uguale a zero

ddλln⁡(L(λ,x))=nλ−nx―=!0n(1λ−x―)=0⟺1λ=x―
Quindi lo stimatore di massima verosimiglianza è
λ^MV=1x―

❗❗❗❗❗❗❗❗❗❗❗❗❗
❗❗❗ COMPLETARE ❗❗❗
❗❗❗❗❗❗❗❗❗❗❗❗❗

Altri esempi

Metodo dei momenti

teorema

Metodo di stima parametrica dei momenti, dei parametri θ∈Rn. Devo risolvere il sistema:
MR=mrr=1,2,…,N

Dove:

  • MR: [[#Momento teorico]] di ordine R
  • mr: [[#Momento campionario]] di ordine r
esempio

Data una popolazione distribuita come una normale fornire una stima del parametro μ con il [[#Metodo dei momenti]]:
P∼N(μ,σ2=2)


Il parametro è a una sola dimensione, quindi basta un'equazione.
M1=m1EX=x―∫RxfX(x)dx=x―

Essendo una normale, la media teorica è proprio μ, per cui la stima è data dalla media campionaria:
μ^MOM=x―

Variabile aleatoria Stimatore

#ArgomentoFondamentale

Data una popolazione P caratterizzata dal parametro θ.

Abbiamo definito la stima di θ il valore θ^, ricavabile dal [[#Metodo della massima Verosimiglianza]] o dal [[#Metodo dei momenti]].
θ^=g(x) è una funzione dell'osservazione x=(x1,x2,…,xn): campione della popolazione, di numerosità n∈N.

n→∞⟹θ^→θ

Si ha quindi che Θ^ è la variabile aleatoria stimatore.
Θ^=g(X) dove X=(X1,X2,...,Xn) è la variabile aleatoria di x e Xk∼P∀k.

Proprietà desiderabili dello stimatore

proprietà desiderabili dello stimatore

Le proprietà desiderabili della [[#Variabile aleatoria Stimatore]] sono la

  • [[#Correttezza]]
  • [[#Consistenza]]

Correttezza

correttezza

EΘ^=θ

Consistenza

consistenza

limn→∞Var(Θ^)=0⟺P(Θ^=θ)=1
Con n= Numerosità campionaria