Nel 1936 una rivista statunitense spedì oltre dieci milioni di schede per prevedere l'esito di un'elezione presidenziale. Risposero più di due milioni di persone e la previsione sbagliò comunque vincitore, di circa 20 punti percentuali.
Un campione si definisce in tre passaggi: stabilisci la popolazione, scegli un metodo di selezione e calcoli la numerosità che ne deriva. Solo l'estrazione casuale permette poi di trarre conclusioni sull'intera popolazione, e solo per essa vale la formula della numerosità campionaria. Alla fine saprai quante persone servono al tuo progetto e come motivare la scelta nella metodologia.
📌 In breve
- Un campione è la parte studiata di una popolazione più ampia.
- Solo l'estrazione casuale consente conclusioni sull'intera popolazione.
- Con il 95 % di confidenza e il 5 % di margine bastano 385 persone.
- Oltre il milione di persone la dimensione della popolazione non cambia nulla.
- La rilevazione Istat sulle forze di lavoro intervista circa 250mila famiglie l'anno.
Crea un sondaggio gratis
Con empirio.ai crei un moderno sondaggio online in pochi minuti — con hosting nell'UE.
- Sondaggio creato con IA
- Modifica con drag & drop
- Analisi in tempo reale
Che cos'è un campione?
Un campione è una parte estratta da un insieme più ampio, la popolazione, e studiata per conto di quell'insieme. I risultati ottenuti su quella parte vengono generalizzati all'insieme intero, a condizione che la selezione derivi da una procedura statistica riconosciuta.
La popolazione comprende tutte le persone o tutti i casi su cui vuoi affermare qualcosa. In statistica la popolazione si scrive con la N maiuscola e il campione con la n minuscola. Studiare tutti gli elementi della popolazione è un censimento. Studiarne solo una parte è un'indagine campionaria, e nella pratica è quasi sempre l'unica strada percorribile.
La statistica ufficiale mostra quanto piccolo possa essere un campione. Secondo l'Istat, la Rilevazione sulle forze di lavoro intervista ogni anno circa 250mila famiglie, 62mila per trimestre, per un totale di circa 600mila individui distribuiti in circa 1.100 comuni (dati di agosto 2026). Rispondere è obbligatorio ai sensi dell'articolo 7 del D.Lgs. 322/1989, e questo riduce molto la distorsione da mancata risposta. La tua ricerca empirica segue lo stesso principio, su scala minore.
Il censimento è l'eccezione. La selezione motivata è la regola.
Perché un campione grande non è automaticamente rappresentativo
Un campione grande non è automaticamente rappresentativo, perché il numero di risposte non dice nulla su come quelle risposte sono state raccolte. Se il metodo di selezione altera la composizione, ogni risposta in più misura soltanto con maggiore precisione un risultato sbagliato.
La prova più nota viene dalla rivista The Literary Digest. Prima delle elezioni statunitensi del 1936 spedì oltre dieci milioni di schede, soprattutto a indirizzi tratti da elenchi telefonici e registri di immatricolazione. Ne tornarono più di 2,3 milioni, un tasso di risposta poco sotto un quarto. La previsione assegnava il 55 % ad Alf Landon e il 41 % a Franklin D. Roosevelt. Vinse Roosevelt, con il 60,8 % dei voti (The American Presidency Project, University of California Santa Barbara).
Quasi tutti i manuali danno la stessa spiegazione: all'epoca telefono e automobile li avevano soprattutto le famiglie benestanti, quindi la selezione era distorta. Il caso è meno lineare. Peverill Squire analizzò nel 1988 su Public Opinion Quarterly un'indagine successiva e trovò che anche chi possedeva auto e telefono aveva votato in maggioranza Roosevelt. Il secondo errore stava nella risposta: i sostenitori di Landon rispedivano la scheda molto più spesso. Come si ripartisca l'errore complessivo tra le due cause è ancora discusso. Squire (1988) pesa di più gli elenchi di indirizzi, Dominic Lusinchi (2012) il tasso di risposta.
Per la tua indagine ne discende una regola scomoda: chi risponde conta quanto chi è stato invitato. Che un'indagine risulti alla fine rappresentativa dipende quindi dal metodo e dal tasso di risposta, non dal raggiungere un numero minimo.
Metodi di campionamento: le tre strade possibili
I metodi di campionamento si dividono in tre famiglie: la selezione arbitraria, la selezione ragionata e l'estrazione casuale. Solo l'estrazione casuale consente una conclusione statisticamente fondata sulla popolazione, perché soltanto lì ogni elemento ha una probabilità nota di essere estratto.
Quale famiglia faccia al caso tuo si decide di rado sull'ideale e quasi sempre su una domanda pratica: hai davvero un elenco completo della tua popolazione? Per «tutte le persone che vanno in bici a Milano» un elenco simile non esiste, quindi l'estrazione casuale è fuori discussione. La risposta onesta nella metodologia è allora che hai selezionato in modo ragionato o arbitrario.
| Metodo | Come si seleziona | Quando funziona |
|---|---|---|
| Selezione arbitraria | chi risulta raggiungibile | prima esplorazione, pretest |
| Selezione ragionata | secondo criteri fissati prima | casi estremi, gruppi rari |
| Estrazione casuale | per sorteggio da un elenco | conclusioni sulla popolazione |
I tre campioni casuali più diffusi
All'interno dell'estrazione casuale la letteratura metodologica distingue tre varianti che richiedono uno sforzo molto diverso. Tutte e tre soddisfano la stessa condizione, cioè che sia il caso a decidere. Collocano semplicemente quel caso in punti diversi della procedura, e questo cambia la precisione del risultato finale.
- Campionamento casuale semplice: ogni elemento della popolazione viene estratto direttamente e con la stessa probabilità.
- Campionamento stratificato: la popolazione viene prima divisa secondo una caratteristica, poi si estrae dentro ogni strato.
- Campionamento a grappoli: si estraggono gruppi interi, per esempio classi scolastiche, e al loro interno si intervistano tutti.
In una tesi la variante stratificata è spesso la più sensata, perché evita che un gruppo importante risulti troppo piccolo per puro caso. Come raggiungere abbastanza persone per l'estrazione è spiegato nell'articolo sui partecipanti a un'indagine.
Calcolare la numerosità campionaria: formula, valori ed esempio
La numerosità campionaria deriva da quattro dati: la dimensione della popolazione, il margine di errore che accetti, il livello di confidenza che vuoi raggiungere e la dispersione attesa delle risposte. Insieme danno il numero minimo di persone che devono completare la tua indagine.
I quattro dati nel dettaglio:
- Popolazione (N): tutte le persone su cui vuoi affermare qualcosa.
- Margine di errore (e): quanto il risultato può discostarsi dal valore reale, di norma il 5 %.
- Livello di confidenza: con quanta affidabilità quell'intervallo contiene il valore reale, di norma il 95 %.
- Valore z: la traduzione numerica del livello di confidenza, cioè 1,645 al 90 %, 1,96 al 95 %, 2,576 al 99 %.
- Dispersione (p): la distribuzione attesa delle risposte, fissata a 0,5 in assenza di informazioni, il caso peggiore.
Due passaggi trasformano questi dati in un numero. Il primo dà il valore per una popolazione molto grande, il secondo lo corregge verso il basso quando il tuo gruppo è piccolo:
n0 = z² × p × (1 − p) / e²
n = n0 / (1 + n0 / N)
Un esempio con i numeri: intervisti gli studenti del tuo ateneo, 12.000 persone in tutto. Con il 95 % di confidenza (z = 1,96), il 5 % di margine di errore (e = 0,05) e p = 0,5, il primo passaggio dà 384,16 e il secondo 372,2. Arrotondando per eccesso servono 373 questionari completi. Lo stesso conto con i tuoi numeri lo fa il calcolatore del campione. Poiché una parte delle persone abbandona sempre a metà strada, invia il questionario a molte più persone.
Quando la formula della numerosità campionaria non vale
La formula presuppone un'estrazione casuale. Se distribuisci l'indagine con una storia Instagram, un gruppo WhatsApp o la bacheca del dipartimento, non è il caso a decidere chi partecipa, ma la disponibilità delle persone che già ti vedono. Per un campione di convenienza di questo tipo non si può calcolare alcun margine di errore, nemmeno con 500 risposte.
⚠️ Attenzione
385 risposte da una storia Instagram non dicono nulla sull'Italia, solo qualcosa sulla tua portata. In casi simili non scrivere alcun margine di errore nella tesi. Nomina invece il metodo, limita l'affermazione al gruppo effettivamente raggiunto e spiega perché basta alla tua domanda di ricerca.
Crea un sondaggio gratis
Con empirio.ai crei un moderno sondaggio online in pochi minuti — con hosting nell'UE.
- Sondaggio creato con IA
- Modifica con drag & drop
- Analisi in tempo reale
Quanti partecipanti servono davvero?
Per la maggior parte dei progetti il campione necessario sta tra 80 e 400 persone. Con il 95 % di confidenza e il 5 % di margine di errore sono 385 persone non appena la popolazione supera il milione, e parecchie meno non appena il tuo gruppo è gestibile.
La cosa sorprendente è quanto poco pesi la dimensione della popolazione. Tra un milione e 59 milioni di persone il campione necessario non cambia più di nulla. Chi gonfia un'indagine sostenendo che il pubblico di riferimento è enorme non ha fatto il conto.
| Popolazione (N) | Campione necessario (n) |
|---|---|
| 100 persone | 80 |
| 500 persone | 218 |
| 1.000 persone | 278 |
| 10.000 persone | 370 |
| 100.000 persone | 383 |
| 1.000.000 persone | 385 |
| 59.000.000 persone | 385 |
Calcolato con il 95 % di confidenza, il 5 % di margine di errore e p = 0,5.
Più precisione costa un numero sproporzionato di persone
Il margine di errore è il dato più costoso dell'intero calcolo, perché entra al quadrato. Passare dal 5 al 3 % costa quasi il triplo dei partecipanti, passare dal 5 all'1 % ne costa venticinque volte tanti. Al contrario, il calcolatore del margine di errore ti mostra quanto è preciso il tuo risultato con il numero di partecipanti che hai già raggiunto. Per una tesi di laurea la combinazione tra 95 % di confidenza e 5 % di margine resta quindi l'impostazione abituale e spesso l'unica realistica.
| Margine di errore | Confidenza | Campione necessario |
|---|---|---|
| 10 % | 95 % | 97 |
| 5 % | 90 % | 271 |
| 5 % | 95 % | 385 |
| 5 % | 99 % | 664 |
| 3 % | 95 % | 1.066 |
| 1 % | 95 % | 9.513 |
Calcolato per una popolazione di un milione di persone e p = 0,5.
Nella ricerca qualitativa conta la saturazione, non il numero
Per interviste e formati aperti la formula non serve, perché lì non si stima alcuna proporzione. Il criterio è la saturazione teorica: continui a intervistare finché i nuovi colloqui non portano più aspetti nuovi. In una tesi si tratta spesso di otto o quindici interviste, ma conta di più la motivazione scritta che il numero. La differenza tra le due strade è spiegata nell'articolo sui metodi qualitativi e quantitativi.
Descrivere il campione nella tesi
Il campione si descrive nel capitolo di metodologia, subito dopo la scelta del metodo di ricerca e prima del questionario. Nessuno si aspetta una selezione perfetta, solo una selezione tracciabile: il relatore vuole leggere chi hai studiato, come hai raggiunto quelle persone e quali limiti ne derivano per i risultati.
È proprio qui che molte tesi perdono punti. Un campione di convenienza non costa nulla, un metodo taciuto costa parecchio, perché la commissione deve poi capire da sola quanto siano solidi i tuoi numeri. Nominare da soli i limiti trasmette sicurezza. Verifica anche il regolamento del tuo corso di laurea, soprattutto sul trattamento dei dati personali.
Che cosa deve comparire nella metodologia
- La popolazione, nominata e delimitata con chiarezza.
- Il metodo di selezione scelto, con la sua motivazione.
- Il canale attraverso cui hai raggiunto i partecipanti.
- Il periodo di rilevazione, con data di inizio e di chiusura.
- Il numero di risposte, distinguendo iniziate e completate.
- La composizione secondo le caratteristiche rilevanti per la tua domanda.
- I limiti che derivano dal metodo.
Per l'ultima riga basta una frase, per esempio: «Il campione è un campione di convenienza, i risultati valgono per il gruppo intervistato e non sono estendibili a tutti gli studenti.» Come si costruisce nel complesso il capitolo metodologico è illustrato nella guida al lavoro empirico.
Errori frequenti sul campione
Gli errori più frequenti non nascono durante il calcolo, ma prima e dopo: quando si definisce la popolazione, quando si distribuisce l'indagine e quando si scrivono i risultati. Quattro casi tornano di continuo.
Tutti e quattro si evitano se metti per iscritto, prima di cominciare, su chi il tuo lavoro deve affermare qualcosa. Senza quella frase su carta il pubblico di riferimento si sposta durante la rilevazione, di solito verso le persone più facili da raggiungere.
La popolazione resta vaga
«I giovani» non è una popolazione, perché da lì non discende alcuna selezione. Senza fascia d'età, territorio e periodo non si può né estrarre un campione né verificare in seguito se sia adeguato. La conseguenza emerge solo in fase di analisi, quando non si capisce più a chi si riferiscano i numeri. Scrivi quindi la popolazione in una frase completa prima ancora della prima domanda.
La numerosità viene fissata a intuito
Numeri tondi come 100 o 200 sembrano solidi ma raramente sono motivati. Con una popolazione di 500 persone bastano 218 risposte per un margine del 5 %; con 100.000 persone ne servono 383. Fissare il numero invece di calcolarlo porta a mirare troppo in alto e perdere tempo, oppure troppo in basso e perdere ogni portata.
Il tasso di risposta non viene messo in conto
Tra inviti spediti e questionari completati c'è regolarmente una distanza notevole. Servono 373 risposte e si scrive a esattamente 373 persone: il risultato resta molto sotto l'obiettivo. Pianifica quindi una distribuzione più ampia e sorveglia il ritorno durante la rilevazione, invece di sperare in un numero alla fine. Quanti inviti ti servono lo stabilisci in anticipo: basta calcolare il tasso di risposta. Un secondo sollecito cortese rende di solito più di una proroga di due settimane.
Una selezione distorta diventa un'affermazione generale
L'errore più costoso sta di solito nelle conclusioni. Un'indagine su 200 compagne e compagni di corso diventa lì una frase su «gli studenti in Italia». Chi conosce la materia coglie subito il salto, e questo svaluta anche le parti fatte bene. Formula sempre i risultati insieme al gruppo che hai davvero intervistato.
Conclusione
Il campione decide la qualità dei tuoi risultati molto prima di qualsiasi analisi. Scegli il metodo con cognizione di causa, calcola la numerosità una volta e bene, e scrivi entrambe le cose con i loro limiti nella metodologia. Un campione piccolo descritto con onestà porta un lavoro più lontano di uno grande che nessuno riesce a ricostruire.
Come proseguire
- Vuoi costruire il questionario? Creare un questionario
- Non sai quale livello di misurazione hanno le tue domande? Livelli di misurazione
- Stai già pianificando l'analisi? Metodi di analisi
Ti servono 385 risposte e hai solo tre settimane?
Con empirio.ai, uno strumento per sondaggi online dalla Germania, crei la tua indagine in pochi passaggi, la condividi con un link e vedi le risposte in tempo reale, così puoi correggere il tiro finché sei in tempo.
