Skip to content

Latest commit

 

History

3 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Prompting in Italian vs English

A controlled empirical study on whether prompting Claude Opus 4.7 in Italian vs English affects output quality. 200 controlled runs, two experiments, all data and code open.

🇬🇧 English summary: Common wisdom in the AI community claims that prompting in English produces better LLM output than prompting in other languages. This study tests that claim empirically on Claude Opus 4.7 across 200 controlled runs in two experiments. Result: on quality and rule compliance, Italian and English instructions perform equivalently. The only systematic difference is verbosity — Italian produces 18–35% longer outputs on long generative tasks. The presumed link "verbosity → context saturation → degradation" does not manifest in the regimes reached, because the model self-limits output length. Full report (Italian): report/report.pdf.

🇮🇹 Riassunto: Nella community AI è diffusa l'idea che promptare in inglese produca output migliori che promptare in italiano. Ho verificato questa ipotesi con due esperimenti controllati su Claude Opus 4.7, per un totale di 200 run. Risultato: su qualità e rispetto delle regole, italiano e inglese sono equivalenti. L'unica differenza sistematica è la verbosità: l'italiano produce output del 18–35% più lunghi sui task generativi. L'ipotesi "verbosità → saturazione contesto → degradazione" non si manifesta nei regimi pratici, perché il modello si autolimita. Il report completo è in report/report.pdf.


📄 Il report

Il report completo è in italiano:

Il report descrive metodologia, risultati, conclusioni oneste, limitazioni dichiarate e appendice tecnica.

📊 Risultati principali

  1. Sulla qualità e sul rispetto delle regole, italiano e inglese sono equivalenti. Compliance, format, struttura, vincoli, recall su input lunghi: praticamente identici tra istruzioni italiane e inglesi.

  2. L'italiano è sistematicamente più verboso. +18-35% di parole sui task generativi, replicato in entrambi gli esperimenti.

  3. L'ipotesi "verbosità → saturazione contesto → degradazione" non si manifesta nei regimi pratici. Il modello si autolimita prima di saturare il contesto.

Conclusione operativa: su Claude Opus 4.7, la lingua delle istruzioni non determina la qualità dell'output. Determina però il costo in token. Promptare in inglese è una scelta razionale a volume e per efficienza, non per "qualità del ragionamento".

📁 Struttura del repository

prompting-italian-vs-english/
├── README.md                          # Questo file
├── LICENSE                            # MIT
├── report/
│   ├── report.pdf                     # Report completo con grafici
│   ├── report.md                      # Sorgente markdown
│   └── chart*.png                     # Grafici embedded nel report
├── experiment-1-baseline/             # 150 run, 15 task quotidiani
│   ├── METHODOLOGY.md
│   ├── RESULTS.md                     # Summary tecnico
│   ├── RESULTS_TABLES.md              # Tabelle riassuntive
│   ├── sample_inputs.md               # Input usati per i task
│   ├── metrics.csv                    # Metriche per ogni run
│   ├── metrics.py                     # Script di calcolo metriche
│   ├── build_prompts.py               # Script di costruzione prompt
│   ├── prompts/                       # 30 file (15 task × 2 lingue)
│   └── raw/                           # 150 output grezzi
├── experiment-2-stress/               # 50 run di stress test
│   ├── RESULTS.md                     # Summary tecnico
│   ├── test_document.md               # Documento di ~6000 parole per Axis B
│   ├── inserted_facts.md              # Fatti e contraddizioni inseriti
│   ├── metrics.csv                    # Metriche per ogni run
│   ├── metrics.py                     # Script di calcolo metriche
│   ├── build_prompts.py               # Script di costruzione prompt
│   ├── prompts/                       # 10 file (5 task × 2 lingue)
│   └── raw/                           # 50 output grezzi
└── assets/                            # Grafici come PNG separati

🔬 Come riprodurre lo studio

I prompt sono in chiaro nelle cartelle prompts/ di ciascun esperimento. Ogni file è eseguibile come singolo prompt su Claude Opus 4.7. Per riprodurre:

  1. Clona il repository e ottieni accesso a Claude Opus 4.7 (via API Anthropic o Claude Code in modalità agentica).

  2. Esegui i prompt seguendo il protocollo descritto in experiment-1-baseline/METHODOLOGY.md:

    • Una sessione fresca per ogni run (isolamento totale)
    • Stessi parametri (default) per versione IT e EN della stessa coppia
    • 5 ripetizioni per coppia (task, lingua)
    • Per i task con input placeholder, usa gli stessi sample input documentati in sample_inputs.md
  3. Calcola le metriche sui tuoi output usando metrics.py. Lo script accetta una cartella di output e produce un CSV con tutte le metriche.

  4. Confronta i risultati con quelli in metrics.csv. Risultati significativamente diversi sono benvenuti come issue su questo repository.

Note importanti sulla riproducibilità:

  • I modelli LLM hanno output non deterministici. Aspettative ragionevoli: i numeri esatti varieranno, le tendenze (verbosità sistematica IT > EN, compliance equivalente) dovrebbero replicarsi.
  • Su modelli diversi da Claude Opus 4.7 (GPT, Gemini, modelli più piccoli) i risultati possono differire. Estensioni a altri modelli sono incoraggiate.
  • Le metriche sono divise in Tier 1 (esatte, affidabili) e Tier 2 (euristiche, possibili falsi positivi). I dettagli sono nei file RESULTS.md.

📈 I grafici principali

I tre grafici chiave del report (PNG ad alta risoluzione in assets/):

La verbosità sistematica dell'italiano

La verbosità sistematica dell'italiano

Compliance posizionale (Asse A dello stress test)

Compliance posizionale

Recall per posizione dei fatti inseriti (Asse B)

Recall per posizione dei fatti inseriti

Possono essere riusati per presentazioni o post citando questo repository.

🤝 Come contribuire

Sono benvenute:

  • Repliche dello studio su altri modelli (GPT, Gemini, Mistral, Llama, Minerva, LLaMAntino, ecc.) — apri una issue con i tuoi risultati
  • Repliche su altre lingue (francese, tedesco, spagnolo, ecc.) — sarebbe interessante capire se il pattern di verbosità è specifico dell'italiano o trasversale
  • Critiche metodologiche — apri una issue. Le limitazioni dichiarate nel report sono un punto di partenza, ma probabilmente non esaustivo
  • Estensioni a regimi di carico più estremi — output forzati ben oltre l'autolimitazione, input di decine di migliaia di parole, ecc.

📚 Come citare

Se usi questo lavoro nei tuoi contenuti, articoli, presentazioni, o ricerca, una citazione è apprezzata ma non obbligatoria (licenza MIT):

Pace, G. (2026). Promptare in italiano o in inglese? Due esperimenti controllati,
200 run, Claude Opus 4.7. https://github.com/ledger-things/prompting-italian-vs-english

👤 Autore

Giuseppe Pace — AI Engineer & Co-founder @ Ledger Things

📜 Licenza

MIT License. Vedi LICENSE per i dettagli. In sintesi: puoi usare, modificare, distribuire e usare commercialmente questo materiale liberamente. Una citazione è apprezzata.


Pubblicato il 29 maggio 2026.

About

Controlled empirical study: does prompting Claude Opus 4.7 in Italian vs English affect output quality? 200 runs, two experiments, all data and code open.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages