WPML

Il Private Translation Cloud (PTC) di WPML ottiene un punteggio di 90,0 su 100 nella valutazione interna della qualità della traduzione di WPML. DeepL, ampiamente considerato il motore di traduzione IA più forte sul mercato, ottiene 77,7. PTC supera DeepL di 12,3 punti complessivi, vince in ognuna delle nove dimensioni di qualità valutate dai nostri linguisti e produce all'incirca una riduzione di 18 volte degli errori per pagina.

In sintesi

Metrica DeepL Logo PTC PTC
Punteggio medio di qualità della traduzione (0–100) 77,7 90,0
Problemi medi per pagina tradotta 1,27 0,07
Dimensioni di qualità in cui PTC ha ottenuto un punteggio superiore a DeepL 9 su 9
Lingue testate in cui PTC ha ottenuto un punteggio superiore a DeepL 6 su 6 (arabo, inglese, francese, tedesco, italiano, spagnolo)

Perché abbiamo condotto questo studio

In base al feedback dei nostri clienti, DeepL è ampiamente considerato il punto di riferimento per la qualità della traduzione IA nell'ecosistema WordPress. Quando i clienti chiedono se possono pubblicare contenuti tradotti con l'IA senza revisione umana, DeepL è di solito il termine di paragone implicito.

WPML ha costruito il proprio motore di traduzione IA, il Private Translation Cloud (PTC), perché “abbastanza buono” non era sufficiente. PTC è il motore predefinito all'interno della modalità Traduci tutto di WPML e alimenta la maggior parte della traduzione automatica negli oltre 1,5 milioni di siti che utilizzano WPML.

Volevamo una risposta misurabile a una domanda che i potenziali clienti ci pongono ogni settimana: come si confronta effettivamente PTC con DeepL? Questo studio è quella risposta. I numeri qui sopra sono il titolo; il resto di questo articolo spiega come sono stati prodotti e cosa significano per un sito di produzione reale.

Cosa abbiamo misurato e come

Abbiamo valutato la qualità della traduzione utilizzando un sistema basato su MQM (Multidimensional Quality Metrics), lo stesso framework che il team di linguistica di WPML utilizza per le continue revisioni dei siti dei clienti PTC. Ogni pagina tradotta viene valutata in nove dimensioni:

  • Grammatica — ci sono stati errori grammaticali?
  • Significato — il significato dell'origine è stato preservato?
  • Naturalezza — suona naturale e idiomatico per un madrelingua?
  • Tono — è stato catturato il tono dell'origine?
  • Formalità — è stato usato il registro giusto, sia nel rivolgersi al lettore che nelle forme grammaticali di indirizzo?
  • Terminologia — è stata usata la terminologia corretta?
  • Coerenza — la terminologia è stata applicata in modo coerente in tutta la pagina?
  • Maiuscole — sono state seguite le convenzioni della lingua di destinazione?
  • Localizzazione di numeri, unità e date — sono state seguite le convenzioni della lingua di destinazione?

Ogni dimensione viene valutata da 1 a 10 da un linguista umano madrelingua della lingua di destinazione. Il punteggio finale per pagina è la media delle nove dimensioni, moltiplicata per dieci, producendo una scala da 1 a 100 che corrisponde a fasce di qualità in linguaggio chiaro:

Punteggio Cosa significa
90–100 Da molto buono a perfetto — pronto per la pubblicazione senza revisione
80–89 Buono — pronto per la pubblicazione nella maggior parte dei contesti
70–79 Da accettabile a mediocre — utilizzabile ma gli errori sono visibili
60–69 Mediocre — necessita di ritocchi prima della pubblicazione
50–59 Errori evidenti anche per i non madrelingua
Sotto 50 Difetti abbastanza significativi da richiedere una rielaborazione

Per dare un contesto: la media pubblicata per la traduzione umana generica si aggira intorno a 76. Il 77,7 di DeepL lo pone appena sopra quella linea. Il 90,0 di PTC lo colloca proprio al limite della fascia “molto buono — pronto per la pubblicazione senza revisione”.

Dimensione del campione e selezione

Per valutare DeepL, abbiamo preso 800 siti casuali tradotti con DeepL negli ultimi 12 mesi, li abbiamo raggruppati per età del sito, volume di contenuti e attività di traduzione, e abbiamo effettuato un campionamento tra i gruppi. I nostri linguisti hanno poi revisionato manualmente le pagine principali dei siti campionati: 227 pagine web in totale, valutate in arabo, inglese, francese, tedesco, italiano e spagnolo.

Il punteggio di PTC proviene da un campione separato: 73 revisioni di siti di produzione, valutate dagli stessi linguisti utilizzando la stessa metodologia MQM descritta in precedenza. Il campione di PTC è più piccolo di quello di DeepL perché ogni misurazione di PTC riflette una versione specifica di PTC e il motore continua a evolversi (vedi la sezione Non abbiamo finito qui sotto).

Per lingua: PTC vince in ogni coppia

I punteggi aggregati sono interessanti; il quadro per lingua è ciò che dice a un team di contenuti multilingue cosa aspettarsi.

Punteggi TQ per lingua

Box plot che confronta i punteggi TQ per PTC e DeepL in arabo, tedesco, inglese, spagnolo, francese e italiano. PTC mostra punteggi mediani costantemente più alti e distribuzioni di punteggio più ristrette in tutte le lingue.
Punteggi TQ per lingua — PTC vs DeepL in arabo, tedesco, inglese, spagnolo, francese, italiano

PTC ottiene un punteggio superiore a DeepL in ogni coppia di lingue che abbiamo testato. Il divario più ampio è in arabo (+22,4 punti), dove DeepL ha storicamente sottoperformato e dove l'investimento di WPML nella qualità delle lingue RTL emerge chiaramente. Seguono il tedesco (+11,5) e il francese (+9,9). Il divario più ristretto è in inglese (+6,0 punti), e anche lì PTC sposta la pagina da “accettabile, visibilmente imperfetta” alla fascia pronta per la pubblicazione.

Anche la varianza è importante. La distribuzione di DeepL ha una lunga coda inferiore in arabo, con singole pagine che ottengono punteggi ben al di sotto della media, pagine che un utente tedesco o francese considererebbe difettose. Le distribuzioni di PTC sono più ristrette e centrate più in alto, quindi un team di contenuti può pianificare in base a una fascia di qualità attesa anziché preventivare per i casi anomali.

PTC supera DeepL anche in ognuna delle nove dimensioni di qualità che valutiamo: grammatica, significato, naturalezza, tono, formalità, terminologia, coerenza, maiuscole e convenzioni locali. I maggiori guadagni si registrano nelle dimensioni che contano di più per un essere umano che legge una pagina su un sito web reale: terminologia (+1,5), grammatica (+1,4), naturalezza (+1,4) e localizzazione di numeri/unità/date (+1,4). Non c'è nessuna dimensione in cui DeepL riesca a tenere il passo e nessuna dimensione in cui PTC sia solo di poco in vantaggio.

Tasso di errore: il quadro operativo

I punteggi medi sono utili; il conteggio degli errori è più utile per chiunque gestisca un sito reale. I nostri revisori hanno registrato ogni singolo problema identificato in ciascuna pagina: grammatica, significato, terminologia, tutto quanto.

Problemi medi per pagina

Grafico a barre che mostra i problemi medi per pagina: DeepL ~1,27, PTC ~0,07, con PTC significativamente inferiore a DeepL.
Problemi medi per pagina — DeepL ~1,27, PTC ~0,07

DeepL produce in media 1,27 problemi per pagina. PTC ne produce 0,07, all'incirca una riduzione di 18 volte degli errori per pagina sullo stesso contenuto di origine.

Per un sito di 200 pagine, questo si traduce all'incirca in:

  • DeepL: ~254 problemi da trovare, valutare e correggere prima della pubblicazione.
  • PTC: ~14 problemi su tutto il sito.

Questa è la differenza tra la traduzione IA come prima bozza e la traduzione IA come flusso di lavoro. In base alla nostra valutazione, DeepL è una solida prima bozza: le nostre misurazioni hanno riscontrato problemi da revisionare sulla maggior parte delle pagine prima della pubblicazione. PTC, in base a questa misurazione, è un flusso di lavoro: il conteggio degli errori è abbastanza basso da rendere la fase di revisione umana opzionale per la maggior parte dei contenuti anziché obbligatoria per tutti.

Cosa significa davvero “buona traduzione”

Le descrizioni dei voti del framework MQM sono un utile contrappeso al linguaggio di marketing che circonda la traduzione IA. Una pagina da “9/10” non è una pagina al 90%; è una pagina in cui un madrelingua, leggendo attentamente, non trova nulla che vorrebbe cambiare. Una pagina da “7/10” è accettabile così com'è ma visibilmente imperfetta. Una pagina da “5/10” è quella in cui un non madrelingua può individuare degli errori.

La media di DeepL si attesta nella parte alta del 7: accettabile, ma visibilmente imperfetta per un lettore madrelingua attento. La media di PTC si attesta a 90,0, proprio al limite di “molto buono — pronto per la pubblicazione senza revisione”. Questa è la differenza di qualità che i nostri revisori hanno misurato. Corrisponde a una distinzione reale: l'output di DeepL è un punto di partenza che richiede una revisione umana prima della pubblicazione; l'output di PTC è, nella maggior parte dei casi, la pubblicazione stessa.

Perché WPML può produrre questa qualità

Siamo consapevoli che “abbiamo costruito il nostro motore IA” è un'affermazione che molte aziende fanno in questo momento. PTC è insolito per due motivi specifici.

Scala e revisione continua. WPML serve oltre 1,5 milioni di siti e lo fa da oltre un decennio. Il team di linguistica di WPML revisiona continuamente la qualità della traduzione di PTC: campionando l'output, valutandolo con lo stesso framework MQM utilizzato in questo studio e osservando i pattern in cui il motore produce costantemente risultati di qualità inferiore per un termine, una coppia di lingue o un tipo di contenuto specifico.

Focus. PTC non è un progetto secondario in WPML. Ha un team dedicato: ingegneri, MLOps e linguisti umani. Quando i linguisti segnalano un pattern ricorrente, il team di ingegneria lo tratta come un bug: estende il glossario, regola il modello di formalità, aggiunge un'eccezione, rilascia la correzione. Questo ciclo viene eseguito continuamente, motivo per cui la qualità di PTC è migliorata negli ultimi 12 mesi da “buona quanto la traduzione umana media” ai numeri di questo studio.

La combinazione di una revisione umana continua su scala significativa, unita a un team che risponde a ogni scoperta come a un ticket di ingegneria, è ciò che produce i numeri di qualità sopra riportati. Non è l'architettura del modello; è il modello operativo.

Non abbiamo finito

Il 90,0 pone PTC proprio al limite di “molto buono — pronto per la pubblicazione senza revisione”. Siamo soddisfatti di questo risultato. Ma non pensiamo che sia il limite massimo.

Il ciclo QA → ingegneria descritto in precedenza è ancora in esecuzione. Il team di linguistica di WPML continua ad analizzare le modifiche che i clienti apportano all'output di PTC su siti reali, identifica i pattern che tali modifiche rivelano e il team di ingegneria rilascia le correzioni: estensioni del glossario, regolazioni della formalità, modifiche specifiche per coppia di lingue. Ci aspettiamo che la prossima misurazione sia ancora più alta di questa.

Cosa significa questo per il tuo flusso di lavoro

Il flusso di lavoro convenzionale per i contenuti multilingue è traduci → revisiona → pubblica. La fase di revisione esiste perché ogni motore IA, e la maggior parte dei traduttori umani, produce un lavoro che ha bisogno di un secondo paio di occhi prima di essere pubblicato. Quella fase di revisione è anche il punto in cui risiede la maggior parte dei costi e della latenza nei contenuti multilingue.

In base alle nostre misurazioni, con DeepL è consigliabile una fase di revisione. La nostra valutazione ha riscontrato una media di 1,27 problemi per pagina; se questi non vengono revisionati, è probabile che i lettori li incontrino. Con PTC, la fase di revisione è opzionale per la maggior parte dei contenuti. Alcuni team effettuano ancora la revisione, per pagine ad alto rischio o settori regolamentati, ma il flusso di lavoro predefinito diventa traduci → pubblica, con la revisione riservata ai casi che ne hanno effettivamente bisogno.

Questa è la differenza operativa descritta dai numeri. E non è di poco conto.

Cosa significa questo per i tuoi costi

Il costo della traduzione è composto da due elementi: il costo di produzione della traduzione e il costo di revisione. Entrambi devono essere pagati prima che i contenuti vadano online.

Nella maggior parte dei contesti professionali, la revisione umana costa pochi centesimi a parola: che i revisori addebitino a parola, a pagina o a sito, i conti portano all'incirca lì. La traduzione umana completa (traduzione, poi revisione da parte di un secondo essere umano) si aggira in genere intorno a 0,10 € – 0,20 € a parola per le principali coppie di lingue, con la sola parte di revisione compresa nell'intervallo di 0,04 € – 0,08 €.

Ecco quanto costa effettivamente ogni flusso di lavoro in questi termini.

Solo traduzione umana — la base di partenza. Intorno a 0,10 € – 0,20 € a parola. Entrambe le fasi sono umane.

DeepL (o qualsiasi motore IA) più revisione umana. L'IA gestisce la fase di traduzione; un essere umano deve comunque revisionare ogni pagina, perché con 1,27 problemi per pagina, questi raggiungeranno i clienti se nessuno li intercetta prima. La fase di traduzione è essenzialmente gratuita; la fase di revisione costa ancora 0,04 € – 0,08 € a parola. Risparmio totale rispetto alla sola traduzione umana: circa 60%. Questo è il classico discorso “l'IA ti fa risparmiare sulla traduzione”, ed è vero, ma il limite di costo si trova nella fase di revisione che la qualità di DeepL richiede ancora.

PTC, nessuna revisione necessaria. PTC costa 0,0012 € – 0,003 € a parola: 4 crediti a parola moltiplicati per 0,30 € – 0,75 € ogni 1.000 crediti a seconda del volume, con i primi 2.000 crediti al mese gratuiti. (Vedi i prezzi della traduzione automatica di WPML per la tabella completa dei livelli). Poiché la qualità misurata di PTC (punteggio TQ 90,0, 0,07 problemi per pagina, divario di +12,3 punti rispetto a DeepL) è abbastanza alta da saltare la fase di revisione nella maggior parte dei casi, il costo di revisione si azzera. Risparmio totale rispetto alla sola traduzione umana: all'incirca il 99%.

Non si tratta di un miglioramento marginale del flusso di lavoro IA più revisione. È un regime di costi completamente diverso.

In sintesi — Costo per pubblicare una parola tradotta

Flusso di lavoro Traduzione Revisione Totale Risparmio vs umana
Traduzione umana completa 0,10 € – 0,20 € inclusa 0,10 € – 0,20 €
DeepL + revisione umana ~0 € 0,04 € – 0,08 € 0,04 € – 0,08 € ~60%
PTC, nessuna revisione 0,0012 € – 0,003 € 0 € 0,0012 € – 0,003 € ~99%

Le tariffe della traduzione umana sono stime tipiche del settore per le principali coppie di lingue. I prezzi di PTC sono tratti dalle tariffe pubblicate da WPML.


Una nota sul fare la revisione da soli: quando il proprietario di un'attività esegue la revisione in prima persona anziché pagare un revisore, il costo non è zero, è solo meno visibile. Le ore impiegate nella revisione sono ore sottratte al resto dell'attività e, a qualsiasi tariffa oraria ragionevole, il costo implicito è di solito più alto di quello che addebiterebbe un revisore esterno, non più basso. Il risparmio di PTC si applica indipendentemente da chi paga per la fase di revisione oggi.

Cosa rende possibile tutto questo. Quando la traduzione costa più di 0,10 € a parola, traduci in modo selettivo: la homepage, le categorie di prodotti principali, una manciata di articoli del blog ad alto traffico. Tutto il resto rimane nella lingua di origine perché i conti non tornano. Quando la traduzione costa 0,002 € a parola e produce un output migliore della tipica traduzione umana, i conti tornano per contenuti che prima non erano sostenibili:

  • Traduzione completa del catalogo nell'eCommerce: ogni descrizione dei prodotti di nicchia, ogni variante.
  • Portali di documentazione completi in ogni lingua che un cliente potrebbe parlare, non solo nelle prime tre.
  • Knowledge base, FAQ di supporto, archivi del blog: la coda lunga che guida la ricerca ma che non ha mai giustificato il suo costo di traduzione.
  • Contenuti editoriali localizzati per gli editori che operano in mercati in cui le entrate per pagina del pubblico non potrebbero coprire la traduzione umana.

Per decenni, i contenuti multilingue sono stati una questione di “cosa possiamo permetterci di tradurre”. Con PTC, la domanda diventa “cosa vale la pena tradurre”, che è una questione diversa e più interessante.

Come ottenere questa qualità sul tuo sito

PTC è il motore predefinito nella modalità Traduci tutto di WPML, che è un'unica impostazione globale che traduce ogni pagina del tuo sito, automaticamente, in background. Non c'è nessuna configurazione per pagina da gestire.

Per ottenere la qualità misurata in questo studio, l'unica configurazione necessaria, oltre ad attivare Traduci tutto, è dedicare circa un minuto a descrivere il pubblico e il tono del tuo sito nelle impostazioni di Traduci tutto, ad esempio: “un'azienda di software che si rivolge agli sviluppatori, tono formale, terminologia tecnica conservata in inglese”. PTC utilizza questa descrizione per allineare le traduzioni alla voce del tuo brand.

Questa è tutta la configurazione. Il risultato è ciò che questo studio ha misurato.

Una nota su cosa non abbiamo fatto

Non abbiamo confrontato PTC con Google Traduttore, Azure Translator o servizi basati su LLM tramite le loro API pubbliche. Il motivo: quei motori cambiano frequentemente e una misurazione puntuale diventerebbe obsoleta nel giro di pochi mesi. Il confronto con DeepL è quello che abbiamo eseguito perché DeepL è il punto di riferimento più citato per la traduzione IA di livello produttivo e perché DeepL è ciò che la maggior parte dei nostri concorrenti utilizza internamente.

In questo studio non abbiamo nemmeno misurato la velocità, i costi o l'esperienza degli sviluppatori: solo la qualità. Quei confronti sono presenti sulla nostra pagina delle funzionalità e sulle nostre pagine di confronto, e raccontano la loro storia.

Provalo

Se gestisci un sito WordPress multilingue e vuoi vedere l'output di PTC sui tuoi contenuti, installa WPML, abilita Traduci tutto e confronta il risultato con qualsiasi cosa tu stia usando oggi. La differenza di qualità descritta qui è la differenza di qualità che dovresti aspettarti di vedere.


Domande sulla metodologia o richieste di dati: contatta il team di WPML.

Studio condotto dal team di linguistica di WPML, aprile 2026. Campione: 227 pagine web tradotte con DeepL e revisionate da linguisti madrelingua, confrontate con 73 revisioni di siti di produzione PTC valutate con la stessa metodologia. Lingue: arabo, inglese, francese, tedesco, italiano, spagnolo. Punteggio: framework per la qualità della traduzione basato su MQM, 9 dimensioni, 1–10 per dimensione, con media e scala per un risultato da 0 a 100.