A Private Translation Cloud (PTC) do WPML atinge a pontuação de 90,0 de 100 na avaliação interna de qualidade de tradução do WPML. O DeepL — amplamente considerado como o mecanismo de tradução por IA mais forte do mercado — atinge 77,7. A PTC supera o DeepL em 12,3 pontos no geral, vence em cada uma das nove dimensões de qualidade que nossos linguistas avaliaram e produz uma redução de aproximadamente 18× nos erros por página.
Visão geral
| Métrica | DeepL |
|
|---|---|---|
| Pontuação média de qualidade de tradução (0–100) | 77,7 | 90,0 |
| Média de problemas por página traduzida | 1,27 | 0,07 |
| Dimensões de qualidade onde a PTC obteve pontuação maior que o DeepL | — | 9 de 9 |
| Idiomas testados onde a PTC obteve pontuação maior que o DeepL | — | 6 de 6 (árabe, inglês, francês, alemão, italiano, espanhol) |
Por que realizamos este estudo
Com base no feedback dos nossos clientes, o DeepL é amplamente considerado como a referência em qualidade de tradução por IA no ecossistema do WordPress. Quando os clientes perguntam se podem publicar conteúdo traduzido por IA sem revisão humana, o DeepL costuma ser o ponto de comparação implícito.
O WPML construiu seu próprio mecanismo de tradução por IA — a Private Translation Cloud (PTC) — porque “bom o suficiente” não bastava. A PTC é o mecanismo padrão dentro do modo Traduzir tudo do WPML e impulsiona a maior parte da tradução automática nos mais de 1,5 milhão de sites que executam o WPML.
Queríamos uma resposta mensurável para uma pergunta que clientes em potencial nos fazem toda semana: como a PTC realmente se compara ao DeepL? Este estudo é essa resposta. Os números acima são o destaque; o restante deste artigo explica como eles foram produzidos e o que significam para um site de produção real.
O que medimos e como
Avaliamos a qualidade da tradução usando um sistema baseado no MQM (Multidimensional Quality Metrics), a mesma estrutura que a equipe de linguística do WPML usa para as revisões contínuas de sites de clientes da PTC. Cada página traduzida recebe uma pontuação em nove dimensões:
- Gramática — houve erros gramaticais?
- Significado — o significado da origem foi preservado?
- Naturalidade — soa natural e idiomático para um falante nativo?
- Tom — o tom da origem foi capturado?
- Formalidade — o registro correto foi usado, tanto ao se dirigir ao leitor quanto nas formas de tratamento gramaticais?
- Terminologia — a terminologia correta foi usada?
- Consistência — a terminologia foi aplicada de forma consistente em toda a página?
- Uso de maiúsculas e minúsculas — as convenções do idioma de destino foram seguidas?
- Localização de números, unidades e datas — as convenções do idioma de destino foram seguidas?
Cada dimensão recebe uma pontuação de 1 a 10 por um linguista humano que é falante nativo do idioma de destino. A pontuação final por página é a média das nove dimensões, multiplicada por dez — resultando em uma escala de 1 a 100 que corresponde a faixas de qualidade em linguagem simples:
| Pontuação | O que significa |
|---|---|
| 90–100 | Muito bom a perfeito — pronto para publicar sem revisão |
| 80–89 | Bom — pronto para publicar na maioria dos contextos |
| 70–79 | Aceitável a medíocre — utilizável, mas os erros são visíveis |
| 60–69 | Medíocre — precisa de retoques antes da publicação |
| 50–59 | Erros óbvios para falantes não nativos |
| Abaixo de 50 | Defeitos significativos o suficiente para exigir retrabalho |
Para contextualizar: a média publicada para a tradução humana genérica fica em torno de 76. A pontuação de 77,7 do DeepL o coloca logo acima dessa linha. A pontuação de 90,0 da PTC a coloca bem no limite da faixa “muito bom — pronto para publicar sem revisão”.
Tamanho e seleção da amostra
Para avaliar o DeepL, pegamos 800 sites aleatórios traduzidos com o DeepL nos últimos 12 meses, nós os agrupamos por idade do site, volume de conteúdo e atividade de tradução, e fizemos uma amostragem entre os grupos. Nossos linguistas então revisaram manualmente as páginas principais dos sites da amostra — 227 páginas da web no total, avaliadas em árabe, inglês, francês, alemão, italiano e espanhol.
A pontuação da PTC vem de uma amostra separada: 73 revisões de sites de produção, avaliadas pelos mesmos linguistas usando a mesma metodologia MQM descrita acima. A amostra da PTC é menor que a do DeepL porque cada medição da PTC reflete uma versão específica da PTC, e o mecanismo continua a evoluir — veja a seção Ainda não terminamos abaixo.
Por idioma: a PTC vence em todos os pares
As pontuações agregadas são interessantes; mas o cenário por idioma é o que diz a uma equipe de conteúdo multilíngue o que esperar.
Pontuações de TQ por idioma

A PTC obteve pontuações mais altas que o DeepL em todos os pares de idiomas que testamos. A maior diferença é no árabe (+22,4 pontos), onde o DeepL historicamente teve um desempenho inferior e onde o investimento do WPML na qualidade de idiomas RTL fica claro. O alemão (+11,5) e o francês (+9,9) vêm em seguida. A menor diferença é no inglês (+6,0 pontos) — e mesmo lá, a PTC move a página de “aceitável, visivelmente imperfeita” para a faixa de pronta para publicar.
A variação também importa. A distribuição do DeepL tem uma longa cauda inferior em árabe, com páginas individuais pontuando bem abaixo da média — páginas que um usuário alemão ou francês consideraria quebradas. As distribuições da PTC são mais estreitas e centradas mais acima, de modo que uma equipe de conteúdo pode se planejar em torno de uma faixa de qualidade esperada em vez de orçar para exceções.
A PTC também supera o DeepL em cada uma das nove dimensões de qualidade que avaliamos: gramática, significado, naturalidade, tom, formalidade, terminologia, consistência, uso de maiúsculas e minúsculas e convenções locais. Os maiores ganhos estão nas dimensões que mais importam para um humano lendo uma página em um site real — terminologia (+1,5), gramática (+1,4), naturalidade (+1,4) e localização de números/unidades/datas (+1,4). Não há nenhuma dimensão onde o DeepL consiga acompanhar, e nenhuma dimensão onde a PTC fique apenas um pouco à frente.
Taxa de erros: o cenário operacional
As pontuações médias são úteis; mas a contagem de erros é mais útil para qualquer pessoa que gerencia um site real. Nossos revisores registraram cada problema distinto que identificaram em cada página — gramática, significado, terminologia e tudo o mais.
Média de problemas por página

O DeepL produz uma média de 1,27 problemas por página. A PTC produz 0,07 — aproximadamente uma redução de 18× nos erros por página no mesmo conteúdo de origem.
Para um site de 200 páginas, isso se traduz aproximadamente em:
- DeepL: ~254 problemas para encontrar, decidir a respeito e corrigir antes da publicação.
- PTC: ~14 problemas em todo o site.
Essa é a diferença entre a tradução por IA como um primeiro rascunho e a tradução por IA como um fluxo de trabalho. Com base em nossa avaliação, o DeepL é um ótimo primeiro rascunho — nossas medições encontraram problemas que precisavam de revisão na maioria das páginas antes da publicação. A PTC, nesta medição, é um fluxo de trabalho: a contagem de erros é baixa o suficiente para que a etapa de revisão humana se torne opcional para a maior parte do conteúdo, em vez de obrigatória para todo ele.
O que “boa tradução” realmente significa
As descrições de notas da estrutura MQM são um contrapeso útil à linguagem de marketing que envolve a tradução por IA. Uma página “9/10” não é uma página 90%; é uma página onde um falante nativo, lendo com atenção, não encontra nada que gostaria de mudar. Uma página “7/10” é aceitável como está, mas visivelmente imperfeita. Uma página “5/10” é aquela onde um falante não nativo consegue identificar erros.
A média do DeepL fica na faixa superior a 7 — aceitável, mas visivelmente imperfeita para um leitor nativo atento. A média da PTC fica em 90,0, bem no limite de “muito bom — pronto para publicar sem revisão”. Essa é a diferença de qualidade que nossos revisores mediram. Isso se traduz em uma distinção real: o resultado do DeepL é um ponto de partida que requer revisão humana antes da publicação; o resultado da PTC é, na maioria dos casos, a própria publicação.
Por que o WPML consegue produzir essa qualidade
Temos consciência de que “construímos nosso próprio mecanismo de IA” é uma afirmação que muitas empresas fazem hoje em dia. A PTC é incomum por dois motivos específicos.
Escala e revisão contínua. O WPML atende a mais de 1,5 milhão de sites e faz isso há mais de uma década. A equipe de linguística do WPML revisa continuamente a qualidade da tradução da PTC — amostrando os resultados, avaliando-os com a mesma estrutura MQM usada neste estudo e observando padrões onde o mecanismo produz consistentemente resultados de qualidade inferior para um termo, par de idiomas ou tipo de conteúdo específico.
Foco. A PTC não é um projeto paralelo no WPML. Ela tem uma equipe dedicada — engenheiros, MLOps e linguistas humanos. Quando os linguistas sinalizam um padrão recorrente, a equipe de engenharia o trata como um bug: estende o glossário, ajusta o modelo de formalidade, adiciona uma exceção, lança a correção. Esse ciclo ocorre continuamente, e é por isso que a qualidade da PTC melhorou nos últimos 12 meses de “tão bom quanto a tradução humana média” para os números deste estudo.
A combinação — revisão humana contínua em escala significativa, aliada a uma equipe que responde a cada descoberta como um ticket de engenharia — é o que produz os números de qualidade acima. Não é a arquitetura do modelo; é o modelo operacional.
Ainda não terminamos
A pontuação de 90,0 coloca a PTC bem no limite de “muito bom — pronto para publicar sem revisão”. Estamos felizes com esse resultado. Mas não achamos que seja o teto.
O ciclo de controle de qualidade → engenharia descrito acima continua em execução. A equipe de linguística do WPML continua a analisar as edições que os clientes fazem nos resultados da PTC em sites reais, identifica os padrões que essas edições revelam, e a equipe de engenharia lança as correções — extensões de glossário, ajustes de formalidade, melhorias específicas de pares de idiomas. Esperamos que a próxima medição seja maior que esta.
O que isso significa para o seu fluxo de trabalho
O fluxo de trabalho convencional de conteúdo multilíngue é traduzir → revisar → publicar. A etapa de revisão existe porque todo mecanismo de IA — e a maioria dos tradutores humanos — produz um trabalho que precisa de um segundo par de olhos antes de ser entregue. Essa etapa de revisão também é onde reside a maior parte do custo e do atraso no conteúdo multilíngue.
Com base em nossas medições, com o DeepL uma etapa de revisão é aconselhável. Nossa avaliação encontrou uma média de 1,27 problemas por página; se eles não forem revisados, é provável que os leitores os encontrem. Com a PTC, a etapa de revisão é opcional para a maior parte do conteúdo. Algumas equipes ainda revisam — para páginas de alto risco ou setores regulamentados — mas o fluxo de trabalho padrão se torna traduzir → publicar, com a revisão reservada para os casos que realmente precisam dela.
Essa é a diferença operacional que os números descrevem. E não é pequena.
O que isso significa para os seus custos
O custo da tradução se divide em dois: o custo de produzir a tradução e o custo de revisá-la. Ambos devem ser pagos antes que o conteúdo vá ao ar.
Para a maioria dos contextos profissionais, a revisão humana custa alguns centavos por palavra — quer os revisores cobrem por palavra, por página ou por site, é aproximadamente aí que a conta fecha. A tradução humana completa (traduzir e, em seguida, revisar por um segundo humano) normalmente custa em torno de € 0,10–€ 0,20 por palavra para os principais pares de idiomas, com a parte da revisão sozinha na faixa de € 0,04–€ 0,08.
Aqui está o que cada fluxo de trabalho realmente custa nesses termos.
Apenas tradução humana — a linha de base. Em torno de € 0,10–€ 0,20 por palavra. Ambas as etapas são humanas.
DeepL (ou qualquer mecanismo de IA) mais revisão humana. A IA cuida da etapa de tradução; um humano ainda precisa revisar cada página, porque com 1,27 problemas por página os erros chegarão aos clientes se ninguém os detectar primeiro. A etapa de tradução é essencialmente gratuita; a etapa de revisão ainda custa € 0,04–€ 0,08 por palavra. Economia total em relação à tradução apenas humana: cerca de 60%. Esse é o discurso padrão de “a IA economiza seu dinheiro na tradução” — e é verdade — mas o teto de custos está na etapa de revisão que a qualidade do DeepL ainda exige.
PTC, sem necessidade de revisão. A PTC custa € 0,0012–€ 0,003 por palavra — 4 créditos por palavra multiplicados por € 0,30–€ 0,75 a cada 1.000 créditos, dependendo do volume, com os primeiros 2.000 créditos por mês grátis. (Veja os preços da tradução automática do WPML para a tabela de níveis completa). Como a qualidade medida da PTC (pontuação de TQ de 90,0, 0,07 problemas por página, diferença de +12,3 pontos sobre o DeepL) é alta o suficiente para pular a etapa de revisão na maioria dos casos, o custo de revisão cai para zero. Economia total em relação à tradução apenas humana: aproximadamente 99%.
Essa não é uma melhoria marginal no fluxo de trabalho de IA mais revisão. É um regime de custos diferente.
Visão geral — custo para publicar uma palavra traduzida
| Fluxo de trabalho | Tradução | Revisão | Total | Economia vs. humano |
|---|---|---|---|---|
| Tradução humana completa | € 0,10–€ 0,20 | incluído | € 0,10–€ 0,20 | — |
| DeepL + revisão humana | ~€ 0 | € 0,04–€ 0,08 | € 0,04–€ 0,08 | ~60% |
| PTC, sem revisão | € 0,0012–€ 0,003 | € 0 | € 0,0012–€ 0,003 | ~99% |
As taxas de tradução humana são estimativas típicas do setor para os principais pares de idiomas. Os preços da PTC são baseados nas taxas publicadas do WPML.
Uma observação sobre fazer a revisão você mesmo: quando o proprietário de uma empresa faz a revisão por conta própria em vez de pagar um revisor, o custo não é zero — é apenas menos visível. As horas gastas na revisão são horas que não são investidas no restante da empresa e, a qualquer taxa horária razoável, o custo implícito costuma ser maior do que um revisor terceirizado cobraria, e não menor. A economia da PTC se aplica independentemente de quem está pagando pela etapa de revisão hoje.
O que isso possibilita. Quando a tradução custa € 0,10 ou mais por palavra, você traduz de forma seletiva — a página inicial, as principais categorias de produtos, alguns posts de blog com alto tráfego. Todo o restante fica no idioma de origem porque a conta não fecha. Quando a tradução custa € 0,002 por palavra e produz um resultado que é melhor do que a tradução humana típica, a conta fecha para conteúdos que antes não eram viáveis:
- Tradução completa de catálogos em comércio eletrônico — cada descrição de produto de cauda longa, cada variação.
- Portais de documentação completos em todos os idiomas que um cliente possa falar, não apenas nos três principais.
- Bases de conhecimento, FAQs de suporte, arquivos de blog — a cauda longa que impulsiona as pesquisas, mas que nunca justificou seu custo de tradução.
- Conteúdo editorial localizado para editores que operam em mercados onde a receita de público por página não poderia cobrir a tradução humana.
O conteúdo multilíngue tem sido uma questão de “o que podemos pagar para traduzir” por décadas. Com a PTC, a pergunta passa a ser “o que vale a pena traduzir” — o que é uma questão diferente e muito mais interessante.
Como obter essa qualidade no seu próprio site
A PTC é o mecanismo padrão no modo Traduzir tudo do WPML, que é uma configuração global única que traduz todas as páginas do seu site, automaticamente, em segundo plano. Não há configuração por página para gerenciar.
Para obter a qualidade medida neste estudo, a única configuração de que você precisa além de ativar o Traduzir tudo é gastar cerca de um minuto descrevendo o público e o tom do seu site nas configurações do Traduzir tudo — por exemplo, “uma empresa de software voltada para desenvolvedores, tom formal, terminologia técnica preservada em inglês”. A PTC usa essa descrição para alinhar as traduções com a voz da sua marca.
Essa é toda a configuração. O resultado é o que este estudo mediu.
Uma observação sobre o que não fizemos
Não comparamos a PTC com o Google Tradutor, Azure Translator ou serviços baseados em LLM por meio de suas APIs públicas. O motivo: esses mecanismos mudam com frequência e uma medição pontual ficaria obsoleta em meses. A comparação com o DeepL é a que realizamos porque o DeepL é a referência mais citada para tradução por IA em nível de produção e porque o DeepL é o que a maioria de nossos concorrentes usa nos bastidores.
Também não medimos velocidade, custo ou experiência do desenvolvedor neste estudo — apenas qualidade. Essas comparações existem em nossa página de recursos e em nossas páginas de comparação, e elas contam sua própria história.
Experimente
Se você gerencia um site WordPress multilíngue e quer ver o resultado da PTC em seu próprio conteúdo, instale o WPML, ative o Traduzir tudo e compare o resultado com o que você está usando hoje. A diferença de qualidade descrita aqui é a diferença de qualidade que você deve esperar ver.
Dúvidas sobre a metodologia ou solicitações de dados: entre em contato com a equipe do WPML.
Estudo conduzido pela equipe de linguística do WPML, abril de 2026. Amostra: 227 páginas da web traduzidas pelo DeepL revisadas por linguistas falantes nativos, comparadas a 73 revisões de sites de produção da PTC avaliadas com a mesma metodologia. Idiomas: árabe, inglês, francês, alemão, italiano, espanhol. Pontuação: estrutura de qualidade de tradução baseada no MQM, 9 dimensões, 1–10 por dimensão, com média e escalonamento para um resultado de 0–100.