WPML

A Private Translation Cloud (PTC) do WPML atinge a pontuação de 90,0 de 100 na avaliação interna de qualidade de tradução do WPML. O DeepL — amplamente considerado como o mecanismo de tradução por IA mais forte do mercado — atinge 77,7. A PTC supera o DeepL em 12,3 pontos no geral, vence em cada uma das nove dimensões de qualidade que nossos linguistas avaliaram e produz uma redução de aproximadamente 18× nos erros por página.

Visão geral

Métrica DeepL Logotipo da PTC PTC
Pontuação média de qualidade de tradução (0–100) 77,7 90,0
Média de problemas por página traduzida 1,27 0,07
Dimensões de qualidade onde a PTC obteve pontuação maior que o DeepL 9 de 9
Idiomas testados onde a PTC obteve pontuação maior que o DeepL 6 de 6 (árabe, inglês, francês, alemão, italiano, espanhol)

Por que realizamos este estudo

Com base no feedback dos nossos clientes, o DeepL é amplamente considerado como a referência em qualidade de tradução por IA no ecossistema do WordPress. Quando os clientes perguntam se podem publicar conteúdo traduzido por IA sem revisão humana, o DeepL costuma ser o ponto de comparação implícito.

O WPML construiu seu próprio mecanismo de tradução por IA — a Private Translation Cloud (PTC) — porque “bom o suficiente” não bastava. A PTC é o mecanismo padrão dentro do modo Traduzir tudo do WPML e impulsiona a maior parte da tradução automática nos mais de 1,5 milhão de sites que executam o WPML.

Queríamos uma resposta mensurável para uma pergunta que clientes em potencial nos fazem toda semana: como a PTC realmente se compara ao DeepL? Este estudo é essa resposta. Os números acima são o destaque; o restante deste artigo explica como eles foram produzidos e o que significam para um site de produção real.

O que medimos e como

Avaliamos a qualidade da tradução usando um sistema baseado no MQM (Multidimensional Quality Metrics), a mesma estrutura que a equipe de linguística do WPML usa para as revisões contínuas de sites de clientes da PTC. Cada página traduzida recebe uma pontuação em nove dimensões:

  • Gramática — houve erros gramaticais?
  • Significado — o significado da origem foi preservado?
  • Naturalidade — soa natural e idiomático para um falante nativo?
  • Tom — o tom da origem foi capturado?
  • Formalidade — o registro correto foi usado, tanto ao se dirigir ao leitor quanto nas formas de tratamento gramaticais?
  • Terminologia — a terminologia correta foi usada?
  • Consistência — a terminologia foi aplicada de forma consistente em toda a página?
  • Uso de maiúsculas e minúsculas — as convenções do idioma de destino foram seguidas?
  • Localização de números, unidades e datas — as convenções do idioma de destino foram seguidas?

Cada dimensão recebe uma pontuação de 1 a 10 por um linguista humano que é falante nativo do idioma de destino. A pontuação final por página é a média das nove dimensões, multiplicada por dez — resultando em uma escala de 1 a 100 que corresponde a faixas de qualidade em linguagem simples:

Pontuação O que significa
90–100 Muito bom a perfeito — pronto para publicar sem revisão
80–89 Bom — pronto para publicar na maioria dos contextos
70–79 Aceitável a medíocre — utilizável, mas os erros são visíveis
60–69 Medíocre — precisa de retoques antes da publicação
50–59 Erros óbvios para falantes não nativos
Abaixo de 50 Defeitos significativos o suficiente para exigir retrabalho

Para contextualizar: a média publicada para a tradução humana genérica fica em torno de 76. A pontuação de 77,7 do DeepL o coloca logo acima dessa linha. A pontuação de 90,0 da PTC a coloca bem no limite da faixa “muito bom — pronto para publicar sem revisão”.

Tamanho e seleção da amostra

Para avaliar o DeepL, pegamos 800 sites aleatórios traduzidos com o DeepL nos últimos 12 meses, nós os agrupamos por idade do site, volume de conteúdo e atividade de tradução, e fizemos uma amostragem entre os grupos. Nossos linguistas então revisaram manualmente as páginas principais dos sites da amostra — 227 páginas da web no total, avaliadas em árabe, inglês, francês, alemão, italiano e espanhol.

A pontuação da PTC vem de uma amostra separada: 73 revisões de sites de produção, avaliadas pelos mesmos linguistas usando a mesma metodologia MQM descrita acima. A amostra da PTC é menor que a do DeepL porque cada medição da PTC reflete uma versão específica da PTC, e o mecanismo continua a evoluir — veja a seção Ainda não terminamos abaixo.

Por idioma: a PTC vence em todos os pares

As pontuações agregadas são interessantes; mas o cenário por idioma é o que diz a uma equipe de conteúdo multilíngue o que esperar.

Pontuações de TQ por idioma

Gráfico de caixa comparando as pontuações de TQ da PTC e do DeepL em árabe, alemão, inglês, espanhol, francês e italiano. A PTC mostra pontuações medianas consistentemente mais altas e distribuições de pontuação mais estreitas em todos os idiomas.
Pontuações de TQ por idioma — PTC vs DeepL em árabe, alemão, inglês, espanhol, francês, italiano

A PTC obteve pontuações mais altas que o DeepL em todos os pares de idiomas que testamos. A maior diferença é no árabe (+22,4 pontos), onde o DeepL historicamente teve um desempenho inferior e onde o investimento do WPML na qualidade de idiomas RTL fica claro. O alemão (+11,5) e o francês (+9,9) vêm em seguida. A menor diferença é no inglês (+6,0 pontos) — e mesmo lá, a PTC move a página de “aceitável, visivelmente imperfeita” para a faixa de pronta para publicar.

A variação também importa. A distribuição do DeepL tem uma longa cauda inferior em árabe, com páginas individuais pontuando bem abaixo da média — páginas que um usuário alemão ou francês consideraria quebradas. As distribuições da PTC são mais estreitas e centradas mais acima, de modo que uma equipe de conteúdo pode se planejar em torno de uma faixa de qualidade esperada em vez de orçar para exceções.

A PTC também supera o DeepL em cada uma das nove dimensões de qualidade que avaliamos: gramática, significado, naturalidade, tom, formalidade, terminologia, consistência, uso de maiúsculas e minúsculas e convenções locais. Os maiores ganhos estão nas dimensões que mais importam para um humano lendo uma página em um site real — terminologia (+1,5), gramática (+1,4), naturalidade (+1,4) e localização de números/unidades/datas (+1,4). Não há nenhuma dimensão onde o DeepL consiga acompanhar, e nenhuma dimensão onde a PTC fique apenas um pouco à frente.

Taxa de erros: o cenário operacional

As pontuações médias são úteis; mas a contagem de erros é mais útil para qualquer pessoa que gerencia um site real. Nossos revisores registraram cada problema distinto que identificaram em cada página — gramática, significado, terminologia e tudo o mais.

Média de problemas por página

Gráfico de barras mostrando a média de problemas por página: DeepL ~1,27, PTC ~0,07, com a PTC significativamente menor que o DeepL.
Média de problemas por página — DeepL ~1,27, PTC ~0,07

O DeepL produz uma média de 1,27 problemas por página. A PTC produz 0,07 — aproximadamente uma redução de 18× nos erros por página no mesmo conteúdo de origem.

Para um site de 200 páginas, isso se traduz aproximadamente em:

  • DeepL: ~254 problemas para encontrar, decidir a respeito e corrigir antes da publicação.
  • PTC: ~14 problemas em todo o site.

Essa é a diferença entre a tradução por IA como um primeiro rascunho e a tradução por IA como um fluxo de trabalho. Com base em nossa avaliação, o DeepL é um ótimo primeiro rascunho — nossas medições encontraram problemas que precisavam de revisão na maioria das páginas antes da publicação. A PTC, nesta medição, é um fluxo de trabalho: a contagem de erros é baixa o suficiente para que a etapa de revisão humana se torne opcional para a maior parte do conteúdo, em vez de obrigatória para todo ele.

O que “boa tradução” realmente significa

As descrições de notas da estrutura MQM são um contrapeso útil à linguagem de marketing que envolve a tradução por IA. Uma página “9/10” não é uma página 90%; é uma página onde um falante nativo, lendo com atenção, não encontra nada que gostaria de mudar. Uma página “7/10” é aceitável como está, mas visivelmente imperfeita. Uma página “5/10” é aquela onde um falante não nativo consegue identificar erros.

A média do DeepL fica na faixa superior a 7 — aceitável, mas visivelmente imperfeita para um leitor nativo atento. A média da PTC fica em 90,0, bem no limite de “muito bom — pronto para publicar sem revisão”. Essa é a diferença de qualidade que nossos revisores mediram. Isso se traduz em uma distinção real: o resultado do DeepL é um ponto de partida que requer revisão humana antes da publicação; o resultado da PTC é, na maioria dos casos, a própria publicação.

Por que o WPML consegue produzir essa qualidade

Temos consciência de que “construímos nosso próprio mecanismo de IA” é uma afirmação que muitas empresas fazem hoje em dia. A PTC é incomum por dois motivos específicos.

Escala e revisão contínua. O WPML atende a mais de 1,5 milhão de sites e faz isso há mais de uma década. A equipe de linguística do WPML revisa continuamente a qualidade da tradução da PTC — amostrando os resultados, avaliando-os com a mesma estrutura MQM usada neste estudo e observando padrões onde o mecanismo produz consistentemente resultados de qualidade inferior para um termo, par de idiomas ou tipo de conteúdo específico.

Foco. A PTC não é um projeto paralelo no WPML. Ela tem uma equipe dedicada — engenheiros, MLOps e linguistas humanos. Quando os linguistas sinalizam um padrão recorrente, a equipe de engenharia o trata como um bug: estende o glossário, ajusta o modelo de formalidade, adiciona uma exceção, lança a correção. Esse ciclo ocorre continuamente, e é por isso que a qualidade da PTC melhorou nos últimos 12 meses de “tão bom quanto a tradução humana média” para os números deste estudo.

A combinação — revisão humana contínua em escala significativa, aliada a uma equipe que responde a cada descoberta como um ticket de engenharia — é o que produz os números de qualidade acima. Não é a arquitetura do modelo; é o modelo operacional.

Ainda não terminamos

A pontuação de 90,0 coloca a PTC bem no limite de “muito bom — pronto para publicar sem revisão”. Estamos felizes com esse resultado. Mas não achamos que seja o teto.

O ciclo de controle de qualidade → engenharia descrito acima continua em execução. A equipe de linguística do WPML continua a analisar as edições que os clientes fazem nos resultados da PTC em sites reais, identifica os padrões que essas edições revelam, e a equipe de engenharia lança as correções — extensões de glossário, ajustes de formalidade, melhorias específicas de pares de idiomas. Esperamos que a próxima medição seja maior que esta.

O que isso significa para o seu fluxo de trabalho

O fluxo de trabalho convencional de conteúdo multilíngue é traduzir → revisar → publicar. A etapa de revisão existe porque todo mecanismo de IA — e a maioria dos tradutores humanos — produz um trabalho que precisa de um segundo par de olhos antes de ser entregue. Essa etapa de revisão também é onde reside a maior parte do custo e do atraso no conteúdo multilíngue.

Com base em nossas medições, com o DeepL uma etapa de revisão é aconselhável. Nossa avaliação encontrou uma média de 1,27 problemas por página; se eles não forem revisados, é provável que os leitores os encontrem. Com a PTC, a etapa de revisão é opcional para a maior parte do conteúdo. Algumas equipes ainda revisam — para páginas de alto risco ou setores regulamentados — mas o fluxo de trabalho padrão se torna traduzir → publicar, com a revisão reservada para os casos que realmente precisam dela.

Essa é a diferença operacional que os números descrevem. E não é pequena.

O que isso significa para os seus custos

O custo da tradução se divide em dois: o custo de produzir a tradução e o custo de revisá-la. Ambos devem ser pagos antes que o conteúdo vá ao ar.

Para a maioria dos contextos profissionais, a revisão humana custa alguns centavos por palavra — quer os revisores cobrem por palavra, por página ou por site, é aproximadamente aí que a conta fecha. A tradução humana completa (traduzir e, em seguida, revisar por um segundo humano) normalmente custa em torno de € 0,10–€ 0,20 por palavra para os principais pares de idiomas, com a parte da revisão sozinha na faixa de € 0,04–€ 0,08.

Aqui está o que cada fluxo de trabalho realmente custa nesses termos.

Apenas tradução humana — a linha de base. Em torno de € 0,10–€ 0,20 por palavra. Ambas as etapas são humanas.

DeepL (ou qualquer mecanismo de IA) mais revisão humana. A IA cuida da etapa de tradução; um humano ainda precisa revisar cada página, porque com 1,27 problemas por página os erros chegarão aos clientes se ninguém os detectar primeiro. A etapa de tradução é essencialmente gratuita; a etapa de revisão ainda custa € 0,04–€ 0,08 por palavra. Economia total em relação à tradução apenas humana: cerca de 60%. Esse é o discurso padrão de “a IA economiza seu dinheiro na tradução” — e é verdade — mas o teto de custos está na etapa de revisão que a qualidade do DeepL ainda exige.

PTC, sem necessidade de revisão. A PTC custa € 0,0012–€ 0,003 por palavra — 4 créditos por palavra multiplicados por € 0,30–€ 0,75 a cada 1.000 créditos, dependendo do volume, com os primeiros 2.000 créditos por mês grátis. (Veja os preços da tradução automática do WPML para a tabela de níveis completa). Como a qualidade medida da PTC (pontuação de TQ de 90,0, 0,07 problemas por página, diferença de +12,3 pontos sobre o DeepL) é alta o suficiente para pular a etapa de revisão na maioria dos casos, o custo de revisão cai para zero. Economia total em relação à tradução apenas humana: aproximadamente 99%.

Essa não é uma melhoria marginal no fluxo de trabalho de IA mais revisão. É um regime de custos diferente.

Visão geral — custo para publicar uma palavra traduzida

Fluxo de trabalho Tradução Revisão Total Economia vs. humano
Tradução humana completa € 0,10–€ 0,20 incluído € 0,10–€ 0,20
DeepL + revisão humana ~€ 0 € 0,04–€ 0,08 € 0,04–€ 0,08 ~60%
PTC, sem revisão € 0,0012–€ 0,003 € 0 € 0,0012–€ 0,003 ~99%

As taxas de tradução humana são estimativas típicas do setor para os principais pares de idiomas. Os preços da PTC são baseados nas taxas publicadas do WPML.


Uma observação sobre fazer a revisão você mesmo: quando o proprietário de uma empresa faz a revisão por conta própria em vez de pagar um revisor, o custo não é zero — é apenas menos visível. As horas gastas na revisão são horas que não são investidas no restante da empresa e, a qualquer taxa horária razoável, o custo implícito costuma ser maior do que um revisor terceirizado cobraria, e não menor. A economia da PTC se aplica independentemente de quem está pagando pela etapa de revisão hoje.

O que isso possibilita. Quando a tradução custa € 0,10 ou mais por palavra, você traduz de forma seletiva — a página inicial, as principais categorias de produtos, alguns posts de blog com alto tráfego. Todo o restante fica no idioma de origem porque a conta não fecha. Quando a tradução custa € 0,002 por palavra e produz um resultado que é melhor do que a tradução humana típica, a conta fecha para conteúdos que antes não eram viáveis:

  • Tradução completa de catálogos em comércio eletrônico — cada descrição de produto de cauda longa, cada variação.
  • Portais de documentação completos em todos os idiomas que um cliente possa falar, não apenas nos três principais.
  • Bases de conhecimento, FAQs de suporte, arquivos de blog — a cauda longa que impulsiona as pesquisas, mas que nunca justificou seu custo de tradução.
  • Conteúdo editorial localizado para editores que operam em mercados onde a receita de público por página não poderia cobrir a tradução humana.

O conteúdo multilíngue tem sido uma questão de “o que podemos pagar para traduzir” por décadas. Com a PTC, a pergunta passa a ser “o que vale a pena traduzir” — o que é uma questão diferente e muito mais interessante.

Como obter essa qualidade no seu próprio site

A PTC é o mecanismo padrão no modo Traduzir tudo do WPML, que é uma configuração global única que traduz todas as páginas do seu site, automaticamente, em segundo plano. Não há configuração por página para gerenciar.

Para obter a qualidade medida neste estudo, a única configuração de que você precisa além de ativar o Traduzir tudo é gastar cerca de um minuto descrevendo o público e o tom do seu site nas configurações do Traduzir tudo — por exemplo, “uma empresa de software voltada para desenvolvedores, tom formal, terminologia técnica preservada em inglês”. A PTC usa essa descrição para alinhar as traduções com a voz da sua marca.

Essa é toda a configuração. O resultado é o que este estudo mediu.

Uma observação sobre o que não fizemos

Não comparamos a PTC com o Google Tradutor, Azure Translator ou serviços baseados em LLM por meio de suas APIs públicas. O motivo: esses mecanismos mudam com frequência e uma medição pontual ficaria obsoleta em meses. A comparação com o DeepL é a que realizamos porque o DeepL é a referência mais citada para tradução por IA em nível de produção e porque o DeepL é o que a maioria de nossos concorrentes usa nos bastidores.

Também não medimos velocidade, custo ou experiência do desenvolvedor neste estudo — apenas qualidade. Essas comparações existem em nossa página de recursos e em nossas páginas de comparação, e elas contam sua própria história.

Experimente

Se você gerencia um site WordPress multilíngue e quer ver o resultado da PTC em seu próprio conteúdo, instale o WPML, ative o Traduzir tudo e compare o resultado com o que você está usando hoje. A diferença de qualidade descrita aqui é a diferença de qualidade que você deve esperar ver.


Dúvidas sobre a metodologia ou solicitações de dados: entre em contato com a equipe do WPML.

Estudo conduzido pela equipe de linguística do WPML, abril de 2026. Amostra: 227 páginas da web traduzidas pelo DeepL revisadas por linguistas falantes nativos, comparadas a 73 revisões de sites de produção da PTC avaliadas com a mesma metodologia. Idiomas: árabe, inglês, francês, alemão, italiano, espanhol. Pontuação: estrutura de qualidade de tradução baseada no MQM, 9 dimensões, 1–10 por dimensão, com média e escalonamento para um resultado de 0–100.