WPML

Private Translation Cloud (PTC) de WPML obtiene una puntuación de 90,0 sobre 100 en la evaluación interna de calidad de traducción de WPML. DeepL, ampliamente considerado como el motor de traducción por IA convencional más potente, obtiene 77,7. PTC supera a DeepL por 12,3 puntos en total, gana en cada una de las nueve dimensiones de calidad que puntuaron nuestros lingüistas y produce una reducción de errores por página de aproximadamente 18 veces.

De un vistazo

Métrica DeepL Logotipo de PTC PTC
Puntuación media de calidad de traducción (0-100) 77,7 90,0
Media de problemas por página traducida 1,27 0,07
Dimensiones de calidad donde PTC obtuvo mayor puntuación que DeepL 9 de 9
Idiomas probados donde PTC obtuvo mayor puntuación que DeepL 6 de 6 (árabe, inglés, francés, alemán, italiano, español)

Por qué realizamos este estudio

Según los comentarios de nuestros clientes, DeepL es ampliamente considerado como el punto de referencia para la calidad de la traducción por IA en el ecosistema de WordPress. Cuando los clientes preguntan si pueden publicar contenido traducido por IA sin revisión humana, DeepL suele ser el punto de comparación implícito.

WPML creó su propio motor de traducción por IA, Private Translation Cloud (PTC), porque «suficientemente bueno» no era suficiente. PTC es el motor predeterminado dentro del modo Traducir todo de WPML e impulsa la mayor parte de la traducción automática en los más de 1,5 millones de sitios que ejecutan WPML.

Queríamos una respuesta medible a una pregunta que los clientes potenciales nos hacen cada semana: ¿cómo se compara realmente PTC con DeepL? Este estudio es esa respuesta. Los números anteriores son el titular; el resto de este artículo explica cómo se produjeron y qué significan para un sitio de producción real.

Qué medimos y cómo

Puntuamos la calidad de la traducción utilizando un sistema basado en MQM (métricas de calidad multidimensionales), el mismo marco que el equipo de lingüística de WPML utiliza para las revisiones continuas de los sitios de clientes de PTC. Cada página traducida se puntúa en nueve dimensiones:

  • Gramática: ¿hubo errores gramaticales?
  • Significado: ¿se conservó el significado del origen?
  • Naturalidad: ¿suena natural e idiomático para un hablante nativo?
  • Tono: ¿se capturó el tono del origen?
  • Formalidad: ¿se utilizó el registro correcto, tanto al dirigirse al lector como en las formas de tratamiento gramaticales?
  • Terminología: ¿se utilizó la terminología correcta?
  • Coherencia: ¿se aplicó la terminología de forma coherente en toda la página?
  • Uso de mayúsculas: ¿se siguieron las convenciones del idioma de destino?
  • Localización de números, unidades y fechas: ¿se siguieron las convenciones del idioma de destino?

Cada dimensión recibe una puntuación del 1 al 10 por parte de un lingüista humano que es hablante nativo del idioma de destino. La puntuación final por página es la media de las nueve dimensiones, multiplicada por diez, lo que da como resultado una escala de 1 a 100 que se corresponde con bandas de calidad en lenguaje sencillo:

Puntuación Qué significa
90-100 Muy buena a perfecta: lista para publicar sin revisión
80-89 Buena: lista para publicar en la mayoría de los contextos
70-79 Aceptable a mediocre: utilizable, pero los errores son visibles
60-69 Mediocre: necesita retoques antes de publicarse
50-59 Errores obvios para los hablantes no nativos
Por debajo de 50 Defectos lo suficientemente importantes como para requerir reelaboración

Para ponerlo en contexto: la media publicada para la traducción humana genérica se sitúa en torno a 76. El 77,7 de DeepL lo sitúa justo por encima de esa línea. El 90,0 de PTC lo sitúa justo en el límite de la banda «muy buena: lista para publicar sin revisión».

Tamaño y selección de la muestra

Para evaluar DeepL, tomamos 800 sitios aleatorios traducidos con DeepL en los últimos 12 meses, los agrupamos por antigüedad del sitio, volumen de contenido y actividad de traducción, y tomamos muestras de todos los grupos. A continuación, nuestros lingüistas revisaron manualmente las páginas principales de los sitios de la muestra: 227 páginas web en total, evaluadas en árabe, inglés, francés, alemán, italiano y español.

La puntuación de PTC proviene de una muestra independiente: 73 revisiones de sitios de producción, puntuadas por los mismos lingüistas utilizando la misma metodología MQM descrita anteriormente. La muestra de PTC es más pequeña que la de DeepL porque cada medición de PTC refleja una versión específica de PTC, y el motor sigue evolucionando; consulte la sección No hemos terminado a continuación.

Por idioma: PTC gana en cada par

Las puntuaciones agregadas son interesantes; el panorama por idioma es lo que le dice a un equipo de contenido multilingüe qué esperar.

Puntuaciones TQ por idioma

Diagrama de caja que compara las puntuaciones TQ para PTC y DeepL en árabe, alemán, inglés, español, francés e italiano. PTC muestra de forma constante puntuaciones medias más altas y distribuciones de puntuación más ajustadas en todos los idiomas.
Puntuaciones TQ por idioma: PTC frente a DeepL en árabe, alemán, inglés, español, francés e italiano

PTC obtiene una puntuación mayor que DeepL en todos los pares de idiomas que probamos. La mayor diferencia se da en el árabe (+22,4 puntos), donde DeepL ha tenido históricamente un rendimiento inferior y donde la inversión de WPML en la calidad de los idiomas RTL se muestra claramente. Le siguen el alemán (+11,5) y el francés (+9,9). La diferencia más estrecha se da en el inglés (+6,0 puntos), e incluso ahí, PTC mueve la página de «aceptable, visiblemente imperfecta» a la banda de lista para publicar.

La varianza también importa. La distribución de DeepL tiene una larga cola inferior en árabe, con páginas individuales que puntúan muy por debajo de la media, páginas que un usuario alemán o francés consideraría rotas. Las distribuciones de PTC son más ajustadas y están centradas más arriba, por lo que un equipo de contenido puede planificar en torno a una banda de calidad esperada en lugar de presupuestar para valores atípicos.

PTC también supera a DeepL en cada una de las nueve dimensiones de calidad que puntuamos: gramática, significado, naturalidad, tono, formalidad, terminología, coherencia, uso de mayúsculas y convenciones locales. Las mayores ganancias se dan en las dimensiones que más importan para un humano que lee una página en un sitio web real: terminología (+1,5), gramática (+1,4), naturalidad (+1,4) y localización de números/unidades/fechas (+1,4). No hay ninguna dimensión en la que DeepL mantenga el ritmo, ni ninguna dimensión en la que PTC solo se adelante por poco.

Tasa de errores: el panorama operativo

Las puntuaciones medias son útiles; los recuentos de errores son más útiles para cualquiera que administre un sitio real. Nuestros revisores registraron cada problema distinto que identificaron en cada página: gramática, significado, terminología, todo.

Media de problemas por página

Gráfico de barras que muestra la media de problemas por página: DeepL ~1,27, PTC ~0,07, con PTC significativamente más bajo que DeepL.
Media de problemas por página: DeepL ~1,27, PTC ~0,07

DeepL produce una media de 1,27 problemas por página. PTC produce 0,07, aproximadamente una reducción de 18 veces en los errores por página en el mismo contenido de origen.

Para un sitio de 200 páginas, eso se traduce aproximadamente en:

  • DeepL: ~254 problemas que encontrar, sobre los que decidir y que corregir antes de publicar.
  • PTC: ~14 problemas en todo el sitio.

Esa es la diferencia entre la traducción por IA como un primer borrador y la traducción por IA como un flujo de trabajo. Según nuestra evaluación, DeepL es un primer borrador sólido: nuestras mediciones encontraron problemas revisables en la mayoría de las páginas antes de su publicación. PTC, en esta medición, es un flujo de trabajo: el recuento de errores es lo suficientemente bajo como para que el paso de revisión humana se vuelva opcional para la mayor parte del contenido en lugar de obligatorio para todo él.

Lo que realmente significa una «buena traducción»

Las descripciones de calificación del marco MQM son un contrapeso útil al lenguaje de marketing que rodea a la traducción por IA. Una página de «9/10» no es una página al 90 %; es una página en la que un hablante nativo, leyendo con atención, no encuentra nada que quiera cambiar. Una página de «7/10» es aceptable tal cual, pero visiblemente imperfecta. Una página de «5/10» es aquella en la que un hablante no nativo puede detectar errores.

La media de DeepL se sitúa en la parte alta de los 7: aceptable, pero visiblemente imperfecta para un lector nativo cuidadoso. La media de PTC se sitúa en 90,0, justo en el límite de «muy buena: lista para publicar sin revisión». Esa es la diferencia de calidad que midieron nuestros revisores. Se corresponde con una distinción real: el resultado de DeepL es un punto de partida que requiere revisión humana antes de su publicación; el resultado de PTC es, en la mayoría de los casos, la publicación en sí.

Por qué WPML puede producir esta calidad

Somos conscientes de que «creamos nuestro propio motor de IA» es una afirmación que muchas empresas hacen en este momento. PTC es inusual por dos razones específicas.

Escala y revisión continua. WPML da servicio a más de 1,5 millones de sitios y lo ha hecho durante más de una década. El equipo de lingüística de WPML revisa continuamente la calidad de traducción de PTC: toma muestras de los resultados, los puntúa con el mismo marco MQM utilizado en este estudio y observa patrones en los que el motor produce sistemáticamente resultados de menor calidad para un término, par de idiomas o tipo de contenido en particular.

Enfoque. PTC no es un proyecto paralelo en WPML. Cuenta con un equipo dedicado: ingenieros, MLOps y lingüistas humanos. Cuando los lingüistas señalan un patrón recurrente, el equipo de ingeniería lo trata como un error: amplía el glosario, ajusta el modelo de formalidad, añade una excepción y publica la corrección. Este bucle se ejecuta de forma continua, razón por la cual la calidad de PTC ha mejorado en los últimos 12 meses de «tan buena como la traducción humana media» a los números de este estudio.

La combinación —revisión humana continua a una escala significativa, junto con un equipo que responde a cada hallazgo como un ticket de ingeniería— es lo que produce los números de calidad anteriores. No es la arquitectura del modelo; es el modelo operativo.

No hemos terminado

El 90,0 sitúa a PTC justo en el límite de «muy buena: lista para publicar sin revisión». Estamos contentos con ese resultado. No creemos que sea el techo.

El bucle de control de calidad → ingeniería descrito anteriormente sigue en marcha. El equipo de lingüística de WPML sigue analizando las ediciones que los clientes hacen en los resultados de PTC en sitios reales, identifica los patrones que revelan esas ediciones y el equipo de ingeniería publica las correcciones: extensiones del glosario, ajustes de formalidad, retoques específicos para pares de idiomas. Esperamos que la próxima medición sea mayor que esta.

Qué significa esto para su flujo de trabajo

El flujo de trabajo convencional de contenido multilingüe es traducir → revisar → publicar. El paso de revisión está ahí porque todos los motores de IA (y la mayoría de los traductores humanos) producen un trabajo que necesita un segundo par de ojos antes de publicarse. Ese paso de revisión es también donde reside la mayor parte del coste y la mayor parte de la latencia en el contenido multilingüe.

Según nuestras mediciones, con DeepL es aconsejable un paso de revisión. Nuestra evaluación encontró una media de 1,27 problemas por página; si no se revisan, es probable que los lectores se encuentren con ellos. Con PTC, el paso de revisión es opcional para la mayor parte del contenido. Algunos equipos siguen revisando (para páginas de gran importancia o sectores regulados), pero el flujo de trabajo predeterminado pasa a ser traducir → publicar, con la revisión reservada para los casos que realmente la necesitan.

Esta es la diferencia operativa que describen los números. No es pequeña.

Qué significa esto para sus costes

El coste de traducción son dos cosas: el coste de producir la traducción y el coste de revisarla. Ambos deben pagarse antes de que el contenido se publique.

Para la mayoría de los contextos profesionales, la revisión humana cuesta unos céntimos por palabra: ya sea que los revisores cobren por palabra, por página o por sitio, ahí es aproximadamente donde acaban los números. La traducción humana completa (traducir y luego revisar por un segundo humano) suele rondar entre 0,10 € y 0,20 € por palabra para los pares de idiomas principales, y solo la parte de la revisión se sitúa en el rango de 0,04 € a 0,08 €.

Esto es lo que cuesta realmente cada flujo de trabajo en esos términos.

Solo traducción humana: la base. Alrededor de 0,10 € a 0,20 € por palabra. Ambos pasos son humanos.

DeepL (o cualquier motor de IA) más revisión humana. La IA se encarga del paso de traducción; un humano todavía tiene que revisar cada página, porque con 1,27 problemas por página, los problemas llegarán a los clientes si nadie los detecta primero. El paso de traducción es esencialmente gratuito; el paso de revisión sigue costando de 0,04 € a 0,08 € por palabra. Ahorro total frente a solo humano: alrededor del 60 %. Este es el argumento estándar de «la IA le ahorra dinero en traducción» (y es cierto), pero el límite de coste se sitúa en el paso de revisión que la calidad de DeepL todavía requiere.

PTC, sin necesidad de revisión. PTC cuesta entre 0,0012 € y 0,003 € por palabra: 4 créditos por palabra multiplicados por 0,30 € a 0,75 € por cada 1.000 créditos dependiendo del volumen, con los primeros 2.000 créditos al mes gratis. (Consulte los precios de traducción automática de WPML para ver la tabla completa de niveles). Dado que la calidad medida de PTC (puntuación TQ de 90,0, 0,07 problemas por página, diferencia de +12,3 puntos sobre DeepL) es lo suficientemente alta como para omitir el paso de revisión en la mayoría de los casos, el coste de revisión se reduce a cero. Ahorro total frente a solo humano: aproximadamente el 99 %.

No se trata de una mejora marginal en el flujo de trabajo de IA más revisión. Es un régimen de costes diferente.

De un vistazo: coste de publicar una palabra traducida

Flujo de trabajo Traducción Revisión Total Ahorro frente a humano
Traducción humana completa 0,10 €-0,20 € incluida 0,10 €-0,20 €
DeepL + revisión humana ~0 € 0,04 €-0,08 € 0,04 €-0,08 € ~60 %
PTC, sin revisión 0,0012 €-0,003 € 0 € 0,0012 €-0,003 € ~99 %

Las tarifas de traducción humana son estimaciones típicas del sector para los pares de idiomas principales. Los precios de PTC proceden de las tarifas publicadas de WPML.


Una nota sobre hacer la revisión usted mismo: cuando el propietario de un negocio hace la revisión por sí mismo en lugar de pagar a un revisor, el coste no es cero; simplemente es menos visible. Las horas dedicadas a la revisión son horas que no se dedican al resto del negocio, y a cualquier tarifa por hora razonable, el coste implícito suele ser mayor que lo que cobraría un revisor externo, no menor. El ahorro de PTC se aplica independientemente de quién pague por el paso de revisión en la actualidad.

Lo que esto abre. Cuando la traducción cuesta 0,10 € o más por palabra, usted traduce de forma selectiva: la página de inicio, las principales categorías de productos, un puñado de entradas de blog con mucho tráfico. Todo lo demás se queda en el idioma de origen porque los números no cuadran. Cuando la traducción cuesta 0,002 € por palabra y produce un resultado que es mejor que la traducción humana típica, los números cuadran para contenido que antes no era viable:

  • Traducción completa del catálogo en el comercio electrónico: cada descripción de producto de cola larga, cada variante.
  • Portales de documentación completos en todos los idiomas que pueda hablar un cliente, no solo en los tres principales.
  • Bases de conocimiento, preguntas frecuentes de soporte, archivos de blog: la larga cola que impulsa la búsqueda pero que nunca justificó su coste de traducción.
  • Contenido editorial localizado para editores que operan en mercados donde los ingresos por audiencia por página no podían cubrir la traducción humana.

El contenido multilingüe ha sido una cuestión de «qué podemos permitirnos traducir» durante décadas. Con PTC, la pregunta pasa a ser «qué vale la pena traducir», que es una pregunta diferente y más interesante.

Cómo obtener esta calidad en su propio sitio

PTC es el motor predeterminado en el modo Traducir todo de WPML, que es una configuración global única que traduce cada página de su sitio, automáticamente, en segundo plano. No hay ninguna configuración por página que gestionar.

Para obtener la calidad medida en este estudio, la única configuración que necesita además de activar Traducir todo es dedicar aproximadamente un minuto a describir el público y el tono de su sitio en la configuración de Traducir todo; por ejemplo, «una empresa de software dirigida a desarrolladores, tono formal, terminología técnica conservada en inglés». PTC utiliza esa descripción para alinear las traducciones con la voz de su marca.

Esa es toda la configuración. El resultado es lo que midió este estudio.

Una nota sobre lo que no hicimos

No comparamos PTC con Google Traductor, Azure Translator ni servicios basados en LLM a través de sus API públicas. La razón: esos motores cambian con frecuencia y una medición en un solo momento quedaría obsoleta en cuestión de meses. La comparación de DeepL es la que realizamos porque DeepL es el punto de referencia más citado para la traducción por IA de nivel de producción, y porque DeepL es lo que la mayoría de nuestros competidores utilizan internamente.

Tampoco medimos la velocidad, el coste ni la experiencia del desarrollador en este estudio, solo la calidad. Esas comparaciones existen en nuestra página de características y en nuestras páginas de comparación, y cuentan su propia historia.

Pruébelo

Si administra un sitio multilingüe de WordPress y quiere ver los resultados de PTC en su propio contenido, instale WPML, active Traducir todo y compare el resultado con lo que esté utilizando en la actualidad. La diferencia de calidad que se describe aquí es la diferencia de calidad que debe esperar ver.


Preguntas sobre la metodología o solicitudes de datos: póngase en contacto con el equipo de WPML.

Estudio realizado por el equipo de lingüística de WPML, abril de 2026. Muestra: 227 páginas web traducidas por DeepL revisadas por lingüistas hablantes nativos, en comparación con 73 revisiones de sitios de producción de PTC puntuadas con la misma metodología. Idiomas: árabe, inglés, francés, alemán, italiano y español. Puntuación: marco de calidad de traducción basado en MQM, 9 dimensiones, de 1 a 10 por dimensión, promediado y escalado a un resultado de 0 a 100.