WPML

Die Private Translation Cloud (PTC) von WPML erzielt 90,0 von 100 Punkten in der internen Bewertung der Übersetzungsqualität von WPML. DeepL – weithin als die stärkste Mainstream-KI-Übersetzungs-Engine angesehen – erzielt 77,7 Punkte. Die PTC übertrifft DeepL insgesamt um 12,3 Punkte, gewinnt in jeder der neun von unseren Linguisten bewerteten Qualitätsdimensionen und führt zu einer etwa 18-fachen Reduzierung der Fehler pro Seite.

Auf einen Blick

Metrik DeepL PTC-Logo PTC
Durchschn. Übersetzungsqualitätswert (0–100) 77,7 90,0
Durchschn. Probleme pro übersetzter Seite 1,27 0,07
Qualitätsdimensionen, in denen die PTC besser abschnitt als DeepL 9 von 9
Getestete Sprachen, in denen die PTC besser abschnitt als DeepL 6 von 6 (Arabisch, Englisch, Französisch, Deutsch, Italienisch, Spanisch)

Warum wir diese Studie durchgeführt haben

Basierend auf dem Feedback unserer Kunden gilt DeepL weithin als Maßstab für die KI-Übersetzungsqualität im WordPress-Ökosystem. Wenn Kunden fragen, ob sie KI-übersetzte Inhalte ohne menschliche Überprüfung veröffentlichen können, ist DeepL in der Regel der implizite Vergleichspunkt.

WPML hat seine eigene KI-Übersetzungs-Engine entwickelt – die Private Translation Cloud (PTC) –, weil „gut genug“ nicht ausreichte. Die PTC ist die Standard-Engine im Modus Alles übersetzen von WPML und treibt den Großteil der automatischen Übersetzung auf den über 1,5 Millionen Websites an, die WPML nutzen.

Wir wollten eine messbare Antwort auf eine Frage, die uns Interessenten jede Woche stellen: Wie schneidet die PTC im Vergleich zu DeepL tatsächlich ab? Diese Studie ist die Antwort. Die obigen Zahlen sind die Schlagzeile; der Rest dieses Artikels erklärt, wie sie zustande kamen und was sie für eine echte Live-Website bedeuten.

Was wir gemessen haben und wie

Wir haben die Übersetzungsqualität mit einem System basierend auf MQM (Multidimensional Quality Metrics) bewertet, demselben Framework, das das Linguistik-Team von WPML für die laufenden Überprüfungen der Kunden-Websites für die PTC verwendet. Jede übersetzte Seite wird in neun Dimensionen bewertet:

  • Grammatik – gab es grammatikalische Fehler?
  • Bedeutung – blieb die Bedeutung des Ausgangstextes erhalten?
  • Natürlichkeit – klingt es für einen Muttersprachler natürlich und idiomatisch?
  • Tonfall – wurde der Tonfall des Ausgangstextes getroffen?
  • Förmlichkeit – wurde das richtige Register verwendet, sowohl bei der Ansprache des Lesers als auch bei den grammatikalischen Anredeformen?
  • Terminologie – wurde die richtige Terminologie verwendet?
  • Konsistenz – wurde die Terminologie auf der gesamten Seite konsistent angewendet?
  • Groß- und Kleinschreibung – wurden die Konventionen der Zielsprache befolgt?
  • Lokalisierung von Zahlen, Einheiten und Daten – wurden die Konventionen der Zielsprache befolgt?

Jede Dimension wird von einem menschlichen Linguisten, der Muttersprachler der Zielsprache ist, mit 1–10 bewertet. Die endgültige Bewertung pro Seite ist der Durchschnitt der neun Dimensionen, multipliziert mit zehn – was eine Skala von 1–100 ergibt, die sich in klar verständliche Qualitätsstufen übersetzen lässt:

Bewertung Bedeutung
90–100 Sehr gut bis perfekt – bereit zur Veröffentlichung ohne Überprüfung
80–89 Gut – in den meisten Kontexten veröffentlichungsreif
70–79 Akzeptabel bis mittelmäßig – brauchbar, aber Fehler sind sichtbar
60–69 Mittelmäßig – benötigt vor der Veröffentlichung Nachbesserungen
50–59 Fehler für Nicht-Muttersprachler offensichtlich
Unter 50 Mängel so gravierend, dass eine Überarbeitung erforderlich ist

Zur Einordnung: Der veröffentlichte Durchschnitt für allgemeine menschliche Übersetzung liegt bei etwa 76. DeepL liegt mit 77,7 knapp über dieser Grenze. Die PTC liegt mit 90,0 genau an der Grenze zur Stufe „Sehr gut – bereit zur Veröffentlichung ohne Überprüfung“.

Stichprobengröße und Auswahl

Um DeepL zu bewerten, haben wir 800 zufällige Websites genommen, die in den letzten 12 Monaten mit DeepL übersetzt wurden, sie nach Alter der Website, Inhaltsvolumen und Übersetzungsaktivität in Kategorien eingeteilt und Stichproben aus diesen Kategorien gezogen. Unsere Linguisten überprüften dann manuell die Hauptseiten der ausgewählten Websites – insgesamt 227 Webseiten, bewertet in Arabisch, Englisch, Französisch, Deutsch, Italienisch und Spanisch.

Die Bewertung der PTC stammt aus einer separaten Stichprobe: 73 Überprüfungen von Live-Websites, bewertet von denselben Linguisten unter Verwendung derselben oben beschriebenen MQM-Methodik. Die PTC-Stichprobe ist kleiner als die DeepL-Stichprobe, da jede PTC-Messung eine spezifische PTC-Version widerspiegelt und die Engine sich ständig weiterentwickelt – siehe den Abschnitt Wir sind noch nicht fertig weiter unten.

Pro Sprache: Die PTC gewinnt in jedem Sprachpaar

Die Gesamtbewertungen sind interessant; das Bild pro Sprache ist jedoch das, was einem mehrsprachigen Content-Team sagt, was es erwarten kann.

TQ-Bewertungen nach Sprache

Boxplot zum Vergleich der TQ-Bewertungen für die PTC und DeepL in Arabisch, Deutsch, Englisch, Spanisch, Französisch und Italienisch. Die PTC zeigt in allen Sprachen durchweg höhere Medianwerte und engere Bewertungsverteilungen.
TQ-Bewertungen nach Sprache – PTC vs. DeepL in Arabisch, Deutsch, Englisch, Spanisch, Französisch, Italienisch

Die PTC schneidet in jedem von uns getesteten Sprachpaar besser ab als DeepL. Der größte Abstand besteht bei Arabisch (+22,4 Punkte), wo DeepL in der Vergangenheit unterdurchschnittlich abschnitt und wo sich die Investition von WPML in die Qualität von RTL-Sprachen deutlich zeigt. Deutsch (+11,5) und Französisch (+9,9) folgen als Nächstes. Der geringste Abstand besteht bei Englisch (+6,0 Punkte) – und selbst dort hebt die PTC die Seite von „akzeptabel, sichtbar unvollkommen“ in den veröffentlichungsreifen Bereich.

Auch die Varianz ist von Bedeutung. Die Verteilung von DeepL hat im Arabischen einen langen unteren Rand, wobei einzelne Seiten weit unter dem Durchschnitt abschneiden – Seiten, die ein deutscher oder französischer Nutzer als fehlerhaft betrachten würde. Die Verteilungen der PTC sind enger und höher zentriert, sodass ein Content-Team mit einem erwarteten Qualitätsbereich planen kann, anstatt Ausreißer budgetieren zu müssen.

Die PTC übertrifft DeepL auch in jeder der neun Qualitätsdimensionen, die wir bewerten: Grammatik, Bedeutung, Natürlichkeit, Tonfall, Förmlichkeit, Terminologie, Konsistenz, Groß- und Kleinschreibung sowie lokale Konventionen. Die größten Zuwächse gibt es in den Dimensionen, die für einen Menschen, der eine Seite auf einer echten Website liest, am wichtigsten sind – Terminologie (+1,5), Grammatik (+1,4), Natürlichkeit (+1,4) und Lokalisierung von Zahlen/Einheiten/Daten (+1,4). Es gibt keine Dimension, in der DeepL mithalten kann, und keine Dimension, in der die PTC nur knapp vorne liegt.

Fehlerquote: Das operative Bild

Durchschnittsbewertungen sind nützlich; Fehlerzahlen sind nützlicher für jeden, der eine echte Website betreibt. Unsere Prüfer haben jedes einzelne Problem protokolliert, das sie auf jeder Seite identifiziert haben – Grammatik, Bedeutung, Terminologie, alles.

Durchschnittliche Probleme pro Seite

Balkendiagramm mit durchschnittlichen Problemen pro Seite: DeepL ~1,27, PTC ~0,07, wobei die PTC deutlich unter DeepL liegt.
Durchschnittliche Probleme pro Seite – DeepL ~1,27, PTC ~0,07

DeepL produziert durchschnittlich 1,27 Probleme pro Seite. Die PTC produziert 0,07 – was etwa einer 18-fachen Reduzierung der Fehler pro Seite bei denselben Ausgangsinhalten entspricht.

Für eine Website mit 200 Seiten bedeutet das in etwa:

  • DeepL: ~254 Probleme, die vor der Veröffentlichung gefunden, beurteilt und behoben werden müssen.
  • PTC: ~14 Probleme auf der gesamten Website.

Das ist der Unterschied zwischen KI-Übersetzung als erstem Entwurf und KI-Übersetzung als Workflow. Basierend auf unserer Bewertung ist DeepL ein starker erster Entwurf – unsere Messungen ergaben auf den meisten Seiten überprüfungsbedürftige Probleme vor der Veröffentlichung. Die PTC ist nach dieser Messung ein Workflow: Die Fehlerzahl ist so gering, dass der Schritt der menschlichen Überprüfung für die meisten Inhalte optional und nicht mehr für alle obligatorisch wird.

Was „gute Übersetzung“ tatsächlich bedeutet

Die Notenbeschreibungen des MQM-Frameworks sind ein nützliches Gegengewicht zur Marketingsprache, die KI-Übersetzung umgibt. Eine „9/10“-Seite ist keine Seite mit 90 %; es ist eine Seite, auf der ein Muttersprachler beim genauen Lesen nichts findet, was er ändern möchte. Eine „7/10“-Seite ist so, wie sie ist, akzeptabel, aber sichtbar unvollkommen. Eine „5/10“-Seite ist eine, auf der ein Nicht-Muttersprachler Fehler erkennen kann.

Der Durchschnitt von DeepL liegt im hohen 7er-Bereich – akzeptabel, aber für einen aufmerksamen muttersprachlichen Leser sichtbar unvollkommen. Der Durchschnitt der PTC liegt bei 90,0, genau an der Grenze zu „Sehr gut – bereit zur Veröffentlichung ohne Überprüfung“. Das ist der Qualitätsunterschied, den unsere Prüfer gemessen haben. Er spiegelt eine echte Unterscheidung wider: Die Ausgabe von DeepL ist ein Ausgangspunkt, der vor der Veröffentlichung eine menschliche Überprüfung erfordert; die Ausgabe der PTC ist in den meisten Fällen die Veröffentlichung selbst.

Warum WPML diese Qualität liefern kann

Wir sind uns bewusst, dass „Wir haben unsere eigene KI-Engine entwickelt“ eine Behauptung ist, die derzeit viele Unternehmen aufstellen. Die PTC ist aus zwei bestimmten Gründen ungewöhnlich.

Skalierung und kontinuierliche Überprüfung. WPML bedient über 1,5 Millionen Websites und tut dies seit mehr als einem Jahrzehnt. Das Linguistik-Team von WPML überprüft kontinuierlich die Übersetzungsqualität der PTC – indem es Stichproben der Ausgaben zieht, diese mit demselben in dieser Studie verwendeten MQM-Framework bewertet und auf Muster achtet, bei denen die Engine für einen bestimmten Begriff, ein bestimmtes Sprachpaar oder einen bestimmten Inhaltstyp durchweg Ergebnisse von geringerer Qualität liefert.

Fokus. Die PTC ist kein Nebenprojekt bei WPML. Sie hat ein engagiertes Team – Ingenieure, MLOps und menschliche Linguisten. Wenn die Linguisten ein wiederkehrendes Muster melden, behandelt das Technikteam es als Fehler: das Glossar erweitern, das Förmlichkeitsmodell anpassen, eine Ausnahme hinzufügen, den Fix ausliefern. Diese Schleife läuft kontinuierlich, weshalb sich die Qualität der PTC in den letzten 12 Monaten von „so gut wie eine durchschnittliche menschliche Übersetzung“ zu den Zahlen in dieser Studie verbessert hat.

Die Kombination – kontinuierliche menschliche Überprüfung in aussagekräftigem Maßstab, gepaart mit einem Team, das auf jede Erkenntnis wie auf ein Technik-Ticket reagiert – ist das, was die obigen Qualitätszahlen hervorbringt. Es ist nicht die Modellarchitektur; es ist das Betriebsmodell.

Wir sind noch nicht fertig

90,0 bringt die PTC genau an die Grenze von „Sehr gut – veröffentlichungsreif ohne Überprüfung“. Wir sind mit diesem Ergebnis zufrieden. Wir glauben nicht, dass dies die Obergrenze ist.

Die oben beschriebene QS → Technik-Schleife läuft weiterhin. Das Linguistik-Team von WPML analysiert weiterhin die Bearbeitungen, die Kunden an der Ausgabe der PTC auf echten Websites vornehmen, identifiziert die Muster, die diese Bearbeitungen offenbaren, und das Technikteam liefert die Fixes aus – Glossarerweiterungen, Anpassungen der Förmlichkeit, sprachpaarspezifische Optimierungen. Wir erwarten, dass die nächste Messung höher ausfallen wird als diese.

Was dies für Ihren Workflow bedeutet

Der herkömmliche Workflow für mehrsprachige Inhalte ist Übersetzen → Überprüfen → Veröffentlichen. Der Überprüfungsschritt ist vorhanden, weil jede KI-Engine – und die meisten menschlichen Übersetzer – Arbeit produziert, die vor der Veröffentlichung ein zweites Paar Augen erfordert. In diesem Überprüfungsschritt liegen auch die meisten Kosten und die meiste Latenz bei mehrsprachigen Inhalten.

Basierend auf unseren Messungen ist bei DeepL ein Überprüfungsschritt ratsam. Unsere Bewertung ergab durchschnittlich 1,27 Probleme pro Seite; wenn diese nicht überprüft werden, werden Leser wahrscheinlich darauf stoßen. Mit der PTC ist der Überprüfungsschritt für die meisten Inhalte optional. Einige Teams überprüfen weiterhin – bei Seiten mit hoher Bedeutung oder in regulierten Branchen –, aber der Standard-Workflow wird zu Übersetzen → Veröffentlichen, wobei die Überprüfung für die Fälle reserviert bleibt, die sie tatsächlich benötigen.

Dies ist der operative Unterschied, den die Zahlen beschreiben. Er ist nicht klein.

Was dies für Ihre Kosten bedeutet

Übersetzungskosten bestehen aus zwei Dingen: den Kosten für die Erstellung der Übersetzung und den Kosten für deren Überprüfung. Beides muss bezahlt werden, bevor Inhalte online gehen.

In den meisten professionellen Kontexten kostet eine menschliche Überprüfung ein paar Cent pro Wort – egal, ob Prüfer pro Wort, pro Seite oder pro Website abrechnen, darauf läuft die Rechnung in etwa hinaus. Eine vollständige menschliche Übersetzung (Übersetzen, dann Überprüfung durch einen zweiten Menschen) kostet für die wichtigsten Sprachpaare typischerweise etwa 0,10 €–0,20 € pro Wort, wobei allein der Überprüfungsteil im Bereich von 0,04 €–0,08 € liegt.

Hier ist, was jeder Workflow unter diesen Gesichtspunkten tatsächlich kostet.

Nur menschliche Übersetzung – die Basislinie. Etwa 0,10 €–0,20 € pro Wort. Beide Schritte werden von Menschen ausgeführt.

DeepL (oder eine beliebige KI-Engine) plus menschliche Überprüfung. Die KI übernimmt den Übersetzungsschritt; ein Mensch muss dennoch jede Seite überprüfen, denn bei 1,27 Problemen pro Seite werden die Probleme die Kunden erreichen, wenn sie niemand vorher abfängt. Der Übersetzungsschritt ist im Grunde kostenlos; der Überprüfungsschritt kostet weiterhin 0,04 €–0,08 € pro Wort. Gesamtersparnis gegenüber rein menschlicher Übersetzung: etwa 60 %. Das ist das Standard-Verkaufsargument „KI spart Ihnen Geld bei der Übersetzung“ – und es ist wahr –, aber die Kostenobergrenze liegt beim Überprüfungsschritt, den die Qualität von DeepL weiterhin erfordert.

PTC, keine Überprüfung erforderlich. Die PTC kostet 0,0012 €–0,003 € pro Wort – 4 Credits pro Wort multipliziert mit 0,30 €–0,75 € pro 1.000 Credits je nach Volumen, wobei die ersten 2.000 Credits pro Monat kostenlos sind. (Siehe Preise für die automatische Übersetzung von WPML für die vollständige Stufentabelle.) Da die gemessene Qualität der PTC (90,0 TQ-Bewertung, 0,07 Probleme pro Seite, +12,3 Punkte Abstand zu DeepL) hoch genug ist, um den Überprüfungsschritt in den meisten Fällen zu überspringen, sinken die Überprüfungskosten auf null. Gesamtersparnis gegenüber rein menschlicher Übersetzung: etwa 99 %.

Das ist keine marginale Verbesserung des Workflows aus KI plus Überprüfung. Es ist ein anderes Kostenregime.

Auf einen Blick – Kosten für die Auslieferung eines übersetzten Wortes

Workflow Übersetzung Überprüfung Gesamt Ersparnis vs. Mensch
Vollständig menschliche Übersetzung 0,10 €–0,20 € inklusive 0,10 €–0,20 €
DeepL + menschl. Überprüfung ~0 € 0,04 €–0,08 € 0,04 €–0,08 € ~60 %
PTC, keine Überprüfung 0,0012 €–0,003 € 0 € 0,0012 €–0,003 € ~99 %

Die Raten für menschliche Übersetzungen sind typische Branchenschätzungen für die wichtigsten Sprachpaare. Die PTC-Preise stammen aus den veröffentlichten Raten von WPML.


Ein Hinweis zur eigenen Überprüfung: Wenn ein Unternehmer die Überprüfung selbst durchführt, anstatt einen Prüfer zu bezahlen, sind die Kosten nicht gleich null – sie sind nur weniger sichtbar. Die für die Überprüfung aufgewendeten Stunden sind Stunden, die nicht für den Rest des Geschäfts aufgewendet werden, und bei jedem angemessenen Stundensatz sind die impliziten Kosten in der Regel höher als das, was ein externer Prüfer berechnen würde, nicht niedriger. Die Ersparnis der PTC gilt unabhängig davon, wer heute für den Überprüfungsschritt bezahlt.

Was dies ermöglicht. Wenn eine Übersetzung 0,10 €+ pro Wort kostet, übersetzen Sie selektiv – die Startseite, die wichtigsten Produktkategorien, eine Handvoll stark frequentierter Blogbeiträge. Alles andere bleibt in der Ausgangssprache, weil die Rechnung nicht aufgeht. Wenn eine Übersetzung 0,002 € pro Wort kostet und Ergebnisse liefert, die besser sind als eine typische menschliche Übersetzung, geht die Rechnung auch für Inhalte auf, die zuvor nicht rentabel waren:

  • Vollständige Katalogübersetzung im E-Commerce – jede Long-Tail-Produktbeschreibung, jede Variante.
  • Komplette Dokumentationsportale in jeder Sprache, die ein Kunde sprechen könnte, nicht nur in den drei wichtigsten.
  • Wissensdatenbanken, Support-FAQs, Blog-Archive – der Long Tail, der Suchanfragen antreibt, aber seine Übersetzungskosten nie gerechtfertigt hat.
  • Lokalisierte redaktionelle Inhalte für Publisher, die in Märkten tätig sind, in denen der Umsatz pro Seite und Zielgruppe die menschliche Übersetzung nicht decken konnte.

Mehrsprachige Inhalte waren jahrzehntelang eine Frage von „Was können wir uns zu übersetzen leisten?“. Mit der PTC wird die Frage zu „Was lohnt sich zu übersetzen?“ – was eine andere und interessantere Frage ist.

Wie Sie diese Qualität auf Ihrer eigenen Website erhalten

Die PTC ist die Standard-Engine im Modus Alles übersetzen von WPML, einer einzigen globalen Einstellung, die jede Seite Ihrer Website automatisch im Hintergrund übersetzt. Es muss keine Konfiguration pro Seite verwaltet werden.

Um die in dieser Studie gemessene Qualität zu erhalten, besteht die einzige Einrichtung, die Sie neben der Aktivierung von Alles übersetzen benötigen, darin, etwa eine Minute damit zu verbringen, die Zielgruppe und den Tonfall Ihrer Website in den Einstellungen von Alles übersetzen zu beschreiben – zum Beispiel: „Ein Softwareunternehmen, das sich an Entwickler richtet, formeller Tonfall, technische Terminologie auf Englisch beibehalten“. Die PTC verwendet diese Beschreibung, um die Übersetzungen an Ihre Markenstimme anzupassen.

Das ist die gesamte Einrichtung. Das Ergebnis ist das, was diese Studie gemessen hat.

Ein Hinweis dazu, was wir nicht getan haben

Wir haben die PTC nicht mit Google Übersetzer, Azure Translator oder LLM-basierten Diensten über deren öffentliche APIs verglichen. Der Grund: Diese Engines ändern sich häufig und eine punktuelle Messung wäre innerhalb von Monaten veraltet. Der DeepL-Vergleich ist derjenige, den wir durchgeführt haben, weil DeepL der am häufigsten zitierte Maßstab für produktionsreife KI-Übersetzung ist und weil DeepL das ist, was die meisten unserer Mitbewerber im Hintergrund verwenden.

Wir haben in dieser Studie auch nicht die Geschwindigkeit, die Kosten oder die Entwicklererfahrung gemessen – nur die Qualität. Diese Vergleiche finden Sie auf unserer Funktionsseite und unseren Vergleichsseiten, und sie erzählen ihre eigene Geschichte.

Probieren Sie es aus

Wenn Sie eine mehrsprachige WordPress-Website betreiben und die Ausgabe der PTC an Ihren eigenen Inhalten sehen möchten, installieren Sie WPML, aktivieren Sie Alles übersetzen und vergleichen Sie das Ergebnis mit dem, was Sie heute verwenden. Der hier beschriebene Qualitätsunterschied ist der Qualitätsunterschied, den Sie erwarten sollten.


Fragen zur Methodik oder Datenanfragen: Kontaktieren Sie das WPML-Team.

Studie durchgeführt vom WPML-Linguistik-Team, April 2026. Stichprobe: 227 mit DeepL übersetzte Webseiten, überprüft von muttersprachlichen Linguisten, verglichen mit 73 Überprüfungen von PTC-Live-Websites, die mit derselben Methodik bewertet wurden. Sprachen: Arabisch, Englisch, Französisch, Deutsch, Italienisch, Spanisch. Bewertung: MQM-basiertes Translation-Quality-Framework, 9 Dimensionen, 1–10 pro Dimension, gemittelt und auf ein Ergebnis von 0–100 skaliert.