Private Translation Cloud (PTC) של WPML מקבל ציון של 90.0 מתוך 100 בהערכת איכות התרגום הפנימית של WPML. מנוע DeepL — שנחשב לרוב למנוע תרגום ה־AI המרכזי החזק ביותר — מקבל ציון של 77.7. PTC עוקף את DeepL ב־12.3 נקודות בסך הכל, מנצח בכל אחד מתשעת ממדי האיכות שהבלשנים שלנו דירגו, ומציג הפחתה של בערך פי 18 בשגיאות לעמוד.
במבט חטוף
| מדד | DeepL |
|
|---|---|---|
| ציון איכות תרגום ממוצע (0–100) | 77.7 | 90.0 |
| ממוצע בעיות לעמוד מתורגם | 1.27 | 0.07 |
| ממדי איכות שבהם PTC קיבל ציון גבוה יותר מ־DeepL | — | 9 מתוך 9 |
| שפות שנבדקו שבהן PTC קיבל ציון גבוה יותר מ־DeepL | — | 6 מתוך 6 (ערבית, אנגלית, צרפתית, גרמנית, איטלקית, ספרדית) |
מדוע ערכנו מחקר זה
בהתבסס על משוב מהלקוחות שלנו, DeepL נחשב לרוב לאמת המידה לאיכות תרגום AI בסביבת WordPress. כאשר לקוחות שואלים אם הם יכולים לפרסם תוכן שתורגם על ידי AI ללא סקירה אנושית, DeepL הוא לרוב נקודת ההשוואה המרומזת.
WPML בנתה מנוע תרגום AI משלה — ה־Private Translation Cloud (PTC) — משום ש"מספיק טוב" לא היה באמת מספיק. PTC הוא מנוע ברירת המחדל בתוך מצב תרגם הכל של WPML ומפעיל את רוב התרגום האוטומטי ביותר מ־1.5 מיליון האתרים המריצים את WPML.
רצינו תשובה מדידה לשאלה שלקוחות פוטנציאליים שואלים אותנו מדי שבוע: כיצד PTC באמת בהשוואה ל־DeepL? מחקר זה הוא התשובה. המספרים שלמעלה הם הכותרת; שאר המאמר מסביר כיצד הם הופקו ומה המשמעות שלהם עבור אתר פעיל אמיתי.
מה מדדנו וכיצד
דירגנו את איכות התרגום באמצעות מערכת המבוססת על MQM (Multidimensional Quality Metrics), אותה מסגרת שצוות הבלשנים של WPML משתמש בה לסקירות השוטפות של אתרי לקוחות ב־PTC. כל עמוד מתורגם מדורג על פני תשעה ממדים:
- דקדוק — האם היו שגיאות דקדוקיות?
- משמעות — האם משמעות המקור נשמרה?
- טבעיות — האם זה נשמע טבעי ואידיומטי לדובר ילידי?
- טון — האם הטון של המקור נשמר?
- רשמיות — האם נעשה שימוש במשלב הנכון, הן בפנייה לקורא והן בצורות פנייה דקדוקיות?
- טרמינולוגיה — האם נעשה שימוש במונחים הנכונים?
- עקביות — האם המונחים יושמו בעקביות לאורך העמוד?
- אותיות רישיות — האם נשמרו מוסכמות שפת היעד?
- לוקליזציה של מספרים, יחידות ותאריכים — האם נשמרו מוסכמות שפת היעד?
כל ממד מדורג מ־1 עד 10 על ידי בלשן אנושי שהוא דובר ילידי של שפת היעד. הציון הסופי לעמוד הוא הממוצע של תשעת הממדים, מוכפל בעשר — מה שיוצר סולם של 1–100 הממופה לרמות איכות במונחים פשוטים:
| ציון | משמעות |
|---|---|
| 90–100 | טוב מאוד עד מושלם — מוכן לפרסום ללא סקירה |
| 80–89 | טוב — מוכן לפרסום ברוב ההקשרים |
| 70–79 | סביר עד בינוני — שמיש אך ישנן שגיאות גלויות |
| 60–69 | בינוני — דורש תיקונים לפני פרסום |
| 50–59 | שגיאות ברורות גם למי שאינם דוברים ילידיים |
| מתחת ל־50 | פגמים משמעותיים מספיק כדי לדרוש עבודה מחדש |
לשם הקשר: הממוצע המפורסם עבור תרגום אנושי גנרי עומד על כ־76. הציון 77.7 של DeepL מציב אותו ממש מעל קו זה. הציון 90.0 של PTC מציב אותו בדיוק בגבול של רמת ה"טוב מאוד — מוכן לפרסום ללא סקירה".
גודל המדגם ובחירתו
כדי להעריך את DeepL, לקחנו 800 אתרים אקראיים שתורגמו עם DeepL ב־12 החודשים האחרונים, חילקנו אותם לקבוצות לפי גיל האתר, נפח התוכן ופעילות התרגום, ודגמנו מתוך הקבוצות הללו. לאחר מכן, הבלשנים שלנו סקרו באופן ידני את העמודים הראשיים של האתרים שנדגמו — 227 דפי אינטרנט בסך הכל, שהוערכו בערבית, אנגלית, צרפתית, גרמנית, איטלקית וספרדית.
הציון של PTC מגיע ממדגם נפרד: 73 סקירות של אתרים פעילים, שדורגו על ידי אותם בלשנים באמצעות אותה מתודולוגיית MQM שתוארה לעיל. מדגם ה־PTC קטן יותר ממדגם ה־DeepL מכיוון שכל מדידה של PTC משקפת גרסה ספציפית של PTC, והמנוע ממשיך להתפתח — ראה את הסעיף לא סיימנו להלן.
לפי שפה: PTC מנצח בכל צמד
הציונים המצטברים מעניינים; אך התמונה לפי שפה היא זו שאומרת לצוות תוכן רב-לשוני למה לצפות.
ציוני איכות תרגום (TQ) לפי שפה

PTC מקבל ציון גבוה יותר מ־DeepL בכל צמד שפות שבדקנו. הפער הרחב ביותר הוא בערבית (+22.4 נקודות), שבה DeepL הציג היסטורית ביצועים חלשים ושבה ההשקעה של WPML באיכות שפות RTL ניכרת בבירור. גרמנית (+11.5) וצרפתית (+9.9) מגיעות לאחר מכן. הפער הצר ביותר הוא באנגלית (+6.0 נקודות) — ואפילו שם, PTC מעביר את העמוד מ"סביר, לא מושלם באופן גלוי" לרמה של מוכן לפרסום.
גם השונות חשובה. להתפלגות של DeepL יש זנב תחתון ארוך בערבית, עם עמודים בודדים שמקבלים ציון נמוך בהרבה מהממוצע — עמודים שמשתמש בגרמנית או בצרפתית היה מחשיב כשבורים. ההתפלגויות של PTC הדוקות יותר ומרוכזות גבוה יותר, כך שצוות תוכן יכול לתכנן סביב רמת איכות צפויה במקום לתקצב עבור חריגים.
PTC גם עוקף את DeepL בכל אחד מתשעת ממדי האיכות שאנו מדרגים: דקדוק, משמעות, טבעיות, טון, רשמיות, טרמינולוגיה, עקביות, אותיות רישיות ומוסכמות מקומיות. השיפורים הגדולים ביותר הם בממדים שחשובים ביותר לאדם שקורא עמוד באתר אמיתי — טרמינולוגיה (+1.5), דקדוק (+1.4), טבעיות (+1.4), ולוקליזציה של מספרים/יחידות/תאריכים (+1.4). אין שום ממד שבו DeepL עומד בקצב, ושום ממד שבו PTC רק מוביל ביתרון קל.
שיעור שגיאות: התמונה התפעולית
ציונים ממוצעים הם שימושיים; אך ספירת שגיאות שימושית יותר עבור כל מי שמנהל אתר אמיתי. הסוקרים שלנו רשמו כל בעיה נפרדת שהם זיהו בכל עמוד — דקדוק, משמעות, טרמינולוגיה, וכל השאר.
ממוצע בעיות לעמוד

DeepL מייצר בממוצע 1.27 בעיות לעמוד. PTC מייצר 0.07 — הפחתה של בערך פי 18 בשגיאות לעמוד על אותו תוכן מקור.
עבור אתר של 200 עמודים, זה מתורגם בערך ל:
- DeepL: כ־254 בעיות למצוא, להחליט לגביהן ולתקן לפני הפרסום.
- PTC: כ־14 בעיות בכל האתר.
זהו ההבדל בין תרגום AI כטיוטה ראשונה לבין תרגום AI כתהליך עבודה. בהתבסס על ההערכה שלנו, DeepL הוא טיוטה ראשונה חזקה — המדידות שלנו מצאו בעיות הדורשות סקירה ברוב העמודים לפני הפרסום. PTC, במדידה זו, הוא תהליך עבודה: ספירת השגיאות נמוכה מספיק כך ששלב הסקירה האנושית הופך לאופציונלי עבור רוב התוכן במקום חובה עבור כולו.
מה המשמעות האמיתית של "תרגום טוב"
תיאורי הציונים של מסגרת MQM מהווים משקל נגד שימושי לשפה השיווקית שאופפת את תרגום ה־AI. עמוד של "9/10" אינו עמוד של 90%; זהו עמוד שבו דובר ילידי, הקורא בתשומת לב, לא מוצא דבר שהיה רוצה לשנות. עמוד של "7/10" הוא סביר כפי שהוא אך לא מושלם באופן גלוי. עמוד של "5/10" הוא עמוד שבו אפילו מי שאינו דובר ילידי יכול לזהות שגיאות.
הממוצע של DeepL עומד על אזור ה־7 הגבוה — סביר, אך לא מושלם באופן גלוי לקורא ילידי קפדן. הממוצע של PTC עומד על 90.0, בדיוק בגבול של "טוב מאוד — מוכן לפרסום ללא סקירה". זהו הבדל האיכות שהסוקרים שלנו מדדו. זה ממופה להבחנה אמיתית: הפלט של DeepL הוא נקודת התחלה שדורשת סקירה אנושית לפני פרסום; הפלט של PTC הוא ברוב המקרים הפרסום עצמו.
מדוע WPML יכולה להפיק איכות כזו
אנו מודעים לכך ש"בנינו מנוע AI משלנו" היא טענה שחברות רבות טוענות כרגע. PTC הוא יוצא דופן משתי סיבות ספציפיות.
קנה מידה וסקירה רציפה. WPML משרתת יותר מ־1.5 מיליון אתרים ועושה זאת במשך למעלה מעשור. צוות הבלשנים של WPML סוקר ברציפות את איכות התרגום של PTC — דוגם פלט, מדרג אותו עם אותה מסגרת MQM ששימשה במחקר זה, ומחפש דפוסים שבהם המנוע מפיק בעקביות תוצאות באיכות נמוכה יותר עבור מונח ספציפי, צמד שפות או סוג תוכן.
מיקוד. PTC אינו פרויקט צדדי ב־WPML. יש לו צוות ייעודי — מהנדסים, אנשי MLOps ובלשנים אנושיים. כאשר הבלשנים מתריעים על דפוס חוזר, צוות ההנדסה מתייחס אליו כאל באג: הרחבת מילון המונחים, התאמת מודל הרשמיות, הוספת חריג, ושחרור התיקון. הלולאה הזו פועלת ברציפות, וזו הסיבה שאיכות ה־PTC השתפרה במהלך 12 החודשים האחרונים מ"טוב כמו תרגום אנושי ממוצע" למספרים במחקר זה.
השילוב — סקירה אנושית רציפה בקנה מידה משמעותי, יחד עם צוות שמגיב לכל ממצא כאל כרטיס הנדסי — הוא מה שמפיק את מספרי האיכות שלמעלה. זו אינה ארכיטקטורת המודל; זהו מודל ההפעלה.
לא סיימנו
ציון 90.0 מציב את PTC בדיוק בגבול של "טוב מאוד — מוכן לפרסום ללא סקירה". אנו מרוצים מהתוצאה הזו. איננו חושבים שזו התקרה.
לולאת ה־QA → הנדסה שתוארה לעיל עדיין פועלת. צוות הבלשנים של WPML ממשיך לנתח את העריכות שלקוחות מבצעים בפלט של PTC באתרים אמיתיים, מזהה את הדפוסים שעריכות אלו חושפות, וצוות ההנדסה משחרר את התיקונים — הרחבות למילון המונחים, התאמות רשמיות, שינויים ספציפיים לצמדי שפות. אנו מצפים שהמדידה הבאה תהיה גבוהה מזו.
מה זה אומר עבור תהליך העבודה שלך
תהליך העבודה המקובל עבור תוכן רב-לשוני הוא תרגום → סקירה → פרסום. שלב הסקירה קיים מכיוון שכל מנוע AI — ורוב המתרגמים האנושיים — מפיקים עבודה שזקוקה לזוג עיניים נוסף לפני שהיא משוחררת. שלב הסקירה הזה הוא גם המקום שבו נמצאים רוב העלויות ורוב העיכובים בתוכן רב-לשוני.
בהתבסס על המדידות שלנו, עם DeepL מומלץ לבצע שלב סקירה. ההערכה שלנו מצאה ממוצע של 1.27 בעיות לעמוד; אם אלו לא יעברו סקירה, הקוראים צפויים להיתקל בהן. עם PTC, שלב הסקירה הוא אופציונלי עבור רוב התוכן. חלק מהצוותים עדיין מבצעים סקירה — עבור עמודים בעלי חשיבות גבוהה או תעשיות בפיקוח — אך תהליך העבודה כברירת מחדל הופך לתרגום → פרסום, כאשר הסקירה שמורה למקרים שבאמת זקוקים לה.
זהו ההבדל התפעולי שהמספרים מתארים. והוא אינו קטן.
מה זה אומר עבור העלויות שלך
עלות תרגום מורכבת משני דברים: עלות הפקת התרגום ועלות סקירתו. יש לשלם על שניהם לפני שהתוכן עולה לאוויר.
ברוב ההקשרים המקצועיים, סקירה אנושית עולה כמה סנטים למילה — בין אם הסוקרים גובים למילה, לעמוד או לאתר, לשם בערך מגיעה המתמטיקה. תרגום אנושי מלא (תרגום, ולאחר מכן סקירה על ידי אדם שני) עולה בדרך כלל סביב 0.10 €–0.20 € למילה עבור צמדי שפות מרכזיים, כאשר חלק הסקירה בלבד נמצא בטווח של 0.04 €–0.08 €.
הנה כמה כל תהליך עבודה באמת עולה במונחים אלו.
תרגום אנושי בלבד — קו הבסיס. סביב 0.10 €–0.20 € למילה. שני השלבים הם אנושיים.
DeepL (או כל מנוע AI אחר) בתוספת סקירה אנושית. ה־AI מטפל בשלב התרגום; אדם עדיין צריך לסקור כל עמוד, מכיוון שעם 1.27 בעיות לעמוד, הבעיות יגיעו ללקוחות אם אף אחד לא יתפוס אותן קודם. שלב התרגום הוא למעשה חינם; שלב הסקירה עדיין עולה 0.04 €–0.08 € למילה. חיסכון כולל לעומת תרגום אנושי בלבד: כ־60%. זהו הטיעון הסטנדרטי של "AI חוסך לך כסף על תרגום" — והוא נכון — אך תקרת העלות נמצאת בשלב הסקירה שהאיכות של DeepL עדיין דורשת.
PTC, ללא צורך בסקירה. PTC עולה 0.0012 €–0.003 € למילה — 4 קרדיטים למילה כפול 0.30 €–0.75 € לכל 1,000 קרדיטים בהתאם לנפח, כאשר 2,000 הקרדיטים הראשונים בחודש הם בחינם. (ראה את תמחור התרגום האוטומטי של WPML לטבלת המדרגות המלאה.) מכיוון שהאיכות הנמדדת של PTC (ציון TQ של 90.0, 0.07 בעיות לעמוד, פער של +12.3 נקודות מעל DeepL) גבוהה מספיק כדי לדלג על שלב הסקירה ברוב המקרים, עלות הסקירה יורדת לאפס. חיסכון כולל לעומת תרגום אנושי בלבד: בערך 99%.
זהו אינו שיפור שולי בתהליך העבודה של AI בתוספת סקירה. זהו משטר עלויות שונה לחלוטין.
במבט חטוף — עלות שחרור מילה מתורגמת
| תהליך עבודה | תרגום | סקירה | סה"כ | חיסכון לעומת אנושי |
|---|---|---|---|---|
| תרגום אנושי מלא | 0.10 €–0.20 € | כלול | 0.10 €–0.20 € | — |
| DeepL + סקירה אנושית | ~0 € | 0.04 €–0.08 € | 0.04 €–0.08 € | ~60% |
| PTC, ללא סקירה | 0.0012 €–0.003 € | 0 € | 0.0012 €–0.003 € | ~99% |
תעריפי תרגום אנושי הם הערכות תעשייה טיפוסיות עבור צמדי שפות מרכזיים. התמחור של PTC הוא מהתעריפים המפורסמים של WPML.
הערה לגבי ביצוע הסקירה בעצמך: כאשר בעל עסק מבצע את הסקירה בעצמו במקום לשלם לסוקר, העלות אינה אפס — היא פשוט פחות גלויה. השעות המושקעות בסקירה הן שעות שלא מושקעות בשאר העסק, ובכל תעריף שעתי סביר, העלות המשתמעת לרוב גבוהה יותר ממה שסוקר במיקור חוץ היה גובה, ולא נמוכה יותר. החיסכון של PTC חל ללא קשר למי שמשלם על שלב הסקירה כיום.
מה זה פותח בפניך. כאשר תרגום עולה מעל 0.10 € למילה, אתה מתרגם באופן סלקטיבי — דף הבית, קטגוריות המוצרים המובילות, קומץ פוסטים בבלוג עם תנועה גבוהה. כל השאר נשאר בשפת המקור כי המתמטיקה לא משתלמת. כאשר תרגום עולה 0.002 € למילה ומפיק פלט שהוא טוב יותר מתרגום אנושי טיפוסי, המתמטיקה משתלמת עבור תוכן שלא היה כדאי קודם לכן:
- תרגום קטלוג מלא במסחר אלקטרוני (eCommerce) — כל תיאור מוצר בזנב הארוך, כל וריאציה.
- פורטלי תיעוד מלאים בכל שפה שלקוח עשוי לדבר, ולא רק בשלוש השפות המובילות.
- מאגרי מידע, שאלות נפוצות לתמיכה, ארכיוני בלוגים — הזנב הארוך שמניע חיפושים אך מעולם לא הצדיק את עלות התרגום שלו.
- תוכן מערכתי שעבר לוקליזציה עבור מוציאים לאור הפועלים בשווקים שבהם ההכנסה מקהל לעמוד לא יכלה לכסות תרגום אנושי.
תוכן רב-לשוני היה שאלה של "מה אנו יכולים להרשות לעצמנו לתרגם" במשך עשורים. עם PTC, השאלה הופכת ל"מה שווה לתרגם" — שהיא שאלה שונה ומעניינת יותר.
כיצד להשיג איכות זו באתר שלך
PTC הוא מנוע ברירת המחדל במצב תרגם הכל של WPML, שהוא הגדרה גלובלית אחת שמתרגמת כל עמוד באתר שלך, באופן אוטומטי, ברקע. אין צורך לנהל תצורה לכל עמוד בנפרד.
כדי לקבל את האיכות שנמדדה במחקר זה, ההגדרה היחידה שאתה צריך מעבר להפעלת תרגם הכל היא להשקיע כדקה בתיאור הקהל והטון של האתר שלך בהגדרות תרגם הכל — לדוגמה, "חברת תוכנה הפונה למפתחים, טון רשמי, מונחים טכניים נשמרים באנגלית". PTC משתמש בתיאור זה כדי להתאים את התרגומים לקול המותג שלך.
זו כל ההגדרה. התוצאה היא מה שמחקר זה מדד.
הערה על מה שלא עשינו
לא השווינו את PTC ל־Google Translate, ל־Azure Translator או לשירותים מבוססי LLM דרך ה־APIs הציבוריים שלהם. הסיבה: מנועים אלו משתנים לעתים קרובות ומדידה בנקודת זמן אחת תהפוך למיושנת תוך חודשים. ההשוואה ל־DeepL היא זו שביצענו מכיוון ש־DeepL הוא אמת המידה המצוטטת ביותר עבור תרגום AI ברמת ייצור, ומכיוון ש־DeepL הוא מה שרוב המתחרים שלנו משתמשים בו מאחורי הקלעים.
כמו כן, לא מדדנו מהירות, עלות או חוויית מפתח במחקר זה — רק איכות. השוואות אלו קיימות בעמוד התכונות שלנו ובעמודי ההשוואה שלנו, והן מספרות סיפור משלהן.
נסה זאת
אם אתה מנהל אתר WordPress רב-לשוני ורוצה לראות את הפלט של PTC על התוכן שלך, התקן את WPML, הפעל את תרגם הכל, והשווה את התוצאה לכל מה שאתה משתמש בו כיום. הבדל האיכות המתואר כאן הוא הבדל האיכות שאתה צריך לצפות לראות.
שאלות על מתודולוגיה או בקשות לנתונים: פנה לצוות WPML.
המחקר נערך על ידי צוות הבלשנים של WPML, אפריל 2026. מדגם: 227 דפי אינטרנט שתורגמו על ידי DeepL נסקרו על ידי בלשנים דוברים ילידיים, בהשוואה ל־73 סקירות של אתרים פעילים ב־PTC שדורגו באותה מתודולוגיה. שפות: ערבית, אנגלית, צרפתית, גרמנית, איטלקית, ספרדית. דירוג: מסגרת איכות תרגום מבוססת MQM, 9 ממדים, 1–10 לכל ממד, ממוצע ומותאם לתוצאה של 0–100.