Private Translation Cloud (PTC) ของ WPML ได้คะแนน 90.0 จาก 100 ในการประเมินคุณภาพการแปลภายในของ WPML ส่วน DeepL ซึ่งได้รับการยอมรับอย่างกว้างขวางว่าเป็นเครื่องมือการแปลด้วย AI กระแสหลักที่แข็งแกร่งที่สุด ได้คะแนน 77.7 โดยรวมแล้ว PTC ทำคะแนนได้ดีกว่า DeepL 12.3 คะแนน ชนะในทุกมิติคุณภาพทั้งเก้ามิติที่นักภาษาศาสตร์ของเราให้คะแนน และลดข้อผิดพลาดต่อหน้าลงได้ประมาณ 18 เท่า
ภาพรวม
| ตัวชี้วัด | DeepL |
|
|---|---|---|
| คะแนนคุณภาพการแปลเฉลี่ย (0–100) | 77.7 | 90.0 |
| ปัญหาเฉลี่ยต่อหน้าที่แปล | 1.27 | 0.07 |
| มิติคุณภาพที่ PTC ได้คะแนนสูงกว่า DeepL | — | 9 จาก 9 |
| ภาษาที่ทดสอบซึ่ง PTC ได้คะแนนสูงกว่า DeepL | — | 6 จาก 6 (ภาษาอาหรับ ภาษาอังกฤษ ภาษาฝรั่งเศส ภาษาเยอรมัน ภาษาอิตาลี ภาษาสเปน) |
เหตุผลที่เราทำการศึกษานี้
จากความคิดเห็นของลูกค้าของเรา DeepL ได้รับการยอมรับอย่างกว้างขวางว่าเป็นมาตรฐานสำหรับคุณภาพการแปลด้วย AI ในระบบนิเวศของ WordPress เมื่อลูกค้าถามว่าสามารถเผยแพร่เนื้อหาที่แปลด้วย AI โดยไม่ต้องให้มนุษย์ตรวจทานได้หรือไม่ DeepL มักจะเป็นจุดเปรียบเทียบโดยนัยเสมอ
WPML สร้างเครื่องมือการแปลด้วย AI ของตนเอง ซึ่งก็คือ Private Translation Cloud (PTC) เนื่องจากคำว่า "ดีพอ" นั้นยังไม่เพียงพอ PTC เป็นเครื่องมือเริ่มต้นในโหมด แปลทุกอย่าง ของ WPML และขับเคลื่อนการแปลอัตโนมัติส่วนใหญ่ในเว็บไซต์กว่า 1.5 ล้านแห่งที่ใช้งาน WPML
เราต้องการคำตอบที่วัดผลได้สำหรับคำถามที่ผู้มีโอกาสเป็นลูกค้าถามเราทุกสัปดาห์ว่า PTC เทียบกับ DeepL แล้วเป็นอย่างไร การศึกษานี้คือคำตอบ ตัวเลขด้านบนคือประเด็นสำคัญ ส่วนที่เหลือของบทความนี้จะอธิบายว่าตัวเลขเหล่านั้นมาได้อย่างไร และมีความหมายอย่างไรต่อเว็บไซต์ที่ใช้งานจริง
สิ่งที่เราวัดผลและวิธีการวัดผล
เราให้คะแนนคุณภาพการแปลโดยใช้ระบบที่อิงตาม MQM (Multidimensional Quality Metrics) ซึ่งเป็นกรอบการทำงานเดียวกับที่ทีมนักภาษาศาสตร์ของ WPML ใช้สำหรับการตรวจสอบเว็บไซต์ลูกค้า PTC อย่างต่อเนื่อง ทุกหน้าที่แปลจะได้รับการให้คะแนนในเก้ามิติ ได้แก่:
- ไวยากรณ์ — มีข้อผิดพลาดทางไวยากรณ์หรือไม่
- ความหมาย — ความหมายของต้นฉบับยังคงอยู่หรือไม่
- ความเป็นธรรมชาติ — ฟังดูเป็นธรรมชาติและตรงตามสำนวนสำหรับเจ้าของภาษาหรือไม่
- น้ำเสียง — ถ่ายทอดน้ำเสียงของต้นฉบับได้หรือไม่
- ความเป็นทางการ — ใช้ระดับภาษาที่ถูกต้องหรือไม่ ทั้งในการเรียกผู้อ่านและรูปแบบการเรียกทางไวยากรณ์
- คำศัพท์เฉพาะทาง — ใช้คำศัพท์เฉพาะทางที่ถูกต้องหรือไม่
- ความสม่ำเสมอ — มีการใช้คำศัพท์เฉพาะทางอย่างสม่ำเสมอตลอดทั้งหน้าหรือไม่
- การใช้ตัวพิมพ์ใหญ่ — ปฏิบัติตามธรรมเนียมของภาษาปลายทางหรือไม่
- การปรับตัวเลข หน่วย และวันที่ให้เข้ากับท้องถิ่น — ปฏิบัติตามธรรมเนียมของภาษาปลายทางหรือไม่
แต่ละมิติจะได้รับการให้คะแนน 1–10 โดยนักภาษาศาสตร์ที่เป็นเจ้าของภาษาปลายทาง คะแนนสุดท้ายต่อหน้าคือค่าเฉลี่ยของทั้งเก้ามิติ คูณด้วยสิบ ซึ่งจะได้ระดับคะแนน 1–100 ที่สอดคล้องกับระดับคุณภาพที่เข้าใจง่ายดังนี้:
| คะแนน | ความหมาย |
|---|---|
| 90–100 | ดีมากถึงสมบูรณ์แบบ — พร้อมเผยแพร่โดยไม่ต้องตรวจทาน |
| 80–89 | ดี — พร้อมเผยแพร่ในบริบทส่วนใหญ่ |
| 70–79 | ยอมรับได้ถึงปานกลาง — ใช้งานได้แต่ยังเห็นข้อผิดพลาด |
| 60–69 | ปานกลาง — จำเป็นต้องปรับปรุงก่อนเผยแพร่ |
| 50–59 | มีข้อผิดพลาดชัดเจนแม้แต่กับผู้ที่ไม่ใช่เจ้าของภาษา |
| ต่ำกว่า 50 | มีข้อบกพร่องมากพอที่จะต้องทำใหม่ |
สำหรับบริบทเพิ่มเติม: ค่าเฉลี่ยที่เผยแพร่สำหรับการแปลโดยมนุษย์ทั่วไปอยู่ที่ประมาณ 76 คะแนน 77.7 ของ DeepL ทำให้คะแนนอยู่เหนือเส้นนั้นเพียงเล็กน้อย ส่วนคะแนน 90.0 ของ PTC ทำให้คะแนนอยู่ตรงขอบเขตของระดับ "ดีมาก — พร้อมเผยแพร่โดยไม่ต้องตรวจทาน" พอดี
ขนาดตัวอย่างและการคัดเลือก
เพื่อประเมิน DeepL เราได้นำเว็บไซต์แบบสุ่ม 800 แห่งที่แปลด้วย DeepL ในช่วง 12 เดือนที่ผ่านมา มาจัดกลุ่มตามอายุเว็บไซต์ ปริมาณเนื้อหา และกิจกรรมการแปล จากนั้นจึงสุ่มตัวอย่างจากทุกกลุ่ม นักภาษาศาสตร์ของเราได้ตรวจสอบหน้าหลักของเว็บไซต์ตัวอย่างด้วยตนเอง ซึ่งมีหน้าเว็บทั้งหมด 227 หน้า โดยประเมินในภาษาอาหรับ ภาษาอังกฤษ ภาษาฝรั่งเศส ภาษาเยอรมัน ภาษาอิตาลี และภาษาสเปน
คะแนนของ PTC มาจากกลุ่มตัวอย่างแยกต่างหาก: บทวิจารณ์เว็บไซต์ที่ใช้งานจริง 73 แห่ง ซึ่งให้คะแนนโดยนักภาษาศาสตร์กลุ่มเดียวกันโดยใช้วิธีการ MQM เดียวกันกับที่อธิบายไว้ข้างต้น กลุ่มตัวอย่างของ PTC มีขนาดเล็กกว่ากลุ่มตัวอย่างของ DeepL เนื่องจากค่าการวัดของ PTC แต่ละค่าสะท้อนถึงเวอร์ชันของ PTC ที่เฉพาะเจาะจง และเครื่องมือนี้ยังคงพัฒนาอย่างต่อเนื่อง โปรดดูส่วน เรายังไม่หยุดเพียงเท่านี้ ด้านล่าง
แยกตามภาษา: PTC ชนะในทุกคู่ภาษา
คะแนนรวมนั้นน่าสนใจ แต่ภาพรวมแยกตามภาษาคือสิ่งที่จะบอกทีมเนื้อหาหลายภาษาว่าควรคาดหวังอะไร
คะแนน TQ แยกตามภาษา

PTC ทำคะแนนได้สูงกว่า DeepL ในทุกคู่ภาษาที่เราทดสอบ ช่องว่างที่กว้างที่สุดอยู่ในภาษาอาหรับ (+22.4 คะแนน) ซึ่ง DeepL มีประสิทธิภาพต่ำกว่ามาตรฐานมาโดยตลอด และแสดงให้เห็นอย่างชัดเจนถึงการลงทุนของ WPML ในคุณภาพของภาษาที่อ่านจากขวาไปซ้าย (RTL) รองลงมาคือภาษาเยอรมัน (+11.5) และภาษาฝรั่งเศส (+9.9) ช่องว่างที่แคบที่สุดอยู่ในภาษาอังกฤษ (+6.0 คะแนน) และแม้แต่ในภาษานี้ PTC ก็ยกระดับหน้าเว็บจาก "ยอมรับได้ แต่ยังเห็นข้อผิดพลาด" ไปสู่ระดับที่พร้อมเผยแพร่
ความแปรปรวนก็มีความสำคัญเช่นกัน การกระจายของ DeepL มีส่วนหางด้านล่างยาวในภาษาอาหรับ โดยมีบางหน้าได้คะแนนต่ำกว่าค่าเฉลี่ยมาก ซึ่งเป็นหน้าที่ผู้ใช้ภาษาเยอรมันหรือภาษาฝรั่งเศสจะมองว่าใช้งานไม่ได้ การกระจายของ PTC แคบกว่าและมีศูนย์กลางสูงกว่า ดังนั้นทีมเนื้อหาจึงสามารถวางแผนตามระดับคุณภาพที่คาดหวังได้ แทนที่จะต้องเตรียมงบประมาณสำหรับกรณีที่ผิดปกติ
PTC ยังทำผลงานได้ดีกว่า DeepL ในทุกมิติคุณภาพทั้งเก้ามิติที่เราให้คะแนน ได้แก่ ไวยากรณ์ ความหมาย ความเป็นธรรมชาติ น้ำเสียง ความเป็นทางการ คำศัพท์เฉพาะทาง ความสม่ำเสมอ การใช้ตัวพิมพ์ใหญ่ และธรรมเนียมของท้องถิ่น การพัฒนาที่มากที่สุดอยู่ในมิติที่สำคัญที่สุดสำหรับมนุษย์ที่อ่านหน้าเว็บในเว็บไซต์จริง ได้แก่ คำศัพท์เฉพาะทาง (+1.5) ไวยากรณ์ (+1.4) ความเป็นธรรมชาติ (+1.4) และการปรับตัวเลข/หน่วย/วันที่ให้เข้ากับท้องถิ่น (+1.4) ไม่มีมิติใดที่ DeepL ตามทัน และไม่มีมิติใดที่ PTC ชนะเพียงฉิวเฉียด
อัตราข้อผิดพลาด: ภาพรวมการปฏิบัติงาน
คะแนนเฉลี่ยนั้นมีประโยชน์ แต่จำนวนข้อผิดพลาดมีประโยชน์มากกว่าสำหรับผู้ที่ดูแลเว็บไซต์จริง ผู้ตรวจทานของเราได้บันทึกทุกปัญหาที่พบในแต่ละหน้า ไม่ว่าจะเป็นไวยากรณ์ ความหมาย คำศัพท์เฉพาะทาง และอื่น ๆ ทั้งหมด
ปัญหาเฉลี่ยต่อหน้า

DeepL สร้างปัญหาโดยเฉลี่ย 1.27 ปัญหาต่อหน้า ส่วน PTC สร้างปัญหา 0.07 ปัญหา ซึ่งช่วยลดข้อผิดพลาดต่อหน้าลงได้ประมาณ 18 เท่าในเนื้อหาต้นฉบับเดียวกัน
สำหรับเว็บไซต์ที่มี 200 หน้า นั่นหมายความว่า:
- DeepL: มีปัญหาประมาณ 254 ปัญหาที่ต้องค้นหา ตัดสินใจ และแก้ไขก่อนเผยแพร่
- PTC: มีปัญหาประมาณ 14 ปัญหาทั่วทั้งเว็บไซต์
นั่นคือความแตกต่างระหว่างการแปลด้วย AI ในฐานะฉบับร่างแรก และการแปลด้วย AI ในฐานะขั้นตอนการทำงาน จากการประเมินของเรา DeepL เป็นฉบับร่างแรกที่แข็งแกร่ง การวัดผลของเราพบปัญหาที่ต้องตรวจทานในหน้าส่วนใหญ่ก่อนเผยแพร่ ในขณะที่ PTC จากการวัดผลนี้คือขั้นตอนการทำงาน: จำนวนข้อผิดพลาดต่ำมากจนขั้นตอนการตรวจทานโดยมนุษย์กลายเป็นทางเลือกสำหรับเนื้อหาส่วนใหญ่ แทนที่จะเป็นสิ่งที่ต้องทำสำหรับเนื้อหาทั้งหมด
ความหมายที่แท้จริงของ "การแปลที่ดี"
คำอธิบายระดับคะแนนของกรอบการทำงาน MQM เป็นสิ่งที่ช่วยถ่วงดุลภาษาทางการตลาดที่เกี่ยวข้องกับการแปลด้วย AI ได้อย่างมีประโยชน์ หน้าเว็บที่ได้ "9/10" ไม่ใช่หน้าเว็บที่สมบูรณ์ 90% แต่เป็นหน้าเว็บที่เจ้าของภาษาอ่านอย่างละเอียดแล้วไม่พบสิ่งที่ต้องการเปลี่ยนแปลง หน้าเว็บที่ได้ "7/10" คือยอมรับได้ตามสภาพแต่ยังเห็นข้อผิดพลาด หน้าเว็บที่ได้ "5/10" คือหน้าเว็บที่แม้แต่ผู้ที่ไม่ใช่เจ้าของภาษาก็สามารถสังเกตเห็นข้อผิดพลาดได้
ค่าเฉลี่ยของ DeepL อยู่ในระดับ 7 ปลาย ๆ ซึ่งยอมรับได้ แต่ผู้อ่านที่เป็นเจ้าของภาษาที่อ่านอย่างระมัดระวังจะเห็นว่ายังไม่สมบูรณ์ ค่าเฉลี่ยของ PTC อยู่ที่ 90.0 ซึ่งอยู่ตรงขอบเขตของ "ดีมาก — พร้อมเผยแพร่โดยไม่ต้องตรวจทาน" พอดี นั่นคือความแตกต่างด้านคุณภาพที่ผู้ตรวจทานของเราวัดผลได้ ซึ่งสะท้อนถึงความแตกต่างที่แท้จริง: ผลลัพธ์ของ DeepL เป็นจุดเริ่มต้นที่ต้องให้มนุษย์ตรวจทานก่อนเผยแพร่ ส่วนผลลัพธ์ของ PTC ในกรณีส่วนใหญ่คือสิ่งที่จะนำไปเผยแพร่ได้เลย
เหตุใด WPML จึงสามารถสร้างคุณภาพระดับนี้ได้
เราตระหนักดีว่า "เราสร้างเครื่องมือ AI ของเราเอง" เป็นคำกล่าวอ้างที่หลายบริษัทใช้ในขณะนี้ แต่ PTC นั้นแตกต่างออกไปด้วยเหตุผลเฉพาะสองประการ
ขนาดและการตรวจสอบอย่างต่อเนื่อง WPML ให้บริการเว็บไซต์กว่า 1.5 ล้านแห่ง และทำเช่นนี้มานานกว่าทศวรรษ ทีมนักภาษาศาสตร์ของ WPML ตรวจสอบคุณภาพการแปลของ PTC อย่างต่อเนื่อง โดยสุ่มตัวอย่างผลลัพธ์ ให้คะแนนด้วยกรอบการทำงาน MQM เดียวกับที่ใช้ในการศึกษานี้ และเฝ้าดูรูปแบบที่เครื่องมือสร้างผลลัพธ์ที่มีคุณภาพต่ำกว่าอย่างสม่ำเสมอสำหรับคำศัพท์ คู่ภาษา หรือประเภทเนื้อหาที่เฉพาะเจาะจง
ความมุ่งเน้น PTC ไม่ใช่โปรเจกต์เสริมของ WPML แต่มีทีมงานเฉพาะกิจ ได้แก่ วิศวกร ผู้เชี่ยวชาญด้าน MLOps และนักภาษาศาสตร์ที่เป็นมนุษย์ เมื่อนักภาษาศาสตร์ตั้งข้อสังเกตถึงรูปแบบที่เกิดขึ้นซ้ำ ๆ ทีมวิศวกรจะถือว่านั่นคือข้อบกพร่อง: พวกเขาจะขยายอภิธานศัพท์ ปรับโมเดลความเป็นทางการ เพิ่มข้อยกเว้น และส่งมอบการแก้ไข วงจรนี้ทำงานอย่างต่อเนื่อง ซึ่งเป็นเหตุผลว่าทำไมคุณภาพของ PTC จึงได้รับการปรับปรุงในช่วง 12 เดือนที่ผ่านมา จาก "ดีพอ ๆ กับการแปลโดยมนุษย์โดยเฉลี่ย" มาเป็นตัวเลขในการศึกษานี้
การผสมผสานระหว่างการตรวจสอบโดยมนุษย์อย่างต่อเนื่องในระดับที่มีนัยสำคัญ ควบคู่กับทีมที่ตอบสนองต่อการค้นพบแต่ละครั้งในรูปแบบของตั๋วงานวิศวกรรม คือสิ่งที่สร้างตัวเลขคุณภาพดังกล่าวข้างต้น ไม่ใช่แค่สถาปัตยกรรมของโมเดล แต่เป็นรูปแบบการดำเนินงาน
เรายังไม่หยุดเพียงเท่านี้
คะแนน 90.0 ทำให้ PTC อยู่ตรงขอบเขตของ "ดีมาก — พร้อมเผยแพร่โดยไม่ต้องตรวจทาน" พอดี เราพอใจกับผลลัพธ์นั้น แต่เราไม่คิดว่านี่คือขีดจำกัดสูงสุด
วงจร QA → วิศวกรรมที่อธิบายไว้ข้างต้นยังคงดำเนินต่อไป ทีมนักภาษาศาสตร์ของ WPML ยังคงวิเคราะห์การแก้ไขที่ลูกค้าทำกับผลลัพธ์ของ PTC บนเว็บไซต์จริง ระบุรูปแบบที่การแก้ไขเหล่านั้นเปิดเผย และทีมวิศวกรก็ส่งมอบการแก้ไข ไม่ว่าจะเป็นการขยายอภิธานศัพท์ การปรับความเป็นทางการ หรือการปรับแต่งเฉพาะสำหรับคู่ภาษา เราคาดว่าการวัดผลครั้งต่อไปจะสูงกว่าครั้งนี้
สิ่งนี้มีความหมายอย่างไรต่อขั้นตอนการทำงานของคุณ
ขั้นตอนการทำงานของเนื้อหาหลายภาษาแบบดั้งเดิมคือ แปล → ตรวจทาน → เผยแพร่ ขั้นตอนการตรวจทานมีอยู่เนื่องจากเครื่องมือ AI ทุกตัว และนักแปลที่เป็นมนุษย์ส่วนใหญ่ สร้างผลงานที่ต้องมีผู้ตรวจทานอีกคนก่อนที่จะส่งมอบ ขั้นตอนการตรวจทานนั้นยังเป็นส่วนที่มีค่าใช้จ่ายส่วนใหญ่และความล่าช้าส่วนใหญ่ในเนื้อหาหลายภาษาอีกด้วย
จากการวัดผลของเรา หากใช้ DeepL ขอแนะนำให้มีขั้นตอนการตรวจทาน การประเมินของเราพบปัญหาเฉลี่ย 1.27 ปัญหาต่อหน้า หากไม่ได้รับการตรวจทาน ผู้อ่านก็มีแนวโน้มที่จะพบปัญหาเหล่านั้น แต่เมื่อใช้ PTC ขั้นตอนการตรวจทานจะเป็นทางเลือกสำหรับเนื้อหาส่วนใหญ่ บางทีมยังคงตรวจทานสำหรับหน้าเว็บที่มีความสำคัญสูงหรืออุตสาหกรรมที่มีการควบคุมดูแล แต่ขั้นตอนการทำงานเริ่มต้นจะกลายเป็น แปล → เผยแพร่ โดยสงวนการตรวจทานไว้สำหรับกรณีที่จำเป็นจริง ๆ เท่านั้น
นี่คือความแตกต่างในการปฏิบัติงานที่ตัวเลขได้อธิบายไว้ และไม่ใช่ความแตกต่างเล็ก ๆ น้อย ๆ
สิ่งนี้มีความหมายอย่างไรต่อค่าใช้จ่ายของคุณ
ค่าใช้จ่ายในการแปลประกอบด้วยสองส่วน: ค่าใช้จ่ายในการสร้างคำแปลและค่าใช้จ่ายในการตรวจทาน คุณต้องจ่ายทั้งสองส่วนนี้ก่อนที่เนื้อหาจะเผยแพร่สู่สาธารณะ
สำหรับบริบททางวิชาชีพส่วนใหญ่ การตรวจทานโดยมนุษย์มีค่าใช้จ่ายไม่กี่เซนต์ต่อคำ ไม่ว่าผู้ตรวจทานจะคิดค่าบริการต่อคำ ต่อหน้า หรือต่อเว็บไซต์ ตัวเลขคร่าว ๆ ก็จะอยู่ที่ประมาณนี้ การแปลโดยมนุษย์เต็มรูปแบบ (แปลแล้วตรวจทานโดยมนุษย์คนที่สอง) มักจะอยู่ที่ประมาณ €0.10–€0.20 ต่อคำ สำหรับคู่ภาษาหลัก โดยเฉพาะส่วนของการตรวจทานเพียงอย่างเดียวจะอยู่ในช่วง €0.04–€0.08
ต่อไปนี้คือค่าใช้จ่ายจริงของแต่ละขั้นตอนการทำงานในแง่มุมเหล่านั้น
การแปลโดยมนุษย์เพียงอย่างเดียว — เกณฑ์มาตรฐาน ประมาณ €0.10–€0.20 ต่อคำ ทั้งสองขั้นตอนดำเนินการโดยมนุษย์
DeepL (หรือเครื่องมือ AI ใด ๆ) บวกกับการตรวจทานโดยมนุษย์ AI จัดการขั้นตอนการแปล แต่มนุษย์ยังคงต้องตรวจทานทุกหน้า เนื่องจากมีปัญหา 1.27 ปัญหาต่อหน้า ปัญหาเหล่านั้นจะไปถึงลูกค้าหากไม่มีใครตรวจพบก่อน ขั้นตอนการแปลนั้นแทบจะไม่มีค่าใช้จ่าย แต่ขั้นตอนการตรวจทานยังมีค่าใช้จ่าย €0.04–€0.08 ต่อคำ ประหยัดเงินรวมเมื่อเทียบกับการใช้มนุษย์เพียงอย่างเดียว: ประมาณ 60% นี่คือคำโฆษณามาตรฐานที่ว่า "AI ช่วยคุณประหยัดเงินในการแปล" ซึ่งเป็นเรื่องจริง แต่เพดานค่าใช้จ่ายจะอยู่ที่ขั้นตอนการตรวจทานซึ่งคุณภาพของ DeepL ยังคงต้องการ
PTC ไม่จำเป็นต้องตรวจทาน PTC มีค่าใช้จ่าย €0.0012–€0.003 ต่อคำ — 4 เครดิตการแปลต่อคำ คูณด้วย €0.30–€0.75 ต่อ 1,000 เครดิตการแปล ขึ้นอยู่กับปริมาณ โดย 2,000 เครดิตการแปลแรกต่อเดือนนั้นฟรี (ดู ราคาการแปลอัตโนมัติของ WPML สำหรับตารางระดับทั้งหมด) เนื่องจากคุณภาพที่วัดได้ของ PTC (คะแนน TQ 90.0, 0.07 ปัญหาต่อหน้า, ช่องว่าง +12.3 คะแนนเหนือ DeepL) สูงพอที่จะข้ามขั้นตอนการตรวจทานได้ในกรณีส่วนใหญ่ ค่าใช้จ่ายในการตรวจทานจึงกลายเป็นศูนย์ ประหยัดเงินรวมเมื่อเทียบกับการใช้มนุษย์เพียงอย่างเดียว: ประมาณ 99%
นั่นไม่ใช่แค่การปรับปรุงเล็กน้อยในขั้นตอนการทำงานแบบ AI บวกการตรวจทาน แต่มันคือโครงสร้างค่าใช้จ่ายที่แตกต่างไปจากเดิมอย่างสิ้นเชิง
ภาพรวม — ค่าใช้จ่ายในการส่งมอบคำที่แปล
| ขั้นตอนการทำงาน | การแปล | การตรวจทาน | รวม | ประหยัดเมื่อเทียบกับมนุษย์ |
|---|---|---|---|---|
| การแปลโดยมนุษย์เต็มรูปแบบ | €0.10–€0.20 | รวมอยู่แล้ว | €0.10–€0.20 | — |
| DeepL + การตรวจทานโดยมนุษย์ | ~€0 | €0.04–€0.08 | €0.04–€0.08 | ~60% |
| PTC ไม่ต้องตรวจทาน | €0.0012–€0.003 | €0 | €0.0012–€0.003 | ~99% |
อัตราค่าแปลโดยมนุษย์เป็นการประมาณการทั่วไปในอุตสาหกรรมสำหรับคู่ภาษาหลัก ราคาของ PTC มาจากอัตราที่เผยแพร่ของ WPML
หมายเหตุเกี่ยวกับการตรวจทานด้วยตนเอง: เมื่อเจ้าของธุรกิจทำการตรวจทานด้วยตนเองแทนที่จะจ่ายเงินให้ผู้ตรวจทาน ค่าใช้จ่ายไม่ได้เป็นศูนย์ เพียงแต่มองเห็นได้ยากขึ้นเท่านั้น เวลาที่ใช้ไปกับการตรวจทานคือเวลาที่ไม่ได้ใช้ไปกับส่วนอื่น ๆ ของธุรกิจ และเมื่อคิดตามอัตราค่าจ้างรายชั่วโมงที่สมเหตุสมผล ค่าใช้จ่ายแฝงมักจะสูงกว่าค่าบริการของผู้ตรวจทานภายนอก ไม่ใช่ต่ำกว่า การประหยัดของ PTC นั้นปรับใช้ได้ไม่ว่าใครจะเป็นผู้รับผิดชอบค่าใช้จ่ายในขั้นตอนการตรวจทานในปัจจุบันก็ตาม
สิ่งนี้เปิดโอกาสอะไรบ้าง เมื่อการแปลมีค่าใช้จ่าย €0.10+ ต่อคำ คุณจะเลือกแปลเฉพาะบางส่วน เช่น หน้าแรก หมวดหมู่ผลิตภัณฑ์ยอดนิยม บล็อกโพสต์ที่มีผู้เข้าชมสูงจำนวนหนึ่ง ส่วนที่เหลือจะยังคงอยู่ในภาษาต้นทางเนื่องจากไม่คุ้มทุน แต่เมื่อการแปลมีค่าใช้จ่าย €0.002 ต่อคำ และให้ผลลัพธ์ที่ดีกว่าการแปลโดยมนุษย์ทั่วไป ความคุ้มทุนก็จะเกิดขึ้นกับเนื้อหาที่ไม่เคยเป็นไปได้มาก่อน:
- การแปลแคตตาล็อกแบบเต็มรูปแบบในอีคอมเมิร์ซ — คำอธิบายผลิตภัณฑ์แบบเจาะจงกลุ่มเป้าหมาย (long-tail) ทุกรายการ และทุกรูปแบบผลิตภัณฑ์
- พอร์ทัลเอกสารอ้างอิงที่สมบูรณ์ในทุกภาษาที่ลูกค้าอาจใช้งาน ไม่ใช่แค่สามภาษาแรก
- ฐานความรู้ คำถามที่พบบ่อยของฝ่ายสนับสนุน คลังเก็บบล็อก — เนื้อหาเฉพาะกลุ่มที่ขับเคลื่อนการค้นหาแต่ไม่เคยคุ้มกับค่าแปล
- เนื้อหาบทบรรณาธิการที่ปรับให้เข้ากับท้องถิ่นสำหรับผู้เผยแพร่ที่ดำเนินงานในตลาดซึ่งรายได้ต่อหน้าผู้ชมไม่สามารถครอบคลุมค่าแปลโดยมนุษย์ได้
เนื้อหาหลายภาษาเคยเป็นคำถามที่ว่า "เราสามารถจ่ายค่าแปลสำหรับอะไรได้บ้าง" มานานหลายทศวรรษ เมื่อมี PTC คำถามจะเปลี่ยนเป็น "อะไรที่คุ้มค่าที่จะแปล" ซึ่งเป็นคำถามที่แตกต่างและน่าสนใจกว่า
วิธีรับคุณภาพระดับนี้บนเว็บไซต์ของคุณเอง
PTC เป็นเครื่องมือเริ่มต้นในโหมด แปลทุกอย่าง ของ WPML ซึ่งเป็นการตั้งค่าส่วนกลางเพียงจุดเดียวที่จะแปลทุกหน้าบนเว็บไซต์ของคุณโดยอัตโนมัติในเบื้องหลัง ไม่มีข้อกำหนดการตั้งค่าต่อหน้าที่ต้องจัดการ
เพื่อให้ได้คุณภาพตามที่วัดผลในการศึกษานี้ การตั้งค่าเดียวที่คุณต้องทำนอกเหนือจากการเปิด แปลทุกอย่าง คือการใช้เวลาประมาณหนึ่งนาทีในการอธิบายกลุ่มเป้าหมายและน้ำเสียงของเว็บไซต์ของคุณในการตั้งค่า แปลทุกอย่าง ตัวอย่างเช่น "บริษัทซอฟต์แวร์ที่สื่อสารกับนักพัฒนา น้ำเสียงเป็นทางการ คงคำศัพท์เฉพาะทางด้านเทคนิคไว้เป็นภาษาอังกฤษ" PTC จะใช้คำอธิบายดังกล่าวเพื่อปรับการแปลให้สอดคล้องกับเอกลักษณ์ของแบรนด์คุณ
นั่นคือการตั้งค่าทั้งหมด ผลลัพธ์ที่ได้คือสิ่งที่การศึกษานี้ได้วัดผลไว้
หมายเหตุเกี่ยวกับสิ่งที่เราไม่ได้ทำ
เราไม่ได้เปรียบเทียบ PTC กับ Google แปลภาษา, Azure Translator หรือบริการที่ใช้ LLM ผ่าน API สาธารณะ เหตุผลคือ: เครื่องมือเหล่านั้นมีการเปลี่ยนแปลงบ่อยครั้ง และการวัดผลแบบจุดเดียวจะล้าสมัยภายในไม่กี่เดือน การเปรียบเทียบกับ DeepL คือสิ่งที่เราดำเนินการ เนื่องจาก DeepL เป็นมาตรฐานที่ได้รับการอ้างถึงมากที่สุดสำหรับการแปลด้วย AI ระดับการใช้งานจริง และเนื่องจาก DeepL คือสิ่งที่คู่แข่งส่วนใหญ่ของเราใช้งานอยู่เบื้องหลัง
นอกจากนี้เรายังไม่ได้วัดความเร็ว ค่าใช้จ่าย หรือประสบการณ์ของนักพัฒนาในการศึกษานี้ — เราวัดเพียงคุณภาพเท่านั้น การเปรียบเทียบเหล่านั้นมีอยู่ในหน้าฟีเจอร์ของเราและหน้าการเปรียบเทียบของเรา และมีรายละเอียดในตัวเอง
ลองใช้งาน
หากคุณดูแลเว็บไซต์ WordPress หลายภาษาและต้องการดูผลลัพธ์ของ PTC บนเนื้อหาของคุณเอง ให้ติดตั้ง WPML เปิดใช้งาน แปลทุกอย่าง และเปรียบเทียบผลลัพธ์กับสิ่งที่คุณกำลังใช้งานอยู่ในปัจจุบัน ความแตกต่างด้านคุณภาพที่อธิบายไว้ที่นี่คือความแตกต่างด้านคุณภาพที่คุณคาดหวังว่าจะได้เห็น
หากมีคำถามเกี่ยวกับระเบียบวิธีหรือต้องการขอข้อมูล: โปรดติดต่อทีมงาน WPML
การศึกษาจัดทำโดยทีมนักภาษาศาสตร์ของ WPML เมษายน 2026 กลุ่มตัวอย่าง: หน้าเว็บที่แปลด้วย DeepL จำนวน 227 หน้า ซึ่งตรวจทานโดยนักภาษาศาสตร์ที่เป็นเจ้าของภาษา เปรียบเทียบกับบทวิจารณ์เว็บไซต์ที่ใช้งานจริงของ PTC จำนวน 73 แห่งที่ให้คะแนนด้วยระเบียบวิธีเดียวกัน ภาษา: ภาษาอาหรับ ภาษาอังกฤษ ภาษาฝรั่งเศส ภาษาเยอรมัน ภาษาอิตาลี ภาษาสเปน การให้คะแนน: กรอบการทำงานคุณภาพการแปลที่อิงตาม MQM, 9 มิติ, 1–10 ต่อมิติ, นำมาเฉลี่ยและปรับสัดส่วนเป็นผลลัพธ์ 0–100