WPML

Private Translation Cloud (PTC) của WPML đạt 90,0 trên 100 điểm trong bài đánh giá chất lượng dịch thuật nội bộ của WPML. DeepL — được coi là công cụ dịch thuật AI phổ biến mạnh mẽ nhất — đạt 77,7 điểm. PTC vượt trội hơn DeepL 12,3 điểm tổng thể, chiến thắng ở cả chín tiêu chí chất lượng mà các nhà ngôn ngữ học của chúng tôi đã chấm điểm và giảm khoảng 18 lần số lỗi trên mỗi trang.

Tóm tắt

Tiêu chí DeepL Logo PTC PTC
Điểm chất lượng dịch thuật trung bình (0–100) 77,7 90,0
Số lỗi trung bình trên mỗi trang đã dịch 1,27 0,07
Tiêu chí chất lượng mà PTC đạt điểm cao hơn DeepL 9 trên 9
Ngôn ngữ được thử nghiệm mà PTC đạt điểm cao hơn DeepL 6 trên 6 (tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Tây Ban Nha)

Lý do chúng tôi thực hiện nghiên cứu này

Dựa trên phản hồi từ khách hàng của chúng tôi, DeepL được coi là tiêu chuẩn cho chất lượng dịch thuật AI trong hệ sinh thái WordPress. Khi khách hàng hỏi liệu họ có thể xuất bản nội dung do AI dịch mà không cần người rà soát hay không, DeepL thường là điểm so sánh ngầm.

WPML đã xây dựng công cụ dịch thuật AI của riêng mình — Private Translation Cloud (PTC) — vì mức “đủ tốt” là chưa đủ. PTC là công cụ mặc định bên trong chế độ Dịch mọi thứ của WPML và cung cấp sức mạnh cho phần lớn hoạt động dịch tự động trên hơn 1,5 triệu trang web đang chạy WPML.

Chúng tôi muốn có một câu trả lời có thể đo lường được cho câu hỏi mà các khách hàng tiềm năng hỏi chúng tôi mỗi tuần: thực tế thì PTC so với DeepL như thế nào? Nghiên cứu này chính là câu trả lời đó. Các con số ở trên là điểm nhấn; phần còn lại của bài viết này giải thích cách chúng được tạo ra và ý nghĩa của chúng đối với một trang web chính thức thực tế.

Những gì chúng tôi đã đo lường và phương pháp

Chúng tôi đã chấm điểm chất lượng dịch thuật bằng một hệ thống dựa trên MQM (Multidimensional Quality Metrics), cùng một khuôn khổ mà nhóm ngôn ngữ học của WPML sử dụng cho các đợt đánh giá trang web của khách hàng dùng PTC đang diễn ra. Mỗi trang đã dịch được chấm điểm qua chín tiêu chí:

  • Ngữ pháp — có lỗi ngữ pháp nào không?
  • Ý nghĩa — ý nghĩa của bản gốc có được giữ nguyên không?
  • Độ tự nhiên — nó có nghe tự nhiên và đúng văn phong đối với người bản xứ không?
  • Giọng điệu — giọng điệu của bản gốc có được nắm bắt không?
  • Độ trang trọng — văn phong phù hợp có được sử dụng không, cả trong cách xưng hô với người đọc và trong các hình thức xưng hô ngữ pháp?
  • Thuật ngữ — thuật ngữ phù hợp có được sử dụng không?
  • Tính nhất quán — thuật ngữ có được áp dụng nhất quán trên toàn bộ trang không?
  • Viết hoa — các quy ước của ngôn ngữ đích có được tuân thủ không?
  • Bản địa hóa số, đơn vị và ngày tháng — các quy ước của ngôn ngữ đích có được tuân thủ không?

Mỗi tiêu chí được chấm điểm từ 1–10 bởi một nhà ngôn ngữ học là người bản xứ của ngôn ngữ đích. Điểm số cuối cùng cho mỗi trang là mức trung bình của chín tiêu chí, nhân với mười — tạo ra thang điểm 1–100 tương ứng với các mức chất lượng bằng ngôn ngữ dễ hiểu:

Điểm số Ý nghĩa
90–100 Rất tốt đến hoàn hảo — sẵn sàng xuất bản mà không cần rà soát
80–89 Tốt — sẵn sàng xuất bản trong hầu hết các ngữ cảnh
70–79 Chấp nhận được đến trung bình — có thể sử dụng nhưng có thể thấy rõ lỗi
60–69 Trung bình — cần chỉnh sửa trước khi xuất bản
50–59 Lỗi rõ ràng đối với người không phải bản xứ
Dưới 50 Các khiếm khuyết đủ nghiêm trọng để yêu cầu làm lại

Để dễ hình dung: mức trung bình được công bố cho bản dịch chung do người dịch nằm ở khoảng 76. Mức 77,7 của DeepL đặt nó ngay trên ranh giới đó. Mức 90,0 của PTC đặt nó ngay tại ranh giới của mức “rất tốt — sẵn sàng xuất bản mà không cần rà soát”.

Kích thước mẫu và cách chọn lọc

Để đánh giá DeepL, chúng tôi đã lấy 800 trang web ngẫu nhiên được dịch bằng DeepL trong 12 tháng qua, phân nhóm chúng theo tuổi của trang web, khối lượng nội dung và hoạt động dịch thuật, rồi lấy mẫu trên các nhóm. Sau đó, các nhà ngôn ngữ học của chúng tôi đã rà soát thủ công các trang chính của các trang web được lấy mẫu — tổng cộng 227 trang web, được đánh giá bằng tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý và tiếng Tây Ban Nha.

Điểm số của PTC đến từ một mẫu riêng biệt: 73 bài đánh giá trang web chính thức, được chấm điểm bởi cùng các nhà ngôn ngữ học sử dụng cùng phương pháp MQM được mô tả ở trên. Mẫu PTC nhỏ hơn mẫu DeepL vì mỗi phép đo PTC phản ánh một phiên bản PTC cụ thể và công cụ này tiếp tục phát triển — xem phần Chúng tôi chưa dừng lại bên dưới.

Theo từng ngôn ngữ: PTC chiến thắng ở mọi cặp

Các điểm số tổng hợp rất thú vị; bức tranh theo từng ngôn ngữ mới là thứ cho nhóm nội dung đa ngôn ngữ biết họ có thể mong đợi điều gì.

Điểm TQ theo ngôn ngữ

Biểu đồ hộp so sánh điểm TQ của PTC và DeepL trên tiếng Ả Rập, tiếng Đức, tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp và tiếng Ý. PTC cho thấy điểm trung vị nhất quán cao hơn và phân bố điểm chặt chẽ hơn trên tất cả các ngôn ngữ.
Điểm TQ theo ngôn ngữ — PTC và DeepL trên tiếng Ả Rập, tiếng Đức, tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp, tiếng Ý

PTC đạt điểm cao hơn DeepL trong mọi cặp ngôn ngữ mà chúng tôi đã thử nghiệm. Khoảng cách lớn nhất là ở tiếng Ả Rập (+22,4 điểm), nơi DeepL trong lịch sử có hiệu suất kém hơn và nơi khoản đầu tư của WPML vào chất lượng ngôn ngữ RTL (viết từ phải sang trái) thể hiện rõ ràng. Tiếng Đức (+11,5) và tiếng Pháp (+9,9) xếp tiếp theo. Khoảng cách hẹp nhất là ở tiếng Anh (+6,0 điểm) — và ngay cả ở đó, PTC cũng đưa trang từ mức “chấp nhận được, có thể thấy rõ lỗi” vào mức sẵn sàng xuất bản.

Phương sai cũng rất quan trọng. Phân bố của DeepL có phần đuôi dưới dài trong tiếng Ả Rập, với các trang riêng lẻ đạt điểm thấp hơn nhiều so với mức trung bình — những trang mà người dùng tiếng Đức hoặc tiếng Pháp sẽ coi là bị hỏng. Các phân bố của PTC chặt chẽ hơn và tập trung cao hơn, vì vậy một nhóm nội dung có thể lập kế hoạch xoay quanh một mức chất lượng dự kiến thay vì phải dự trù ngân sách cho các trường hợp ngoại lệ.

PTC cũng vượt trội hơn DeepL ở cả chín tiêu chí chất lượng mà chúng tôi chấm điểm: ngữ pháp, ý nghĩa, độ tự nhiên, giọng điệu, độ trang trọng, thuật ngữ, tính nhất quán, viết hoa và các quy ước bản địa. Những cải thiện lớn nhất nằm ở các tiêu chí quan trọng nhất đối với một người đọc trang trên một trang web thực tế — thuật ngữ (+1,5), ngữ pháp (+1,4), độ tự nhiên (+1,4) và bản địa hóa số/đơn vị/ngày tháng (+1,4). Không có tiêu chí nào mà DeepL theo kịp, và không có tiêu chí nào mà PTC chỉ nhỉnh hơn một chút.

Tỷ lệ lỗi: Bức tranh vận hành

Điểm số trung bình rất hữu ích; số lượng lỗi còn hữu ích hơn đối với bất kỳ ai đang điều hành một trang web thực tế. Những người rà soát bản dịch của chúng tôi đã ghi lại mọi vấn đề riêng biệt mà họ xác định được trên mỗi trang — ngữ pháp, ý nghĩa, thuật ngữ và tất cả những thứ khác.

Số lỗi trung bình trên mỗi trang

Biểu đồ thanh hiển thị số lỗi trung bình trên mỗi trang: DeepL ~1,27, PTC ~0,07, với PTC thấp hơn đáng kể so với DeepL.
Số lỗi trung bình trên mỗi trang — DeepL ~1,27, PTC ~0,07

DeepL tạo ra trung bình 1,27 lỗi trên mỗi trang. PTC tạo ra 0,07 — giảm khoảng 18 lần số lỗi trên mỗi trang trên cùng một nội dung nguồn.

Đối với một trang web 200 trang, điều đó tương đương với:

  • DeepL: ~254 lỗi cần tìm, quyết định và sửa trước khi xuất bản.
  • PTC: ~14 lỗi trên toàn bộ trang web.

Đó là sự khác biệt giữa dịch thuật AI như một bản nháp đầu tiên và dịch thuật AI như một quy trình làm việc. Dựa trên đánh giá của chúng tôi, DeepL là một bản nháp đầu tiên tốt — các phép đo của chúng tôi đã tìm thấy các vấn đề cần rà soát trên hầu hết các trang trước khi xuất bản. PTC, trên phép đo này, là một quy trình làm việc: số lượng lỗi đủ thấp để bước rà soát bởi con người trở thành tùy chọn cho hầu hết nội dung thay vì bắt buộc đối với tất cả.

Ý nghĩa thực sự của “Bản dịch tốt”

Các mô tả cấp độ của khuôn khổ MQM là một đối trọng hữu ích đối với ngôn ngữ tiếp thị xoay quanh dịch thuật AI. Một trang “9/10” không phải là một trang 90%; đó là một trang mà một người bản xứ, khi đọc cẩn thận, không tìm thấy bất cứ điều gì họ muốn thay đổi. Một trang “7/10” có thể chấp nhận được như hiện tại nhưng có thể thấy rõ sự không hoàn hảo. Một trang “5/10” là trang mà một người không phải bản xứ có thể phát hiện ra lỗi.

Mức trung bình của DeepL nằm ở mức 7 cao — chấp nhận được, nhưng có thể thấy rõ sự không hoàn hảo đối với một người đọc bản xứ cẩn thận. Mức trung bình của PTC nằm ở 90,0, ngay tại ranh giới của mức “rất tốt — sẵn sàng xuất bản mà không cần rà soát”. Đó là sự khác biệt về chất lượng mà những người rà soát bản dịch của chúng tôi đã đo lường. Nó tương ứng với một sự khác biệt thực tế: đầu ra của DeepL là một điểm khởi đầu yêu cầu rà soát bởi con người trước khi xuất bản; đầu ra của PTC trong hầu hết các trường hợp chính là ấn bản cuối cùng.

Tại sao WPML có thể tạo ra chất lượng này

Chúng tôi nhận thức được rằng “chúng tôi đã xây dựng công cụ AI của riêng mình” là một tuyên bố mà rất nhiều công ty đang đưa ra hiện nay. PTC đặc biệt vì hai lý do cụ thể.

Quy mô và rà soát liên tục. WPML phục vụ hơn 1,5 triệu trang web và đã làm như vậy trong hơn một thập kỷ. Nhóm ngôn ngữ học của WPML liên tục rà soát chất lượng dịch thuật của PTC — lấy mẫu đầu ra, chấm điểm bằng cùng khuôn khổ MQM được sử dụng trong nghiên cứu này và theo dõi các kiểu mẫu mà công cụ liên tục tạo ra kết quả chất lượng thấp hơn cho một thuật ngữ, cặp ngôn ngữ hoặc loại nội dung cụ thể.

Sự tập trung. PTC không phải là một dự án phụ tại WPML. Nó có một nhóm chuyên trách — các kỹ sư, chuyên gia MLOps và các nhà ngôn ngữ học. Khi các nhà ngôn ngữ học đánh dấu một kiểu mẫu lặp lại, nhóm kỹ thuật sẽ coi đó là một lỗi: mở rộng bảng thuật ngữ, điều chỉnh mô hình độ trang trọng, thêm một ngoại lệ, tung ra bản sửa lỗi. Vòng lặp này chạy liên tục, đó là lý do tại sao chất lượng của PTC đã cải thiện trong 12 tháng qua từ “tốt như bản dịch chung do người dịch” lên các con số trong nghiên cứu này.

Sự kết hợp — rà soát liên tục bởi con người ở quy mô có ý nghĩa, kết hợp với một nhóm phản hồi từng phát hiện như một yêu cầu kỹ thuật — là điều tạo ra các con số chất lượng ở trên. Đó không phải là kiến trúc mô hình; đó là mô hình vận hành.

Chúng tôi chưa dừng lại

90,0 đặt PTC ngay tại ranh giới của mức “rất tốt — sẵn sàng xuất bản mà không cần rà soát”. Chúng tôi hài lòng với kết quả đó. Chúng tôi không nghĩ đó là giới hạn cuối cùng.

Vòng lặp QA → kỹ thuật được mô tả ở trên vẫn đang chạy. Nhóm ngôn ngữ học của WPML tiếp tục phân tích các chỉnh sửa mà khách hàng thực hiện đối với đầu ra của PTC trên các trang web thực tế, xác định các kiểu mẫu mà những chỉnh sửa đó tiết lộ và nhóm kỹ thuật tung ra các bản sửa lỗi — mở rộng bảng thuật ngữ, điều chỉnh độ trang trọng, các tinh chỉnh cụ thể cho từng cặp ngôn ngữ. Chúng tôi kỳ vọng phép đo tiếp theo sẽ cao hơn phép đo này.

Ý nghĩa của điều này đối với quy trình làm việc của bạn

Quy trình làm việc nội dung đa ngôn ngữ thông thường là dịch → rà soát → xuất bản. Bước rà soát tồn tại vì mọi công cụ AI — và hầu hết người dịch — đều tạo ra tác phẩm cần một người thứ hai kiểm tra trước khi phát hành. Bước rà soát đó cũng là nơi tiêu tốn phần lớn chi phí và phần lớn độ trễ trong nội dung đa ngôn ngữ.

Dựa trên các phép đo của chúng tôi, với DeepL, bước rà soát là điều nên làm. Đánh giá của chúng tôi đã tìm thấy trung bình 1,27 lỗi trên mỗi trang; nếu những lỗi đó không được rà soát, người đọc có khả năng sẽ gặp phải chúng. Với PTC, bước rà soát là tùy chọn đối với hầu hết nội dung. Một số nhóm vẫn rà soát — đối với các trang quan trọng hoặc các ngành được quản lý chặt chẽ — nhưng quy trình làm việc mặc định trở thành dịch → xuất bản, với việc rà soát được dành riêng cho các trường hợp thực sự cần thiết.

Đây là sự khác biệt về mặt vận hành mà các con số mô tả. Nó không hề nhỏ.

Ý nghĩa của điều này đối với chi phí của bạn

Chi phí dịch thuật bao gồm hai phần: chi phí để tạo ra bản dịch và chi phí để rà soát nó. Cả hai đều phải được thanh toán trước khi nội dung được xuất bản.

Đối với hầu hết các ngữ cảnh chuyên nghiệp, việc rà soát bởi con người tốn vài xu cho mỗi từ — cho dù người rà soát tính phí theo từ, theo trang hay theo trang web, con số tính toán thường rơi vào khoảng đó. Dịch thuật hoàn toàn bởi con người (dịch, sau đó được rà soát bởi người thứ hai) thường tiêu tốn khoảng €0,10–€0,20 mỗi từ cho các cặp ngôn ngữ chính, với riêng phần rà soát nằm trong khoảng €0,04–€0,08.

Dưới đây là chi phí thực tế của mỗi quy trình làm việc theo các điều kiện đó.

Chỉ dịch thuật bởi con người — mức cơ sở. Khoảng €0,10–€0,20 mỗi từ. Cả hai bước đều do con người thực hiện.

DeepL (hoặc bất kỳ công cụ AI nào) cộng với rà soát bởi con người. AI xử lý bước dịch; một người vẫn phải rà soát mọi trang, vì với 1,27 lỗi trên mỗi trang, các lỗi sẽ đến tay khách hàng nếu không ai phát hiện ra chúng trước. Bước dịch về cơ bản là miễn phí; bước rà soát vẫn tốn €0,04–€0,08 mỗi từ. Tổng mức tiết kiệm so với chỉ dùng con người: khoảng 60%. Đây là lời quảng cáo tiêu chuẩn “AI giúp bạn tiết kiệm chi phí dịch thuật” — và điều đó là đúng — nhưng trần chi phí nằm ở bước rà soát mà chất lượng của DeepL vẫn yêu cầu.

PTC, không cần rà soát. PTC có giá €0,0012–€0,003 mỗi từ — 4 điểm dịch mỗi từ nhân với €0,30–€0,75 cho mỗi 1.000 điểm dịch tùy thuộc vào khối lượng, với 2.000 điểm dịch đầu tiên mỗi tháng miễn phí. (Xem bảng giá dịch tự động của WPML để biết bảng phân cấp đầy đủ.) Vì chất lượng được đo lường của PTC (điểm TQ 90,0, 0,07 lỗi trên mỗi trang, khoảng cách +12,3 điểm so với DeepL) đủ cao để bỏ qua bước rà soát trong hầu hết các trường hợp, chi phí rà soát giảm xuống bằng không. Tổng mức tiết kiệm so với chỉ dùng con người: khoảng 99%.

Đó không phải là một cải tiến nhỏ đối với quy trình làm việc AI cộng với rà soát. Đó là một cơ chế chi phí hoàn toàn khác.

Tóm tắt — Chi phí để xuất bản một từ đã dịch

Quy trình làm việc Dịch thuật Rà soát Tổng cộng Tiết kiệm so với con người
Dịch thuật hoàn toàn bởi con người €0,10–€0,20 bao gồm €0,10–€0,20
DeepL + rà soát bởi con người ~€0 €0,04–€0,08 €0,04–€0,08 ~60%
PTC, không rà soát €0,0012–€0,003 €0 €0,0012–€0,003 ~99%

Mức giá dịch thuật bởi con người là các ước tính điển hình trong ngành cho các cặp ngôn ngữ chính. Giá PTC được lấy từ mức giá công bố của WPML.


Một lưu ý về việc tự rà soát: khi chủ doanh nghiệp tự rà soát thay vì trả tiền cho người rà soát bản dịch, chi phí không phải là bằng không — nó chỉ ít được nhìn thấy hơn. Số giờ dành cho việc rà soát là số giờ không được dành cho phần còn lại của doanh nghiệp, và ở bất kỳ mức lương theo giờ hợp lý nào, chi phí ngầm định thường cao hơn so với mức phí mà một người rà soát thuê ngoài sẽ tính, chứ không thấp hơn. Mức tiết kiệm của PTC được áp dụng bất kể ai đang trả tiền cho bước rà soát hiện nay.

Điều này mở ra những gì. Khi chi phí dịch thuật là €0,10+ mỗi từ, bạn sẽ dịch một cách có chọn lọc — trang chủ, các danh mục sản phẩm hàng đầu, một số ít các bài viết blog có lưu lượng truy cập cao. Mọi thứ khác vẫn giữ nguyên ở ngôn ngữ nguồn vì bài toán chi phí không khả thi. Khi chi phí dịch thuật là €0,002 mỗi từ và tạo ra đầu ra tốt hơn so với bản dịch chung do người dịch, bài toán chi phí sẽ khả thi đối với nội dung mà trước đây không thể thực hiện được:

  • Dịch toàn bộ danh mục trong thương mại điện tử — mọi mô tả sản phẩm ngách, mọi biến thể.
  • Các cổng tài liệu hoàn chỉnh bằng mọi ngôn ngữ mà khách hàng có thể nói, không chỉ ba ngôn ngữ hàng đầu.
  • Cơ sở kiến thức, câu hỏi thường gặp hỗ trợ, kho lưu trữ blog — phần đuôi dài thúc đẩy tìm kiếm nhưng chưa bao giờ bù đắp được chi phí dịch thuật của nó.
  • Nội dung biên tập được bản địa hóa cho các nhà xuất bản hoạt động tại các thị trường nơi doanh thu trên mỗi trang từ khán giả không thể trang trải cho việc dịch thuật bởi con người.

Nội dung đa ngôn ngữ đã là một câu hỏi “chúng ta có thể đủ khả năng để dịch những gì” trong nhiều thập kỷ. Với PTC, câu hỏi trở thành “những gì đáng để dịch” — đó là một câu hỏi khác biệt và thú vị hơn.

Cách để có được chất lượng này trên trang web của riêng bạn

PTC là công cụ mặc định trong chế độ Dịch mọi thứ của WPML, đây là một cài đặt toàn cục duy nhất giúp dịch mọi trang trên trang web của bạn, một cách tự động, ở chế độ nền. Không có cấu hình nào cần quản lý cho từng trang.

Để có được chất lượng được đo lường trong nghiên cứu này, thiết lập duy nhất bạn cần ngoài việc bật Dịch mọi thứ là dành khoảng một phút để mô tả đối tượng và giọng điệu trang web của bạn trong cài đặt Dịch mọi thứ — ví dụ: “một công ty phần mềm hướng tới các nhà phát triển, giọng điệu trang trọng, thuật ngữ kỹ thuật được giữ nguyên bằng tiếng Anh”. PTC sử dụng mô tả đó để điều chỉnh các bản dịch phù hợp với tiếng nói thương hiệu của bạn.

Đó là toàn bộ quá trình thiết lập. Kết quả là những gì nghiên cứu này đã đo lường.

Lưu ý về những gì chúng tôi đã không làm

Chúng tôi đã không so sánh PTC với Google Translate, Azure Translator hoặc các dịch vụ dựa trên LLM thông qua API công khai của họ. Lý do: những công cụ đó thay đổi thường xuyên và một phép đo tại một thời điểm duy nhất sẽ trở nên lỗi thời trong vòng vài tháng. So sánh với DeepL là phép đo mà chúng tôi đã thực hiện vì DeepL là tiêu chuẩn được trích dẫn nhiều nhất cho dịch thuật AI cấp độ sản xuất, và vì DeepL là thứ mà hầu hết các đối thủ cạnh tranh của chúng tôi sử dụng bên trong.

Chúng tôi cũng không đo lường tốc độ, chi phí hoặc trải nghiệm của nhà phát triển trong nghiên cứu này — chỉ đo lường chất lượng. Những so sánh đó tồn tại trên trang tính năngcác trang so sánh của chúng tôi, và chúng kể câu chuyện của riêng mình.

Dùng thử

Nếu bạn điều hành một trang web WordPress đa ngôn ngữ và muốn xem đầu ra của PTC trên nội dung của riêng bạn, hãy cài đặt WPML, bật Dịch mọi thứ và so sánh kết quả với bất kỳ công cụ nào bạn đang sử dụng hiện nay. Sự khác biệt về chất lượng được mô tả ở đây là sự khác biệt về chất lượng mà bạn sẽ thấy.


Các câu hỏi về phương pháp hoặc yêu cầu dữ liệu: liên hệ với nhóm WPML.

Nghiên cứu được thực hiện bởi nhóm ngôn ngữ học WPML, tháng 4 năm 2026. Mẫu: 227 trang web được dịch bằng DeepL do các nhà ngôn ngữ học bản xứ rà soát, so sánh với 73 bài đánh giá trang web chính thức bằng PTC được chấm điểm với cùng phương pháp. Ngôn ngữ: tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Tây Ban Nha. Chấm điểm: Khuôn khổ Chất lượng Dịch thuật dựa trên MQM, 9 tiêu chí, 1–10 cho mỗi tiêu chí, lấy trung bình và quy đổi theo thang điểm 0–100.