WPML

WPML 的 Private Translation Cloud (PTC) 在 WPML 的内部翻译质量评估中获得 90.0 分(满分 100 分)。DeepL——被广泛认为是最强大的主流 AI 翻译引擎——得分为 77.7 分。PTC 的总分比 DeepL 高出 12.3 分,在我们的语言学家评分的九个质量维度中全部胜出,并且每页错误数量大约减少了 18 倍。

概览

指标 DeepL PTC 徽标 PTC
平均翻译质量分数(0–100) 77.7 90.0
每翻译页面的平均问题数 1.27 0.07
PTC 得分高于 DeepL 的质量维度 9 个(共 9 个)
PTC 得分高于 DeepL 的测试语言 6 个(共 6 个)(阿拉伯语、英语、法语、德语、意大利语、西班牙语)

我们为何进行此项研究

根据我们客户的反馈,DeepL 被广泛视为 WordPress 生态系统中 AI 翻译质量的基准。当客户询问他们是否可以在没有人工审核的情况下发布 AI 翻译的内容时,DeepL 通常是隐含的比较对象。

WPML 构建了自己的 AI 翻译引擎——Private Translation Cloud (PTC)——因为“足够好”还不够。PTC 是 WPML 翻译所有内容模式下的默认引擎,并为运行 WPML 的 150 万多个网站的大部分自动翻译提供支持。

我们希望对潜在客户每周都会问的一个问题给出一个可衡量的答案:PTC 与 DeepL 相比究竟如何?这项研究就是答案。上面的数字是核心结论;本文的其余部分将解释这些数字是如何产生的,以及它们对真实生产站点的意义。

我们测量了什么以及如何测量

我们使用基于 MQM(多维质量指标)的系统对翻译质量进行评分,这也是 WPML 语言学团队用于持续进行 PTC 客户站点审核的同一框架。每个翻译页面都在九个维度上进行评分:

  • 语法——是否存在语法错误?
  • 含义——是否保留了原文的含义?
  • 自然度——对母语人士来说听起来是否自然地道?
  • 语气——是否捕捉到了原文的语气?
  • 正式程度——在称呼读者和语法称谓形式上,是否使用了正确的语域?
  • 术语——是否使用了正确的术语?
  • 一致性——页面上的术语应用是否一致?
  • 大小写——是否遵循了目标语言的约定?
  • 数字、单位和日期本地化——是否遵循了目标语言的约定?

每个维度由一位目标语言为母语的人类语言学家打分,分值为 1–10。每页的最终得分为九个维度的平均值乘以 10——得出 1–100 的分制,对应以下通俗易懂的质量等级:

分数 含义
90–100 非常好到完美——无需审核即可发布
80–89 良好——在大多数情况下可直接发布
70–79 尚可到中等——可用,但存在明显错误
60–69 中等——发布前需要润色
50–59 非母语人士也能明显看出错误
低于 50 缺陷严重,需要返工

作为背景参考:公布的常规人工翻译平均得分在 76 左右。DeepL 的 77.7 分刚好略高于该基准线。PTC 的 90.0 分则正好处于“非常好——无需审核即可发布”这一等级的边界。

样本量与选择

为了评估 DeepL,我们随机抽取了过去 12 个月中使用了 DeepL 翻译的 800 个网站,按网站年龄、内容量和翻译活跃度对它们进行分组,并在各个组别中进行抽样。然后,我们的语言学家手动审核了抽样网站的主要页面——总计 227 个网页,评估语言包括阿拉伯语、英语、法语、德语、意大利语和西班牙语

PTC 的得分来自一个独立的样本:73 个生产站点审核,由同一批语言学家使用上述相同的 MQM 方法进行评分。PTC 样本量小于 DeepL 样本量,因为每次 PTC 测量都反映了一个特定的 PTC 版本,而该引擎仍在不断演进——请参阅下文的我们并未止步于此部分。

按语言划分:PTC 在所有语言对中均胜出

总体得分固然有趣;但按语言划分的具体情况才能告诉多语言内容团队应该有怎样的预期。

各语言的 TQ 得分

箱形图比较了 PTC 和 DeepL 在阿拉伯语、德语、英语、西班牙语、法语和意大利语中的 TQ 得分。PTC 在所有语言中均显示出始终较高的一般分数和更集中的分数分布。
各语言的 TQ 得分——PTC 与 DeepL 在阿拉伯语、德语、英语、西班牙语、法语、意大利语中的对比

在我们测试的每个语言对中,PTC 的得分均高于 DeepL。差距最大的是阿拉伯语(+22.4 分),DeepL 在这方面历来表现不佳,而 WPML 在 RTL 语言质量上的投入则显而易见。其次是德语(+11.5)和法语(+9.9)。差距最小的是英语(+6.0 分)——但即使在这里,PTC 也将页面从“尚可,存在明显瑕疵”提升到了可直接发布的等级。

差异性也很重要。DeepL 在阿拉伯语中的分布有一条很长的下尾,个别页面的得分远低于平均水平——德语或法语用户会认为这些页面是损坏的。PTC 的分布更集中且中心偏高,因此内容团队可以围绕预期的质量等级进行规划,而无需为异常值预留预算。

PTC 在我们评分的九个质量维度上也均优于 DeepL:语法、含义、自然度、语气、正式程度、术语、一致性、大小写以及区域设置约定。最大的提升在于对人类阅读真实网站页面最关键的维度——术语(+1.5)、语法(+1.4)、自然度(+1.4)以及数字/单位/日期本地化(+1.4)。没有任何一个维度 DeepL 能够跟上,也没有任何一个维度 PTC 只是险胜。

错误率:实际运营情况

平均得分很有用;但对于任何运营真实网站的人来说,错误计数更有用。我们的审核员记录了他们在每个页面上发现的每一个具体问题——语法、含义、术语等等。

每页平均问题数

柱状图显示每页平均问题数:DeepL 约 1.27,PTC 约 0.07,PTC 显著低于 DeepL。
每页平均问题数——DeepL 约 1.27,PTC 约 0.07

DeepL 平均每页产生 1.27 个问题。PTC 为 0.07——在相同源内容上,每页错误数量大约降低了 18 倍。

对于一个 200 页的网站,这大致意味着:

  • DeepL:在发布前需要发现、决定并修复约 254 个问题。
  • PTC:整个网站大约只有 14 个问题。

这就是将 AI 翻译作为初稿与将 AI 翻译作为工作流程之间的区别。根据我们的评估,DeepL 是一份出色的初稿——我们的测量发现,大多数页面在发布前都存在需要审核的问题。而在此项测量中,PTC 是一种工作流程:错误计数足够低,以至于人工审核步骤对于大多数内容来说变成了可选操作,而不是所有内容的强制要求。

“优秀的翻译”到底意味着什么

MQM 框架的等级描述是对围绕 AI 翻译的营销话术的一种有效制衡。一个“9/10”的页面不是一个 90% 完美的页面;它是一个让母语人士仔细阅读后,找不到任何想要修改之处的页面。一个“7/10”的页面按原样可接受,但存在明显瑕疵。一个“5/10”的页面则是非母语人士也能发现错误的页面。

DeepL 的平均分在 7 分的高段——可以接受,但对于仔细阅读的母语读者来说,瑕疵显而易见。PTC 的平均分为 90.0,正好处于“非常好——无需审核即可发布”的边界。这就是我们的审核员测量出的质量差异。它映射了一个真实的区别:DeepL 的输出是一个在发布前需要人工审核的起点;而 PTC 的输出在大多数情况下就是发布内容本身。

为什么 WPML 能够提供这种质量

我们知道,“我们构建了自己的 AI 引擎”是目前许多公司都在宣称的。PTC 的与众不同之处在于以下两个具体原因。

规模与持续审核。WPML 为超过 150 万个网站提供服务,并且已经持续了十多年。WPML 的语言学团队不断审查 PTC 的翻译质量——对输出进行抽样,使用本研究中相同的 MQM 框架对其进行评分,并观察引擎在特定术语、语言对或内容类型中始终产生较低质量结果的模式。

专注。PTC 在 WPML 中不是一个附带项目。它有一个专门的团队——工程师、MLOps(机器学习运维)以及人类语言学家。当语言学家标记出一个反复出现的模式时,工程团队会将其视为一个错误来处理:扩展术语表、调整正式程度模型、添加例外规则、发布修复。这个循环持续运行,这就是为什么 PTC 的质量在过去 12 个月中从“与普通人工翻译一样好”提升到了本研究中的数字。

这种组合——在有意义的规模上进行持续的人工审核,加上一个将每个发现视为工程工单来响应的团队——正是产生上述质量数字的原因。这不仅是模型架构的功劳;更是运营模式的成果。

我们并未止步于此

90.0 分使 PTC 正好处于“非常好——无需审核即可发布”的边界。我们对这个结果很满意。但我们并不认为这就是天花板。

上面描述的 QA → 工程循环仍在运行。WPML 的语言学团队继续分析客户在真实网站上对 PTC 输出所做的编辑,识别这些编辑所揭示的模式,然后工程团队发布修复——术语表扩展、正式程度调整、特定于语言对的微调。我们预计下一次的测量结果会比这次更高。

这对您的工作流程意味着什么

传统的多语言内容工作流程是翻译 → 审核 → 发布。之所以有审核步骤,是因为每个 AI 引擎——以及大多数人工译员——所产生的工作成果在发布前都需要第二双眼睛来把关。这个审核步骤也是多语言内容中大部分成本和延迟的所在。

根据我们的测量,使用 DeepL 时,建议进行审核。我们的评估发现平均每页有 1.27 个问题;如果不加审核,读者很可能会遇到这些问题。使用 PTC,审核步骤对于大多数内容来说是可选的。一些团队仍然会进行审核——针对高风险页面或受监管的行业——但默认的工作流程变成了翻译 → 发布,仅对真正需要的情况保留审核。

这就是这些数字所描述的实际运营差异。这种差异不容小觑。

这对您的成本意味着什么

翻译成本包含两方面:生成翻译的成本和审核翻译的成本。这两项费用都必须在内容上线前支付。

在大多数专业背景下,人工审核的成本为每个字几美分——无论审核员是按字、按页还是按网站收费,计算结果大致都在这个范围。对于主要语言对,全人工翻译(翻译,然后由第二个人工审核)通常在每字 €0.10–€0.20 左右,其中仅审核部分的费用就在 €0.04–€0.08 之间。

以下是每种工作流程在这些条件下的实际成本。

纯人工翻译——基准线。大约每字 €0.10–€0.20。两个步骤均由人工完成。

DeepL(或任何 AI 引擎)加人工审核。AI 负责翻译步骤;但仍然需要人工审核每一页,因为在每页 1.27 个问题的情况下,如果没有人提前发现,这些问题就会呈现给客户。翻译步骤基本是免费的;审核步骤的成本仍为每字 €0.04–€0.08。与纯人工翻译相比的总节省:约 60%。这是标准的“AI 为您节省翻译资金”的宣传——这也是事实——但成本上限卡在 DeepL 质量仍需要的审核步骤上。

PTC,无需审核。PTC 的成本为每字 €0.0012–€0.003——每字 4 积分乘以每 1,000 积分 €0.30–€0.75(取决于数量),每月前 2,000 积分免费。(请参阅 WPML 的自动翻译定价获取完整层级表。)由于 PTC 的实测质量(90.0 TQ 得分,每页 0.07 个问题,比 DeepL 高出 12.3 分)足以在大多数情况下跳过审核步骤,因此审核成本降至零。与纯人工翻译相比的总节省:约 99%。

这不仅仅是对 AI 加审核工作流程的微小改进。这是一种截然不同的成本体系。

概览——发布一个翻译字的成本

工作流程 翻译 审核 总计 对比人工的节省
全人工翻译 €0.10–€0.20 包含在内 €0.10–€0.20
DeepL + 人工审核 ~€0 €0.04–€0.08 €0.04–€0.08 ~60%
PTC,无需审核 €0.0012–€0.003 €0 €0.0012–€0.003 ~99%

人工翻译费率是主要语言对的典型行业估计值。PTC 定价来自 WPML 的公布费率。


关于自行审核的说明:当企业主自己进行审核而不是花钱请审核员时,成本并非为零——它只是不那么明显。花在审核上的时间就是没有花在业务其他方面的时间,并且按照任何合理的小时费率计算,隐含成本通常高于外包审核员的收费,而不是更低。无论今天由谁来承担审核步骤的成本,PTC 的节省都同样适用。

这带来了哪些可能性。当翻译成本达到每字 €0.10+ 时,您会有选择性地进行翻译——主页、热门产品类别、少数高流量的博客文章。其他所有内容都保留在源语言中,因为在经济上不划算。当翻译成本为每字 €0.002 并且生成的输出优于典型的人工翻译时,对于以前不可行的内容,在经济上也就变得合理了:

  • 电子商务中的完整目录翻译——每个长尾产品描述,每个变体。
  • 涵盖客户可能使用的每种语言的完整文档门户,而不仅仅是前三种语言。
  • 知识库、支持常见问题解答、博客存档——这些驱动搜索但其翻译成本从未被证明是合理的的长尾内容。
  • 为在单页受众收入无法覆盖人工翻译成本的市场中运营的发布商提供本地化的编辑内容。

几十年来,多语言内容一直是一个“我们能负担得起翻译什么”的问题。有了 PTC,问题变成了“什么值得翻译”——这是一个截然不同且更有趣的问题。

如何在您自己的网站上获得这种质量

PTC 是 WPML 翻译所有内容模式下的默认引擎,该模式是一个单一的全局设置,可在后台自动翻译您网站上的每个页面。无需管理每页的配置。

要获得本研究中测量的质量,除了开启翻译所有内容之外,您唯一需要进行的设置是花大约一分钟的时间在翻译所有内容设置中描述您网站的受众和语气——例如,“一家面向开发人员的软件公司,语气正式,技术术语保留为英语”。PTC 会使用该描述使翻译与您的品牌声音保持一致。

这就是全部的设置过程。其结果就是本研究所测量的质量。

关于我们未做事项的说明

我们没有将 PTC 与 Google 翻译、Azure Translator 或通过其公共 API 提供的基于大语言模型(LLM)的服务进行比较。原因在于:这些引擎变化频繁,单次测量的结果在几个月内就会过时。我们之所以进行 DeepL 比较,是因为 DeepL 是生产级 AI 翻译中最常被引用的基准,并且 DeepL 也是我们大多数竞争对手在后台使用的引擎。

在这项研究中,我们也没有测量速度、成本或开发者体验——仅测量了质量。这些比较在我们的功能页面和我们的比较页面上都有,它们讲述了各自的故事。

尝试一下

如果您运营着一个多语言 WordPress 网站,并希望看到 PTC 在您自己内容上的输出,请安装 WPML,启用翻译所有内容,并将结果与您当前使用的任何工具进行比较。这里描述的质量差异就是您应该期望看到的质量差异。


方法论问题或数据请求:请联系 WPML 团队。

本研究由 WPML 语言学团队于 2026 年 4 月进行。样本:由母语语言学家审核的 227 个使用 DeepL 翻译的网页,与使用相同方法评分的 73 个 PTC 生产站点审核结果进行比较。语言:阿拉伯语、英语、法语、德语、意大利语、西班牙语。评分:基于 MQM 的翻译质量框架,9 个维度,每个维度 1–10 分,取平均值并换算为 0–100 的结果。