WPML의 Private Translation Cloud(PTC)는 WPML의 내부 번역 품질 평가에서 100점 만점에 90.0점을 받았습니다. 가장 강력한 주류 AI 번역 엔진으로 널리 알려진 DeepL은 77.7점을 받았습니다. PTC는 전체적으로 DeepL보다 12.3점 더 높은 점수를 받았으며, WPML 언어학자가 평가한 9가지 품질 기준 모두에서 우위를 차지했고, 페이지당 오류 발생률을 약 18배 감소시킵니다.
한눈에 보기
| 측정 항목 | DeepL |
|
|---|---|---|
| 평균 번역 품질 점수(0–100) | 77.7 | 90.0 |
| 번역된 페이지당 평균 문제 수 | 1.27 | 0.07 |
| PTC가 DeepL보다 높은 점수를 받은 품질 기준 | — | 9개 중 9개 |
| PTC가 DeepL보다 높은 점수를 받은 테스트 언어 | — | 6개 중 6개(아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어) |
이 연구를 진행한 이유
고객 피드백에 따르면 DeepL은 WordPress 생태계에서 AI 번역 품질의 기준으로 널리 인식되고 있습니다. 고객이 사람의 검토 없이 AI로 번역된 콘텐츠를 게시할 수 있는지 물어볼 때, 보통 DeepL이 암묵적인 비교 대상이 됩니다.
WPML은 “적당히 좋은” 수준에 만족하지 않았기 때문에 자체 AI 번역 엔진인 Private Translation Cloud(PTC)를 구축했습니다. PTC는 WPML의 모든 항목 번역 모드에 내장된 기본 엔진이며, WPML을 실행하는 150만+ 개의 사이트에서 대부분의 자동 번역을 처리합니다.
잠재 고객이 매주 묻는 질문인 PTC는 실제로 DeepL과 비교하면 어떻습니까?에 대해 측정 가능한 답변을 제공하고 싶었습니다. 이 연구가 바로 그 답변입니다. 위의 수치는 핵심 요약이며, 이 글의 나머지 부분에서는 이러한 수치가 어떻게 도출되었고 실제 운영 사이트에서 어떤 의미를 갖는지 설명합니다.
측정 항목 및 방법
WPML 언어학 팀이 진행 중인 PTC 고객사 사이트 검토에 사용하는 것과 동일한 프레임워크인 MQM(다차원 품질 지표)을 기반으로 한 시스템을 사용하여 번역 품질을 평가했습니다. 번역된 각 페이지는 다음 9가지 기준에 따라 평가됩니다.
- 문법 — 문법적인 오류가 있었습니까?
- 의미 — 원본의 의미가 보존되었습니까?
- 자연스러움 — 원어민이 읽기에 자연스럽고 관용적인 표현입니까?
- 어조 — 원본의 어조가 잘 반영되었습니까?
- 격식 — 독자를 부를 때와 문법적인 경어법 모두에서 올바른 어투가 사용되었습니까?
- 용어 — 올바른 용어가 사용되었습니까?
- 일관성 — 페이지 전체에 용어가 일관되게 적용되었습니까?
- 대소문자 표기 — 대상 언어의 표기 규칙을 따랐습니까?
- 숫자, 단위 및 날짜 현지화 — 대상 언어의 표기 규칙을 따랐습니까?
각 기준은 대상 언어의 원어민인 언어학자가 1–10점으로 평가합니다. 페이지당 최종 점수는 9가지 기준의 평균에 10을 곱하여 산출되며, 이를 통해 1–100점 척도로 변환하여 이해하기 쉬운 품질 등급에 매핑합니다.
| 점수 | 의미 |
|---|---|
| 90–100 | 매우 우수함에서 완벽함 — 검토 없이 바로 게시할 수 있음 |
| 80–89 | 우수함 — 대부분의 상황에서 바로 게시할 수 있음 |
| 70–79 | 허용 가능함에서 보통 — 사용할 수 있지만 오류가 눈에 띔 |
| 60–69 | 보통 — 게시하기 전에 수정이 필요함 |
| 50–59 | 비원어민도 알아볼 수 있는 명백한 오류가 있음 |
| 50 미만 | 재작업이 필요할 만큼 심각한 결함이 있음 |
참고로, 일반적인 사람 번역의 발표된 평균 점수는 약 76점입니다. DeepL의 77.7점은 그 기준선을 약간 넘는 수준입니다. PTC의 90.0점은 “매우 우수함 — 검토 없이 바로 게시할 수 있음” 등급의 경계에 정확히 위치합니다.
표본 크기 및 선정
DeepL을 평가하기 위해 지난 12개월 동안 DeepL로 번역된 800개의 무작위 사이트를 선정하여 사이트 연령, 콘텐츠 양, 번역 활동에 따라 분류하고 각 분류에서 표본을 추출했습니다. 그런 다음 언어학자가 표본 사이트의 주요 페이지를 수동으로 검토했습니다. 총 227개의 웹페이지를 아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어로 평가했습니다.
PTC의 점수는 별도의 표본에서 도출되었습니다. 위에서 설명한 것과 동일한 MQM 방법론을 사용하여 동일한 언어학자가 평가한 73건의 운영 사이트 검토 결과입니다. 각 PTC 측정값은 특정 PTC 버전을 반영하고 엔진이 계속 발전하고 있기 때문에 PTC 표본은 DeepL 표본보다 작습니다. 아래의 아직 끝나지 않았습니다 섹션을 참조하세요.
언어별 결과: 모든 언어 쌍에서 PTC 우세
종합 점수도 흥미롭지만, 다국어 콘텐츠 팀이 실제로 기대할 수 있는 결과를 보여주는 것은 언어별 결과입니다.
언어별 번역 품질(TQ) 점수

PTC는 테스트한 모든 언어 쌍에서 DeepL보다 높은 점수를 받았습니다. 가장 격차가 큰 언어는 아랍어(+22.4점)로, DeepL이 역사적으로 부진했던 반면 WPML이 RTL(우측에서 좌측으로 읽는) 언어 품질에 투자한 결과가 분명하게 나타났습니다. 독일어(+11.5점)와 프랑스어(+9.9점)가 그 뒤를 이었습니다. 격차가 가장 작은 언어는 영어(+6.0점)였지만, 이 경우에도 PTC는 페이지를 “허용 가능하지만 눈에 띄게 불완전함” 수준에서 바로 게시할 수 있는 등급으로 끌어올렸습니다.
분산도 중요합니다. DeepL의 분포는 아랍어에서 하위 꼬리가 길게 나타나며, 개별 페이지의 점수가 평균을 훨씬 밑돌아 독일어나 프랑스어 사용자라면 문제가 있다고 여길 만한 페이지도 있습니다. PTC의 분포는 더 좁고 중심이 높게 형성되어 있어, 콘텐츠 팀은 예외적인 상황에 대비해 예산을 책정하는 대신 예상되는 품질 등급을 중심으로 계획을 세울 수 있습니다.
또한 PTC는 문법, 의미, 자연스러움, 어조, 격식, 용어, 일관성, 대소문자 표기 및 로캘 규칙 등 평가 대상인 9가지 품질 기준 모두에서 DeepL보다 우수한 성과를 보였습니다. 실제 웹사이트에서 페이지를 읽는 사람에게 가장 중요한 기준인 용어(+1.5), 문법(+1.4), 자연스러움(+1.4), 숫자/단위/날짜 현지화(+1.4)에서 가장 큰 차이를 보였습니다. DeepL이 비슷한 수준을 유지한 기준은 없었으며, PTC가 근소한 차이로 앞선 기준도 없었습니다.
오류 발생률: 운영 관점
평균 점수도 유용하지만, 실제 사이트를 운영하는 사람에게는 오류 발생 건수가 더 유용합니다. 검토자는 문법, 의미, 용어 등 각 페이지에서 식별한 모든 개별 문제를 기록했습니다.
페이지당 평균 문제 수

DeepL은 페이지당 평균 1.27건의 문제를 발생시킵니다. PTC는 0.07건으로, 동일한 원본 콘텐츠에서 페이지당 오류가 약 18배 감소했습니다.
200페이지 규모의 사이트의 경우, 이는 대략 다음과 같습니다.
- DeepL: 게시하기 전에 찾아내서 결정하고 수정해야 할 문제가 약 254건입니다.
- PTC: 사이트 전체에 걸쳐 문제가 약 14건입니다.
이것이 바로 초안으로서의 AI 번역과 워크플로로서의 AI 번역의 차이입니다. 평가에 따르면 DeepL은 훌륭한 초안입니다. 측정 결과 게시하기 전에 대부분의 페이지에서 검토해야 할 문제가 발견되었습니다. 반면 PTC는 이 측정 기준에서 워크플로 역할을 합니다. 즉, 오류 건수가 충분히 적어 사람의 검토 단계가 모든 콘텐츠에 필수적인 것이 아니라 대부분의 콘텐츠에서 선택 사항이 됩니다.
“좋은 번역”의 실제 의미
MQM 프레임워크의 등급 설명은 AI 번역을 둘러싼 마케팅 용어에 대한 유용한 균형추 역할을 합니다. “10점 만점에 9점”인 페이지는 90%만 완성된 페이지가 아니라, 원어민이 주의 깊게 읽어도 수정하고 싶은 부분을 찾을 수 없는 페이지를 의미합니다. “10점 만점에 7점”인 페이지는 있는 그대로 허용할 수는 있지만 눈에 띄게 불완전합니다. “10점 만점에 5점”인 페이지는 비원어민도 오류를 발견할 수 있는 수준입니다.
DeepL의 평균은 7점대 후반으로, 허용할 수는 있지만 주의 깊은 원어민 독자에게는 눈에 띄게 불완전합니다. PTC의 평균은 90.0으로 “매우 우수함 — 검토 없이 바로 게시할 수 있음”의 경계에 정확히 위치합니다. 이것이 바로 검토자가 측정한 품질의 차이입니다. 이는 실제적인 차이로 이어집니다. DeepL의 결과물은 게시하기 전에 사람의 검토가 필요한 출발점인 반면, PTC의 결과물은 대부분의 경우 바로 게시할 수 있는 완성본입니다.
WPML이 이러한 품질을 제공할 수 있는 이유
현재 많은 기업이 “자체 AI 엔진을 구축했다”고 주장하고 있다는 것을 잘 알고 있습니다. 하지만 PTC는 두 가지 특별한 이유로 남다릅니다.
규모와 지속적인 검토. WPML은 10년 이상 150만+ 개의 사이트에 서비스를 제공해 왔습니다. WPML 언어학 팀은 결과물을 샘플링하고 이 연구에 사용된 것과 동일한 MQM 프레임워크로 평가하며, 특정 용어, 언어 쌍 또는 콘텐츠 유형에 대해 엔진이 지속적으로 낮은 품질의 결과를 생성하는 패턴이 있는지 관찰하는 등 PTC의 번역 품질을 지속적으로 검토합니다.
집중. PTC는 WPML의 부수적인 프로젝트가 아닙니다. 엔지니어, MLOps 및 언어학자로 구성된 전담 팀이 있습니다. 언어학자가 반복되는 패턴을 신고하면 엔지니어링 팀은 이를 버그로 취급하여 용어집을 확장하고, 격식 모델을 조정하고, 예외를 추가하고, 수정 사항을 배포합니다. 이 주기가 지속적으로 실행되기 때문에 PTC의 품질이 지난 12개월 동안 “평균적인 사람 번역 수준”에서 이 연구의 수치로 향상될 수 있었습니다.
의미 있는 규모의 지속적인 사람의 검토와 각 발견 사항을 엔지니어링 티켓으로 처리하여 대응하는 팀의 결합이 바로 위와 같은 품질 수치를 만들어냅니다. 이는 모델 아키텍처가 아니라 운영 모델의 결과입니다.
아직 끝나지 않았습니다
90.0점은 PTC를 “매우 우수함 — 검토 없이 바로 게시할 수 있음”의 경계에 올려놓았습니다. 이 결과에 만족하지만, 이것이 한계라고 생각하지는 않습니다.
위에서 설명한 QA → 엔지니어링 주기는 여전히 실행 중입니다. WPML 언어학 팀은 실제 사이트에서 고객이 PTC의 결과물에 적용한 수정 사항을 계속 분석하고 이러한 수정 사항이 나타내는 패턴을 식별하며, 엔지니어링 팀은 용어집 확장, 격식 조정, 언어 쌍별 미세 조정 등의 수정 사항을 배포합니다. 다음 측정에서는 이보다 더 높은 수치가 나올 것으로 기대합니다.
워크플로에 미치는 영향
기존의 다국어 콘텐츠 워크플로는 번역 → 검토 → 게시 순이었습니다. 모든 AI 엔진과 대부분의 사람 번역가는 배포하기 전에 다른 사람의 확인이 필요한 결과물을 생성하기 때문에 검토 단계가 존재합니다. 이 검토 단계는 다국어 콘텐츠 제작에서 비용과 지연이 가장 많이 발생하는 부분이기도 합니다.
측정 결과에 따르면 DeepL을 사용할 때는 검토 단계를 거치는 것이 좋습니다. 평가 결과 페이지당 평균 1.27건의 문제가 발견되었으며, 이를 검토하지 않으면 독자가 문제를 발견할 가능성이 높습니다. PTC를 사용하면 대부분의 콘텐츠에서 검토 단계가 선택 사항이 됩니다. 중요한 페이지나 규제가 엄격한 산업의 경우 일부 팀은 여전히 검토를 진행하지만, 기본 워크플로는 번역 → 게시가 되며, 실제로 필요한 경우에만 검토를 진행합니다.
이것이 바로 수치가 설명하는 운영상의 차이입니다. 결코 작은 차이가 아닙니다.
비용에 미치는 영향
번역 비용은 번역을 생성하는 비용과 이를 검토하는 비용 두 가지로 나뉩니다. 두 가지 모두 콘텐츠가 게시되기 전에 지불해야 합니다.
대부분의 전문적인 환경에서 사람의 검토 비용은 단어당 몇 센트입니다. 검토자가 단어당, 페이지당 또는 사이트당 요금을 청구하든 대략적인 계산은 이와 같습니다. 주요 언어 쌍의 경우 전체 사람 번역(번역 후 다른 사람이 검토)은 일반적으로 단어당 €0.10–€0.20 정도이며, 검토 부분만 €0.04–€0.08 범위입니다.
각 워크플로에 실제로 소요되는 비용은 다음과 같습니다.
사람 번역만 진행 — 기준선. 단어당 약 €0.10–€0.20입니다. 두 단계 모두 사람이 수행합니다.
DeepL(또는 모든 AI 엔진)과 사람의 검토. 번역 단계는 AI가 처리하지만, 페이지당 1.27건의 문제가 발생하므로 아무도 발견하지 못하면 고객에게 문제가 노출될 수 있기 때문에 여전히 사람이 모든 페이지를 검토해야 합니다. 번역 단계는 사실상 무료이지만 검토 단계는 여전히 단어당 €0.04–€0.08의 비용이 듭니다. 사람만 진행하는 경우 대비 총 절감액: 약 60%. 이것이 일반적인 “AI로 번역 비용을 절감할 수 있다”는 홍보 문구이며 사실이기도 하지만, DeepL의 품질 때문에 여전히 필요한 검토 단계에서 비용 한계에 부딪히게 됩니다.
PTC, 검토 불필요. PTC의 비용은 단어당 €0.0012–€0.003입니다. 단어당 4크레딧에 수량에 따라 1,000크레딧당 €0.30–€0.75를 곱한 금액이며, 매월 첫 2,000크레딧은 무료로 제공됩니다. (전체 요금표는 WPML 자동 번역 가격을 참조하세요.) PTC의 측정된 품질(TQ 점수 90.0점, 페이지당 문제 0.07건, DeepL 대비 +12.3점 격차)은 대부분의 경우 검토 단계를 건너뛸 수 있을 만큼 높기 때문에 검토 비용이 0원이 됩니다. 사람만 진행하는 경우 대비 총 절감액: 약 99%.
이는 AI와 검토를 결합한 워크플로의 미미한 개선이 아닙니다. 완전히 다른 비용 체계입니다.
한눈에 보기 — 번역된 단어 배포 비용
| 워크플로 | 번역 | 검토 | 합계 | 사람 대비 절감액 |
|---|---|---|---|---|
| 전체 사람 번역 | €0.10–€0.20 | 포함됨 | €0.10–€0.20 | — |
| DeepL + 사람 검토 | ~€0 | €0.04–€0.08 | €0.04–€0.08 | ~60% |
| PTC, 검토 없음 | €0.0012–€0.003 | €0 | €0.0012–€0.003 | ~99% |
사람 번역 요금은 주요 언어 쌍에 대한 일반적인 업계 예상치입니다. PTC 가격은 WPML의 발표된 요금을 기준으로 합니다.
직접 검토하는 경우에 대한 참고 사항: 비즈니스 소유자가 검토자에게 비용을 지불하지 않고 직접 검토하는 경우 비용이 0원이 되는 것이 아니라 단지 눈에 덜 띌 뿐입니다. 검토에 소비한 시간은 비즈니스의 다른 부분에 투자하지 못한 시간이며, 합리적인 시간당 요율을 적용하면 암묵적인 비용은 일반적으로 외주 검토자가 청구하는 금액보다 낮지 않고 오히려 더 높습니다. PTC의 절감 효과는 현재 누가 검토 단계의 비용을 지불하고 있는지와 관계없이 적용됩니다.
이로 인해 열리는 가능성. 번역 비용이 단어당 €0.10 이상일 때는 홈페이지, 주요 제품 카테고리, 트래픽이 많은 소수의 블로그 게시물 등 선택적으로 번역하게 됩니다. 타산이 맞지 않기 때문에 그 외의 모든 콘텐츠는 원본 언어로 유지됩니다. 번역 비용이 단어당 €0.002이고 일반적인 사람 번역보다 더 나은 결과물을 생성할 경우, 이전에는 불가능했던 콘텐츠에서도 타산이 맞게 됩니다.
- 전자상거래의 전체 카탈로그 번역 — 모든 롱테일 제품 설명 및 모든 변형 제품.
- 상위 3개 언어뿐만 아니라 고객이 사용하는 모든 언어로 된 전체 문서 포털.
- 지식 기반, 지원 FAQ, 블로그 아카이브 — 검색을 유도하지만 번역 비용을 정당화할 수 없었던 롱테일 콘텐츠.
- 페이지당 독자 수익으로 사람 번역 비용을 충당할 수 없었던 시장에서 운영되는 퍼블리셔를 위한 현지화된 편집 콘텐츠.
다국어 콘텐츠는 수십 년 동안 “우리가 번역할 여력이 있는가”라는 문제였습니다. PTC를 통해 이 질문은 “무엇을 번역할 가치가 있는가”로 바뀌며, 이는 완전히 다르고 더 흥미로운 문제입니다.
내 사이트에서 이러한 품질을 얻는 방법
PTC는 WPML의 모든 항목 번역 모드의 기본 엔진입니다. 이 모드는 사이트의 모든 페이지를 백그라운드에서 자동으로 번역하는 단일 전역 설정입니다. 관리해야 할 페이지별 설정이 없습니다.
이 연구에서 측정된 품질을 얻으려면 모든 항목 번역을 켜는 것 외에 모든 항목 번역 설정에서 사이트의 대상 고객과 어조를 설명하는 데 약 1분 정도만 투자하면 됩니다. 예를 들어 “개발자를 대상으로 하는 소프트웨어 회사, 격식 있는 어조, 영어로 보존된 기술 용어”와 같이 작성합니다. PTC는 이 설명을 사용하여 번역을 브랜드의 목소리에 맞게 조정합니다.
이것이 설정의 전부입니다. 그 결과가 바로 이 연구에서 측정한 내용입니다.
수행하지 않은 작업에 대한 참고 사항
공개 API를 통해 PTC를 Google 번역, Azure 번역기 또는 LLM 기반 서비스와 비교하지는 않았습니다. 그 이유는 이러한 엔진은 자주 변경되며 단일 시점의 측정은 몇 달 내에 무의미해지기 때문입니다. DeepL이 프로덕션급 AI 번역의 기준으로 가장 많이 인용되고, 대부분의 경쟁업체가 내부적으로 DeepL을 사용하기 때문에 DeepL과 비교를 진행했습니다.
또한 이 연구에서는 속도, 비용 또는 개발자 경험을 측정하지 않고 오직 품질만 측정했습니다. 이러한 비교는 WPML의 기능 페이지와 비교 페이지에 있으며, 각각 고유한 정보를 제공합니다.
직접 사용해 보기
다국어 WordPress 사이트를 운영 중이고 내 콘텐츠에서 PTC의 결과물을 확인하고 싶다면 WPML을 설치하고 모든 항목 번역을 활성화한 다음 그 결과를 현재 사용 중인 번역과 비교해 보세요. 여기에 설명된 품질 차이가 바로 여러분이 기대할 수 있는 품질 차이입니다.
방법론에 대한 질문이나 데이터 요청: WPML 팀에 문의하세요.
연구 수행: WPML 언어학 팀, 2026년 4월. 표본: 원어민 언어학자가 검토한 227개의 DeepL 번역 웹페이지를 동일한 방법론으로 평가한 73건의 PTC 운영 사이트 검토 결과와 비교. 언어: 아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어. 평가: MQM 기반 번역 품질 프레임워크, 9가지 기준, 기준당 1–10점, 평균을 내어 0–100점 결과로 환산.